MATE-like cross-modal entity linking dataset generated from CLEVR-style scenes for probe training.
Config
Renderer
Scenes
Samples
Strict
Description
2d
Pillow
3,000
18,000
No
Fast 2D shape rendering
pyrender
pyrender
3,000
18,000
No
Offscreen 3D rendering
blender
Blender Cycles
3,000
18,000
No
Photorealistic ray-traced rendering
2d_strict
Pillow
3,000
18,000
Yes
2D, strict cross-modal
pyrender_strict
pyrender
3,000
18,000
Yes
3D… See the full description on the dataset page:
https://huggingface.co/datasets/qinglinhou/CLEVR-MATE.