A benchmark for evaluating intelligent image editing models.
The primary benchmark data is in data/original-00000-of-00001.parquet (360 samples). Each row contains:
Column
Type
Description
uid
string
Unique sample identifier
images
List[binary]
Input images as raw bytes
caption
Struct{a, q}
q: editing instruction, a: answer
class
string
Category: w (writing), r (reasoning), d (drawing)