正文与图片交错排列:text 里的每个
占位符对应 images 数组的
同一个位置,顺序就是图片在条目中原本出现的位置。格式对齐 MMC4/OBELICS 的惯例。
不变量:text.count("
") == len(images),全量实测 0 误差。章节被丢弃时
它的图片一并丢弃,两者永远对得上。
与纯文本版的差别只有
图片处理:纯文本版把标记整行移除、并清掉“拿掉图片后就空掉”的章节;这一版
保留它们——只有地图的一节对纯文本模型是空标题,对多模态模型是有价值的图文对。
⚠️ 图片授权各不相同(CC… See the full description on the dataset page:
https://huggingface.co/datasets/yuhuanstudio/wikipedia-omni-zh.