根據DRCD閱讀理解資料集合成的VQA資料集
格式如下
{
"conversations": [
{
"from": "human",
"value": "
根據文件上的文章內容,《史通》的作者是誰?"
},
{
"from": "gpt",
"value": "劉知幾"
}
],
"images": [
"auged_jpg_images/page_16420.jpg"
]
}
共有兩種任務,分別是DRCD原始閱讀理解題目,以及文件全文OCR任務
本資料集區分為兩個子資料集,分別是auged_jpg_images以及noaug_jpg_images
前者是將合成的文件隨機渲染到自然場景(ImageNet)上的版本,後者為純合成出來的文件
Json檔案無遵照常見標記結構,請根據檔案路徑進行匹配
由於Huggingface的API是只下載格式trace到的檔案,使用上請不要透過datasets或huggingface-cli,直接git clone… See the full description on the dataset page:
https://huggingface.co/datasets/CGTec3/synthdoc-drcd.