finevision-zhtw 是一個以台灣在地視覺為主題的群眾貢獻(crowdsourced)圖像資料集,由 twinkle-ai/fine-vision-album Space 收集而來。包含 718 筆多圖像條目,涵蓋街景、招牌、建築、食物、日常物品等台灣生活場景,適用於訓練繁體中文多模態模型對台灣在地視覺文化之理解。
Dataset Details
Dataset Description
繁體中文多模態模型在台灣在地視覺場景之表現普遍偏弱——中文招牌、街景、小吃、路標等本地元素在國際多模態資料集中缺席。本資料集透過 twinkle-ai/fine-vision-album 這個 HuggingFace Space 提供之上傳介面,邀請社群志願者上傳自己拍攝的台灣在地照片,並自行標註授權與分類,逐步累積一份屬於台灣視覺文化的圖像語料。
每筆資料可包含多張圖像(images 為… See the full description on the dataset page: https://huggingface.co/datasets/lianghsun/finevision-zhtw.