tw-public-figures-vision 是一個以台灣公眾人物與地景為主題之繁體中文視覺語言資料集,合計約 19,000 筆,分為 383 個 parquet shard。每筆包含一至多張圖片(以二進位 bytes 儲存)、對應之中文說明文字、以及(可選之)對話格式 messages,可用於訓練繁中 vision-language model(VLM)對台灣人物、地點與社群貼文風格之理解。
Dataset Details
Dataset Description
繁體中文 VLM 之訓練資料多以英文圖文對為主,缺乏對台灣本土人物、地景、活動之涵蓋。本資料集由 curator 整理來自公開社群媒體與公開來源之圖文內容,內容包含:
台灣地景照片(如花東縱谷、夜市、活動現場);
社群貼文之說明文字(含 emoji、hashtag);
投稿者之識別碼(contributor)與每筆圖文之獨立 uuid;
圖片之二進位內容與原始… See the full description on the dataset page:
https://huggingface.co/datasets/lianghsun/tw-public-figures-vision.