finepdf-filtered-zhtw 是以 Hugging Face FinePDF 為來源,過濾出繁體中文(zh-tw)為主的子集,保留 finepdf 的完整 metadata(包含語言判別分數、文件 dump、URL 等),可作為繁中持續預訓練語料的補充。
Dataset Details
Dataset Description
以原始 metadata 中的 language 欄位先行篩選為 zh*。
對每筆 PDF 文本以 fastText/lid 等語言判別工具重新計算 page_average_lid、full_doc_lid 等欄位,並依分數判定是否為繁體中文(zh-tw)為主。
對偵測為簡體為主的樣本進行排除。