本資料集是 lianghsun/wikipedia-zh-742M(中文維基百科語料)的繁體中文(zh-tw)過濾子集,每筆樣本含維基條目段落、token/字元統計與原始 URL。可作為繁中模型在百科類知識上的預訓練語料。
Dataset Details
Dataset Description
原始 wikipedia-zh-742M 涵蓋多種中文(簡體、繁體);本資料集刻意過濾出以繁體(zh-tw)為主的條目段落,並排除被識別為簡體為主的樣本。內容涵蓋臺灣本土條目(地理、歷史、人物)以及通用百科知識。
每筆樣本欄位:
text:條目內文段落。
token_count / word_count:token 數與字元數。
url:原條目網址(部分樣本可能為空字串)。
updated_at:抓取/更新時間戳。
Curated by: Huang Liang Hsun
Language(s) (NLP): Traditional… See the full description on the dataset page:
https://huggingface.co/datasets/lianghsun/wikipedia-zh-filtered.