本資料集收錄中華民國(臺灣)政府公開網站的中文(含中英對照)文本,涵蓋國史、機關沿革、政府公開資料等內容,總字數約 556,000 字(556k),以「text」單欄位的純文本格式提供,作為繁體中文持續預訓練(continued pretraining)語料的補充。
Dataset Details
Dataset Description
資料來源以中華民國政府公開頁面為主,內容偏向具有時間軸/傳記/沿革性質的中文敘事文本(部分樣本含中英對照)。文本經過簡單清理(移除 HTML 標籤、空白、合併段落等),但保留段落原貌,方便用於語言建模任務。
資料集名稱中的「556k」指原始彙整文本之總字數約 556,000 字,並非樣本數;實際樣本數落在 1K–10K 區間。
Curated by: Huang Liang Hsun
Language(s) (NLP): Traditional Chinese(部分樣本含英文對照)… See the full description on the dataset page:
https://huggingface.co/datasets/lianghsun/tw-gov-556k.