Dataset Card for "yuhuanstudio/twdict_pretrain"
資料集摘要
本資料集將「成語典」與「重編字典」的內容合併為單一資料集,提供繁體中文的詞彙、成語與其解釋、用例等資訊。此資料集適用於大型語言模型(LLM)預訓練以及自然語言處理(NLP)各類應用,如關鍵字抽取、問答系統、語義分析等。
原始資料來源:
• 數據來源:
– 「成語典」:收錄常見與罕見成語,含釋義、典故、例句等相關資訊
– 「重編字典」:收錄繁體中文詞彙與解釋,含詞性、詞義、引文等
• 語言:繁體中文
• 資料格式:
– JSON 格式,結構化每個詞條或成語的內容
– 便於 LLM 預訓練和 NLP 分析
• 資料規模:
– 含數萬條繁體中文詞彙與成語
– 豐富的用法示例、解釋及歷史典故