TimeCapsuleLLM-ja corpus phase4
1868–1945年の日本語だけを対象にした、ゼロからの言語モデル学習用コーパスです。青空文庫の旧字旧仮名作品と、国立国会図書館次世代デジタルライブラリーのPDM OCR資料から構成します。本文はルビ・入力注記除去、外字写像、OCR品質隔離を行った加工データです。
aozora-bunko: 1,576 documents / 15,457,625 characters
ndl-next-digital-library: 85,796 documents / 4,976,374,756 characters
split documents — train: 85,658 / validation: 1,690 / test: 24
各行の rights_status と source_url… See the full description on the dataset page:
https://huggingface.co/datasets/trtd56/TimeCapsuleLLM-ja-corpus-v2.