TimeCapsuleLLM-ja corpus phase2
1868–1945年の日本語だけを対象にした、ゼロからの言語モデル学習用コーパスです。青空文庫の旧字旧仮名作品と、国立国会図書館次世代デジタルライブラリーのPDM OCR資料から構成します。本文はルビ・入力注記除去、外字写像、OCR品質隔離を行った加工データです。
各行の rights_status と source_url を確認してください。NDL資料はPDM、青空文庫資料は作品カードの著作権状態と収録ファイル取扱規準に基づきます。加工を原作者または提供機関が行ったかのように表示しないでください。
OCR誤り、歴史的な差別表現、当時の社会的偏りを含みます。現代の事実確認、意思決定、人物評価には使用しないでください。