CC-news-2024-July-October-cleaned
このデータセットはCommon Crawlのnewsサブセットから作成した2024年7月から10月の日本語のニュースの文章が収録されています。
データセットの規模はllm-jp/llm-jp-13b-v1.0 tokenizer使用で612M tokensです。
使用したツールはUzushioです。フィルター設定はサンプルのpipeline_03a.confです。
作成につきまして以下を参考にさせていただきました。
uzushio使ってwebコンテンツから綺麗な日本語コーパスを抽出する手順