WikipediaのHTML形式のダンプファイルから抽出したテキストデータセットです。
Wikiextractorによって抽出したテキストデータと異なり、段落などの文書構造を維持したまま、不要なマークアップのないテキストが利用できます。
ダンプファイルは、2024年1月1日に公開されたものを利用しています。
また、各種NLPタスクに利用しやすいよう、様々なデータを同梱しています。
各種前処理スクリプトはGitHubのリポジトリをご参照ください。
paragraphs (list[dict[str, int | str]])
記事中の段落の集合です。各段落は辞書型で表現されており、以下のデータ構造に基づきます。
paragraph_id… See the full description on the dataset page:
https://huggingface.co/datasets/hpprc/jawiki.