日英対訳文対応付けデータ(内山ら, 2003)として公開されている日英対訳文データセットです。
本リポジトリはデータセットのダウンロード・解析・前処理のみを行うスクリプトを提供しているものであり、データの再配布はしておりません。
データセットの前処理に下記のライブラリを使用します。
データの使用前にインストールをお願いいたします。
pip install bs4 lxml
使用例は以下のとおりです。
import datasets as ds
dataset = ds.load_dataset("hpprc/en-ja-align", num_proc=16, trust_remote_code=True)
print(dataset)
DatasetDict({
train: Dataset({
features: ['id', 'en', 'ja', 'source'],
num_rows: 42738
})