AI Hub의 한-일 번역 관련 데이터셋 10개를 병합한 자료입니다. 병합 시 총 데이터 개수는 4,339,465개이며, 이중 10,000개의 validation set와 2,000개의 test set가 분리되어 모든 데이터 사이즈(large-4.3m, base-1m, small-100k)에서 동일하게 사용됩니다.
large-4.3m (train): 병합 데이터 100% 사용; 총 4,327,465개
base-1m (train): 병합 데이터 중 1M개 사용; 총 1,000,000개
small-100k (train): 병합 데이터 중 100K개 사용; 총 100,000개
Subsets
Name
Total Size
Japanese Size (Utilized Only)
URL
Datasetkey (AIHub)