EN-VI-JA 300K Triplet Dataset
A high-quality parallel corpus of 300,000 sentence-level aligned triplets across English, Vietnamese, and Japanese.
Languages: English (en), Vietnamese (vi), Japanese (ja)
Size: 300,000 triplets
Format: JSONL with en, vi, ja keys
This dataset is curated from OPUS parallel corpora:
Corpus
Language Pair
Description
CCMatrix v1
EN-VI, EN-JA
Web-crawled parallel sentences