A massive, unified multilingual parallel corpus for Persian, English, and Arabic NMT research.
Translation-Dataset_Large aggregates and normalizes millions of sentence pairs across three language directions — English↔Persian (en-fa), Arabic↔English (ar-en), and Arabic↔Persian (ar-fa) — into a single, deduplicated, research-ready .parquet dataset.
Languages
Persian (fa), English (en), Arabic… See the full description on the dataset page:
https://huggingface.co/datasets/Arshia82sbn/Translation-Dataset-Large.