Filtered Multilingual Corpus (EN-HI-PA)
Dataset Description
A cleaned and balanced multilingual corpus extracted from the Samanantar dataset, containing parallel sentences in English, Hindi, and Punjabi.
This dataset is a filtered subset of the Samanantar parallel corpus, specifically:
150,000 English sentences (from EN-HI and EN-PA… See the full description on the dataset page:
https://huggingface.co/datasets/PredictiveManish/multilingual-corpus.