A high-quality multilingual retrieval corpus constructed from the Mozhi Tamil Corpus and machine-translated into English using IndicTrans2.
This dataset contains Tamil documents paired with English translations.
The corpus was created by filtering high-quality documents from the Mozhi Tamil Corpus and translating them using AI4Bharat's IndicTrans2 translation model.
The resulting corpus is intended to support:… See the full description on the dataset page:
https://huggingface.co/datasets/nlpctx/tamil-english-corpus.