Pralekha: Cross-Lingual Document Alignment for Indic Languages
Pralekha is a large-scale parallel document dataset spanning across 11 Indic languages and English. It comprises over 3 million document pairs, with 1.5 million being English-Indic Pairs. This dataset serves both as a benchmark for evaluating Cross-Lingual Document Alignment (CLDA) techniques and as a domain-specific parallel corpus for training document-level Machine… See the full description on the dataset page: https://huggingface.co/datasets/kcsb28/Pralekha.