Pralekha: Cross-Lingual Document Alignment for Indic Languages
Pralekha is a large-scale parallel document dataset spanning across 11 Indic languages and English. It comprises over 3 milliondocument pairs, with 1.5 million being English-Indic Pairs. This dataset serves both as a benchmark for evaluating Cross-Lingual Document Alignment (CLDA) techniques and as a domain-specific parallel corpus for training document-level Machine… See the full description on the dataset page: https://huggingface.co/datasets/ai4bharat/Pralekha.