First publicly available clean Hindi-Kumaoni parallel translation dataset.
Language pair: Hindi (hi) ↔ Kumaoni (kum, ISO 639-3: kfy)
Size: 920 pairs (736 train / 92 dev / 92 test)
Script: Devanagari
Dialect: Central Kumaoni (Almora)
speakkumaoni.com (structured lessons)
euttaranchal.com (language lessons)
Wikipedia EN Kumaoni language page
Each JSONL line:
{"translation": {"hi": "..."… See the full description on the dataset page:
https://huggingface.co/datasets/swapedoc/hindi-kumaoni-parallel-corpus.