Language: Mongolian (Traditional Mongolian script)
Size: ~12GB
Format: Plain text (.txt)
Use Case: Language model pretraining
Description
This dataset contains Mongolian text data for training language models on low-resource languages. The data uses Traditional Mongolian script and covers 45 core characters identified through frequency analysis.
Code: The Huffman transliteration framework implementation is… See the full description on the dataset page: https://huggingface.co/datasets/CMLI-NLP/Mongolian-pretrain-dataset.