A randomly sampled subset of 1M Sinhala sentences from the Minuri/diverse_sinhala_dataset corpus, used for continual pretraining of LLaMA 3.2 1B (Model B) as part of a diversity-driven Sinhala language model adaptation study.
Minuri/sinhala-corpus-a-news-1m - News-only subset (domain-homogeneous baseline)
Minuri/sinhala-corpus-b-random-1m - Random subset (random baseline) - this repo
Minuri/sinhala-corpus-c-diverse-1m… See the full description on the dataset page:
https://huggingface.co/datasets/Minuri/sinhala-corpus-b-random-1m.