KurCorpus 2B is a multidialectal Kurdish text corpus (>2B tokens) for large-scale language modeling and downstream NLP.
Dialects:Sorani (ckb), Kurmanji/Badini (kmr), Hawrami/Gorani (hac)
License: CC BY 4.0
Repo:
https://huggingface.co/datasets/abdulhade/Kurdishcorpus
External record: Mendeley Data DOI 10.17632/fb5xhhn6m5.1
Ready for pretraining and finetuning Kurdish LMs
Single field text (UTF-8), offered as large archives or sharded… See the full description on the dataset page:
https://huggingface.co/datasets/abdulhade/Kurdishcorpus.