Dataset Card for Kurdish Web Corpus (Deduplicated)
Dataset Summary
A multilingual corpus of web text in three Kurdish/Zaza varieties — Kurmanji Kurdish
(kmr_Latn), Sorani Kurdish (ckb_Arab), and Zazaki (diq_Latn) — scraped from Kurdish-language
websites, language-identified with GlotLID, and
deduplicated (exact + MinHash near-duplicate removal). See the "Dataset Creation" section below
for the full pipeline.
Rows, by language config: