The corpus-ckb is a large-scale text dataset primarily composed of Kurdish texts. It is intended for use in various natural language processing (NLP) tasks such as text classification, language modeling, and machine translation. The dataset is particularly useful for researchers and developers working with Kurdish (Central Kurdish, ckb) language data.