Danish Pretrain Corpus v1
Combined Danish text corpus for LM pretraining, assembled from:
Source
Docs (approx)
Description
wikipedia
250,781
Danish Wikipedia articles (20231101 snapshot)
dynaword
3,921,480
danish-foundation-models/danish-dynaword — 45 curated subsets (parliament, court judgments, EU legal, historical newspapers, literature, forums, etc.)
ia_danish
3,161
Internet Archive Danish PD books (OCR'd _djvu.txt)
gutenberg_da_delta
19
Project Gutenberg… See the full description on the dataset page:
https://huggingface.co/datasets/jensjepsen/danish-pretrain.