Consolidated 19th-century Chronicling America OCR corpus, merged from ten
decade-partitioned source datasets for ModernBERT continued-pretraining.
ambrosfitz/ca_1830s_ocr_v2
ambrosfitz/ca_1840s_ocr_v2
ambrosfitz/ca_1850s_ocr_v2
ambrosfitz/ca_1860s_ocr_v2
ambrosfitz/ca_1870s_ocr_v2… See the full description on the dataset page:
https://huggingface.co/datasets/ambrosfitz/ca_19c_ocr_combined.