This dataset is a normalized, one-row-per-document view over the page-level
DocLayNet v1.1
dataset. Pages are grouped using DocLayNet's source metadata and ordered by their original
page number.
2,944 logical documents
80,863 observed pages
896 complete document groups
2,048 partial document groups
Train: 2,355 documents / 60,810 pages
Validation: 294 documents / 7,964 pages
Test: 295 documents / 12,089… See the full description on the dataset page:
https://huggingface.co/datasets/operant-ai/doclaynet-document-level.