This dataset was used to fine-tuned Jean-Baptiste/camembert-ner for nested NER task using Independant NER layers approach [M1].
It contains Paris trade directories entries from the 19th century.
Dataset parameters
Approachrd : M2 and M3
Dataset type : noisy (Pero OCR)
Tokenizer : Jean-Baptiste/camembert-ner
Tagging format : IO
Counts :
Train : 6084
Dev : 676
Test : 1685