Multilingual PII/PHI De-identification Corpus (Final)
This is the finalized, training-ready corpus for a multilingual PII/PHI
de-identification (token classification) model scoped to en-GB, nl-BE,
fr-FR. It merges two sources:
Our own synthetic clinical/administrative corpus
(Marawanelbalal/synthetic-pii-phi-v2),
unchanged.
A normalized subset of
ai4privacy/pii-masking-openpii-1.5m
(English/French/Dutch rows only), added as generic-register training text.