nomos-ner-fr (v5, expérimental)
Modèle de reconnaissance d'entités nommées pour la détection de données à
caractère personnel dans des documents rédigés en français, avec une attention
particulière portée aux écrits juridiques (actes, conclusions, décisions).
Architecture CamembertForTokenClassification : 12 couches, 768 dimensions,
étiquetage BIO.
Vérification humaine obligatoire
Le modèle laisse passer des entités. Sur des documents réels, des fuites
résiduelles sont observées, notamment sur les personnes morales aux
dénominations inhabituelles, les noms d'origine étrangère et les mentions
dégradées par l'OCR.
Un texte traité par ce modèle n'est pas un texte anonymisé. Il constitue une
première passe qui doit être relue par une personne compétente avant toute
communication, publication ou transmission à un tiers. Aucune garantie n'est
donnée quant à l'exhaustivité de la détection, en particulier au regard des
obligations découlant du RGPD ou du secret professionnel.
Documents longs
Le modèle a été entraîné sur des séquences courtes. Pour un document long,
découper le texte en fenêtres d'environ 1 000 caractères avec un recouvrement
de 250 caractères, plutôt que de s'en remettre à la troncature du tokenizer.
Entités reconnues
Étiquetage BIO, 79 étiquettes réparties en 40 familles.
| Domaine | Familles |
|---|
| Personnes | NOM_PERSONNE, PRENOM_PERSONNE, DOB, AGE, GENDER, HEIGHT, EYECOLOR |
| Organisations | NOM_SOCIETE, JOBTITLE, JOBAREA, JOBTYPE |
| Adresses | NUMERO_VOIE, NOM_VOIE, SECONDARYADDRESS, CODE_POSTAL, VILLE, STATE, COUNTRY |
| Contact | EMAIL, TELEPHONE, URL, USERNAME, USERAGENT, IP, MAC |
| Identifiants | NUM_SECURITE_SOCIALE, NUM_DOSSIER, REF_CADASTRALE, VEHICLEVIN, VEHICLEVRM, PASSWORD |
| Bancaire | IBAN, ACCOUNTNUMBER, CREDITCARD, BITCOINADDRESS, ETHEREUMADDRESS, AMOUNT, CURRENCY |
| Temporel | DATE, TIME |
Limites connues
- Français uniquement. Les autres langues ne sont pas prises en charge.
- Les dénominations sociales atypiques et les noms de personnes d'origine
étrangère sont moins bien détectés que les formes courantes.
- Les surfaces détectées peuvent déborder sur les mots voisins ou, à l'inverse,
ne couvrir qu'une partie de l'entité.
- Le modèle ne distingue pas les institutions publiques des organisations
privées. Cette distinction relève d'un traitement en aval.
- Les textes issus d'une numérisation de mauvaise qualité dégradent nettement
les résultats.
Licence et attribution
Publié sous licence MIT.
Ce modèle est un fine-tune de
Anonym-IA/V2-camembert-ner-pii-french
(licence MIT), lui-même fondé sur
CamemBERT (Martin et al., 2020, licence MIT), un
modèle de langue français de la famille RoBERTa. Les licences et attributions
d'origine sont conservées et s'appliquent aux poids publiés ici.
English summary
French-language NER model for personal data detection in legal documents.
Experimental release. The model misses entities: text processed with it is
not anonymised and requires human review before any disclosure. BIO tagging,
79 labels. MIT licence.