Dataset pronto al training per la token-classification di PII in testi legali italiani
(22 categorie in schema BIO), derivato dal corpus community
rizzoaiacademy/anonimizzazione-testi-italiano
tramite una pipeline di deduplicazione e bilanciamento. Alimenta il modello
rizzo-pii.
⚠️ 100% sintetico. Nessun dato personale reale. Nomi, codici fiscali, IBAN, indirizzi ecc.
sono generati (con checksum validi o volutamente… See the full description on the dataset page:
https://huggingface.co/datasets/rizzoaiacademy/anonimizzazione-testi-italiano-clean.