Aquest dataset conté 45.000 parelles de frases en format:
text_erroni,text_correcte
Està dissenyat per entrenar models de correcció ortogràfica general en català, abastant una gran varietat d’errors comuns en l’escriptura manual, digitació ràpida, ASR o OCR.
Lletres intercanviades o repetides: Axo és una prova → Això és una prova
Omissions o afegits de caràcters:… See the full description on the dataset page:
https://huggingface.co/datasets/Oriolshhh/parlabe-errors-ortografia-45k.