Aquest dataset conté 85.000 parelles de frases en format:
text_erroni,text_correcte
Està orientat a entrenar models de correcció d’errors d’accentuació i dièresi en català, especialment útil en contextos com OCR, ASR, o entrades sense accents en teclats mòbils.
S’ha seleccionat 85.000 frases que contenen accents (é, à, í, etc.) o dièresi (ï, ü)
A cada frase se li ha eliminat qualsevol signe… See the full description on the dataset page:
https://huggingface.co/datasets/Oriolshhh/parlabe-errors-accents-85k.