Aquest dataset conté 60.000 parelles de frases amb errors de gènere, generades mitjançant un script automatitzat en Python. Cada parella està formada per:
text_erroni,text_correcte
Aquest conjunt de dades està pensat per entrenar models de correcció gramatical en català, amb un focus específic en la detecció i correcció d’errors de gènere:
Concordança nominal (ex: el noia → la noia)
Concordança adjectival… See the full description on the dataset page:
https://huggingface.co/datasets/Oriolshhh/parlabe-errors-genere-60k.