Aquest dataset conté 1.000.000 frases correctes en català obtingudes a partir dels datasets públics TeCla v2 (notícies) i CaWikiTC (Viquipèdia catalana), provinents del projecte AINA.
Les frases s’han netejat i filtrat per garantir qualitat:
Eliminació d’espais duplicats
Separació en frases amb nltk.sent_tokenize
Longitud entre 7 i 40 paraules
Eliminació de frases amb caràcters no catalans o erronis