Корпус оригинално ћириличних докумената
и латиничних парњака
Погодан за обучавање модела и тестирање решења за пресловљавање.
Иницијална верзија - око 220 милиона речи из корпуса Знање, Википедије, и Редит корпуса
Korpus originalno ćiriličnih dokumenata
i latiničnih parnjaka
Pogodan za obučavanje modela i testiranje rešenja za preslovljavanje.
Inicijalna verzija - oko 220 miliona reči iz korpusa Znanje, Vikipedije i Redit… See the full description on the dataset page: https://huggingface.co/datasets/procesaur/cirilica.