Этот датасет не следует использовать для обучения GEC. 39% строк () —
это параллельный корпус переводов kk↔ru и kk↔en с задачей и пустыми
. Он попал в сборку из — претрейн-микса,
а не GEC-набора. Обучение без фильтра учит модель переводить вместо того, чтобы исправлять.
Внутри также лежат строки публичного бенчмарка (), что делает любую оценку
без явной деконтаминации недействительной.
Преемники:
— только
коррекция, без переводов и без бенчмарка (2 860 104 строки… See the full description on the dataset page:
https://huggingface.co/datasets/TilQazyna/Til-GEC.