Модель для мульти‑лейбл теггирования русскоязычных текстов
Дообучена на базе
deepvk/RuModernBERT-base с использованием синтетических тегов,
сгенерированных
Qwen3‑235B‑A22B‑Instruct‑2507 для выборки из
140 000 текстов из датасета FineWeb (русскоязычный подкорпус rus_Cyrl).
В данной версии модель обучалась на тегах, которые были наиболее близки к центру кластера схожих тегов. Также остался тег, который обозначал кластер различных аббревиатур.