Модель для классификации вакансий была создана на основе предобученной архитектуры BERT путем дообучения (fine-tuning) на специально размеченном датасете.
Датасет для обучения содержал 1000 текстов вакансий, сбалансированных по двум классам:
500 примеров — релевантные вакансии для IT-сферы.
500 примеров — нерелевантные вакансии, не относящиеся к сфере информационных технологий.
В результате модель научилась эффективно различать и категоризировать тексты вакансий на соответствующие IT и все прочие.