В рамках задания были реализованы три различных механизма внимания:
1. ALiBi (Attention with Linear Biases)
Базовый механизм внимания, где позиционная информация добавляется через линейные смещения к матрице внимания.
Это позволяет модели лучше обрабатывать последовательности различной длины.
2. RoPE (Rotary Position Embedding)
Механизм, который внедряет информацию о позиции через вращения в комплексном пространстве. Ключевые преимущества:
Лучше сохраняет относительные позиции токенов
Обеспечивает хорошую экстраполяцию на последовательности длиннее тренировочных
Более эффективен для задач, требующих понимания структуры текста
3. Multi-Head Latent Attention (MHLA)
Альтернативный механизм внимания, использующий латентное пространство для более эффективного вычисления. Ключевые особенности:
Снижает вычислительную сложность с O(n²) до O(n)
Использует обучаемые латентные векторы как "посредники" в механизме внимания
Сохраняет способность моделировать глобальные зависимости при более низких вычислительных затратах
Результаты работы
1. Nano
Графики обучения:
Графики обучения nano
Пример работы:
"Заходит в бар и говорит мужчинул, к куда, начинает, на дете. Мальчик в домой:- Что же вчера у него сегодня зайтиведела!"
2. Mini
Графики обучения:
Графики обучения mini
Пример работы:
"Заходит в бар в садик, второй купил к ней папой и говорит:- Ну что это, что сейчас вчера за ней не занимаются?"
"- Возьми, я не понял, что в детстве не догадался!- Напибо. Я, я не скажу, что ли, что ты скажешь?"
3. Small
Графики обучения:
Графики обучения small 1
Графики обучения small 2
Примеры работы:
"Заходит в бар и говорит мужчинул, к куда, начинает, на дете. Мальчик в домой:- Что же вчера у него сегодня зайтиведела!"
"Заходит в бар. Она идут к нему подходит в магазин. Один говорит: — Папа! Вовочка, сынок, ты меня сделал? — Спасибо, я в квартире договорим."
Мнение о результатах
Small обучается дольше всех - 70 минут на эпозу, nano и mini примерно по 10 минут.
За 1 эпоху модели не учатся генерировать что-то сильно осмысленное, но читать результаты генерации становится смешнее, чем анекдоты!
А у анекдотов всё же смысл как раз в итоговом смехе, так что можно считать что с ТЗ модели справляются успешно! :)
Преимущество модели small над остальными заключается в большей успешности генерации осмысленных слов, хоть и плохо связанных друг с другом.
Но, естественно, обратной стороной медали является долгое время работы...
Модели с RoPE и MHLA я успел реализовать, но не успел попробовать :(