This model is a homework assignment from LLM course from HSE University. It was trained on a
russian jokes dataset.
Tokenizer: byte-level BPE with vocabulary size 1024.
Architecture: transformer with ALiBi positional embeddings, Grouped Query Attention and SwiGLU feed-forward blocks.
This model was also trained with Rotational Positional Embeddings (and with Multi-head Latent Attention). These models are accessible on 'rope-head-dim' and 'latent' branch respectively. The initial model is accessible on 'alibi' branch.
The main branch contains the model trained on ALiBi positional embeddings.
Generation examples (all of the models started with phrase 'Заходят в бар'):
- ALiBi:
'Заходит в бар кенгуру. Бармен: - Что вы такое говорите? Бармен: - Это я, брат, в бар. Бармен: - Да. Бармен: - А вы меня не знаете. Бармен назвал. Бармен: - А, это я. Бармен: - Да. Одна дамочка. Бармен: - А я знаю. Повторяю. Она: - Это что! Иванов: - Да! А я братве беременна.[EOS]'
- RoPE:
'Заходит в бар, а там бармен с барабаном с бармена. Бармен подходит кенкеровому пиво и начинает бить. Бармен: - Зараза бараба выпили! Бармен: - Бармензаммен. Парашенокал: - Бармен, бармен, пива нет, барахил. - Абар. Чарабан: - Дал, бармен: - Бармен, барин, бармен, яблоко и барабан. Парашка: - Таблонь, Бармен, бархан.[EOS]'
- MHLA:
'Заходит в бар бармен-пармен, и спрашивает:- Что ты делаешь?- А, много пью![EOS]'
Model comparison: ALiBi and RoPE have approximately the same loss, and MHLA has a bit higher loss, but it's to be expected, because it has a bit less parameters. The generation quality is approximately the same.