Обучение LLM с нуля с помощью nanochat. Создание pretrain только на статьях Хабра, размер d16 (0.5B), сравнение обучения в fp8 и bf16. bf16 оказался лучше. Разные варианты для sft и dpo.
Для обучения и запуска модифицирован проект nanochat для кастомной загрузки датасетов, dpo, продолжения sft, web-чата с dpo.
Остальные версии представлены для опытных, для понимания разницы между fp8, bf16, разных датасетов обучения.
Ответы на простые вопросы должны быть без зацикливаний, с нормальным оформлением. Качество самих ответов плавающее, так как эта модель обучена только на маленьком узкоспециализированном датасете и представляет собой proof-of-concept, а не законченный продукт.
При нажатии на блок ответа запустится перегенерация, отстановить генерацию можно нажатием Esc.