В этом репозитарии планируется сделать попытку дообучение модели Qwen3:-6b до моделирования интеллекта Алексея Стрельникова Белоруского театрального критика и большого знатока белоруской театральной тусовки вплоть до личной постановки спектаклей уличных театров и исполнения моноспектаклей в качестве актёра. Для дообучения модели был создан датасет в который вошли наиболее знакомые публикации Алексея в СМИ РБ. Кроме того была оцифрована его диссертация. В случае положительных результатов дообучения будет проведено дообучение на большем количестве цикловю В то же время независимо от результатов дообучения будет проводится работа по повышению качества и увеличению объёма датасета. Так же будут опубликованы файлы обучения модели. Буду благодарен за критику и подсказки. Так же будут проводится работы по встраиванию дообученной модели в сайт Алексея.
https://free-teatr-aleks-strel.net/.Последняя загруженная модель после 2000 циклов обучения. Тесты показали, что модель обучилась так себе. Дообучение на моей машине длилось 10 часов. Есть предположения, что модель для моей задачи слабовата. Перед тем как убивать время на дообучение этой модели попробую другие модели.Попрообовал GPT2,T5 результаты огорчили решил вернуться. Пошёл по пути усложнения датасетов вот результаты. Сравнение ответов модели Qwen3-0.6b при разных вариантах дообучения
Для сравнения был подготовлен ряд вопросов на двух языках вопросы можно отнести к следующим областям знаний - первая группа
это базовый набор знаний модели Qwen3, вторая группа относится к общей теории театра и третья группа это вопросы основанные на
материалах конкретной личности так же, при условии достижения положительных результатов будет добавлена группа личных диалогов.
Физичесие ответы приведены в отдельном файле, а здесь будет только анализ.
Первые ответы получим от локально установленной модели(при помощи Ollama) Qwen3:0.6b, предварительно очистив их от всего лишнего -
Второй вариант ответов приведём от необученной модели Qwen3:0.6b скачанной из HigginFace(HF) в формате safetensor он идеентичен формату
модели после дообучения поэтому приводится здесь (Все ответы очищены от лишней информации)
Анализ показывает, что более или менее вразумительные ответы базовая модель дает только на первые три вопроса на остальные вопросы она
отвечает имповизацией причем у Ollama параметры, наверное, подобраны лучше чем у меня поэтому ответы посимпатичней. Но поскольку моя цель
в другом я на этом не заморачивался. Далее прводилось дообучение модели по методу SFT на минимальном датасете который приведён в моём
аккаунте посмотрим его результат. Очевидно, что модель теперь лучше отвечает на вопросы присутствующие в датасете(хотя далеко от идеала)
вместе с тем очевидно "забывание" базовых навыков. В жальнейшем были приняты попытки дообучение на более сложных датасетах с добавлением
вопросов по теории театра и личных данных прототипа. Серьёзных результатов это не принесло.Поэтому было принято решение изьенить стратегию
дообучения модели. Во первых решено изменить структуру датасета сразбив его на три части 1. Теория театра 2. Публикации письма дневники
прототипа и 3.Личные данные и диалоги прототипа. То же самое на английском языке, извините что пользуюсь переводчиком:In this repository, it is planned to make an attempt to further train the Qwen3:-6b model to model the intelligence of Alexey Strelnikov, a Belarusian theater critic and a great connoisseur of the Belarusian theater community, up to his personal staging of street theater performances and performing solo performances as an actor. To further train the model, a dataset was created that included Alexey's most familiar publications in the media of the Republic of Belarus. In addition, his dissertation was digitized. In case of positive results of further training, further training will be carried out on a larger number of cycles. At the same time, regardless of the results of further training, work will be carried out to improve the quality and increase the volume of the dataset. Model training files will also be published. I will be grateful for criticism and tips.Work will also be carried out to integrate the retrained model into Alexey's website.
https://free-teatr-aleks-strel.net/.The last loaded model after 2000 training cycles. Tests showed that the model trained so-so. Further training on my machine lasted 10 hours. There are assumptions that the model is weak for my task. Before killing time on further training of this model, I will try other models.Comparison of Qwen3-0.6b model responses with different additional training options
For comparison, a series of questions in two languages was prepared. The questions can be classified into the following knowledge areas: the first group
is the basic knowledge set of the Qwen3 model, the second group relates to general theater theory, and the third group is questions based on
material from a specific individual. A group of personal dialogues will also be added if positive results are achieved.
The physical responses are provided in a separate file; only the analysis will be presented here. We'll get the first answers from a locally installed Qwen3:0.6b model (using Ollama), after first removing all unnecessary information.
The second set of answers is from an untrained Qwen3:0.6b model downloaded from HigginFace (HF) in safetensor format. It's identical to the format of the model after further training, so it's provided here. (All answers have been removed.)
Analysis shows that the base model only provides more or less intelligible answers to the first three questions. It improvises on the remaining questions. Ollama's parameters are probably better chosen than mine, so the answers are more appealing. But since my goal is different, I didn't bother with that. Next, I trained the model using the SFT method on the minimal dataset provided in my account.
We'll see the results. It's clear that the model now better answers the questions in the dataset (though far from ideal).
However, it's clearly "forgetting" basic skills. Unfortunately, attempts were made to retrain the model on more complex datasets, adding questions on theater theory and the prototype's personal data. This didn't yield significant results. Therefore, a decision was made to modify the retraining strategy.
First, we decided to change the structure of the dataset, dividing it into three parts: 1. Theater theory; 2. Publications, letters, and diaries
of the prototype; and 3. Personal data and dialogues of the prototype.