В результате исследования было проведено 4 эксперимента из 6 предложенных:
Сравнение SmolVLA + finetune и SmolVLM. У первой модели в результате обучения был замечен attention sink эффект, когда модель
перестает выделять объекты и мы видим однотонный цвет на изображении весов. Отсюда же и ухудшение выделения главных объектов.
t-SNE. На малых значениях числа объектов различия почти незаметны, на бОльшем , мы понимаем, что SmolVLA показывает более некачественные результаты , чем VLM
в связи с тем, что деление на кластеры в первом случае менее точное , чем во втором.
В 3ем эксперименте требовалось обучить модель на датасете, а в 4ом произвелась замена loss-функции на l1. Замена не показала улучшений в качестве тренированной модели.