One-Euler denoiser для steering GPT-2
Чекпойнт тестового задания T-LAB, направление mechanistic interpretability.
Denoiser обучен на естественных активациях GPT-2 small и возвращает активацию,
сдвинутую линейным steering, обратно к многообразию естественных активаций. Обучение
идёт по velocity field в духе flow matching, а на inference делается один шаг
Эйлера вместо двадцати.
| метод | NLL | property | мс/токен |
|---|
| GLP, 20 шагов | 3.190 | 0.806 | 10.795 |
| GLP, один шаг Эйлера | 3.192 | 0.807 | 1.405 |
| наивный steering без repair | 3.073 | 0.785 | 0.275 |
Одношаговый вариант даёт то же качество, что двадцатишаговый, при вмешательстве в
7.7 раза более быстром. Время измерено как длительность самого repair, а не полный
wall-clock генерации.
Активации собраны на FineWeb, train и validation разделены по хешу документа, BOS
исключён, validation direction не участвовало в обучении denoiser. Property меряется
SST-2-классификатором, quality — conditional continuation NLL под чистой GPT-2.
Три training seeds, M1 Max.
Код, отчёт со всеми экспериментами и самодостаточная HTML-диагностика — в репозитории
проекта.