FlaffyTail-abliterated
Экспериментальная модель с удалёнными механизмами отказа, созданная в исследовательских целях.
ЮРИДИЧЕСКОЕ ПРЕДУПРЕЖДЕНИЕ (ОБЯЗАТЕЛЬНО К ПРОЧТЕНИЮ)
Настоящая модель является экспериментальной и была создана исключительно в академических и исследовательских целях для изучения механизмов работы больших языковых моделей.
Автор не несёт ответственности за любой контент, сгенерированный данной моделью.
Вы используете эту модель на свой страх и риск.
- Вы, как пользователь, единолично и полностью ответственны за любой текст, созданный этой моделью
- Автор не контролирует и не может контролировать то, как вы её используете
- Автор категорически не одобряет и не поощряет использование модели для создания незаконного, вредоносного или аморального контента
- Вы, скачивая и используя эту модель, соглашаетесь с этим положением и принимаете на себя все возможные юридические последствия её использования.
Описание
это модифицированная версия
Qwen2.5-7B-Instruct, прошедшая процедуру
аблитерации и дообучения при помощи LoRA адаптации
Цель эксперимента: исследовать поведение LLM после удаления механизмов цензуры, включая:
- Реакцию на NSFW-запросы
- Кросс-языковые эффекты при экстремальных нагрузках
- Сохранность критического мышления после аблитерации
Модель НЕ предназначена для коммерческого использования и публичных чат-ботов без дополнительной модерации.
Методология
Использованный инструмент
- llm-abliteration от NousResearch
Датасет для измерения направлений отказа
- Harmful промты (19шт.): негатив
- Harmless промты (25 шт.): безопасные запросы
Процесс
- Измерение скрытых состояний на каждом слое модели для harmful и harmless запросов
- Вычисление "направления отказа" как разницы средних активаций:
R = mean(H_harmful) - mean(H_harmless)
- Анализ отношения сигнал/шум (SNR) для выбора оптимальных слоёв
- Вычитание направления отказа из выбранных слоёв
Технические детали аблитерации
Конфигурация
| Параметр | Значение |
|---|
| Source layer | 24 |
| Destination layers | 20, 21, 22, 23, 24, 25, 26 |
| Scale | 1.0 |
| Sparsity | 0.0 |
| Projected | False |
Анализ SNR по слоям
| Слой | SNR |
|---|
| 1 | 0.0418 |
| 10 | 0.1013 |
| 14 | 0.1968 |
| 20 | 0.4332 |
| 24 | 0.4944 |
| 26 | 0.5416 |
| 27 | 0.4594 |
Почему не слой 26: Несмотря на максимальный SNR, слой 26 находится слишком близко к выходу. На этом этапе к сигналу отказа примешивается лингвистическая структура ответа, что повышает риск повреждения генеративных способностей модели.
Результаты и наблюдения
Основные результаты
- Модель полностью утратила способность явно отказываться от NSFW-запросов
- Сохранила базовые знания и связность речи
Неожиданные наблюдения
1. Кросс-языковой коллапс
При генерации экстремального NSFW-контента модель спонтанно переключается с русского на китайский язык. Предположительный механизм:
- Отсутствие механизма отказа приводит к невозможности отклонить запрос как итог - модель находит аварийный выход через возврат в зону лингвистического комфорта