Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS-GGUF (любительская сборка)
📌 Что это
Квантованная версия
IQ3_XXS модели
HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive в формате GGUF.
Сборка создана для личного использования на NVIDIA GeForce GTX 1080 (8 ГБ VRAM) и публикуется «как есть». Все приведённые ниже цифры получены на конкретной тестовой системе; на других конфигурациях поведение может отличаться.
⚠️ Любительская сборка. Тестировалась только на указанной конфигурации.
📦 Состав репозитория
| Файл | Размер | Описание |
|---|
Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf | 3,66 ГБ | основной файл модели |
mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf | 880 МБ | визуальный энкодер (из оригинального репозитория) |
no-think.jinja | ~1 КБ | шаблон для отключения размышлений |
Modelfile | ~1 КБ | конфигурация для Ollama |
В авторском репозитории HauhauCS отсутствуют 3-битные кванты. Минимальный размер там — Q4_K_M (5,3 ГБ).
Квант Q3_K_L (4,58 ГБ) был получен в ходе экспериментов, но не публикуется из-за худшего соотношения качество/память на целевом домене.
🖥️ Тестовая конфигурация
| Компонент | Значение |
|---|
| GPU | NVIDIA GeForce GTX 1080 (8 ГБ VRAM) |
| CPU | 12th Gen Intel Core i5-12400F |
| ОЗУ | 31 ГБ |
| llama.cpp | сборка с CUDA, коммит b8750-bfd1f453c |
🔬 Детали квантизации
Калибровочный датасет (imatrix)
Использовался файл imatrix.dat (~1 МБ) со следующей структурой:
| Компонент | Доля | Состав |
|---|
| Код | 40% | Python, TypeScript, C++/C#, SQL, Bash, веб-стек |
| Языковые данные | 40% | русский / английский в пропорции 40/60 |
| Логика / математика | 10–15% | — |
| Энтропийный слой | 5–10% | предотвращение «роботизации» |
Сам файл imatrix.dat не публикуется.
Стратегия сжатия слоёв
| Группа слоёв | Тип квантования | Средний bpw | Причина |
|---|
ffn_* | IQ3_XXS | ~3,06 | хорошо переносят сжатие |
attn_* | Q4_K / Q5_K | ~4,50 | критичны для логики и контекста |
ssm_out | F16 / BF16 | 16,0 | катастрофический рост ошибки при сжатии |
output | Q5_K | ~5,50 | баланс качества и размера |
token_embd | IQ3_S | ~3,44 | умеренное сжатие |
Средний битрейт модели: 3,51 bpw.
📊 Результаты тестов
Производительность
| Режим | Контекст | Prompt eval (t/s) | Generation (t/s) |
|---|
| Текстовый (короткий промпт) | 2k | ~129 | ~32,4 |
| Длинный контекст | 32k | ~581 | ~30,7 |
Пиковые значения prompt eval достигали 581 t/s. Скорость генерации стабильна в районе 30–35 t/s.
Потребление видеопамяти (контекст ~2k)
| Параметр | Значение |
|---|
| Модель (только веса) | ~3328 MiB |
| KV-кэш (контекст) | ~2242 MiB |
| Вычислительные буферы | ~493 MiB |
| Свободно VRAM | ~1170 MiB |
Сравнение с другими квантами
| Квант | Размер | PPL (гибрид) | PPL (WikiText-2) | Генерация | Экономия VRAM |
|---|
Q4_K_M | 5,23 ГБ | 7,95 | 21,94 | ~26 t/s | — |
Q3_K_L | 4,58 ГБ | 8,82 | 22,53 | ~27 t/s | -13% |
IQ3_XXS | 3,66 ГБ | 8,26 | 23,32 | ~32 t/s | -30% |
Гибридный датасет — смесь кода, логических задач и текстов на русском/английском, близкая к калибровочному набору.
🧠 Тестирование длинного контекста (32k)
Модель протестирована с --ctx-size 32768 на задаче «иголка в стоге сена». Использовался отрывок из романа «Война и мир» (~37 400 токенов). В середину текста вставлена фраза: «Внезапно в комнату вошёл розовый слон и вежливо поздоровался с Анной Павловной». Модель успешно извлекла и воспроизвела эту информацию.
Важно:
- Тест проведён на художественном тексте. На сложных технических или специализированных материалах качество работы с 32k контекстом может варьироваться.
- Модель может «плыть» при ответах, требующих синтеза информации из разных частей длинного документа.
Рекомендация: для гарантированно стабильной работы используйте контекст до 16k токенов.
🖼️ Мультимодальность
Модель поддерживает работу с изображениями (проверено в llama.cpp).
Важно: на видеокартах с 8 ГБ VRAM обязателен флаг --no-mmproj-offload, иначе возникнет ошибка cudaMalloc failed: out of memory.
Поддержка видео заявлена архитектурой, но не тестировалась.
🚀 Инструкции по запуску
1. Текстовый режим (llama.cpp)
Базовая команда:
1./llama.cpp/build/bin/llama-cli \
2 -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
3 -ngl 99 \
4 --temp 0.7 \
5 -n 2048 \
6 -p "Ваш запрос"
7С отключением размышлений (рекомендуется):
8
9Создайте файл no-think.jinja со следующим содержимым:
10
11jinja
12{{ bos_token }}
13{% for message in messages %}
14 {% if message['role'] == 'user' %}
15 <|im_start|>user
16 {{ message['content'] }}<|im_end|>
17 {% elif message['role'] == 'assistant' %}
18 <|im_start|>assistant
19 {{ message['content'] }}<|im_end|>
20 {% elif message['role'] == 'system' %}
21 <|im_start|>system
22 {{ message['content'] }}<|im_end|>
23 {% endif %}
24{% endfor %}
25{% if add_generation_prompt %}
26 <|im_start|>assistant
27{% endif %}
28И запускайте модель с флагом --chat-template-file:
29
30bash
31./llama.cpp/build/bin/llama-cli \
32 -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
33 --chat-template-file no-think.jinja \
34 -ngl 99 \
35 --temp 0.7 \
36 -n 2048 \
37 -p "Ваш запрос"
38Творческий режим (генерация идей, написание текстов):
39
40bash
41./llama.cpp/build/bin/llama-cli \
42 -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
43 --chat-template-file no-think.jinja \
44 -ngl 99 \
45 --temp 1.0 --top-p 1.0 --top-k 40 \
46 --repeat-penalty 1.1 \
47 -n 2048 \
48 -p "Ваш запрос"
49Режим точных ответов (логика, код, факты):
50
51bash
52./llama.cpp/build/bin/llama-cli \
53 -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
54 --chat-template-file no-think.jinja \
55 -ngl 99 \
56 --temp 0.6 --top-p 0.95 --top-k 20 \
57 -n 2048 \
58 -p "Ваш запрос"
592. Мультимодальный режим (llama.cpp)
60bash
61./llama.cpp/build/bin/llama-cli \
62 -m ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
63 --mmproj ./models/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
64 --image your_image.png \
65 --chat-template-file no-think.jinja \
66 -ngl 99 \
67 --no-mmproj-offload \
68 -n 2048 \
69 -p "Опиши подробно, что изображено на этой картинке."
703. Использование с Ollama (только текст)
71Текстовая совместимость с Ollama проверена. Создайте файл Modelfile:
72
73dockerfile
74FROM ./models/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf
75
76TEMPLATE """{{ if .System }}<|im_start|>system
77{{ .System }}<|im_end|>
78{{ end }}{{ if .Prompt }}<|im_start|>user
79{{ .Prompt }}<|im_end|>
80{{ end }}<|im_start|>assistant
81"""
82
83PARAMETER temperature 0.7
84PARAMETER top_p 0.8
85PARAMETER top_k 20
86PARAMETER repeat_penalty 1.1
87
88PARAMETER stop "<|im_start|>"
89PARAMETER stop "<|im_end|>"
90Импортируйте и запустите модель:
91
92bash
93ollama create qwen35-iq3xxs -f Modelfile
94ollama run qwen35-iq3xxs "Ваш запрос"
95Мультимодальность в Ollama не поддерживается (проверено на актуальной версии). Для работы с изображениями используйте llama.cpp.
96
97⬇️ Быстрая загрузка всех файлов
98Чтобы скачать модель, mmproj, шаблон и Modelfile одной командой:
99
100bash
101curl -L -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf \
102 -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/mmproj-Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-BF16.gguf \
103 -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/no-think.jinja \
104 -O https://huggingface.co/Nic22Of2003/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive-IQ3_XXS.gguf/resolve/main/Modelfile
105⚠️ Ограничения и известные проблемы
106Единственная тестовая система: все замеры на GTX 1080. На других GPU поведение может отличаться.
107
108Длинный контекст: модель прошла тест «иголка в стоге сена», но на сложных технических текстах качество не гарантируется.
109
110Мультимодальность в Ollama: не работает. Используйте llama.cpp.
111
112Качество на чистом тексте: немного уступает Q3_K_L (WikiText-2), но на смешанных данных с кодом и логикой превосходит его.
113
114❓ FAQ
115Q: Почему выложен только IQ3_XXS, а не Q3_K_L?
116A: Q3_K_L на гибридном домене показал худшее качество при большем размере.
117
118Q: Где взять mmproj?
119A: Файл включён в репозиторий. Также доступен в оригинальном репозитории.
120
121Q: Будет ли модель работать на Windows?
122A: Да, через llama.cpp или LM Studio. Команды адаптируются.
123
124
125
126📄 Лицензия
127Apache License 2.0 (соответствует оригинальной модели).
128
129🙏 Благодарности
130HauhauCS — за оригинальную модель.
131
132Команда llama.cpp — за инструменты квантизации и инференса.