Mad Cat Lab tarafından dijital pazarlama ve marketing mix diyalogları için
ince ayarlanmış 4B parametreli dil modeli. GGUF formatında, CPU'da çalışır,
ekran kartı gerektirmez.
Model iç muhakeme bloğu açar ancak kapatmaz. Bu ayar verilmezse OpenAI uyumlu
API yanıtında content alanı boş döner, metin reasoning_content alanına
gider ve standart istemciler boş cevap görür.
Ölçülen davranış (/v1/chat/completions, aynı soru):
Ayar
content
reasoning_content
Sonuç
varsayılan
0
686
❌ boş cevap
--reasoning-format none
619
0
⚠️ etiket metne karışır
enable_thinking=false
510
0
✅ temiz
Kullanım
llama.cpp — sunucu (önerilen)
OpenAI uyumlu endpoint açar, mevcut entegrasyonlara doğrudan takılır.
Ollama 0.32.5 bu modeli çalıştıramıyor. Model başarıyla oluşturuluyor ve
metadata doğru okunuyor, ancak yükleme sırasında motor çöküyor:
Error: 500 Internal Server Error: llama-server process has terminated: signal: killed
Sebep: modelin katmanlarının çoğu lineer dikkat (SSM) kullanıyor ve Ollama'nın
gömülü motoru bu katman tipini henüz implemente etmiyor. Bağlam boyutundan
veya bellekten kaynaklanmıyor — 2048 bağlamla da aynı hata alınıyor.
Depodaki Modelfile doğru yapılandırılmıştır; Ollama bu mimariyi desteklediğinde
değişiklik yapmadan çalışacaktır. O zamana kadar llama.cpp kullanın.
Donanım gereksinimi
GPU / VRAM gerekmez. Katmanların yalnızca dörtte biri klasik dikkat
kullanır, kalanı lineer dikkattir; bu yüzden KV cache olağandışı küçüktür
(token başına ~32 KB) ve uzun bağlam RAM sorunu çıkarmaz.
Bağlam
KV cache
Toplam RAM
4K
0.13 GB
~3.4 GB
16K
0.54 GB
~3.8 GB
32K
1.07 GB
~4.3 GB
128K
4.29 GB
~7.5 GB
8 GB RAM'li bir ofis bilgisayarında 16K bağlamla rahat çalışır.--cache-type-k q8_0 --cache-type-v q8_0 ile KV cache yarıya iner.
Ölçülen hız (Apple M4 Max, saf CPU)
Thread
Prompt işleme
Token üretimi
4
101 t/s
36.1 t/s
8
172 t/s
52.4 t/s
12
155 t/s
25.8 t/s
Thread sayısını fiziksel performans çekirdeği kadar ayarlayın.
Verimlilik çekirdeklerine taşmak senkronizasyon nedeniyle üretimi yavaşlatır.
Token üretimi bellek bant genişliğine bağlıdır. Tipik bir DDR5 dizüstünde
(~90 GB/s) yaklaşık 11 t/s beklenir — ortalama okuma hızının üzerinde.
Kullanım amacı ve sınırlar
Türkçe/İngilizce pazarlama, reklam, SEO ve strateji odaklı soru-cevap.
Sistem prompt'u ile asistan/chatbot senaryolarında kullanım.
Üretilen metinler doğrulanmadan yasal, finansal veya kritik iş
kararlarında kullanılmamalıdır.
Güncel platform politikaları ve rakamsal gerçekler için harici doğrulama
gerekir; model tarih ve rakam üretirken yanılabilir.
Quantization, ince ayarın kattığı ton ve format davranışında küçük kayıplara
yol açabilir.
Lisans
Apache-2.0. Model, Apache-2.0 lisanslı bir temel model üzerine LoRA yöntemiyle
ince ayarlanmıştır; türev eser aynı lisans altında dağıtılmaktadır.