Views
No views yet
| Alan | Değer |
|---|---|
| Kaynak model | madcatlab/Qwen3.5-4B-Marketing |
| Taban mimari | unsloth/Qwen3.5-4B (qwen3_5) |
| Quantization | Q4_K_M |
| Dosya boyutu | 2.6G |
| Lisans | Apache-2.0 |
| Diller | Türkçe, İngilizce |
| Dosya | Quant | Boyut |
|---|---|---|
qwen-madcatlabs-4b-Q4_K_M.gguf | Q4_K_M | 2.6G |
Q4_K_Msaf 4-bit değildir: K-quant reçetesindeattn_vveffn_downtensörleri daha yüksek hassasiyette bırakılır, ortalama ~4.7 bit/parametre olur.
| Bağlam | KV cache | Toplam RAM |
|---|---|---|
| 4K | 0.13 GB | ~3.4 GB |
| 16K | 0.54 GB | ~3.8 GB |
| 32K | 1.07 GB | ~4.3 GB |
| 128K | 4.29 GB | ~7.5 GB |
--cache-type-k q8_0 --cache-type-v q8_0 ile KV cache yarıya iner.-dev none)| Thread | Prompt işleme | Token üretimi |
|---|---|---|
| 4 | 101 t/s | 36.1 t/s |
| 8 | 172 t/s | 52.4 t/s |
| 12 | 155 t/s | 25.8 t/s |
Thread sayısını fiziksel performans çekirdeği sayısıyla sınırlayın. Verimlilik çekirdeklerine taşmak senkronizasyon nedeniyle üretimi yavaşlatır.Token üretimi bellek bant genişliğine bağlıdır. Tipik bir DDR5 dizüstünde (~90 GB/s) yaklaşık 11 t/s beklenir — okuma hızının üzerinde.
enable_thinking=false zorunlu<think> bloğunu açar ama kapatmaz — cevabın tamamı kapanmamış
düşünce bloğunun içinde kalır. Varsayılan ayarlarla llama-server kullanırsanız
OpenAI uyumlu yanıtta content alanı boş döner, metin reasoning_content
alanına gider. Standart istemciler yalnızca content okuduğu için entegrasyon
her istekte boş cevap alır./v1/chat/completions, aynı soru):| Ayar | content | reasoning_content | Sonuç |
|---|---|---|---|
| varsayılan | 0 | 686 | ❌ boş cevap |
--reasoning-format none | 619 | 0 | ⚠️ <think> etiketi metne karışır |
--chat-template-kwargs '{"enable_thinking":false}' | 510 | 0 | ✅ temiz |
enable_thinking false iken önceden kapatılmış boş blok
(<think>\n\n</think>) yazar ve model cevabı doğrudan içerik olarak üretir.1llama-server -m qwen-madcatlabs-4b-Q4_K_M.gguf -c 16384 -t 8 \
2 --chat-template-kwargs '{"enable_thinking":false}' \
3 --cache-type-k q8_0 --cache-type-v q8_0 --port 80801llama-cli -m qwen-madcatlabs-4b-Q4_K_M.gguf -c 16384 -t 8 \
2 --chat-template-kwargs '{"enable_thinking":false}' \
3 -sys "Sen dijital pazarlama uzmanısın."1ollama create Qwen3.5-4B-Marketing -f Modelfile
2ollama run Qwen3.5-4B-MarketingQ5_K_M veya Q6_K tercih edin.1@misc{madcatlab_qwen35_4b_marketing_gguf,
2 title = { Qwen3.5-4B-Marketing-GGUF },
3 author = {madcatlab},
4 year = {2026},
5 howpublished = {\url{https://huggingface.co/madcatlab/Qwen3.5-4B-Marketing}},
6 note = {GGUF conversion of a LoRA fine-tune of unsloth/Qwen3.5-4B}
7}