Views
No views yet
| Quant | Size | Uso recomendado |
|---|---|---|
| Q2_K | 12.9 GB | recursos minimos, calidad notable degradada |
| IQ3_M | 15.4 GB | low VRAM, mejor calidad que Q3_K_S |
| Q3_K_M | 16.8 GB | low VRAM compromise standard |
| IQ4_XS | 18.7 GB | mejor calidad/tamaño que Q4_K_M para algunos casos |
| Q4_K_M | 21.2 GB | LA MAS USADA, default recomendado |
| Q5_K_M | 24.7 GB | near-lossless, recomendado si VRAM permite |
| Q8_0 | 36.9 GB | reference quality, casi sin perdida vs F16 |
imatrix.dat incluido en el repo para re-quantizar si querés generar otros formatos.temperature = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
presence_penalty = 1.5
repeat_penalty = 1.0llama-server --model Slopus-4.65-XHigh-Q4_K_M.gguf --gpu-layers 999 --ctx-size 16384 --host 0.0.0.0 --port 8000--model-draft sobre Slopus. El base Darwin NO tiene MTP heads (es merge sin esa optimización). Benchmarks comunitarios (RTX 3090, A6000) muestran que speculative tradicional con A3B MoE es net negativo. Correr solo.