| Repo | Quantization | Size | BPW | imatrix | Best for |
|---|---|---|---|---|---|
| blackshell69/Llama-Sahabat-AI-v2-70B-IT-Q8_0 | Q8_0 | 70 GB | 8.50 | No | Near-lossless, 80+ GB VRAM |
| blackshell69/Llama-Sahabat-AI-v2-70B-IT-Q3_K_S | Q3_K_S | 29 GB | 3.50 | No | Best quality that fits a 32 GB GPU |
| blackshell69/Llama-Sahabat-AI-v2-70B-IT-Q2_K_S | Q2_K_S | 23 GB | 2.77 | Yes | Smallest footprint, quality trade-off |
llama-cli -m llama-sahabat-70b-Q3_K_S.gguf -p "Halo, apa kabar?" -ngl 40| Quantization | Min VRAM (full offload) | CPU RAM (no GPU) |
|---|---|---|
| Q2_K_S | ~25 GB | ~28 GB |
| Q3_K_S | ~32 GB | ~34 GB |
| Q8_0 | ~75 GB | ~78 GB |