Views
No views yet
| Quant | Use case |
|---|---|
| F16 | Full precision, reference quality |
| Q8_0 | Near-lossless, largest quant size |
| Q6_K | Very high quality, minimal loss |
| Q5_K_M / Q5_K_S | High quality, good balance |
| Q4_K_M / Q4_K_S | Recommended default — best speed/quality tradeoff |
| Q4_0 | Legacy 4-bit, faster on some hardware |
| Q3_K_L / Q3_K_M / Q3_K_S | Lower RAM, noticeable quality drop |
| Q2_K | Smallest, most compressed, quality degrades |
./llama-cli -m NVIDIA-Nemotron-3.5-Lightning-30B-A3B-Q4_K_M.gguf -p "Your prompt here"llama.cpp's conversion and quantization tools.