Views
No views yet
| File | Quant | Size | Notes |
|---|---|---|---|
AJ-DeepSeekR1Qwen32B-v2.1.0-Q4_K_M.gguf | Q4_K_M | ~19 GB | Recommended for 24 GB GPUs (RTX 4090). Good quality / speed. |
AJ-DeepSeekR1Qwen32B-v2.1.0-Q8_0.gguf | Q8_0 | ~33 GB | Near-lossless. Needs 40+ GB VRAM or CPU offload. |
deepseek-ai/DeepSeek-R1-Distill-Qwen-32B (32B, BF16)ianwesterfield/AJ-DeepSeekR1Qwen32B-v2.1.0-lora for
the raw adapter.1llama-server -m AJ-DeepSeekR1Qwen32B-v2.1.0-Q4_K_M.gguf \
2 --host 0.0.0.0 --port 8081 \
3 --n-gpu-layers 65 --ctx-size 8192<|User|> /
<|Assistant|> / <|end▁of▁sentence|>). llama-server picks this up
from the embedded tokenizer metadata; no manual template required.