Views
No views yet

📢 V2.0 is available — We have released an updated model with enhanced tool-calling capabilities. Welcome to try the new version:
| File | Quant | Size | Notes |
|---|---|---|---|
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-Q4_K_M.gguf | Q4_K_M | ~657 MB | smallest footprint |
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-Q5_K_M.gguf | Q5_K_M | ~751 MB | balanced quality / size |
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-Q8_0.gguf | Q8_0 | ~1.1 GB | recommended default |
MiniCPM5-1B-Claude-Opus-Fable5-Thinking-F16.gguf | F16 | ~2.1 GB | full-precision conversion base |
llama-cli)1llama-cli \
2 -m MiniCPM5-1B-Claude-Opus-Fable5-Thinking-Q8_0.gguf \
3 -p "Write a Python function to merge two sorted lists." \
4 -n 512 \
5 --temp 0.9 --top-p 0.95 \
6 -c 8192The model supports up to 128K tokens (131,072) perconfig.json. Set-caccording to your available VRAM/RAM.
1llama-server \
2 -m MiniCPM5-1B-Claude-Opus-Fable5-Thinking-Q8_0.gguf \
3 -c 8192 --port 8080.gguf file from this repository. The MiniCPM5 chat template is embedded in the GGUF metadata.| Mode | Params |
|---|---|
| Think (default) | temperature=0.9, top_p=0.95 |
| No Think | temperature=0.7, top_p=0.95, enable_thinking=False |
config.json)