Views
No views yet

| decode @ 129k cached | 19.0 t/s |
| full-ctx prime | 503 t/s |
| short decode / prefill | 28.6 / ~1277 t/s |
1git clone https://github.com/newjordan/museB70.git
2cd museB70
3
4hf download Frosty40/Muse-Glimmer-30B-ArcB70-GGUF muse-glimmer-30B-kquant-17gb.gguf
5
6gh release download v2026.08.12-b70 --repo newjordan/museB70 \
7 --pattern 'muse-serve-3ce44d373-linux-b70.tar.zst'
8sha256sum -c releases/ASSET_SHA256SUMS
9tar --zstd -C releases -xf muse-serve-3ce44d373-linux-b70.tar.zst
10rm -f muse-serve-3ce44d373-linux-b70.tar.zst1MODEL=muse-glimmer-30B-kquant-17gb.gguf \
2LLAMA_BIN=./releases/muse-serve-3ce44d373/bin/llama-server \
3 ./serve-muse-arc.sh1curl -s localhost:8095/v1/chat/completions \
2 -H 'Content-Type: application/json' \
3 -d '{"model":"muse-glimmer-30b-q4","messages":[{"role":"user","content":"hi"}],"max_tokens":128}'reasoning_content. Echo both that and content on later turns, and give it enough max_tokens.