Half of all MoE experts removed from
Qwen3-Coder-Next using GOBA-AI-Labs' proprietary calibration-based expert optimization, achieving extreme compression with minimal quality loss.
This model requires
moe-stream for inference due to its layer-adaptive expert structure.
1git clone https://github.com/GOBA-AI-Labs/moe-stream
2cd moe-stream
3cargo build --release --features metal,accelerate
4
5# Download model
6huggingface-cli download goba-ai-labs/PrunedHub-Qwen3-Coder-Next-50pct \
7 --local-dir models/
1# Text generation
2./target/release/moe-stream models/PrunedHub-Qwen3-Coder-Next-50pct-Q4_K_M.gguf 512 \
3 --prompt "def fibonacci(n):" --stream \
4 --preload-gates --preload-attn
1# Start server
2./target/release/moe-stream-server \
3 --model models/PrunedHub-Qwen3-Coder-Next-50pct-Q4_K_M.gguf --port 11434
4
5# Test with curl
6curl http://localhost:11434/v1/chat/completions \
7 -H "Content-Type: application/json" \
8 -d '{"model":"local","messages":[{"role":"user","content":"Write a Python function to sort a linked list"}],"stream":true}'
1from openai import OpenAI
2
3client = OpenAI(base_url="http://localhost:11434/v1", api_key="unused")
4response = client.chat.completions.create(
5 model="local",
6 messages=[{"role": "user", "content": "Implement binary search in Rust"}],
7 stream=True
8)
9for chunk in response:
10 if chunk.choices[0].delta.content:
11 print(chunk.choices[0].delta.content, end="")
moe-stream is a Rust-based MoE inference engine by GOBA-AI-Labs.
1@misc{goba-ai-labs-prunedhub-qwen3-coder-next-50pct,
2 title={PrunedHub Qwen3-Coder-Next-50pct: Extreme MoE Compression via Expert Pruning},
3 author={GOBA-AI-Labs},
4 year={2026},
5 url={https://huggingface.co/GOBA-AI-Labs/PrunedHub-Qwen3-Coder-Next-50pct}
6}