Views
No views yet
self_attn, the router (mlp.gate), shared_expert, GatedDeltaNet (linear_attn), lm_head, embeddings, vision tower, MTP head.compressed-tensors (pack-quantized). Full recipe: recipe.yaml.| Benchmark | Score |
|---|---|
| GSM8K | 96.8% (242/250) |
| MMLU-Pro | 80.2% (401/500) |
1# W4A16 — int4 expert weights, fp16 activations
2vllm serve Avesed/Qwen3.6-35B-A3B-INT4-W4A16 \
3 --tensor-parallel-size 2 --trust-remote-code --reasoning-parser qwen31vllm serve Avesed/Qwen3.6-35B-A3B-INT4-W4A16 \
2 --tensor-parallel-size 2 --marlin-input-dtype int8 --trust-remote-code --reasoning-parser qwen3