Views
No views yet
Inferact/MiniMax-M3-EAGLE3-GQA.MiniMaxAI/MiniMax-M3-MXFP8 served with vLLM at tensor-parallel-size=4, num_speculative_tokens=3, greedy sampling (temperature=0, top_p=1.0), max-concurrency=16.| Dataset | n | Mean accepted length | Draft accept rate | Per-position accept rate (pos 1 / 2 / 3) |
|---|---|---|---|---|
| MT-Bench | 64 | 2.663 | 55.42% | 0.742 / 0.534 / 0.386 |
| SPEED-Bench (qualitative) | 64 | 2.633 | 54.43% | 0.736 / 0.526 / 0.371 |