Views
No views yet
| Property | Value |
|---|---|
| Base model | moonshotai/Kimi-VL-A3B-Thinking-2506 |
| Release tier | Provisional (datafree RTN — re-quant scheduled) |
| Quant method | datafree RTN W4A16 (AutoRound blocked — KNOWN-FAILURES) |
| FLAC status | Not measured (T+7d milestone) |
| Quant format | compressed-tensors (Marlin G32) |
| Disk size | ~18 GB |
1docker run --gpus device=0 -p 8080:8080 \
2 vllm/vllm-openai:v0.21.0-cu129-ubuntu2404 vllm serve \
3 88plug/Kimi-VL-A3B-Thinking-2506-W4A16 \
4 --trust-remote-code \
5 --max-model-len 8192 \
6 --gpu-memory-utilization 0.90| Metric | Status |
|---|---|
| Throughput (tok/s) | In progress — T+7d milestone |
| MMLU delta vs BF16 | In progress — T+7d milestone |
| RULER@128k | In progress — T+30d milestone |