Views
No views yet
| Precision | Layers |
|---|---|
| FP8 E4M3 | All Linear weights: MLA projections, MLP gate/up/down, expert projections, DSA indexer |
| BF16 | lm_head, embed_tokens, MoE router gates, norms |
model_type=glm_moe_dsa78 layers (3 dense + 75 MoE, first_k_dense_replace=3)n_routed_experts=256, num_experts_per_tok=8, n_shared_experts=1max_position_embeddings=202752hidden_size=6144, moe_intermediate_size=2048vocab_size=1548801python3 -m sglang.launch_server --model mconcat/GLM-5.1-FP8-Dynamic \
2 --tensor-parallel-size 8 \
3 --dtype bfloat16 \
4 --trust-remote-code \
5 --mem-fraction-static 0.801vllm serve mconcat/GLM-5.1-FP8-Dynamic \
2 --tensor-parallel-size 8 \
3 --dtype bfloat16 \
4 --trust-remote-code| Framework | Supported | Notes |
|---|---|---|
| vLLM >= 0.19.0 | Yes | Requires glm_moe_dsa + compressed-tensors support |
| SGLang >= 0.5.10 | Yes | Requires GLM-5.1 architecture support |
| transformers >= 5.4.0 | Yes | Direct loading with device_map="auto" |
num_nextn_predict_layers=1 in config.1# Patch 1: FlashMLA ops - add SM120 to sparse support check
2FLASHMLA_OPS=$(python -c "import vllm, os; print(os.path.join(os.path.dirname(vllm.__file__), 'v1/attention/ops/flashmla.py'))") && \
3sed -i 's/is_device_capability_family(90)\s*or current_platform.is_device_capability_family(100)/is_device_capability_family(90) or current_platform.is_device_capability_family(100) or current_platform.is_device_capability_family(120)/' "$FLASHMLA_OPS"
4
5# Patch 2: FlashMLA sparse backend - add SM12 to capability check
6FLASHMLA_SPARSE=$(python -c "import vllm, os; print(os.path.join(os.path.dirname(vllm.__file__), 'v1/attention/backends/mla/flashmla_sparse.py'))") && \
7sed -i 's/return capability.major in \[9, 10\]/return capability.major in [9, 10, 12]/' "$FLASHMLA_SPARSE"
8
9# Patch 3: FlashMLA dense backend (if exists)
10FLASHMLA_DENSE=$(python -c "import vllm, os; print(os.path.join(os.path.dirname(vllm.__file__), 'v1/attention/backends/mla/flashmla.py'))") && \
11sed -i 's/return capability.major in \[9, 10\]/return capability.major in [9, 10, 12]/' "$FLASHMLA_DENSE" 2>/dev/null || truetorch.float8_e4m3fn dtype