Views
No views yet
cd Quark/examples/torch/language_modeling/llm_ptq/
export exclude_layers="*mlp.gate.* *lm_head model.layers.61.eh_proj model.layers.61.shared_head.head model.layers.61.embed_tokens"
python3 quantize_quark.py --model_dir amd/DeepSeek-R1-0528-BF16 \
--quant_scheme mxfp4 \
--layer_quant_scheme '*self_attn*' ptpc_fp8 \
--exclude_layers $exclude_layers \
--skip_evaluation \
--model_export hf_format \
--output_dir amd/DeepSeek-R1-0528-MXFP4-MTP-MoEFP4 \
--multi_gpu| Benchmark | DeepSeek-R1-0528 | DeepSeek-R1-0528-MXFP4-MTP-MoEFP4(this model) |
| GSM8K | 94.24 | 94.90 |
1vllm serve amd/DeepSeek-R1-0528-MXFP4-MTP-MoEFP4 \
2 --tensor-parallel-size 8 \
3 --dtype auto \
4 --speculative-config '{"method":"mtp","num_speculative_tokens":1}' \
5 --gpu-memory-utilization 0.9 \
6 --block-size 1 \
7 --trust-remote-code \
8 --port 8000--tensor-parallel-size, --gpu-memory-utilization, and --port can be adjusted as needed to match the target runtime environment.python3 tests/evals/gsm8k/gsm8k_eval.py