Views
No views yet
1from quark.torch import ModelQuantizer
2from quark.torch.quantization.config.template import LLMTemplate
3
4template = LLMTemplate.get('deepseek_v4')
5qconfig = template.get_config(scheme='mxfp4')
6ModelQuantizer(qconfig).direct_quantize_checkpoint(
7 pretrained_model_path='<DSV4_Pro_src_path>',
8 save_path='<output_dir>',
9 keep_excluded_layers_as_original_model_state=True,
10)vllm/vllm-openai-rocm:v0.29.0. vLLM and lm_eval are both installed from source.| Benchmark | deepseek-ai/DeepSeek-V4-Pro | amd/DeepSeek-V4-Pro-MXFP4 | Recovery |
|---|---|---|---|
| GSM8K (strict-match) | 94.90 | 93.6 | 99.0% |
vllm/vllm-openai-rocm:v0.29.0.1export VLLM_ROCM_USE_AITER=1
2export VLLM_ROCM_USE_AITER_FUSION_SHARED_EXPERTS=1
3vllm serve amd/DeepSeek-V4-Pro-MXFP4 --tensor-parallel-size 4 --kv-cache-dtype fp8 \
4 --trust-remote-code --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 \
5 --tool-call-parser deepseek_v4 --enable-auto-tool-choice \
6 --compilation-config '{"mode": 3, "cudagraph_mode": "FULL_DECODE_ONLY"}'1lm_eval --model local-completions \
2 --model_args model=amd/DeepSeek-V4-Pro-MXFP4,base_url=http://localhost:30000/v1/completions,tokenized_requests=False,num_concurrent=32 \
3 --tasks gsm8k --batch_size auto --num_fewshot 8