Views
No views yet
1cd Quark/examples/torch/language_modeling/llm_ptq/
2 python quantize_quark.py \
3 --model_dir zai-org/GLM-5.2 \
4 --output_dir GLM-5.2-MXFP4 \
5 --quant_scheme mxfp4 \
6 --exclude_layers "*self_attn*" "*mlp.gate" "*lm_head" \
7 "*mlp.gate_proj" "*mlp.up_proj" "*mlp.down_proj" \
8 "*layers.78.*" \ # Exclude the MTP layer (layer 78)
9 --file2file_quantization| Benchmark | GLM-5.2 | GLM-5.2-MXFP4(this model) | Recovery |
| GSM8K (flexible-extract) | 94.09 | 93.93 | 99.8% |
lm-evaluation-harness framework, based on the Docker image lmsysorg/sglang:v0.5.13.post1-rocm700-mi35x, with SGLang pre-installed inside the image and lm-eval compiled and installed from source.lm_eval --model sglang \
--model_args pretrained=amd/GLM-5.2-MXFP4,tp_size=4 \
--tasks gsm8k \
--batch_size autorocm/vllm-dev:nightly_main_20260616 with vLLM pre-installed can also be used for reproducing using vLLM backend.export VLLM_ROCM_USE_AITER=1
export VLLM_ROCM_USE_AITER_FP8BMM=0
export VLLM_ROCM_USE_AITER_FP4BMM=0
lm_eval --model vllm \
--model_args 'pretrained=amd/GLM-5.2-MXFP4,tensor_parallel_size=4,dtype=auto,quantization='quark',gpu_memory_utilization=0.9,max_model_len=32768,trust_remote_code=True' \
--tasks gsm8k \
--batch_size auto