Views
No views yet
cd Quark/examples/torch/language_modeling/llm_ptq/
export exclude_layers="lm_head model.visual.* mtp.* *mlp.gate *shared_expert_gate* *.linear_attn.* *.self_attn.* *.shared_expert.*"
python3 quantize_quark.py --model_dir Qwen/Qwen3.5-35B-A3B-FP8 \
--quant_scheme mxfp4 \
--file2file_quantization \
--exclude_layers $exclude_layers \
--output_dir amd/Qwen3.5-35B-A3B-MXFP4| Benchmark | Qwen/Qwen3.5-35B-A3B-FP8 | amd/Qwen3.5-35B-A3B-MXFP4(this model) | Recovery |
| gsm8k (flexible-extract) | 89.39 | 93.25 | 104.32% |
lm_eval \
--model vllm \
--model_args pretrained=amd/Qwen3.5-35B-A3B-MXFP4,tensor_parallel_size=4,max_model_len=262144,gpu_memory_utilization=0.90,max_gen_toks=2048,trust_remote_code=True,reasoning_parser=qwen3 \
--tasks gsm8k --num_fewshot 5 \
--batch_size auto