Views
No views yet
cd Quark/examples/torch/language_modeling/llm_ptq/
exclude_layers="*lm_head *self_attn* *router*"
python3 internal_scripts/quantize_quark.py \
--model_dir openai/gpt-oss-120b \
--quant_scheme w_mxfp4_a_fp8 \
--exclude_layers $exclude_layers \
--num_calib_data 512 \
--output_dir amd/gpt-oss120b-w-mxfp4-a-fp8 \
--model_export hf_format \
--multi_gpulow reasoning effort.| Benchmark | gpt-oss-120b | gpt-oss120b-w-mxfp4-a-fp8(this model) | Recovery |
| AIME25 | 65.25 | 67.12 | 102.87% |
| GPQA | 51.67 | 53.42 | 103.39% |
low effort setting, and vLLM docker rocm/vllm-private:rocm7.0_ubuntu_22.04_vllm_0.10.1_instinct_gptoss_wmxfp4_afp8_20251030.vllm serve amd/gpt-oss120b-w-mxfp4-a-fp8 \
--tensor_parallel_size 2 \
--gpu-memory-utilization 0.90 \
--no-enable-prefix-caching \
--max-num-batched-tokens 1024python -m gpt_oss.evals --model /shareddata/amd/gpt-oss120b-w-mxfp4-a-fp8 --eval aime25,gpqa --reasoning-effort low --n-threads 128