Views
No views yet
hf download openai/gpt-oss-120b --local-dir /path/to/openai-gpt-oss-120b 1#/bin/bash
2exclude_layers="*lm_head* *router*"
3
4python3 quantize_quark.py \
5--model_dir /path/to/openai-gpt-oss-120b \
6--quant_scheme mxfp4_fp8 \
7--kv_cache_dtype fp8 \
8--attention_dtype fp8 \
9--exclude_layers $exclude_layers \
10--num_calib_data 512 \
11--output_dir /path/to/gpt-oss-120b-w-mxfp4-a-fp8-kv-fp8-fp8attn-no_lmhead_router \
12--model_export hf_format \
13--multi_gpu1wget https://download.amd.com/opendownload/Quark/amd_quark-0.11.1-py3-none-any.whl
2pip install amd_quark-0.11.1-py3-none-any.whl
3wget https://download.amd.com/opendownload/Quark/amd_quark-0.11.1.zip
4unzip amd_quark-0.11.1.zip
5cd amd_quark-0.11.1/examples/torch/language_modeling/llm_ptq
6chmod +x quantization_command.sh
7./quantization_command.shlow reasoning effort.| Benchmark | gpt-oss-120b | gpt-oss-120b-w-mxfp4-a-fp8-kv-fp8-fp8attn-no_lmhead_router(this model) | Recovery |
| AIME25 | 65.25 | 47.91 | 71.37% |
| GPQA | 51.67 | 64.64 | 125.10% |
low effort setting, and vLLM docker rocm/vllm-dev:nightly.vllm serve amd/gpt-oss-120b-w-mxfp4-a-fp8-kv-fp8-fp8attn-no_lmhead_router \
--tensor_parallel_size 2 \
--gpu-memory-utilization 0.90 \
--no-enable-prefix-caching \
--max-num-batched-tokens 1024python -m gpt_oss.evals --model /shareddata/amd/gpt-oss-120b-w-mxfp4-a-fp8-kv-fp8-fp8attn-no_lmhead_router --eval aime25,gpqa --reasoning-effort low --n-threads 128