MXFP4_MOE GGUF quantization of
openai/gpt-oss-20b.
MXFP4_MOE is the MoE variant of MXFP4 (OCP Microscaling FP4 E2M1 format). It applies a mixed-precision quantization:
MXFP4 runs on any GPU or CPU (unlike NVFP4 which requires Blackwell).
1from llama_cpp import Llama
2
3llm = Llama.from_pretrained(
4 repo_id="FreedomAISVR/gpt-oss-20B-MXFP4-MOE-GGUF",
5 filename="gpt-oss-20B-MXFP4_MOE.gguf",
6)
1# 1. Convert HF model to intermediate GGUF
2python convert_hf_to_gguf.py ./models/gpt-oss-20b/ --outfile gpt-oss-20b-f16.gguf --outtype f16
3
4# 2. Quantize to MXFP4_MOE (requires --allow-requantize due to converter auto-type assignment)
5llama-quantize --allow-requantize gpt-oss-20b-f16.gguf gpt-oss-20b-mxfp4_moe.gguf MXFP4_MOE