Views
No views yet
openai/gpt-oss-20b (Apache-2.0)q_group_size=32 (some tensors remain FP16 for stability)config.json; tokenizer files included for drop-in usepip install mlx-lm transformers1# Python API (uses tokenizer bundled with this repo)
2from mlx_lm import load, generate
3
4model, tokenizer = load("halley-ai/gpt-oss-20b-MLX-5bit-gs32")
5print(generate(
6 model, tokenizer,
7 prompt="Explain the Chudnovsky algorithm to compute π.",
8 max_tokens=256, max_kv_size=512
9))1# CLI
2python -m mlx_lm generate --model halley-ai/gpt-oss-20b-MLX-5bit-gs32 \
3 --prompt "Explain the Chudnovsky algorithm to compute pi." \
4 --max-kv-size 512 --max-tokens 256| Variant | PPL (ctx=4096) |
|---|---|
| MLX 8-bit (reference) | 10.75 |
| MLX 6-bit (gs=32) | 10.46 (−2.7% vs 8-bit/gs64) |
| MLX 5-bit (gs=32) | 11.11 (+3.3% vs 8-bit/gs64, +6.2% vs 6-bit/gs32) |
| MLX 4-bit (gs=32) | 13.70 (+27.4% vs 8-bit/gs64, +31.0% vs 6-bit/gs32) |
1python -m mlx_lm convert \
2 --hf-path openai/gpt-oss-20b \
3 --mlx-path gpt-oss-20b-mlx-q5-gs32 \
4 --q-bits 5 --q-group-size 32 -q