Views
No views yet
<think> chain-of-thought with enable_thinking=Trueegypt-won tag)pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("sahilchachra/fable-traces-mxfp4-mlx")
4
5messages = [{"role": "user", "content": "Tell me something interesting."}]
6prompt = tokenizer.apply_chat_template(
7 messages, tokenize=False, add_generation_prompt=True
8)
9response = generate(model, tokenizer, prompt=prompt, max_tokens=512, verbose=True)
10print(response)1prompt = tokenizer.apply_chat_template(
2 messages, tokenize=False, add_generation_prompt=True,
3 enable_thinking=True, # injects <think> block before answer
4)
5response = generate(model, tokenizer, prompt=prompt, max_tokens=1024, verbose=True)1mlx_lm.generate --model sahilchachra/fable-traces-mxfp4-mlx \
2 --prompt "What's the fastest animal on Earth?" \
3 --max-tokens 256| Variant | Format | bpw | Disk | Peak RAM |
|---|---|---|---|---|
| FP16 (original) | BF16 safetensors | 16.0 | 7688 MB | ~8 GB |
| mxfp4 ← this | Block float MX FP4 | 4.25 | 2050 MB | 2.12 GB |
| sahilchachra/fable-traces-4bit-mlx | Affine int4 (group size 64) | 4.50 | 2184 MB | 2.22 GB |
| sahilchachra/fable-traces-mxfp8-mlx | Block float MX FP8 | 8.25 | 3968 MB | 3.98 GB |
Note on bpw: Embedding and norm layers are kept at bf16; the reported bpw is across all linear weights.
| Repo | Format | bpw | Disk |
|---|---|---|---|
| sahilchachra/fable-traces-mxfp4-mlx ← this | MX FP4 | 4.25 | 2050 MB |
| sahilchachra/fable-traces-4bit-mlx | Affine int4 | 4.50 | 2184 MB |
| sahilchachra/fable-traces-mxfp8-mlx | MX FP8 | 8.25 | 3968 MB |