Views
No views yet
1 arc arc/e boolq hswag obkqa piqa wino
2mxfp8 0.392,0.441,0.627,0.601,0.360,0.739,0.590
3q8-hi 0.398,0.435,0.622,0.604,0.362,0.732,0.585
4q8 0.398,0.434,0.622,0.604,0.362,0.733,0.582
5q6-hi 0.398,0.436,0.622,0.601,0.366,0.733,0.589
6q6 0.392,0.437,0.622,0.604,0.372,0.736,0.590
7mxfp4 0.371,0.444,0.632,0.585,0.356,0.732,0.548
8
9Quant Perplexity Peak memory
10mxfp8 4.953 ± 0.035 9.61 GB
11mxfp4 5.209 ± 0.037 7.65 GB
12
13Qwen3.5-4B-Instruct
14mxfp8 0.505,0.688,0.892,0.652,0.420,0.760,0.658
15q8-hi 0.509,0.667,0.886,0.654,0.424,0.757,0.663
16q8 0.507,0.663,0.885,0.654,0.424,0.758,0.662
17q6-hi 0.501,0.663,0.887,0.652,0.434,0.757,0.661
18q6 0.503,0.658,0.884,0.653,0.426,0.756,0.662
19mxfp4 0.487,0.656,0.878,0.634,0.420,0.746,0.616
20
21tvall43/Qwen3.5-4B-Text-heretic
22 arc arc/e boolq hswag obkqa piqa wino
23mxfp8 0.507,0.686,0.881,0.654,0.424,0.756,0.660
24mxfp4 0.480,0.656,0.878,0.635,0.418,0.742,0.624
25
26Qwen3.5-4B-Text
27mxfp8 0.392,0.439,0.628,0.601,0.360,0.739,0.585
28
29Old model
30
31Qwen3-4B-Thinking-2507
32mxfp4 0.381,0.408,0.686,0.516,0.364,0.701,0.585
33
34Qwen3-4B-Instruct-2507
35dwq5 0.449,0.588,0.843,0.458,0.394,0.697,0.556{%- set enable_thinking = false %}
pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("Qwen3.5-4B-mxfp4-mlx")
4
5prompt = "hello"
6
7if tokenizer.chat_template is not None:
8 messages = [{"role": "user", "content": prompt}]
9 prompt = tokenizer.apply_chat_template(
10 messages, add_generation_prompt=True, return_dict=False,
11 )
12
13response = generate(model, tokenizer, prompt=prompt, verbose=True)