Views
No views yet

1 arc arc/e boolq hswag obkqa piqa wino
2mxfp8 0.608,0.770,0.897,0.761,0.430,0.814,0.707
3qx86-hi 0.606,0.764,0.894,0.760,0.430,0.811,0.712
4qx64-hi 0.607,0.776,0.898,0.756,0.450,0.806,0.697
5mxfp4 0.602,0.779,0.894,0.757,0.424,0.805,0.693
6Thinking
7bf16 0.432,0.477,0.702,0.695,0.386,0.787,0.711
8qx64-hi 0.425,0.481,0.766,0.696,0.390,0.782,0.706
9mxfp4 0.425,0.489,0.391,0.697,0.378,0.784,0.708
10
11Quant Perplexity Peak Memory Tokens/sec
12bf16 4.217 ± 0.027 76.15 GB 1642
13qx64-hi 4.231 ± 0.028 36.83 GB 1573
14mxfp4 4.522 ± 0.030 25.33 GB 16091 arc arc/e boolq hswag obkqa piqa wino
2Qwen3.6-35B-A3B-Holo3-Instruct
3mxfp8 0.606,0.771,0.897,0.762,0.426,0.811,0.709
4
5Qwen3.6-35B-A3B-Qwopus-Instruct
6mxfp8 0.601,0.754,0.894,0.761,0.430,0.810,0.704
7
8Qwen3.6-35B-A3B-Instruct
9mxfp8 0.581,0.757,0.892,0.751,0.428,0.803,0.688
10Thinking
11qx86-hi 0.427,0.465,0.759,0.689,0.392,0.778,0.691
12qx64-hi 0.433,0.476,0.708,0.693,0.384,0.778,0.704
13qx64 0.425,0.474,0.590,0.690,0.390,0.781,0.700
14
15Quant Perplexity Peak Memory Tokens/sec
16mxfp8 5.138 ± 0.037 42.65 GB 1201
17mxfp4 5.158 ± 0.037 25.33 GB 1355
18qx86-hi 4.826 ± 0.033 45.50 GB 1474
19qx64-hi 4.710 ± 0.032 36.83 GB 1414
20qx64 4.702 ± 0.032 30.69 GB 13661models:
2 - model: Qwen/Qwen3.6-35B-A3B
3 parameters:
4 weight: 1.6
5 - model: Hcompany/Holo3-35B-A3B
6 parameters:
7 weight: 0.4
8merge_method: nuslerp
9dtype: bfloat16
10name: Qwen3.6-35B-A3B-Holo3
11
12models:
13 - model: Qwen/Qwen3.6-35B-A3B
14 parameters:
15 weight: 1.6
16 - model: samuelcardillo/Qwopus-MoE-35B-A3B
17 parameters:
18 weight: 0.4
19merge_method: nuslerp
20dtype: bfloat16
21name: Qwen3.6-35B-A3B-Qwopus
22
23models:
24 - model: Qwen3.6-35B-A3B-Holo3
25 parameters:
26 weight: 1.6
27 - model: Qwen3.6-35B-A3B-Qwopus
28 parameters:
29 weight: 0.4
30merge_method: nuslerp
31dtype: bfloat16
32name: Qwen3.6-35B-A3B-Holo3-Qwopuspip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("Qwen3.6-35B-A3B-Holo3-Qwopus-Instruct-qx64-hi-mlx")
4
5prompt = "hello"
6
7if tokenizer.chat_template is not None:
8 messages = [{"role": "user", "content": prompt}]
9 prompt = tokenizer.apply_chat_template(
10 messages, add_generation_prompt=True, return_dict=False,
11 )
12
13response = generate(model, tokenizer, prompt=prompt, verbose=True)