Views
No views yet
1 arc arc/e boolq hswag obkqa piqa wino
2qx86-hi 0.420,0.457,0.379,0.671,0.354,0.777,0.702
3qx64-hi 0.413,0.459,0.378,0.670,0.366,0.772,0.687
4mxfp4 0.413,0.464,0.378,0.675,0.364,0.771,0.687
5
6Quant Perplexity Max Memory
7qx86-hi 4.042 ± 0.026 41.52 GB
8qx64-hi 4.073 ± 0.026 32.86 GB
9
10Older models with VL
11
12Qwen3-VL-30B-A3B-Instruct
13qx86-hi 0.439,0.541,0.894,0.619,0.430,0.764,0.592
14qx64-hi 0.454,0.544,0.893,0.618,0.428,0.749,0.590
15
16Qwen3-VL-30B-A3B-Thinking
17qx86-hi 0.393,0.466,0.751,0.648,0.366,0.776,0.667qx86-hi 0.418,...
qx64-hi 0.419,...
Perplexity
qx86-hi 4.037 ± 0.026 37.46 GB
qx64-hi 4.079 ± 0.026 28.79 GBpip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("Qwen3.5-35B-A3B-Text-qx86-hi-mlx")
4
5prompt = "hello"
6
7if tokenizer.chat_template is not None:
8 messages = [{"role": "user", "content": prompt}]
9 prompt = tokenizer.apply_chat_template(
10 messages, add_generation_prompt=True, return_dict=False,
11 )
12
13response = generate(model, tokenizer, prompt=prompt, verbose=True)