Views
No views yet
1 arc arc/e boolq hswag obkqa piqa wino
2mxfp8 0.433,0.624,0.807,0.593,0.390,0.752,0.602
3qx86-hi 0.454,0.658,0.821,0.636,0.412,0.770,0.639
4qx64-hi 0.442,0.643,0.824,0.631,0.410,0.765,0.635
5mxfp4 0.444,0.634,0.823,0.622,0.390,0.765,0.628
6
7Quant Perplexity Peak Memory Tokens/sec
8mxfp8 6.228 ± 0.048 17.04 GB 2165
9qx86-hi 5.269 ± 0.039 15.18 GB 2128
10qx64-hi 5.407 ± 0.040 12.08 GB 2326
11mxfp4 5.786 ± 0.044 10.83 GB 1788pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("NVIDIA-Nemotron-Labs-3-Elastic-12B-A2B-mxfp4-mlx")
4
5prompt = "hello"
6
7if tokenizer.chat_template is not None:
8 messages = [{"role": "user", "content": prompt}]
9 prompt = tokenizer.apply_chat_template(
10 messages, add_generation_prompt=True, return_dict=False,
11 )
12
13response = generate(model, tokenizer, prompt=prompt, verbose=True)