Views
No views yet
--q-mode nvfp4 --q-group-size 16).Qwen3_5MoeForConditionalGeneration, 35B total / 3B active)Note — text-only. The base is multimodal; mlx-lm converts the language model only (vision tower not included). Tokenizer, chat template, andgeneration_configare included.
1pip install -U mlx-lm
2mlx_lm.generate --model pipenetwork/Qwen3.6-35B-A3B-mlx-nvfp4 \
3 --prompt "Write a haiku about Apple Silicon." --max-tokens 2561from mlx_lm import load, generate
2model, tokenizer = load("pipenetwork/Qwen3.6-35B-A3B-mlx-nvfp4")
3messages = [{"role": "user", "content": "Explain mixture-of-experts in one paragraph."}]
4prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
5print(generate(model, tokenizer, prompt=prompt, max_tokens=512, verbose=True))