Views
No views yet
Qwen3_5ForConditionalGeneration (qwen3_5) — vision-language model (text + image + video)mlx_lm 0.31.1, source dtype bfloat16pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("chaddy81/Qwen3.6-27b-coder-4bit-mlx")
4prompt = "Write a Python function that returns the nth Fibonacci number."
5messages = [{"role": "user", "content": prompt}]
6text = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
7print(generate(model, tokenizer, prompt=text, max_tokens=512, verbose=True))mlx_lm.generate --model chaddy81/Qwen3.6-27b-coder-4bit-mlx --prompt "Explain async/await in Python."| Variant | bits-per-weight | Size | Repo |
|---|---|---|---|
| 8-bit | 8.5 | ~27 GB | chaddy81/Qwen3.6-27b-coder-8bit-mlx |
| 6-bit | 6.5 | ~20 GB | chaddy81/Qwen3.6-27b-coder-6bit-mlx |
| 4-bit | 4.5 | ~14 GB | chaddy81/Qwen3.6-27b-coder-4bit-mlx |
tokenizers notice and does not affect the Qwen3.5 architecture or quantized weights. If you observe
unexpected tokenization, load the tokenizer with fix_mistral_regex=True.