Views
No views yet
tokyotech-llm/Qwen3-Swallow-30B-A3B-RL-v0.2, optimized for Apple Silicon.| Attribute | Value |
|---|---|
| Original Model | tokyotech-llm/Qwen3-Swallow-30B-A3B-RL-v0.2 |
| Architecture | Mixture of Experts (MoE) |
| Parameters | 30B total / 3B active |
| Quantization | 6-bit quantization |
| Model Size | ~23 GB |
| Format | MLX (Apple Silicon optimized) |
| Converted with | mlx-lm v0.30.8 |
| License | Apache 2.0 |
1from mlx_lm import load, generate
2
3model, tokenizer = load("tocchitocchi/Qwen3-Swallow-30B-A3B-RL-v0.2-MLX-6bit")
4
5messages = [{"role": "user", "content": "hello"}]
6prompt = tokenizer.apply_chat_template(
7 messages, add_generation_prompt=True
8)
9
10response = generate(model, tokenizer, prompt=prompt, verbose=True, max_tokens=512)mlx_lm.chat --model tocchitocchi/Qwen3-Swallow-30B-A3B-RL-v0.2-MLX-6bitmlx_lm.server --model tocchitocchi/Qwen3-Swallow-30B-A3B-RL-v0.2-MLX-6bit --port 8080http://localhost:8080/v1.