Views
No views yet
tokyotech-llm/Qwen3-Swallow-32B-RL-v0.2, optimized for Apple Silicon.| Attribute | Value |
|---|---|
| Original Model | tokyotech-llm/Qwen3-Swallow-32B-RL-v0.2 |
| Architecture | Dense Transformer |
| Parameters | 32B |
| Quantization | 4-bit quantization |
| Model Size | ~17 GB |
| Format | MLX (Apple Silicon optimized) |
| Converted with | mlx-lm v0.30.8 |
| License | Apache 2.0 |
1from mlx_lm import load, generate
2
3model, tokenizer = load("tocchitocchi/Qwen3-Swallow-32B-RL-v0.2-MLX-4bit")
4
5messages = [{"role": "user", "content": "hello"}]
6prompt = tokenizer.apply_chat_template(
7 messages, add_generation_prompt=True
8)
9
10response = generate(model, tokenizer, prompt=prompt, verbose=True, max_tokens=512)mlx_lm.chat --model tocchitocchi/Qwen3-Swallow-32B-RL-v0.2-MLX-4bitmlx_lm.server --model tocchitocchi/Qwen3-Swallow-32B-RL-v0.2-MLX-4bit --port 8080http://localhost:8080/v1.