Views
No views yet
| タスク | 指標 | スコア |
|---|---|---|
| 議事録要約 | 事実忠実度(0-2) | 1.48(ローカル実行の国産モデルで最高値) |
| 議事録要約 | 形式適合 | 1.00 |
| RAG引用 | 引用F1 | 0.772 |
| RAG引用 | 根拠性(0-2) | 1.95 |
| 実効速度 | tok/s(議事録生成/RAG) | 8 / 2 |
tokyotech-llm/Qwen3-Swallow-32B-RL-v0.2(公式BF16、commit 23d2fa7)mlx-lm 0.31.3 / mlx_lm convert -q --q-bits 4(group size 64, 4.5 bpw)1from mlx_lm import load, generate
2
3model, tokenizer = load("tokimoa/Qwen3-Swallow-32B-RL-v0.2-MLX-4bit")
4prompt = tokenizer.apply_chat_template(
5 [{"role": "user", "content": "こんにちは"}],
6 add_generation_prompt=True, tokenize=False, enable_thinking=False,
7)
8print(generate(model, tokenizer, prompt=prompt, max_tokens=512))