Views
No views yet
1from mlx_lm import load, generate
2
3model, tokenizer = load("bmeyer2025/qmd-query-expansion-qwen3.5-2B-mlx-4bit")
4response = generate(model, tokenizer, prompt="Expand this search query: transformer attention mechanism")mlx_lm.convert:mlx_lm.convert --hf-path tobil/qmd-query-expansion-qwen3.5-2B -q --q-bits 4