Views
No views yet
1from mlx_lm import load, generate
2model, tokenizer = load("JANGQ-AI/Gemma-4-26B-A4B-it-JANG_4M")
3print(generate(model, tokenizer, "Hello", max_tokens=256))mlx_lm picks up the multi-stop-token list ([1, 106, 50]) automatically from generation_config.json — no manual configuration required.