Views
No views yet
mlx_lm.server — faster, lower memory, Apple-native1from mlx_lm import load, generate
2
3model, tokenizer = load("osirisbrain/OsirisCortex-v7-MLX")
4prompt = tokenizer.apply_chat_template(
5 [{"role": "user", "content": "Explain quantum computing"}],
6 add_generation_prompt=True
7)
8response = generate(model, tokenizer, prompt=prompt, max_tokens=2048)