Views
No views yet
pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("Otilde/gpt-oss-safeguard-20b-MXFP4-Q4-MLX")
4
5prompt = "hello"
6
7if tokenizer.chat_template is not None:
8 messages = [{"role": "user", "content": prompt}]
9 prompt = tokenizer.apply_chat_template(
10 messages, add_generation_prompt=True
11 )
12
13response = generate(model, tokenizer, prompt=prompt, verbose=True)Running warmup..
Timing with prompt_tokens=512, generation_tokens=1024, batch_size=1.
Trial 1: prompt_tps=436.297, generation_tps=67.886, peak_memory=11.702
Trial 2: prompt_tps=429.775, generation_tps=66.781, peak_memory=11.703
Trial 3: prompt_tps=434.135, generation_tps=57.611, peak_memory=11.703
Trial 4: prompt_tps=140.279, generation_tps=4.825, peak_memory=11.704
Trial 5: prompt_tps=65.847, generation_tps=6.404, peak_memory=11.704
Averages: prompt_tps=301.266, generation_tps=40.701, peak_memory=11.703