Views
No views yet
1from mlx_lm import load, generate
2
3model, tokenizer = load("QuantLLM/Llama-3.2-3B-2bit-mlx")
4
5prompt = "Write a story about Einstein"
6messages = [{"role": "user", "content": prompt}]
7prompt = tokenizer.apply_chat_template(
8 messages, add_generation_prompt=True
9)
10
11text = generate(model, tokenizer, prompt=prompt, verbose=True)1from mlx_lm import load, stream_generate
2
3model, tokenizer = load("QuantLLM/Llama-3.2-3B-2bit-mlx")
4
5prompt = "Explain quantum computing"
6messages = [{"role": "user", "content": prompt}]
7prompt = tokenizer.apply_chat_template(
8 messages, add_generation_prompt=True
9)
10
11for token in stream_generate(model, tokenizer, prompt=prompt, max_tokens=500):
12 print(token, end="", flush=True)1# Install mlx-lm
2pip install mlx-lm
3
4# Generate text
5python -m mlx_lm.generate --model QuantLLM/Llama-3.2-3B-2bit-mlx --prompt "Hello!"
6
7# Chat mode
8python -m mlx_lm.chat --model QuantLLM/Llama-3.2-3B-2bit-mlxpip install mlx-lm| Property | Value |
|---|---|
| Base Model | meta-llama/Llama-3.2-3B |
| Format | MLX |
| Quantization | Q2_K |
| License | apache-2.0 |
| Created | 2025-12-20 |
1from quantllm import turbo
2
3# Load and quantize any model
4model = turbo("meta-llama/Llama-3.2-3B")
5
6# Export to any format
7model.export("mlx", quantization="Q2_K")