Views
No views yet
gemma-4-E4B-it for Apple Silicon via MLX.| Property | Value |
|---|---|
| Base model | google/gemma-4-e4b-it |
| Parameters | 7.5B |
| Quantization | DWQ 4-bit (teacher: 8-bit) |
| Framework | MLX |
| RAM | ~5 GB |
| Metric | Score |
|---|---|
| Accuracy | 0.7113 |
| Accuracy (normalized) | 0.6540 |
allenai/tulu-3-sft-mixture (256 samples, 131,072 tokens, seq len 512)| Metric | Score |
|---|---|
| BLEU Max | 9.69 |
| BLEU Acc | 0.52 |
| ROUGE-1 Acc | 0.56 |
| ROUGE-2 Acc | 0.44 |
| ROUGE-L Acc | 0.55 |
| Metric | Score |
|---|---|
| MC1 Accuracy | 0.31 |
| MC2 Accuracy | 0.5637 |
| Model | ARC Easy (acc) | Perplexity ↓ | TruthfulQA MC2 | RAM |
|---|---|---|---|---|
| 8-bit (base) | 0.7168 | 44.44 | 0.5705 | 8.5 GB |
| DWQ 4-bit (this) | 0.7113 | 42.85 ✅ | 0.5637 | 4.8 GB |
| Std 4-bit | 0.7075 | 54.07 ❌ | 0.5506 | 4.8 GB |
1from mlx_lm import load, generate
2
3model, tokenizer = load("chantra/gemma-4-4bit-it-mlx-dwq-ram-5gb")
4response = generate(model, tokenizer, prompt="Hello!", max_tokens=512)
5print(response)