lm-evaluation-harness (Zero-Shot).| Model | Type | Params (Active) | Training Tokens | Average | SciQ | ARC-Easy | PIQA (Norm) | HellaSwag (Norm) | OpenBookQA (Norm) | Winogrande |
|---|---|---|---|---|---|---|---|---|---|---|
| TinyLlama 1.1B Chat | Dense | 1.1B | 3T | 63.5% | 88.3% | 61.8% | 74.5% | 60.4% | 35.4% | 60.3% |
| SmolLM 360M Inst | Dense | 360M | 600B | 60.7% | 85.9% | 64.1% | 70.6% | 52.8% | 37.0% | 53.7% |
| Qwen2 0.5B Inst | Dense | 0.5B | 12T | 59.0% | 90.3% | 55.0% | 69.3% | 49.1% | 33.0% | 57.3% |
| GTLM-1.2B (Ours) | MoE | 350M | 15B | 56.2% | 87.6% | 56.6% | 66.7% | 42.0% | 32.6% | 51.8% |
| Pythia 410M | Dense | 410M | 300B | 53.9% | 80.8% | 51.9% | 67.3% | 40.6% | 29.6% | 53.4% |
| SmolLM 135M Inst | Dense | 135M | 600B | 52.9% | 73.4% | 49.2% | 67.3% | 42.0% | 33.8% | 51.4% |
| GPT-2 Medium | Dense | 355M | 10B | 52.5% | 77.1% | 49.3% | 66.2% | 39.5% | 30.0% | 53.0% |
| Pythia 160M | Dense | 160M | 300B | 47.7% | 73.4% | 43.4% | 61.4% | 30.4% | 27.4% | 50.0% |


