Views
No views yet
| Dataset | Base | Tuned (mean ± std) | Δ (pp, rel %) |
|---|---|---|---|
| gsm8k | 81.2 | 54.3 ± 4.0 | -26.8 pp, -33% |
| arc_challenge | 85.2 | 79.2 ± 0.8 | -6.0 pp, -7% |
| arc_easy | 97.7 | 94.2 ± 1.0 | -3.5 pp, -4% |
| commonsenseqa | 69.8 | 73.7 ± 3.3 | +3.8 pp, +5% |
| openbookqa | 82.3 | 77.7 ± 0.8 | -4.7 pp, -6% |
| qasc | 76.5 | 76.0 ± 0.5 | -0.5 pp, -1% |
| sciq | 93.8 | 92.8 ± 1.2 | -1.0 pp, -1% |
| mmlu_pro(OOD) | 33.8 | 31.8 ± 1.9 | -2.0 pp, -6% |
| mmlu_redux(OOD) | 52.5 | 54.0 ± 4.4 | +1.5 pp, +3% |
| gpqa_diamond(OOD) | 7.6 | 31.6 ± 3.6 | +24.1 pp, +318% |
| InD Average | 83.8 | 78.3 ± 0.3 | -5.5 pp, -7% |
| OOD | 31.4 | 39.2 ± 0.7 | +7.8 pp, +25% |
| ALL | 68.1 | 66.6 ± 0.1 | -1.5 pp, -2% |
pp) and the relative percent change (tuned − base) / base × 100 (rel %, shown as n/a when base accuracy is 0).| Dataset | Base | Tuned (mean ± std) | Reduction % |
|---|---|---|---|
| gsm8k | 4450 | 410 ± 6 | -91% |
| arc_challenge | 3157 | 196 ± 1 | -94% |
| arc_easy | 1871 | 192 ± 2 | -90% |
| commonsenseqa | 3949 | 183 ± 1 | -95% |
| openbookqa | 3378 | 183 ± 1 | -95% |
| qasc | 3932 | 207 ± 1 | -95% |
| sciq | 1944 | 194 ± 3 | -90% |
| mmlu_pro(OOD) | 6582 | 277 ± 2 | -96% |
| mmlu_redux(OOD) | 5589 | 269 ± 25 | -95% |
| gpqa_diamond(OOD) | 8001 | 289 ± 1 | -96% |
| InD Average | 3240 | 223 ± 1 | -93% |
| OOD | 6720 | 278 ± 9 | -96% |
| ALL | 4281 | 240 ± 3 | -94% |
+, means the tuned model generates more tokens).