Views
No views yet
| Benchmark | Base | This model (FT on OctoBench-2.2k) | Δ |
|---|---|---|---|
| HumanEval (5 runs avg, n=164, t=0.2) | 55.5% (±2.1) | 72.3% (±2.0) | +16.8pp |
| HumanEval+ (5 runs avg, n=164, t=0.2) | 49.0% (±1.9) | 65.1% (±1.6) | +16.1pp |
| BigCodeBench full instruct (1 run, n=1140) | 39.3% | 39.7% | +0.4pp |
| LiveCodeBench v6 (1 run, n=1055, t=0.0) | 29.0% | 26.9% | -2.1pp |
