Views
No views yet
rg_reward.py:compute_score)reasoning-gym containing multiple algorithmic and logic tasks across multiple languages, available at MauroPello/reasoning-gym-verl-datasets. The training set was dynamically interleaved across tasks and languages to maintain a balanced data distribution.1e-62564096819220.001Qwen/Qwen3-1.7B across several benchmarks, showing substantial improvements in reasoning accuracy, particularly on the Reasoning Gym validation split and held-out validation tasks/languages.| Benchmark / Dataset | Base model Accuracy | RL model Accuracy | Absolute Improvement |
|---|---|---|---|
Reasoning Gym Validation Split (val.parquet) | 35.29% | 50.51% | +15.22% |
Held Out Languages (Dutch nl, Turkish tr) | 30.20% | 36.60% | +6.40% |
| Held Out Tasks | 37.88% | 40.29% | +2.41% |
| MMLU Pro Lite (Multilingual subset) | 38.48% | 38.97% | +0.49% |
| Polymath (Multilingual Mathematics) | 33.24% | 33.44% | +0.20% |