Views
No views yet
1{
2 "experiment": "kl_track_Qwen3-8B_s42",
3 "model": "Qwen/Qwen3-8B",
4 "seed": 42,
5 "steps": 30,
6 "final_kl": 60.75,
7 "final_entropy": 0.7421875,
8 "max_kl": 60.75,
9 "platform": "modal_h100"
10}1@misc{tinker-rl-bench-2026,
2 title={TinkerRL-Bench: A Unified Benchmark for RL Post-Training},
3 author={Arvind C R and Sandhya Jeyaraj and Madhu Kumara L and Mohammad Rafi and Dhruva N Murthy and Arumugam K},
4 year={2026},
5 url={https://github.com/arvindcr4/tinker-rl-lab}
6}