Views
No views yet
Mid-Training Checkpoint of Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
Stage: After 200 RL steps via alternating rewards — showing the adaptive parallel reasoning ability and serve as structure exploration stage.