Views
No views yet
reward/avg_raw_reward across all 80 steps of the training chain.global_step_80 (EMA = 0.9785, raw reward at step = 0.9727)reward/avg_pass_at_8 = 1.0, reached max_steps = 80/80 (clean exit-0 completion)rl_config.yaml. Parsed training
metrics, plots, and raw logs are under training_logs/.last episode of each trial (per
make_and_upload_trace_dataset --episodes last) — the same rollouts
the policy was trained on after rollback / truncation.