phase_1//grpo_phase_1/episode_log.jsonl — per-episode breakdown for Phase 1 training (100 eps, Qwen2.5-3B, clean catalog)
phase_2//grpo_phase_2/episode_log.jsonl — per-episode breakdown for Phase 2 training (Qwen2.5-3B, 7B, 1.5B and 0.5B variants — see commit messages on the Space for which timestamp = which run)… See the full description on the dataset page: https://huggingface.co/datasets/vex-0/mcparena-runs.