Precomputed embeddings + trajectory records for a dual-encoder contrastive Trajectory
Reward Model (TRM) on the SWE_Rebench split of togethercomputer/CoderForge-Preview
(OpenHands agent trajectories). 1000 train + 100 test instances (task-disjoint; MIXED
only: each instance has ≥1 resolved and ≥1 failed run), 8 runs/instance.
Trained dual-encoder TRM reaches val_auc = 0.799.