70K DPO preference pairs covering three reasoning-heavy verticals: math, legal, and code. The rejected response contains a specific, named error type — off-by-one, unit confusion, missing edge case, etc. Apache 2.0 — commercial use permitted.
from datasets import load_dataset
ds = load_dataset("stindardlogic/dpo-reasoning-70k", split="train")
TRL DPOTrainer — works directly (prompt/chosen/rejected columns already present)