A high-quality dataset of mathematical reasoning preference pairs for Direct Preference Optimization (DPO) and Learning by Teaching (LBT) training.
✨ This dataset includes precomputed reference model log probabilities for efficient DPO training!
📊 Dataset Statistics
Total Examples: 44,565
Train Split: 37,895
Test Split: 6,670
Chapters: 30