SLM Synthetic DPO — direct_subtraction
Summary
Synthetic preference-pair dataset containing chosen and rejected assistant responses for direct_subtraction.
Dataset type: preference optimization
Total pairs: 6428
Signal: direct_subtraction
Language: English
Category: direct_arithmetic
Difficulty: 1
Template family: direct_subtraction
Eval family: direct_subtraction