SLM Synthetic DPO — basic_arithmetic_qa
Summary
Synthetic preference-pair dataset containing chosen and rejected assistant responses for basic_arithmetic_qa.
Dataset type: preference optimization
Total pairs: 6429
Signal: basic_arithmetic_qa
Language: English
Category: direct_arithmetic
Difficulty: 1
Template family: direct_addition
Eval family: basic_arithmetic_qa