DPO-style preference pairs derived from LitBench: writing prompts with a community-preferred continuation
(chosen) versus a lower-voted one (rejected).
Training pairs: SAA-Lab/LitBench-Train
Test pair IDs: SAA-Lab/LitBench-Test-IDs-Complete-Final
Upvote margin: chosen_upvotes - rejected_upvotes >= 50
Length cap: prompt, chosen, rejected each encoded… See the full description on the dataset page:
https://huggingface.co/datasets/sumuks/litbench-ha.