The Quasar-RP-DPO-v0.1 dataset is a collection of roleplaying preference data designed primarily for training and aligning language models. With a focus on improving creative outputs such as prose, poetry, and overall narrative creativity, this dataset is also well-suited for developing reward models and preference optimization techniques (e.g., Direct Preference Optimization or DPO).