Zephyr 7B SFT aligned with DPO on OASST1 with β=0.01
This repo contains LoRA adapter created by aligning Zephyr 7B SFT on the OpenAssistant Conversations Dataset (OASST1) dataset using Direct Preference Optimization (DPO).
It was trained as a series of models for studying DPO alignment.