Checkpoint intermédiaire (SFT + DPO) du pipeline base→instruct
SFT → DPO → RLVR appliqué à
Qwen/Qwen2.5-7B. Le DPO aligne le modèle SFT sur des
préférences humaines (réponses choisies vs rejetées).
DPO
LoRA (TRL
DPOTrainer, r=32), référence calculée en direct, 1 epoch, lr 5e-6,
β=0.1,
seq_len 1536, bf16, gradient checkpointing. Adaptateur fusionné dans le modèle. Données :
HuggingFaceH4/ultrafeedback_binarized (10k paires).
Le DPO sur 10k paires génériques bouge peu les benchmarks ici. Analyse complète :
dépôt GitHub.