Views
No views yet
rlhf-compact-llm pipeline.Qwen/Qwen2.5-0.5Boutputs/models/sft_qwen/, merged into the base before DPO.Anthropic/hh-rlhf (5000 chosen/rejected triples)trl.DPOTrainer with DPOConfig (TRL 0.9.6)loss_type="sigmoid"), beta=0.1peft==0.10.0| Metric | Start | End |
|---|---|---|
| Loss | 0.6923 | 0.5992 |
rewards/margins (chosen − rejected) | 0.002 | 0.322 |
rewards/accuracies (pairwise) | 0.512 | 0.663 |
rewards/chosen (implicit log-ratio) | -0.002 | -0.545 |
rewards/rejected | -0.004 | -0.867 |
outputs/logs/dpo_config_snapshot.yaml, outputs/logs/dpo_training_log.csv.
Plot: outputs/figures/dpo_training.png.1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-0.5B")
5model = PeftModel.from_pretrained(base, "Julia569922/qwen2.5-0.5b-rlhf-dpo")
6tok = AutoTokenizer.from_pretrained("Julia569922/qwen2.5-0.5b-rlhf-dpo")model = PeftModel.from_pretrained(base, "outputs/models/dpo_qwen")