Views
No views yet
unsloth/Qwen2.5-3B-bnb-4bitT4bkai-foundation-models/vi-alpacaargilla/ultrafeedback-binarized-preferences-cleanedprompt, chosen, rejected| Hyperparameter | Value |
|---|---|
| DPO beta | 0.1 |
| Learning rate | 5e-07 |
| Epochs | 1 |
| Final DPO loss | 0.8476034660339355 |
| End chosen reward | -0.556167197227478 |
| End rejected reward | -0.5189349949359894 |
| End reward gap | -0.0372322022914886 |
data/eval/judge_results.json:1{
2 "tie": 8
3}| Benchmark | SFT-only | SFT+DPO | Delta |
|---|---|---|---|
| IFEval | 0.2000 | 0.2000 | +0.0000 |
| GSM8K | 0.0000 | 0.0000 | +0.0000 |
| MMLU | 0.7368 | 0.7544 | +0.0175 |
| AlpacaEval-lite | nan | nan | +nan |
1from unsloth import FastLanguageModel
2from peft import PeftModel
3
4base_model = "unsloth/Qwen2.5-3B-bnb-4bit"
5adapter_path = "solar11781/lab22-dpo-vn"
6
7model, tokenizer = FastLanguageModel.from_pretrained(
8 model_name=base_model,
9 max_seq_length=512,
10 dtype=None,
11 load_in_4bit=True,
12)
13
14model = PeftModel.from_pretrained(model, adapter_path)