Views
No views yet
| Model | LLM-judge score |
|---|---|
| Mistral-7B base | 7.3 / 10 |
| Mistral-7B SFT | 8.9 / 10 |
| Mistral-7B DPO (this model) | 9.2 / 10 |
openbmb/UltraFeedback chosen responses (59,510 examples)mistralai/Mistral-7B-v0.1openbmb/UltraFeedback preference pairs (47,731 pairs, score gap ≥ 1.0)1from peft import PeftModel
2from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
3import torch
4
5base_model = "mistralai/Mistral-7B-v0.1"
6adapter = "npaiker/mistral-7b-dpo-ultrafeedback"
7
8bnb_config = BitsAndBytesConfig(
9 load_in_4bit=True,
10 bnb_4bit_quant_type="nf4",
11 bnb_4bit_compute_dtype=torch.bfloat16,
12 bnb_4bit_use_double_quant=True,
13)
14
15model = AutoModelForCausalLM.from_pretrained(
16 base_model,
17 quantization_config=bnb_config,
18 device_map="auto",
19 dtype=torch.bfloat16,
20)
21model = PeftModel.from_pretrained(model, adapter)
22tokenizer = AutoTokenizer.from_pretrained(base_model)
23
24prompt = "<|im_start|>user\nExplain recursion to a 10-year-old.<|im_end|>\n<|im_start|>assistant\n"
25inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
26
27with torch.no_grad():
28 outputs = model.generate(**inputs, max_new_tokens=512, temperature=0.7, do_sample=True)
29
30print(tokenizer.decode(outputs[0], skip_special_tokens=True))