Views
No views yet
trl.DPOTrainer.u-10bei/sft_alfworld_trajectory_dataset_v2,u-10bei/sft_alfworld_trajectory_dataset_v4 dataset.
The DPO training process aims to increase the likelihood of generating 'chosen' responses
and decrease the likelihood of 'rejected' responses for given prompts.1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5model_id = "rokugatsu/LLM2025_Advanced_6_DPO2"
6
7tokenizer = AutoTokenizer.from_pretrained(model_id)
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 torch_dtype=torch.bfloat16, # Use bfloat16 if your GPU supports it
11 device_map="auto",
12)
13# The model is already merged, so no need for PeftModel.from_pretrained(model, adapter)
14
15# Example for inference (assuming you have a chat_template)
16messages = [
17 {"role": "system", "content": "You are a helpful assistant."},
18 {"role": "user", "content": "What is the capital of France?"}
19]
20input_ids = tokenizer.apply_chat_template(messages, tokenize=True, add_generation_prompt=True, return_tensors="pt").to(model.device)
21
22outputs = model.generate(input_ids, max_new_tokens=256)
23print(tokenizer.decode(outputs[0], skip_special_tokens=True))