This dataset is an
upsampled version of the original
u-10bei/dpo-dataset-qwen-cot dataset. The upsampling was performed to address class imbalance and improve model performance on underrepresented categories.
This model has been optimized using DPO to align its responses with preferred outputs, focusing on improving reasoning (Chain-of-Thought) and structured response quality based on the provided preference dataset.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "your_id/your-repo-name"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 torch_dtype=torch.float16,
10 device_map="auto"
11)
12
13# Test inference
14prompt = "Your question here"
15inputs = tokenizer.apply_chat_template([{"role": "user", "content": prompt}], tokenize=True, add_generation_prompt=True, return_tensors="pt").to("cuda")
16outputs = model.generate(**inputs, max_new_tokens=512)
17print(tokenizer.decode(outputs[0]))
18