Views
No views yet
unsloth/Qwen2.5-3B-bnb-4bit using TRL DPOTrainer.unsloth/Qwen2.5-3B-bnb-4bitargilla/ultrafeedback-binarized-preferences-cleaned + 5CD-AI/Vietnamese-alpaca-cleaned1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3
4base_model = AutoModelForCausalLM.from_pretrained("unsloth/Qwen2.5-3B-bnb-4bit", torch_dtype="auto", device_map="auto")
5tokenizer = AutoTokenizer.from_pretrained("lucasnhandang/lab22-dpo-qwen2.5-vn")
6model = PeftModel.from_pretrained(base_model, "lucasnhandang/lab22-dpo-qwen2.5-vn")