Vietnamese-aligned model produced by VinUniversity AICB Day-22 lab (Track 3 — DPO/ORPO Alignment).
1from llama_cpp import Llama
2llm = Llama(model_path="lab22-dpo-Q4_K_M.gguf", n_ctx=512)
3print(llm.create_chat_completion(messages=[{"role": "user", "content": "Giải thích quicksort."}])
4 ["choices"][0]["message"]["content"])
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel
3tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-3B")
4base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-3B", torch_dtype="bfloat16", device_map="cuda")
5model = PeftModel.from_pretrained(base, "hiepphambk/lab22-dpo-vn") # this DPO adapter
See full report (incl. reward curves analysis, alignment-tax interpretation, and W&B run link) in the
lab repo.
Trained by Phạm Hữu Hoàng Hiệp (MSSV 2A202600415).