base_model: unsloth/Qwen2.5-3B-bnb-4bit
library_name: peft
pipeline_tag: text-generation
tags:
- base_model:adapter:unsloth/Qwen2.5-3B-bnb-4bit
- dpo
- lora
- transformers
- trl
- unsloth
Model Card for Qwen2.5-3B DPO
Model Details
Model Description
- Developed by: Lê Duy Anh
- Model type: Causal Language Model (DPO Fine-tuned)
- Language(s) (NLP): English / Vietnamese
- License: Apache 2.0 (Kế thừa từ base model Qwen2.5)
- Finetuned from model: unsloth/Qwen2.5-3B-bnb-4bit
Uses
Direct Use
Mô hình này có thể được sử dụng trực tiếp để sinh văn bản trả lời các hướng dẫn (instructions), với sự cải thiện về độ an toàn và mức độ hữu ích nhờ phương pháp Direct Preference Optimization (DPO).
Out-of-Scope Use
Mô hình chỉ phục vụ cho mục đích nghiên cứu và học tập. Không khuyến khích sử dụng cho các hệ thống ra quyết định tự động, y tế, hay các lĩnh vực yêu cầu độ chính xác tuyệt đối mà không có sự giám sát của con người.
Bias, Risks, and Limitations
Giống như các LLM khác, mô hình có thể gặp hiện tượng hallucination (sinh ra thông tin không chính xác) hoặc kế thừa định kiến có sẵn trong tập dữ liệu UltraFeedback và vi_alpaca_clean.
Recommendations
Người dùng nên tự xác minh lại các thông tin do mô hình sinh ra trước khi sử dụng vào thực tế.
Training Details
Training Data
Quá trình fine-tune trải qua 2 giai đoạn với 2 tập dữ liệu:
- SFT Dataset:
tsdocode/vi_alpaca_clean (1,000 mẫu tiếng Việt).
- Preference Dataset (DPO):
argilla/ultrafeedback-binarized-preferences-cleaned (2,000 cặp tiếng Anh).
Preprocessing
Dữ liệu được format tự động theo Qwen2.5 Chat Template, bao gồm các trường prompt, chosen và rejected với chiều dài tối đa là 512 tokens (chiều dài prompt tối đa 256 tokens).
Training Hyperparameters
- Learning rate: 5e-07
- Beta: 0.1
- Loss type: sigmoid
- Epochs: 1
- Batch size: 8 (1 per device * 8 gradient accumulation steps)
- Optimizer: adamw_8bit
- LR Scheduler: cosine
- Max sequence length: 512
Speeds, Sizes, Times
- Trainable parameters: 29,933,568 (0.96%)
- Training steps: 250
- Training time (DPO): ~50 phút.
Evaluation
Testing Data
50 cặp dữ liệu cuối cùng từ tập argilla/ultrafeedback-binarized-preferences-cleaned được cắt ra để làm tập eval.
Metrics
- DPO Loss: Giám sát mức độ hội tụ của mô hình trong việc học preference.
- Reward margins/gap: Theo dõi sự khác biệt giữa
chosen rewards và rejected rewards.
Results
- Final SFT Loss: 1.6288
- Final DPO Loss: 1.1995
- Quá trình train cho thấy chosen reward có xu hướng đi ngang/tăng nhẹ, trong khi rejected reward giảm nhanh, tạo ra reward margin rõ rệt.
Environmental Impact
- Hardware Type: NVIDIA Tesla T4 GPU (15.6 GB VRAM)
- Hours used: ~1 giờ
- Cloud Provider: Google Colab Free Tier
Technical Specifications
Model Architecture and Objective
Kiến trúc Qwen2.5-3B (Causal LM) được gắn thêm LoRA adapter (r=16, alpha=32). Mục tiêu huấn luyện là Alignment mô hình với sở thích con người thông qua thuật toán DPO.
Compute Infrastructure
Môi trường máy ảo Linux trên Google Colab.
Hardware
NVIDIA Tesla T4 GPU
Software
unsloth, transformers, trl, peft 0.19.1, PyTorch