| Config | Pretrain | SFT | DPO |
|---|---|---|---|
| Base Model | Qwen2.5-VL-3B-Instruct | Qwen2.5-VL-3B-Instruct | Qwen2.5-VL-3B-Instruct |
| Learning Rate | 1.0×10⁻⁶ | 1.0×10⁻⁵ | 3.0×10⁻⁷ |
| Batch Size | 16 | 4 | 64 |
| Epochs | 1 | 1 | 1 |
| Scheduler | Cosine (warmup 0.03) | Cosine (warmup 0.03) | Cosine (warmup 0.03) |
| Optimizer | AdamW | AdamW | AdamW |
| Trainable Params | LLM only | Full (vision + LLM) | LLM only |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "Jingcz/RobustRDP"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModelForCausalLM.from_pretrained(model_name)