Views
No views yet
A_t = log P_teacher(y_t) - log P_student(y_t)
nielsr/docvqa_1200_examples) — document images with questions and answersprepare_sdpo_dataset.py — prepares DocVQA with student/teacher promptstrain_sdpo_vlm.py — SDPO training loop1# Prepare dataset (creates docvqa_sdpo_train/ and docvqa_sdpo_test/)
2python prepare_sdpo_dataset.py
3
4# Train (requires CUDA GPU, ~16GB VRAM)
5python train_sdpo_vlm.py| Param | Value |
|---|---|
| Learning rate | 5e-6 |
| Epochs | 2 |
| Micro batch size | 1 |
| Gradient accumulation | 8 (effective batch = 8) |
| Max completion length | 64 tokens |
| Temperature | 0.7 |
| Top-p | 0.9 |
| Max examples | 600 |
| Few-shot bank size | 25 |
| Few-shot per sample | 2 |