Views
No views yet
| Parameter | Value |
|---|---|
| Dataset | Video-R1-COT-10k-video-only-4k (4000 samples) |
| Epochs | 2 |
| Effective batch size | 16 (4 GPU × bs2 × grad_accum 2) |
| Learning rate | 1e-5 (custom params: 5e-5) |
| Scheduler | Cosine with 3% warmup |
| invoke_prob | 0.5 |
| query_len / mem_len | 8 / 8 |
| LoRA | r=16, alpha=32, targets=q,k,v,o_proj |
| Trainable params | 134M (QB: 110M, CA: 14M, LoRA: 10M) |
| Metric | Value |
|---|---|
| Final loss | 0.912 |
| Average loss | 0.972 |
| Ref loss (no memory) | ~1.14 |
| Final mem_lift | +0.19 |
| Training time | 2h 8min (4× GPU) |
epoch1/ — Checkpoint at step 250 (end of epoch 1)epoch2/ — Checkpoint at step 500 (end of epoch 2, final)1from open_r1.vismem_video_model import load_vismem_video_checkpoint
2
3# Point to epoch1/ or epoch2/ directory
4load_vismem_video_checkpoint(model, "path/to/epoch2")--latent_checkpoint path/to/epoch2