Views
No views yet
Qwen3-VL-8B-Thinking on the audited PhysR1Corp (2,268 closed-form physics problems) via full-parameter FSDP1 GRPO with binary correctness reward.physics-r1-seed42-v4-step60-fsdpphysics-r1-seed17-canonical-step63-fsdpphysics-r1-seed23-canonical-step60-fsdp| Checkpoint | Used for | Notes |
|---|---|---|
physics-r1-seed42-v4-step60-fsdp | Paper Table 2 seed-42 row | Binary, step 60 |
physics-r1-seed17-canonical-step63-fsdp | Paper Table 2 seed-17 row | Binary, step 63 |
physics-r1-seed23-canonical-step60-fsdp | Paper Table 2 seed-23 row | Binary, step 60 |
physics-r1-seed17-v4-step60-fsdp | Seed-17 v4 re-validation, tracks canonical | Binary, step 60 |
physics-r1-seed42-v4-step{40,50}-fsdp | Step ablation (seed 42) | Earlier steps |
physics-r1-seed17-v4-step{40,50}-fsdp | Step ablation (seed 17) | Earlier steps |
Qwen/Qwen3-VL-8B-Thinkingactor.strategy=fsdp, not fsdp2; FSDP2 fails on Qwen3-VL visual encoder device placement)shanyangmie/physr1corp — 2,268 audited closed-form problemsAutoModelForImageTextToText.from_pretrained without a merge step.actor/
├── huggingface/ # HF-style config + tokenizer
├── model_world_size_4_rank_{0,1,2,3}.pt # 4-way FSDP weight shards (~8.7 GB each, ~35 GB total)
├── optim_world_size_4_rank_{0,1,2,3}.pt # optimizer state (~17.5 GB each, not needed for inference)
├── extra_state_world_size_4_rank_{0..3}.pt
└── fsdp_config.json
data.pt # verl bookkeeping (not needed for inference)model_merger.py:1git clone https://github.com/volcengine/verl
2cd verl
3
4# Download only the inference-required files (skips ~70 GB of optimizer state)
5huggingface-cli download shanyangmie/physics-r1-seed42-v4-step40-fsdp \\
6 --include "actor/model_world_size_4_rank_*.pt" \\
7 --include "actor/huggingface/*" \\
8 --include "actor/fsdp_config.json" \\
9 --include "actor/extra_state_world_size_4_rank_*.pt" \\
10 --local-dir ./ckpt
11
12# Merge FSDP shards into HF safetensors
13python scripts/model_merger.py merge \\
14 --backend fsdp \\
15 --hf_model_path Qwen/Qwen3-VL-8B-Thinking \\
16 --local_dir ./ckpt/actor \\
17 --target_dir ./physics-r1-seed42-v4-step40-fsdp-hf1from transformers import AutoModelForImageTextToText, AutoProcessor
2
3model = AutoModelForImageTextToText.from_pretrained(
4 "./physics-r1-seed42-v4-step40-fsdp-hf",
5 torch_dtype="bfloat16",
6 device_map="auto",
7)
8processor = AutoProcessor.from_pretrained("./physics-r1-seed42-v4-step40-fsdp-hf")Qwen3-VL-8B-Thinking. Training data (physr1corp) is CC BY-NC 4.0, so this derivative checkpoint is intended for non-commercial research use.1@misc{yang2026physicsr1,
2 title = {Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning},
3 author = {Yang, Shan},
4 year = {2026},
5 url = {https://huggingface.co/papers/2605.14040}
6}