Views
No views yet
Qwen/Qwen3-4B: the policy exported every 10 optimizer steps,
from step 10 to step 250, as 25 self-contained Hugging Face model directories.step_10/ step_20/ step_30/ ... step_250/step_N/ is a standard HF model directory (config.json,
model-0000*-of-00002.safetensors, model.safetensors.index.json, tokenizer files) and loads
directly:1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "TIE-Pilot/qwen3-4b-grpo-dapo-ckpts",
5 subfolder="step_250",
6 dtype="bfloat16",
7)
8tok = AutoTokenizer.from_pretrained(
9 "TIE-Pilot/qwen3-4b-grpo-dapo-ckpts", subfolder="step_250"
10)hf download TIE-Pilot/qwen3-4b-grpo-dapo-ckpts --include "step_250/*" --local-dir ./ckpt| Base model | Qwen/Qwen3-4B |
| Algorithm | GRPO (adv_estimator=grpo) |
| Dataset | DAPO-Math |
| KL | use_kl_in_reward=False, use_kl_loss=True, kl_loss_coef=0.001, low_var_kl |
| Learning rate | 1e-6 |
| Train batch / mini-batch | 64 / 32 (16 / 8 per GPU × 4 GPUs) |
| Rollouts per prompt | 8, temperature 0.9 |
| Max prompt / response | 1024 / 4096 tokens |
| Epochs | 8 |
| Save frequency | every 10 steps |
| Precision | bfloat16 weights |
verl.model_merger merge --backend fsdp.TIE-Pilot/qwen25-7b-base-grpo-dapo-ckpts