Views
No views yet
verl reinforcement learning framework.Qwen/Qwen3-VL-4B-Thinkingverlverl framework.1#!/usr/bin/env bash
2
3set -x
4
5PROJECT_NAME=verl_grpo
6EXPERIMENT_NAME=qwen3_vl_4b_thinking_safegrpo
7
8ENGINE=${1:-vllm}
9
10GPU_UTILIZATION=0.6
11
12MODEL_PATH=Qwen/Qwen3-VL-4B-Thinking
13TRAIN_FILES=./train_data/safetygrpo_train.parquet
14VAL_FILES=./train_data/safetygrpo_test.parquet
15
16TRAIN_BATCH_SIZE=256
17MAX_PROMPT_LENGTH=2048
18MAX_RESPONSE_LENGTH=4096
19ROLLOUT_N=8
20PPO_MINI_BATCH_SIZE=64
21PPO_MICRO_BATCH_SIZE_PER_GPU=16
22LOG_PROB_MICRO_BATCH_SIZE_PER_GPU=16
23TENSOR_MODEL_PARALLEL_SIZE=1
24
25SAVE_FREQ=3000
26TEST_FREQ=10
27TOTAL_EPOCHS=15
28
29python3 -m verl.trainer.main_ppo \
30 algorithm.adv_estimator=grpo \
31 data.train_files=$TRAIN_FILES \
32 data.val_files=$VAL_FILES \
33 data.train_batch_size=$TRAIN_BATCH_SIZE \
34 data.max_prompt_length=$MAX_PROMPT_LENGTH \
35 data.max_response_length=$MAX_RESPONSE_LENGTH \
36 data.filter_overlong_prompts=True \
37 data.truncation='error' \
38 data.image_key=images \
39 actor_rollout_ref.model.path=$MODEL_PATH \
40 actor_rollout_ref.actor.optim.lr=1e-6 \
41 actor_rollout_ref.model.use_remove_padding=True \
42 actor_rollout_ref.model.use_fused_kernels=True \
43 actor_rollout_ref.actor.ppo_mini_batch_size=$PPO_MINI_BATCH_SIZE \
44 actor_rollout_ref.actor.ppo_micro_batch_size_per_gpu=$PPO_MICRO_BATCH_SIZE_PER_GPU \
45 actor_rollout_ref.actor.use_kl_loss=True \
46 actor_rollout_ref.actor.kl_loss_coef=0.01 \
47 actor_rollout_ref.actor.kl_loss_type=low_var_kl \
48 actor_rollout_ref.actor.entropy_coeff=0 \
49 actor_rollout_ref.model.enable_gradient_checkpointing=True \
50 actor_rollout_ref.actor.fsdp_config.param_offload=False \
51 actor_rollout_ref.actor.fsdp_config.optimizer_offload=False \
52 actor_rollout_ref.rollout.log_prob_micro_batch_size_per_gpu=$LOG_PROB_MICRO_BATCH_SIZE_PER_GPU \
53 actor_rollout_ref.rollout.tensor_model_parallel_size=$TENSOR_MODEL_PARALLEL_SIZE \
54 actor_rollout_ref.rollout.name=$ENGINE \
55 +actor_rollout_ref.rollout.engine_kwargs.vllm.disable_mm_preprocessor_cache=True \
56 actor_rollout_ref.rollout.gpu_memory_utilization=$GPU_UTILIZATION \
57 actor_rollout_ref.rollout.enable_chunked_prefill=True \
58 actor_rollout_ref.rollout.enforce_eager=False \
59 actor_rollout_ref.rollout.free_cache_engine=True \
60 actor_rollout_ref.rollout.n=$ROLLOUT_N \
61 actor_rollout_ref.ref.log_prob_micro_batch_size_per_gpu=$LOG_PROB_MICRO_BATCH_SIZE_PER_GPU \
62 actor_rollout_ref.ref.fsdp_config.param_offload=True \
63 algorithm.use_kl_in_reward=False \
64 reward_model.reward_manager=batch \
65 custom_reward_function.path=./reward/safetygrpo_qwen3.py \
66 custom_reward_function.name=compute_score_batch \
67 trainer.critic_warmup=0 \
68 trainer.logger=wandb \
69 trainer.project_name=$PROJECT_NAME \
70 trainer.experiment_name=$EXPERIMENT_NAME \
71 trainer.n_gpus_per_node=4 \
72 trainer.nnodes=1 \
73 trainer.save_freq=$SAVE_FREQ \
74 trainer.test_freq=$TEST_FREQ \
75 trainer.total_epochs=$TOTAL_EPOCHS \
76 trainer.default_local_dir=./checkpoints/$PROJECT_NAME/$EXPERIMENT_NAME $@