Views
No views yet
qwen3vl-grpo-v6-20251215-121705 is built on top of Qwen/Qwen3-VL through a two-stage training pipeline:train_sft.jsonltrain_grpo.jsonlQwen/Qwen3-VLtransformersapache-2.0dataset/train.jsonltrain_sft.jsonldataset/grpo.jsonltrain_grpo.jsonl1FPS_MAX_FRAMES=64 VIDEO_MAX_PIXELS=50176 \
2export NPROC_PER_NODE=8
3CUDA_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 \
4swift sft \
5 --model Qwen/Qwen3-VL \
6 --train_type lora \
7 --dataset dataset/train.jsonl \
8 --load_from_cache_file true \
9 --torch_dtype bfloat16 \
10 --num_train_epochs 1 \
11 --per_device_train_batch_size 2 \
12 --per_device_eval_batch_size 1 \
13 --learning_rate 1e-4 \
14 --lora_rank 64 \
15 --lora_alpha 16 \
16 --freeze_vit True \
17 --target_modules all-linear \
18 --gradient_accumulation_steps 1 \
19 --eval_steps 50 \
20 --save_steps 900 \
21 --save_total_limit 5 \
22 --logging_steps 5 \
23 --output_dir save_qwenvl3 \
24 --warmup_ratio 0.05 \
25 --dataloader_num_workers 8 \
26 --use_chat_template False \
27 --max_length 2000001swift export \
2 --adapters save_qwenvl3 \
3 --merge_lora true1FPS_MAX_FRAMES=64 \
2VIDEO_MAX_PIXELS=50176 \
3CUDA_VISIBLE_DEVICES=4,5,6,7 \
4NPROC_PER_NODE=4 \
5swift rlhf \
6 --rlhf_type grpo \
7 --model models/sft/v2-20251215-091134/checkpoint-844-merged \
8 --train_type lora \
9 --use_vllm true \
10 --vllm_mode colocate \
11 --vllm_gpu_memory_utilization 0.75 \
12 --vllm_tensor_parallel_size 4 \
13 --dataset dataset/grpo.jsonl \
14 --torch_dtype bfloat16 \
15 --num_train_epochs 1 \
16 --per_device_train_batch_size 1 \
17 --per_device_eval_batch_size 1 \
18 --gradient_accumulation_steps 2 \
19 --eval_steps 1000 \
20 --save_steps 500 \
21 --learning_rate 1e-6 \
22 --save_total_limit 5 \
23 --logging_steps 5 \
24 --output_dir output_grpo_text \
25 --warmup_ratio 0.05 \
26 --dataloader_num_workers 4 \
27 --max_completion_length 4096 \
28 --reward_funcs coderm \
29 --external_plugins plugin.py \
30 --num_generations 8 \
31 --temperature 1.0 \
32 --log_completions true \
33 --async_generate false \
34 --move_model_batches 16 \
35 --offload_optimizer true \
36 --offload_model true \
37 --sleep_level 0