Views
No views yet
1LLM_VERSION="Qwen/Qwen1.5-32B-Chat"
2LLM_VERSION_CLEAN="${LLM_VERSION//\//_}"
3VISION_MODEL_VERSION="google/siglip-so400m-patch14-384"
4VISION_MODEL_VERSION_CLEAN="${VISION_MODEL_VERSION//\//_}"
5
6PROMPT_VERSION=plain
7PRETRAIN_DATA_VERSION="blip558k"
8############### Pretrain ################
9
10BASE_RUN_NAME="llavanext-${LLM_VERSION_CLEAN}-${VISION_MODEL_VERSION_CLEAN}-pretrain_${PRETRAIN_DATA_VERSION}_plain"
11echo "BASE_RUN_NAME: ${BASE_RUN_NAME}"
12
13PROMPT_VERSION="qwen_1_5"
14MID_RUN_NAME="llavanext-${LLM_VERSION_CLEAN}-${VISION_MODEL_VERSION_CLEAN}-pretrain_${PRETRAIN_DATA_VERSION}_plain-ft_la1_6mix_d32k"
15echo "MID_RUN_NAME: ${MID_RUN_NAME}"
16
17torchrun # with necessary torchrun information for distributed training\
18 llava/train/train_mem.py \
19 --deepspeed scripts/zero3.json \
20 --model_name_or_path $LLM_VERSION \
21 --version $PROMPT_VERSION \
22 --data_path="/path/to/data/llava_instruct/llava1_6mix.json" \
23 --image_folder /path/to/data/llava_data \
24 --pretrain_mm_mlp_adapter="./checkpoints/projectors/${BASE_RUN_NAME}/mm_projector.bin" \
25 --mm_tunable_parts="mm_vision_tower,mm_mlp_adapter,mm_language_model" \
26 --mm_vision_tower_lr=2e-6 \
27 --vision_tower ${VISION_MODEL_VERSION} \
28 --mm_projector_type mlp2x_gelu \
29 --mm_vision_select_layer -2 \
30 --mm_use_im_start_end False \
31 --mm_use_im_patch_token False \
32 --group_by_modality_length True \
33 --image_aspect_ratio anyres \
34 --image_grid_pinpoints "[(336, 672), (672, 336), (672, 672), (1008, 336), (336, 1008)]" \
35 --mm_patch_merge_type spatial_unpad \
36 --bf16 True \
37 --run_name $MID_RUN_NAME \
38 --output_dir ./checkpoints/$MID_RUN_NAME \
39 --num_train_epochs 1 \
40 --per_device_train_batch_size 1 \
41 --per_device_eval_batch_size 4 \
42 --gradient_accumulation_steps 2 \
43 --evaluation_strategy "no" \
44 --save_strategy "steps" \
45 --save_steps 3000 \
46 --save_total_limit 1 \
47 --learning_rate 1e-5 \
48 --weight_decay 0. \
49 --warmup_ratio 0.03 \
50 --lr_scheduler_type "cosine" \
51 --logging_steps 1 \
52 --tf32 True \
53 --model_max_length 32768 \
54 --gradient_checkpointing True \
55 --dataloader_num_workers 8 \
56 --lazy_preprocess True \
57 --report_to wandb \
58 --torch_compile True \
59 --torch_compile_backend "inductor"
60 --dataloader_drop_last Truelmms-eval