Views
No views yet
1PRE_SEQ_LEN=16
2LR=1e-2
3NUM_GPUS=1
4
5torchrun --standalone --nnodes=1 --nproc-per-node=$NUM_GPUS main.py \
6 --do_train \
7 --train_file train_data/train_100k.json \
8 --validation_file train_data/dev_1k.json \
9 --preprocessing_num_workers 10 \
10 --prompt_column question \
11 --response_column answer \
12 --overwrite_cache \
13 --model_name_or_path THUDM/chatglm2-6b \
14 --output_dir output/chatglm2-6b-pt-$PRE_SEQ_LEN-$LR-20230720 \
15 --overwrite_output_dir \
16 --max_source_length 256 \
17 --max_target_length 512 \
18 --per_device_train_batch_size 2 \
19 --per_device_eval_batch_size 2 \
20 --gradient_accumulation_steps 8 \
21 --predict_with_generate \
22 --max_steps 1000 \
23 --logging_steps 10 \
24 --save_steps 1000 \
25 --learning_rate $LR \
26 --pre_seq_len $PRE_SEQ_LEN \
27 --quantization_bit 4 epoch = 0.2
train_loss = 0.1023
train_runtime = 3:08:02.06
train_samples = 78577
train_samples_per_second = 1.418
train_steps_per_second = 0.089