Views
No views yet
1!CUDA_VISIBLE_DEVICES=0,1 python3 main.py \
2 --do_train \
3 --train_file /kaggle/input/sql-create-context-json/train_10k.json \
4 --validation_file /kaggle/input/sql-create-context-json/dev_1k.json \
5 --prompt_column question \
6 --response_column answer \
7 --overwrite_cache \
8 --model_name_or_path THUDM/chatglm-6b-int4 \
9 --output_dir output/adgen-chatglm-6b-int4-pt-128-2e-2 \
10 --overwrite_output_dir \
11 --max_source_length 64 \
12 --max_target_length 64 \
13 --per_device_train_batch_size 1 \
14 --per_device_eval_batch_size 1 \
15 --gradient_accumulation_steps 16 \
16 --predict_with_generate \
17 --max_steps 1000 \
18 --logging_steps 10 \
19 --save_steps 1000 \
20 --learning_rate 2e-2 \
21 --pre_seq_len 128 \
22 --quantization_bit 4***** train metrics *****
epoch = 3.2
train_loss = 0.1746
train_runtime = 7:41:22.34
train_samples = 10000
train_samples_per_second = 1.156
train_steps_per_second = 0.036predict metrics
predict_bleu-4 = 95.6857
predict_rouge-1 = 96.2341
predict_rouge-2 = 92.906
predict_rouge-l = 95.9385
predict_runtime = 0:49:37.03
predict_samples = 1000
predict_samples_per_second = 0.336
predict_steps_per_second = 0.168