Views
No views yet
0.4.01base_model: /workspace/models/Qwen1.5-32B-Chat
2trust_remote_code: true
3
4load_in_8bit: false
5load_in_4bit: false
6strict: false
7
8datasets:
9 - path: /workspace/axolotl/alpaca.json
10 type: alpaca
11dataset_prepared_path:
12val_set_size: 0.05
13output_dir: ./out-qwen32
14
15
16sequence_len: 1400 # supports up to 32k
17sample_packing: false
18pad_to_sequence_len: false
19
20adapter: lora
21lora_model_dir:
22lora_r: 64
23lora_alpha: 16
24lora_dropout: 0.05
25lora_target_linear: true
26lora_fan_in_fan_out:
27
28wandb_mode: online
29wandb_project: huixiangdou-cr
30wandb_entity:
31wandb_watch:
32wandb_name: qwen32
33wandb_log_model:
34
35gradient_accumulation_steps: 1
36micro_batch_size: 4
37num_epochs: 1
38optimizer: paged_adamw_8bit
39lr_scheduler: cosine
40learning_rate: 0.0002
41
42train_on_inputs: false
43group_by_length: false
44gradient_checkpointing: true
45gradient_checkpointing_kwargs:
46 use_reentrant: false
47early_stopping_patience:
48resume_from_checkpoint:
49local_rank:
50logging_steps: 1
51xformers_attention:
52flash_attention: true
53
54warmup_steps: 10
55evals_per_epoch: 1
56saves_per_epoch: 1
57debug:
58deepspeed:
59weight_decay: 0.0
60fsdp:
61fsdp_config:
62special_tokens:
63| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 0.0183 | 1.0 | 273 | 0.0370 |