Views
No views yet
0.12.21base_model: "google/gemma-3-1b-it"
2
3load_in_4bit: true
4
5# gemma3 doesn't seem to play nice with ddp
6ddp_find_unused_parameters: true
7
8chat_template: gemma3
9eot_tokens:
10 - <end_of_turn>
11
12resume_from_checkpoint: outputs/out/checkpoint-3000
13
14datasets:
15 - path: dataset_train_val_split/train_parts
16 type: alpaca
17 data_files:
18 - dataset_train_val_split/train_parts/train_part_01.jsonl
19 - dataset_train_val_split/train_parts/train_part_02.jsonl
20 - dataset_train_val_split/train_parts/train_part_03.jsonl
21 - dataset_train_val_split/train_parts/train_part_04.jsonl
22 - dataset_train_val_split/train_parts/train_part_05.jsonl
23 - dataset_train_val_split/train_parts/train_part_06.jsonl
24 - dataset_train_val_split/train_parts/train_part_07.jsonl
25 - dataset_train_val_split/train_parts/train_part_08.jsonl
26 - dataset_train_val_split/train_parts/train_part_09.jsonl
27 - dataset_train_val_split/train_parts/train_part_10.jsonl
28
29test_datasets:
30 - path: dataset_train_val_split/validation.jsonl
31 type: alpaca
32 split: train
33
34dataset_prepared_path: last_run_prepared
35output_dir: ./outputs/out
36
37adapter: qlora
38lora_model_dir:
39
40sequence_len: 2048
41sample_packing: true
42
43lora_r: 32
44lora_alpha: 16
45lora_dropout: 0.05
46lora_target_modules:
47 - up_proj
48 - down_proj
49 - gate_proj
50 - q_proj
51 - k_proj
52 - v_proj
53 - o_proj
54
55wandb_project:
56wandb_entity:
57wandb_watch:
58wandb_name:
59wandb_log_model:
60
61gradient_accumulation_steps: 6
62micro_batch_size: 1
63num_epochs: 3
64optimizer: adamw_bnb_8bit
65lr_scheduler: cosine
66learning_rate: 0.0004
67
68# Training on full dataset: 265,590 samples
69# Total steps per epoch: 265,590 / (micro_batch_size * gradient_accumulation_steps)
70# = 265,590 / (2 * 4) = ~33,199 steps per epoch
71# Ensure we use the full dataset
72max_steps: # Leave empty to use all data
73eval_strategy: epoch
74saves_per_epoch: 1
75
76bf16: true
77fp16: false
78tf32: true
79
80gradient_checkpointing: true
81gradient_checkpointing_kwargs:
82 use_reentrant: false
83logging_steps: 1
84flash_attention:
85eager_attention: true
86
87warmup_ratio: 0.1
88weight_decay: 0.0
89
90# save_first_step: true # uncomment this to validate checkpoint saving works with your config
91
92
93gradio_max_new_tokens: 512
94gradio_temperature: 0.7| Training Loss | Epoch | Step | Validation Loss | Mem Reserved(gib) | Mem Active(gib) | Mem Allocated(gib) |
|---|---|---|---|---|---|---|
| No log | 0 | 0 | 3.9506 | 12.01 | 11.72 | 11.72 |
| 1.2302 | 0.1035 | 500 | 1.2162 | 14.29 | 14.2 | 14.2 |
| 0.898 | 0.2071 | 1000 | 0.8612 | 14.29 | 14.2 | 14.2 |
| 0.4979 | 0.3106 | 1500 | 0.5640 | 14.29 | 14.2 | 14.2 |
| 0.2908 | 0.4142 | 2000 | 0.3491 | 14.3 | 14.2 | 14.2 |
| 0.271 | 0.5177 | 2500 | 0.2368 | 14.3 | 14.2 | 14.2 |
| 0.2208 | 0.6213 | 3000 | 0.1751 | 14.3 | 14.2 | 14.2 |
| 0.2208 | 0.6213 | 3000 | 4.7060 | 6.46 | 6.46 | 6.68 |
| 0.0918 | 0.9999 | 6486 | 0.1107 | 7.72 | 7.72 | 8.91 |
| 0.0163 | 2.0 | 12973 | 0.0470 | 7.72 | 7.72 | 8.93 |
| 0.0332 | 3.0 | 19460 | 0.0417 | 7.72 | 7.72 | 8.93 |