Views
No views yet
0.6.01adapter: qlora
2base_model: Qwen/Qwen2.5-Coder-7B-Instruct
3bf16: true
4dataloader_num_workers: 4
5dataset_prepared_path: v2/prepared/sft
6datasets:
7- path: v2/inputs/datasets/axolotl/train_50k_alpaca.jsonl
8 type: alpaca
9 split: train
10eval_datasets:
11- path: v2/inputs/datasets/axolotl/val_alpaca.jsonl
12 type: alpaca
13 split: val
14eval_sample_max_num: 100
15eval_steps: 1000
16eval_strategy: steps
17flash_attention: false
18gradient_accumulation_steps: 8
19gradient_checkpointing: true
20group_by_length: false
21learning_rate: 2e-4
22load_in_4bit: true
23logging_steps: 10
24lora_alpha: 64
25lora_dropout: 0.05
26lora_modules_to_save:
27- embed_tokens
28- lm_head
29lora_r: 32
30lora_target_modules:
31- q_proj
32- k_proj
33- v_proj
34- o_proj
35- gate_proj
36- up_proj
37- down_proj
38lr_scheduler: cosine
39micro_batch_size: 2
40num_epochs: 1
41optimizer: adamw_8bit
42output_dir: v2/model/sft
43report_to: none
44rl_beta: null
45sample_packing: true
46save_steps: 1000
47save_strategy: steps
48save_total_limit: 1
49seed: 42
50pad_to_sequence_len: false
51sequence_len: 4096
52special_tokens:
53 pad_token: <|endoftext|>
54tf32: true
55train_on_inputs: false
56warmup_ratio: 0.03
57