Views
No views yet
0.16.0.dev01# === Model Configuration ===
2base_model: Qwen/Qwen3.5-27B
3load_in_8bit: false
4load_in_4bit: false
5
6# === Training Setup ===
7num_epochs: 2
8micro_batch_size: 8
9gradient_accumulation_steps: 4
10sequence_len: 8192
11sample_packing: true
12pad_to_sequence_len: true
13
14adapter: lora
15lora_r: 64
16lora_alpha: 512
17lora_target_modules:
18 - q_proj
19 - k_proj
20 - v_proj
21 - o_proj
22 - down_proj
23 - up_proj
24 - linear_attn.in_proj_qkv
25 - linear_attn.in_proj_z
26 - linear_attn.out_proj
27
28# === Hyperparameter Configuration ===
29optimizer: adamw_torch_8bit
30learning_rate: 1e-5
31lr_scheduler: constant
32weight_decay: 0.001
33max_grad_norm: 0.1
34warmup_ratio: 0.05
35cosine_min_lr_ratio: 0.1
36
37# === Data Configuration ===
38datasets:
39 - path: output.parquet
40 ds_type: parquet
41 type:
42
43chat_template: tokenizer_default
44
45dataset_prepared_path: last_run_prepared
46
47# === Hardware Optimization ===
48gradient_checkpointing: offload
49
50# === Wandb Tracking ===
51wandb_project: qwen-27b-seemo
52
53# === Checkpointing ===
54saves_per_epoch: 1
55
56# === Advanced Settings ===
57output_dir: ./model-output
58bf16: auto
59flash_attention: true
60train_on_inputs: false
61group_by_length: false
62logging_steps: 1
63trust_remote_code: false
64
65plugins:
66 - axolotl.integrations.liger.LigerPlugin
67 - axolotl.integrations.cut_cross_entropy.CutCrossEntropyPlugin
68