Views
No views yet
0.15.0.dev01# === Model Configuration ===
2base_model: dphn/Dolphin-Xgen-RL
3load_in_8bit: false
4load_in_4bit: false
5
6# === Training Setup ===
7num_epochs: 2
8micro_batch_size: 2
9gradient_accumulation_steps: 1
10sequence_len: 8192
11sample_packing: true
12pad_to_sequence_len: true
13
14# === Hyperparameter Configuration ===
15optimizer: adamw_torch_8bit
16learning_rate: 1e-5
17lr_scheduler: constant
18weight_decay: 0.001
19max_grad_norm: 0.1
20warmup_ratio: 0.05
21cosine_min_lr_ratio: 0.1
22
23# === Data Configuration ===
24datasets:
25 - path: output.parquet
26 ds_type: parquet
27 type:
28
29dataset_prepared_path: last_run_prepared
30
31# === Hardware Optimization ===
32gradient_checkpointing: offload
33
34# === Wandb Tracking ===
35wandb_project: we-have-seed-at-home
36
37# === Checkpointing ===
38saves_per_epoch: 1
39
40# === Advanced Settings ===
41output_dir: ./model-output
42bf16: auto
43flash_attention: true
44train_on_inputs: false
45group_by_length: false
46logging_steps: 1
47trust_remote_code: false
48
49plugins:
50 - axolotl.integrations.liger.LigerPlugin
51 - axolotl.integrations.cut_cross_entropy.CutCrossEntropyPlugin
52
53fsdp:
54 - auto_wrap
55 - full_shard
56fsdp_config:
57 fsdp_version: 2
58 fsdp_offload_params: false
59 fsdp_cpu_ram_efficient_loading: true
60 fsdp_auto_wrap_policy: TRANSFORMER_BASED_WRAP
61 fsdp_transformer_layer_cls_to_wrap: LlamaDecoderLayer
62 fsdp_state_dict_type: SHARDED_STATE_DICT
63 fsdp_sharding_strategy: FULL_SHARD
64 fsdp_reshard_after_forward: true
65 fsdp_activation_checkpointing: true # will disable if doesnt work
66