Views
No views yet
0.13.0.dev01# === Model Configuration ===
2base_model: ibm-granite/granite-4.0-h-tiny
3load_in_8bit: false
4load_in_4bit: false
5
6# === Training Setup ===
7num_epochs: 2
8micro_batch_size: 1
9gradient_accumulation_steps: 1
10sequence_len: 2048
11sample_packing: true
12pad_to_sequence_len: true
13
14# === Hyperparameter Configuration ===
15optimizer: adamw_torch_8bit
16learning_rate: 1e-5
17lr_scheduler: constant
18weight_decay: 0.01
19warmup_ratio: 0.05
20cosine_min_lr_ratio: 0.1
21
22# === Data Configuration ===
23datasets:
24 - path: WokeAI/polititune-tankie-warmup
25 type: chat_template
26 split: train
27chat_template: tokenizer_default
28
29dataset_prepared_path: last_run_prepared
30
31# === Hardware Optimization ===
32gradient_checkpointing: offload
33
34# === Wandb Tracking ===
35wandb_project: polititune-q34b-warmup
36
37# === Checkpointing ===
38saves_per_epoch: 2
39
40# === Advanced Settings ===
41output_dir: ./model-output
42bf16: auto
43flash_attention: true
44train_on_inputs: false
45group_by_length: false
46logging_steps: 1
47trust_remote_code: true
48
49
50
51
52fsdp:
53 - auto_wrap
54 - full_shard
55fsdp_config:
56 fsdp_version: 2
57 fsdp_offload_params: false
58 fsdp_cpu_ram_efficient_loading: true
59 fsdp_auto_wrap_policy: TRANSFORMER_BASED_WRAP
60 fsdp_transformer_layer_cls_to_wrap: GraniteMoeHybridDecoderLayer
61 fsdp_state_dict_type: SHARDED_STATE_DICT
62 fsdp_sharding_strategy: FULL_SHARD
63 fsdp_reshard_after_forward: true
64 fsdp_activation_checkpointing: true # will disable if doesnt work
65
66