1base_model: Qwen/Qwen3-14B
2# Automatically upload checkpoint and final model to HF
3hub_model_id: Rexhaif/Qwen3-14B-MTEval-SFT
4hub_private_repo: false
5
6
7load_in_8bit: false
8load_in_4bit: false
9strict: false
10
11chat_template: tokenizer_default
12datasets:
13 - path: Rexhaif/wmt23-pairs-sft
14 split: "train"
15 type: chat_template
16 field_messages: messages
17 roles_to_train: ["assistant"]
18
19shuffle_merged_datasets: true
20
21skip_prepare_dataset: false
22dataset_prepared_path: ./data/wmt23-pairs-sft
23output_dir: /hnvme/workspace/v106be28-outputs/sft-14b
24
25dataloader_prefetch_factor: 32
26dataloader_num_workers: 2
27dataloader_pin_memory: true
28
29gc_steps: 1
30
31sequence_len: 512
32sample_packing: false
33eval_sample_packing: false
34pad_to_sequence_len: false
35
36wandb_project: llm-reasoning-mt-eval
37wandb_entity:
38wandb_name: qwen3-14b-sft
39
40plugins:
41 - axolotl.integrations.liger.LigerPlugin
42liger_rope: true
43liger_rms_norm: true
44liger_glu_activation: true
45liger_layer_norm: true
46liger_fused_linear_cross_entropy: true
47gradient_accumulation_steps: 8
48micro_batch_size: 8 # should match num_generations / num_gpus
49
50optimizer: adamw_torch_fused
51lr_scheduler: cosine
52learning_rate: 5.0e-5
53cosine_min_lr_ratio: 1.0e-7
54max_grad_norm: 1.0
55weight_decay: 0.1
56
57bf16: true
58tf32: true
59
60flash_attention: true
61flash_attn_fuse_qkv: true
62flash_attn_fuse_mlp: true
63auto_resume_from_checkpoints: true
64
65n_epochs: 3
66logging_steps: 10
67warmup_ratio: 0.1
68evals_per_epoch: 10
69saves_per_epoch: 10
70save_total_limit: 1
71#max_steps: 5000
72seed: 42
73val_set_size: 0.01
74
75gradient_checkpointing: false
76gradient_checkpointing_kwargs:
77 use_reentrant: false
78