Views
No views yet
0.12.21# Automatically upload checkpoint and final model to HF
2# hub_model_id: username/custom_model_name
3# 是否以 8-bit 精度加载模型
4load_in_8bit: false
5# 是否以 4-bit 精度加载模型(与QLoRA绑定, 强制使用)
6load_in_4bit: false
7# 是否严格匹配模型结构,关闭表示可加载少部分差异结构(如以适配 adapter)
8# strict: false
9base_model: Qwen/Qwen3-4B-Instruct-2507
10# 数据集设置
11chat_template: qwen3
12datasets:
13 - path: /workspace/train_dir_0924/all_data.json # - 表示列表(list)中的一项, 即可以同时使用多个数据集
14 type: chat_template # chat_template(自定义格式) alpaca
15 roles_to_train: ["assistant"]
16 field_messages: messages # 标识的字段
17 message_property_mappings: # message_property_mappings={'role':'role', 'content':'content'})
18 role: role
19 content: content
20dataset_prepared_path:
21val_set_size: 0.08
22output_dir: /workspace/train_dir_0924/checkpoints
23sequence_len: 16384 # 模型所能处理的最大上下文长度(默认2048)
24pad_to_sequence_len: false
25# context_parallel_size: 2 # 长序列拆分至多个GPU(强制要求 mirco_batch_size: 1)
26sample_packing: false # 在训练时将多个样本拼接(packing)成一个长序列(sequence_len)输入到模型中,以提高训练效率。
27eval_sample_packing: false # 评估时拼接多个样本
28# 训练超参数
29adapter: lora # lora qlora
30lora_model_dir:
31lora_r: 32 # lora_r默认首选 16,平衡精度与显存
32lora_alpha: 64 # 缩放系数,用于控制 LoRA 的影响力, 一般设为 2*r 或 4*r
33lora_dropout: 0.05 # 从0.05改为0.1,增加dropout
34lora_target_linear: true
35micro_batch_size: 4 # 微批次大小 94G的H100可以设为4(Token为1w)
36gradient_accumulation_steps: 4 # 梯度累积: 将多个微批次的梯度(micro_batch_size)累积起来,然后更新模型权重 有效 Batch 常取 16: 小于 8 训练会抖,大于 32 只会更耗时、收益有限
37auto_find_batch_size: false # 允许Axolotl不断调整batch_size ⚠️Zero-3不适用
38num_epochs: 3
39optimizer: adamw_torch_fused
40lr_scheduler: cosine
41learning_rate: 5e-5
42# bf16: auto + tf32: true,可获得更好的稳定性和性能。
43bf16: auto
44tf32: true
45# early_stopping_patience:
46gradient_checkpointing: true
47gradient_checkpointing_kwargs:
48 use_reentrant: false
49# auto_resume_from_checkpoints: true #自动从output_dir寻找最新checkpoint断点恢复
50
51logging_steps: 1
52logging_dir: /workspace/train_dir_0924/logs
53
54flash_attention: true
55warmup_ratio: 0.03
56evals_per_epoch: 8 # 增加评估频次,从4改为8
57saves_per_epoch: 1 # 增加保存频次,便于选择最佳checkpoint
58weight_decay: 0.01 # 从0.0改为0.01,增加正则化
59
60
61
62
63fsdp:
64 - full_shard
65 - auto_wrap
66fsdp_config:
67 fsdp_limit_all_gathers: true
68 fsdp_sync_module_states: true
69 fsdp_offload_params: false # H200显存足够,无需offload
70 fsdp_use_orig_params: false
71 fsdp_cpu_ram_efficient_loading: true
72 fsdp_auto_wrap_policy: TRANSFORMER_BASED_WRAP
73 fsdp_transformer_layer_cls_to_wrap: Qwen3DecoderLayer
74 fsdp_state_dict_type: FULL_STATE_DICT
75 fsdp_sharding_strategy: FULL_SHARD| Training Loss | Epoch | Step | Validation Loss | Mem Active(gib) | Mem Allocated(gib) | Mem Reserved(gib) |
|---|---|---|---|---|---|---|
| No log | 0 | 0 | 0.9792 | 48.13 | 47.95 | 48.76 |
| 0.0796 | 0.1255 | 66 | 0.0796 | 62.91 | 62.71 | 73.19 |
| 0.0615 | 0.2511 | 132 | 0.0662 | 66.5 | 66.31 | 76.92 |
| 0.064 | 0.3766 | 198 | 0.0616 | 66.5 | 66.31 | 76.92 |
| 0.0673 | 0.5021 | 264 | 0.0591 | 72.68 | 72.48 | 84.29 |
| 0.0574 | 0.6277 | 330 | 0.0568 | 72.68 | 72.48 | 84.29 |
| 0.053 | 0.7532 | 396 | 0.0553 | 72.68 | 72.48 | 84.29 |
| 0.0631 | 0.8787 | 462 | 0.0543 | 72.68 | 72.48 | 84.29 |
| 0.0571 | 1.0038 | 528 | 0.0528 | 72.68 | 72.48 | 84.29 |
| 0.0507 | 1.1293 | 594 | 0.0522 | 72.8 | 72.6 | 84.29 |
| 0.0498 | 1.2549 | 660 | 0.0513 | 72.8 | 72.6 | 84.29 |
| 0.0446 | 1.3804 | 726 | 0.0507 | 72.8 | 72.6 | 84.29 |
| 0.0525 | 1.5059 | 792 | 0.0498 | 95.98 | 95.98 | 111.41 |
| 0.0518 | 1.6315 | 858 | 0.0493 | 95.98 | 95.98 | 111.41 |
| 0.0445 | 1.7570 | 924 | 0.0486 | 95.98 | 95.98 | 111.41 |
| 0.0593 | 1.8825 | 990 | 0.0482 | 95.98 | 95.98 | 111.41 |
| 0.0491 | 2.0076 | 1056 | 0.0478 | 95.98 | 95.98 | 111.41 |
| 0.0459 | 2.1331 | 1122 | 0.0475 | 95.98 | 95.98 | 111.41 |
| 0.0393 | 2.2587 | 1188 | 0.0471 | 95.98 | 95.98 | 111.41 |
| 0.048 | 2.3842 | 1254 | 0.0468 | 95.98 | 95.98 | 111.41 |
| 0.0532 | 2.5097 | 1320 | 0.0466 | 95.98 | 95.98 | 111.41 |
| 0.0395 | 2.6353 | 1386 | 0.0465 | 95.98 | 95.98 | 111.41 |
| 0.0457 | 2.7608 | 1452 | 0.0464 | 95.98 | 95.98 | 111.41 |
| 0.0528 | 2.8864 | 1518 | 0.0463 | 95.98 | 95.98 | 111.41 |