Views
No views yet
0.16.0.dev01# Mirror of SERA's axolotl_qwen3_8b.yaml, parameterized for Jupiter SFT on v3 data.
2# Filled at render time via sed-substitution of 316.
3
4base_model: Qwen/Qwen3-8B
5deepspeed: /e/scratch/jureap59/feuer1/code/axolotl/deepspeed_configs/zero3_bf16.json
6
7load_in_8bit: false
8load_in_4bit: false
9
10# plugins disabled 2026-04-22: CCE + bf16 + flash-attn on aarch64/torch2.9 caused
11# gradient explosion (grad_norm 9.8e+11) and loss -> 0 within first 3-7 steps.
12# plugins:
13# - axolotl.integrations.cut_cross_entropy.CutCrossEntropyPlugin
14
15chat_template: chatml
16datasets:
17 - path: laion/Sera-4.5A-Full-T1-v3-316
18 data_files:
19 - sera-4.5a-full-t1_v3_316.jsonl
20 type: chat_template
21 field_messages: messages
22 ds_type: json
23 message_field_training: train
24
25dataset_prepared_path: /e/data1/datasets/playground/ot-baf/axolotl_dataset_cache/sera-v3-316
26output_dir: /e/data1/datasets/playground/ot-baf/checkpoints/sera-v3-316-axolotl__Qwen3-8B
27
28sequence_len: 32768
29
30wandb_project:
31wandb_entity:
32wandb_watch:
33wandb_name: sera-v3-316-axolotl__Qwen3-8B
34wandb_log_model:
35
36gradient_accumulation_steps: 8
37micro_batch_size: 1
38num_epochs: 3
39optimizer: adamw_torch
40lr_scheduler: cosine
41learning_rate: 1e-5
42adam_beta1: 0.9
43adam_beta2: 0.95
44
45bf16: auto
46tf32: false
47
48gradient_checkpointing: true
49activation_offloading: true
50resume_from_checkpoint:
51logging_steps: 1
52flash_attention: true
53
54loss_watchdog_threshold: 5.0
55loss_watchdog_patience: 3
56
57warmup_ratio: 0.1875
58evals_per_epoch: 0
59save_strategy: epoch
60
61weight_decay: 0.01
62max_grad_norm: 1.0
63special_tokens:
64