Views
No views yet
0.16.0.dev01# Sera v6 — scale data 316→1000 + num_epochs 3→6.
2#
3# Background: Sera v3 (316 rows × 6 epochs, SLURM 391242) passed turn-1 cleanly
4# but collapsed at turn-3+ (degenerate tokens, 4.4.4.4… or for-the-for-the…)
5# once a tool observation >~20 KB entered context. Greedy decoding didn't save
6# it, so the root cause is under-training rather than sampling. See
7# /Users/benjaminfeuer/Documents/notes/ot-agent/sera_braces_diagnosis.md for
8# evidence (per-token probe + turn-3 replay).
9#
10# v6 = F3 fix: 3× more rows to give the model enough updates to stay stable
11# in long multi-turn contexts.
12
13base_model: Qwen/Qwen3-8B
14deepspeed: /e/scratch/jureap59/feuer1/code/axolotl/deepspeed_configs/zero3_bf16.json
15
16load_in_8bit: false
17load_in_4bit: false
18
19chat_template: tokenizer_default
20datasets:
21- laion/Sera-4.6-Lite-T2-v4-1000
22 type: chat_template
23 field_messages: messages
24 ds_type: json
25 message_field_training: train
26
27dataset_prepared_path: /e/data1/datasets/playground/ot-baf/axolotl_dataset_cache/sera-v4-1000-v7
28output_dir: /e/data1/datasets/playground/ot-baf/checkpoints/sera-v4-1000-axolotl__Qwen3-8B-v7
29
30sequence_len: 32768
31
32wandb_project:
33wandb_entity:
34wandb_watch:
35wandb_name: sera-v4-1000-axolotl__Qwen3-8B-v7
36wandb_log_model:
37
38gradient_accumulation_steps: 8
39micro_batch_size: 1
40num_epochs: 12
41optimizer: adamw_torch
42lr_scheduler: cosine
43learning_rate: 1e-5
44adam_beta1: 0.9
45adam_beta2: 0.95
46
47bf16: auto
48tf32: false
49
50gradient_checkpointing: true
51activation_offloading: true
52resume_from_checkpoint:
53logging_steps: 1
54flash_attention: true
55
56loss_watchdog_threshold: 5.0
57loss_watchdog_patience: 3
58
59warmup_ratio: 0.1875
60evals_per_epoch: 0
61save_strategy: epoch
62
63weight_decay: 0.01
64max_grad_norm: 1.0
65special_tokens:
66