Views
No views yet
0.16.0.dev01# Sera v4 retrain v3 — size=316, num_epochs doubled 3->6
2# v2 (num_epochs=3, tokenizer_default) recovered structure but model still
3# emits malformed JSON ({"name": "view"}}} — 3 closing braces) and collapses
4# str_replace_editor -> inner arguments.command='view'. Training data confirmed
5# clean (5 rows / 140 tool calls / 0 malformed / tool names str_replace_editor/
6# bash/submit). Hypothesis: ~120 grad updates at size=316 is too few to latch
7# onto nested JSON structure + tool-name dictionary; double passes to 6 epochs.
8
9base_model: Qwen/Qwen3-8B
10deepspeed: /e/scratch/jureap59/feuer1/code/axolotl/deepspeed_configs/zero3_bf16.json
11
12load_in_8bit: false
13load_in_4bit: false
14
15chat_template: tokenizer_default
16# datasets: (stripped — axolotl embedded invalid local path)
17_datasets_:
18- laion/Sera-4.6-Lite-T2-v4-316
19 type: chat_template
20 field_messages: messages
21 ds_type: json
22 message_field_training: train
23
24dataset_prepared_path: /e/data1/datasets/playground/ot-baf/axolotl_dataset_cache/sera-v4-316-v3
25output_dir: /e/data1/datasets/playground/ot-baf/checkpoints/sera-v4-316-axolotl__Qwen3-8B-v3
26
27sequence_len: 32768
28
29wandb_project:
30wandb_entity:
31wandb_watch:
32wandb_name: sera-v4-316-axolotl__Qwen3-8B-v3
33wandb_log_model:
34
35gradient_accumulation_steps: 8
36micro_batch_size: 1
37num_epochs: 6
38optimizer: adamw_torch
39lr_scheduler: cosine
40learning_rate: 1e-5
41adam_beta1: 0.9
42adam_beta2: 0.95
43
44bf16: auto
45tf32: false
46
47gradient_checkpointing: true
48activation_offloading: true
49resume_from_checkpoint:
50logging_steps: 1
51flash_attention: true
52
53loss_watchdog_threshold: 5.0
54loss_watchdog_patience: 3
55
56warmup_ratio: 0.1875
57evals_per_epoch: 0
58save_strategy: epoch
59
60weight_decay: 0.01
61max_grad_norm: 1.0
62special_tokens:
63