Views
No views yet
0.10.0.dev01base_model: Qwen/Qwen3-8B
2
3load_in_8bit: false
4load_in_4bit: false
5strict: false
6
7datasets:
8 - path: thesantatitan/text2svg-stack-follow-constraints-10k
9 type: chat_template
10 split: train
11 chat_template: tokenizer_default
12 field_messages: messages
13 roles_to_train: ["assistant"]
14
15dataset_prepared_path: text2svg-prepared
16val_set_size: 0.05
17output_dir: ./lora-out
18
19sequence_len: 4096
20sample_packing: false
21eval_sample_packing: false
22pad_to_sequence_len: false
23
24adapter: lora
25lora_model_dir:
26lora_r: 32
27lora_alpha: 32
28lora_dropout: 0.05
29lora_target_linear: true
30lora_fan_in_fan_out:
31lora_modules_to_save: # required when adding new tokens to LLaMA/Mistral
32 - embed_tokens
33 - lm_head
34
35wandb_project: svg-sft-qwen-8b-saved
36wandb_entity:
37wandb_watch:
38wandb_run_id: sexyrun1
39
40gradient_accumulation_steps: 64
41micro_batch_size: 1
42num_epochs: 1
43optimizer: adamw_torch
44lr_scheduler: cosine
45learning_rate: 0.0001
46
47bf16: auto
48fp16: false
49tf32: false
50train_on_inputs: false
51group_by_length: false
52
53gradient_checkpointing: true
54early_stopping_patience:
55resume_from_checkpoint:
56local_rank:
57logging_steps: 1
58xformers_attention:
59flash_attention: true
60
61warmup_steps: 10
62save_steps: 20
63debug:
64deepspeed: /workspace/axolotl/deepspeed_configs/zero3_bf16.json
65weight_decay: 0.0
66fsdp:
67fsdp_config:
68
69hub_strategy: every_save
70hub_model_id: thesantatitan/qwen-svg-sft-new-rank32| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 0.6496 | 0.9926 | 69 | 0.7087 |