Views
No views yet
0.13.11base_model: Qwen/Qwen3-Coder-30B-A3B-Instruct
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4trust_remote_code: true
5
6load_in_8bit: false
7load_in_4bit: false
8
9adapter: lora
10lora_r: 128
11lora_alpha: 256
12lora_dropout: 0.05
13lora_target_linear: true
14lora_target_modules:
15 - q_proj
16 - k_proj
17 - v_proj
18 - o_proj
19 - gate_proj
20 - up_proj
21 - down_proj
22
23datasets:
24 - path: /root/sweetflipstraining/data/sweetflippy_train.jsonl
25 type: chat_template
26 chat_template: chatml
27 field_messages: conversations
28
29val_set_size: 0.0
30dataset_prepared_path: null
31dataset_num_proc: 64
32dataloader_num_workers: 8
33
34output_dir: /root/sweetflipstraining/outputs/agent-sft-max-speed
35hub_model_id: Sweetflips/qwen3-coder-30b-agent-v1
36
37# REDUCED for memory
38sequence_len: 8192
39sample_packing: true
40pad_to_sequence_len: true
41
42# REDUCED batch size
43micro_batch_size: 2
44gradient_accumulation_steps: 4
45
46num_epochs: 1
47learning_rate: 1e-4
48lr_scheduler: cosine
49warmup_ratio: 0.05
50
51optimizer: adamw_torch_fused
52weight_decay: 0.01
53max_grad_norm: 1.0
54lr_groups: []
55
56bf16: true
57tf32: true
58
59# ENABLE gradient checkpointing to save memory
60gradient_checkpointing: true
61
62flash_attention: false
63sdp_attention: true
64
65deepspeed: configs/deepspeed_configs/zero3_no_offload.json
66
67save_strategy: steps
68save_steps: 100
69save_total_limit: 10
70eval_strategy: "no"
71
72wandb_mode: disabled
73seed: 42
74chat_template: chatml
75special_tokens:
76 pad_token: "<|endoftext|>"
77
78auto_resume_from_checkpoints: false
79