0.14.0.dev01adapter: qlora
2base_model: Qwen/Qwen2.5-3B-Instruct
3bf16: false
4chat_template: qwen3
5dataloader_num_workers: 2
6dataloader_pin_memory: true
7dataloader_prefetch_factor: 2
8datasets:
9- eot_tokens:
10 - <|im_end|>
11 path: winglian/pirate-ultrachat-10k
12 split: train
13 type: chat_template
14embeddings_skip_upcast: true
15fp16: true
16gradient_accumulation_steps: 8
17gradient_checkpointing: true
18gradient_checkpointing_kwargs:
19 use_reentrant: false
20learning_rate: 0.00019
21load_in_4bit: true
22logging_steps: 1
23lora_alpha: 64
24lora_mlp_kernel: false
25lora_o_kernel: false
26lora_qkv_kernel: false
27lora_r: 32
28lora_target_modules:
29- q_proj
30- k_proj
31- v_proj
32- o_proj
33- gate_proj
34- down_proj
35- up_proj
36lr_scheduler: cosine
37max_grad_norm: 0.1
38micro_batch_size: 1
39num_epochs: 1
40optimizer: paged_adamw_8bit
41output_dir: ./outputs/qwen-sft-pirate-rrr
42plugins: []
43sample_packing: false
44saves_per_epoch: 2
45sequence_len: 1024
46warmup_steps: 5
47xformers_attention: true
480.14.0.dev01adapter: qlora
2axolotl_config_path: /tmp/axolotl_config_99dsexe3.yml
3base_model: Qwen/Qwen2.5-3B-Instruct
4bf16: false
5chat_template: qwen3
6dataloader_num_workers: 2
7dataloader_pin_memory: true
8dataloader_prefetch_factor: 2
9datasets:
10- !!python/object:axolotl.utils.schemas.datasets.SFTDataset
11 __dict__:
12 chat_template: !!python/object/apply:axolotl.utils.schemas.enums.ChatTemplate
13 - tokenizer_default
14 chat_template_jinja: null
15 conversation: null
16 data_files: null
17 drop_system_message: null
18 ds_type: null
19 field: null
20 field_human: null
21 field_messages: null
22 field_model: null
23 field_thinking: null
24 field_tools: null
25 input_format: null
26 input_transform: null
27 logprobs_field: null
28 message_field_content: null
29 message_field_role: null
30 message_field_training: null
31 message_field_training_detail: null
32 message_property_mappings:
33 content: content
34 role: role
35 name: null
36 path: winglian/pirate-ultrachat-10k
37 preprocess_shards: null
38 revision: null
39 roles: null
40 roles_to_train: null
41 shards: null
42 shards_idx: null
43 split: train
44 split_thinking: null
45 temperature: null
46 template_thinking_key: null
47 train_on_eos: null
48 trust_remote_code: false
49 type: chat_template
50 __pydantic_extra__: null
51 __pydantic_fields_set__: !!set
52 chat_template: null
53 message_property_mappings: null
54 path: null
55 split: null
56 type: null
57 __pydantic_private__: null
58embeddings_skip_upcast: true
59fp16: true
60gradient_accumulation_steps: 8
61gradient_checkpointing: true
62gradient_checkpointing_kwargs:
63 use_reentrant: false
64learning_rate: 0.00019
65load_in_4bit: true
66logging_steps: 1
67lora_alpha: 64
68lora_mlp_kernel: false
69lora_o_kernel: false
70lora_qkv_kernel: false
71lora_r: 32
72lora_target_modules:
73- q_proj
74- k_proj
75- v_proj
76- o_proj
77- gate_proj
78- down_proj
79- up_proj
80lr_scheduler: cosine
81max_grad_norm: 0.1
82micro_batch_size: 1
83num_epochs: 1
84optimizer: paged_adamw_8bit
85output_dir: ./outputs/qwen-sft-pirate-rrr
86plugins: []
87sample_packing: false
88saves_per_epoch: 2
89sequence_len: 1024
90warmup_steps: 5
91xformers_attention: true
92