1base_model: Qwen/Qwen2.5-1.5B-Instruct
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4trust_remote_code: false
5
6load_in_8bit: false
7load_in_4bit: false
8strict: false
9
10
11
12output_dir: ./outputs_plug/out
13chat_template: qwen_25
14datasets:
15 - path: train_plug.jsonl
16 type: chat_template
17 # chat_template: tokenizer_default
18 field_messages: messages
19 message_field_role: role
20 message_field_content: content
21 roles:
22 system:
23 - system
24 user:
25 - user
26 assistant:
27 - assistant
28
29dataset_prepared_path: last_run_prepared
30val_set_size: 0.005
31output_dir: ./outputs_plug/out
32eval_sample_packing: False
33
34sequence_len: 8192
35sample_packing: False
36pad_to_sequence_len: False
37
38wandb_project: hrm8k
39wandb_entity:
40wandb_watch:
41wandb_name: PLUG-1.5B-50k
42hub_model_id: Cartinoe5930/PLUG-1.5B-50k
43
44plugins:
45 - axolotl.integrations.liger.LigerPlugin
46liger_rope: true
47liger_rms_norm: true
48liger_swiglu: true
49liger_fused_linear_cross_entropy: true
50
51gradient_accumulation_steps: 8
52micro_batch_size: 8
53eval_batch_size: 4
54num_epochs: 1
55optimizer: paged_adamw_8bit
56lr_scheduler: cosine
57learning_rate: 1e-5
58
59train_on_inputs: false
60group_by_length: false
61bf16: auto
62fp16:
63tf32: false
64
65gradient_checkpointing: true
66gradient_checkpointing_kwargs:
67 use_reentrant: false
68early_stopping_patience:
69resume_from_checkpoint:
70logging_steps: 1
71xformers_attention:
72flash_attention: true
73
74warmup_ratio: 0.05
75evals_per_epoch: 1
76eval_max_new_tokens: 128
77eval_table_size:
78saves_per_epoch: 1
79debug:
80deepspeed: deepspeed_configs/zero1.json
81weight_decay: 0.01
82fsdp:
83fsdp_config:
84special_tokens:
85