1base_model: Qwen/Qwen2.5-7B-Instruct
2trust_remote_code: true
3
4load_in_8bit:
5load_in_4bit:
6strict: false
7
8datasets:
9 - path: medalpaca/medical_meadow_medqa
10 type: alpaca
11dataset_prepared_path:
12val_set_size: 0.2
13output_dir: ./fulloutputs/out
14
15sequence_len: 8192
16sample_packing: true
17eval_sample_packing: true
18pad_to_sequence_len: true
19
20
21wandb_project: full-ft-qwen
22wandb_entity:
23wandb_watch:
24wandb_name:
25wandb_log_model:
26
27gradient_accumulation_steps: 1
28micro_batch_size: 1
29num_epochs: 3
30optimizer: adamw_torch
31lr_scheduler: cosine
32learning_rate: 0.00002
33
34train_on_inputs: false
35group_by_length: false
36bf16: true
37fp16: false
38tf32: false
39
40gradient_checkpointing: true
41gradient_checkpointing_kwargs:
42 use_reentrant: false
43early_stopping_patience:
44resume_from_checkpoint:
45local_rank:
46logging_steps: 10
47xformers_attention:
48flash_attention: true
49
50warmup_steps:
51eval_steps: 100
52save_steps: 100
53debug:
54deepspeed: deepspeed_configs/zero2.json
55weight_decay: 0.05
56fsdp:
57fsdp_config:
58special_tokens:
59
60hub_model_id: neginashz/qwen2-ins-full-fsdp
61early_stopping_patience: 3
62