Views
No views yet
0.11.0.dev01adapter: lora
2base_model: Qwen/Qwen2.5-0.5B-Instruct
3bf16: false
4chat_template: chatml
5dataset_prepared_path: last_run_prepared
6datasets:
7- field_messages: messages
8 path: shenghuanjiuer/sft-train
9 type: chat_template
10eval_sample_packing: true
11evals_per_epoch: 1
12flash_attention: true
13fp16: true
14gradient_accumulation_steps: 2
15gradient_checkpointing: true
16group_by_length: false
17hub_model_id: shenghuanjiuer/fr-lora-mini
18learning_rate: 0.0002
19load_in_4bit: false
20load_in_8bit: false
21logging_steps: 1
22lora_alpha: 8
23lora_dropout: 0.05
24lora_r: 4
25lora_target_modules:
26- q_proj
27- v_proj
28loss_watchdog_patience: 4
29loss_watchdog_threshold: 8
30lr_scheduler: cosine
31micro_batch_size: 1
32num_epochs: 1
33optimizer: adamw_8bit
34output_dir: /runpod-volume/fine-tuning/test-run
35pad_to_sequence_len: true
36push_to_hub: true
37run_name: test-run
38runpod_job_id: 0343c0e6-ca53-4c21-bdbf-f5df3f5d92a0-e1
39sample_packing: true
40saves_per_epoch: 1
41sequence_len: 2048
42special_tokens:
43 pad_token: <|end_of_text|>
44strict: true
45tf32: false
46train_on_inputs: false
47val_set_size: 0.1
48warmup_steps: 10
49weight_decay: 0
50