Views
No views yet
0.11.0.dev01adapter: lora
2base_model: Qwen/Qwen2.5-7B-Instruct
3bf16: false
4chat_template: chatml
5dataset_prepared_path: last_run_prepared
6datasets:
7- field_messages: messages
8 path: shenghuanjiuer/sft-train
9 type: chat_template
10eval_sample_packing: true
11evals_per_epoch: 4
12flash_attention: true
13fp16: true
14gradient_accumulation_steps: 2
15gradient_checkpointing: true
16group_by_length: false
17hub_model_id: shenghuanjiuer/fr-lora
18learning_rate: 0.0002
19load_in_4bit: false
20load_in_8bit: true
21logging_steps: 1
22lora_alpha: 32
23lora_dropout: 0.05
24lora_r: 16
25lora_target_modules:
26- gate_proj
27- down_proj
28- up_proj
29- q_proj
30- v_proj
31- k_proj
32- o_proj
33loss_watchdog_patience: 3
34loss_watchdog_threshold: 5
35lr_scheduler: cosine
36micro_batch_size: 1
37num_epochs: 6
38optimizer: adamw_8bit
39output_dir: /runpod-volume/fine-tuning/test-run
40pad_to_sequence_len: true
41push_to_hub: true
42run_name: test-run
43runpod_job_id: da89ac2d-7df2-469f-819c-e5dca7a3ecb7-e2
44sample_packing: true
45saves_per_epoch: 1
46sequence_len: 2048
47special_tokens:
48 pad_token: <|end_of_text|>
49strict: false
50tf32: false
51train_on_inputs: false
52val_set_size: 0.1
53warmup_steps: 10
54weight_decay: 0
55| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| No log | 0 | 0 | 7.8256 |
| 7.8065 | 0.2857 | 4 | 5.6124 |