Views
No views yet
0.4.11adapter: lora
2base_model: Qwen/Qwen1.5-0.5B
3bf16: auto
4dataset_prepared_path: null
5datasets:
6- data_files:
7 - 223a29e970e70cf2_train_data.json
8 ds_type: json
9 format: custom
10 path: 223a29e970e70cf2_train_data.json
11 type:
12 field: null
13 field_input: null
14 field_instruction: Question
15 field_output: A
16 field_system: null
17 format: null
18 no_input_format: null
19 system_format: '{system}'
20 system_prompt: ''
21debug: null
22deepspeed: null
23early_stopping_patience: null
24evals_per_epoch: 1
25flash_attention: true
26fp16: null
27fsdp: null
28fsdp_config: null
29gradient_accumulation_steps: 4
30gradient_checkpointing: true
31gradient_checkpointing_kwargs:
32 use_reentrant: false
33group_by_length: false
34hub_model_id: taopanda-4/468ca133-4214-4539-a14f-1b1ee5704fe0
35learning_rate: 0.0002
36load_in_4bit: false
37load_in_8bit: false
38local_rank: null
39logging_steps: 1
40lora_alpha: 16
41lora_dropout: 0.05
42lora_fan_in_fan_out: null
43lora_model_dir: null
44lora_r: 32
45lora_target_linear: true
46lr_scheduler: cosine
47micro_batch_size: 1
48num_epochs: 2
49optimizer: paged_adamw_8bit
50output_dir: ./outputs/out/taopanda-4_8cc33ac9-f924-455b-8b96-1103a51c90b5
51pad_to_sequence_len: false
52resume_from_checkpoint: null
53sample_packing: false
54saves_per_epoch: 1
55seed: 61157
56sequence_len: 1024
57special_tokens: null
58strict: false
59tf32: true
60train_on_inputs: false
61trust_remote_code: true
62val_set_size: 0.05
63wandb_entity: fatcat87-taopanda
64wandb_log_model: null
65wandb_mode: online
66wandb_name: taopanda-4_8cc33ac9-f924-455b-8b96-1103a51c90b5
67wandb_project: subnet56
68wandb_runid: taopanda-4_8cc33ac9-f924-455b-8b96-1103a51c90b5
69wandb_watch: null
70warmup_steps: 10
71weight_decay: 0.0
72xformers_attention: null
73| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 2.768 | 0.0011 | 1 | 2.7560 |
| 1.8555 | 1.0 | 949 | 2.0047 |
| 1.6581 | 2.0 | 1898 | 2.0038 |