Views
No views yet
0.4.11adapter: lora
2base_model: katuni4ka/tiny-random-qwen1.5-moe
3bf16: auto
4dataset_prepared_path: null
5datasets:
6- data_files:
7 - bab283e818c97851_train_data.json
8 ds_type: json
9 format: custom
10 path: bab283e818c97851_train_data.json
11 type:
12 field: null
13 field_input: null
14 field_instruction: context
15 field_output: level_2
16 field_system: null
17 format: null
18 no_input_format: null
19 system_format: '{system}'
20 system_prompt: ''
21debug: null
22deepspeed: null
23early_stopping_patience: null
24evals_per_epoch: 3
25flash_attention: true
26fp16: null
27fsdp: null
28fsdp_config: null
29gradient_accumulation_steps: 4
30gradient_checkpointing: true
31gradient_checkpointing_kwargs:
32 use_reentrant: false
33group_by_length: false
34hub_model_id: taopanda/2c157ea5-df82-4f8e-a01c-eed7d3c6cb1d
35learning_rate: 0.0002
36load_in_4bit: false
37load_in_8bit: false
38local_rank: null
39logging_steps: 1
40lora_alpha: 16
41lora_dropout: 0.05
42lora_fan_in_fan_out: null
43lora_model_dir: null
44lora_r: 32
45lora_target_linear: true
46lr_scheduler: cosine
47micro_batch_size: 1
48num_epochs: 1
49optimizer: paged_adamw_8bit
50output_dir: ./outputs/out/taopanda-2_a4cfd74d-319f-41fe-90ca-a0914a9d703e
51pad_to_sequence_len: false
52resume_from_checkpoint: null
53sample_packing: false
54saves_per_epoch: 1
55seed: 11975
56sequence_len: 1024
57special_tokens: null
58strict: false
59tf32: true
60train_on_inputs: false
61trust_remote_code: true
62val_set_size: 0.05
63wandb_entity: fatcat87-taopanda
64wandb_log_model: null
65wandb_mode: online
66wandb_name: taopanda-2_a4cfd74d-319f-41fe-90ca-a0914a9d703e
67wandb_project: subnet56
68wandb_runid: taopanda-2_a4cfd74d-319f-41fe-90ca-a0914a9d703e
69wandb_watch: null
70warmup_steps: 10
71weight_decay: 0.0
72xformers_attention: null
73| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 11.9292 | 0.0002 | 1 | 11.9319 |
| 11.7579 | 0.3334 | 1716 | 11.7547 |
| 11.7407 | 0.6668 | 3432 | 11.7507 |