Views
No views yet
0.4.11base_model: lordspline/mergestein
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9chat_template: chatml
10datasets:
11 - path: lordspline/scidata
12 type: sharegpt
13 conversation: chatml
14 - path: lordspline/wizard_v2_196k_unfiltered
15 type: sharegpt
16 conversation: chatml
17 - path: lordspline/ultrainteract
18 type: sharegpt
19 conversation: chatml
20
21dataset_prepared_path: last_run_prepared
22val_set_size: 0.002
23
24output_dir: ./mergestein
25
26sequence_len: 8192
27sample_packing: true
28pad_to_sequence_len: true
29eval_sample_packing: false
30
31wandb_project: mergestein
32wandb_entity:
33wandb_watch:
34wandb_name:
35wandb_log_model:
36hub_model_id: lordspline/mergestein
37
38gradient_accumulation_steps: 1
39micro_batch_size: 1
40num_epochs: 1
41optimizer: paged_adamw_8bit
42lr_scheduler: cosine
43learning_rate: 0.0001 # look
44
45train_on_inputs: false
46group_by_length: false
47bf16: auto
48fp16:
49tf32: false
50
51gradient_checkpointing: unsloth
52gradient_checkpointing_kwargs:
53 use_reentrant: true # look
54early_stopping_patience:
55resume_from_checkpoint: # ./mergestein/checkpoint-8015
56local_rank:
57logging_steps: 1
58xformers_attention:
59flash_attention: true
60
61warmup_steps: 10
62evals_per_epoch: 1
63eval_table_size:
64eval_max_new_tokens: 128
65saves_per_epoch: 300
66debug:
67
68# deepspeed: deepspeed_configs/zero3_bf16.json
69weight_decay: 0.05
70fsdp:
71fsdp_config:
72special_tokens:
73 eos_token: "<|im_end|>"
74 pad_token: "<|end_of_text|>"
75tokens:
76 - "<|im_start|>"
77 - "<|im_end|>"| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.4476 | 1.0 | 48435 | 1.2069 |