Views
No views yet
0.4.01base_model: microsoft/phi-2
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4trust_remote_code: true
5
6hub_model_id: AlekseyKorshuk/ultrachat-phi-2-sft-chatml
7hub_strategy: every_save
8
9load_in_8bit: false
10load_in_4bit: false
11strict: false
12
13datasets:
14 - path: AlekseyKorshuk/ultrachat_200k
15 split: train_sft
16 type: sharegpt
17 conversation: chatml
18
19dataset_prepared_path:
20val_set_size: 0
21output_dir: ./output
22
23sequence_len: 2048
24sample_packing: false
25pad_to_sequence_len:
26
27lora_r:
28lora_alpha:
29lora_dropout:
30lora_target_modules:
31lora_target_linear:
32lora_fan_in_fan_out:
33
34wandb_project: ui-thesis
35wandb_entity:
36wandb_watch:
37wandb_name: ultrachat-phi-2-sft-chatml
38wandb_log_model:
39
40gradient_accumulation_steps: 2
41micro_batch_size: 16
42num_epochs: 1
43optimizer: paged_adamw_8bit
44adam_beta1: 0.9
45adam_beta2: 0.95
46max_grad_norm: 1.0
47adam_epsilon: 0.00001
48lr_scheduler: cosine
49cosine_min_lr_ratio: 0.1
50learning_rate: 4e-5
51warmup_ratio: 0.1
52weight_decay: 0.1
53
54train_on_inputs: false
55group_by_length: false
56bf16: true
57fp16: false
58tf32: true
59
60gradient_checkpointing: true
61early_stopping_patience:
62resume_from_checkpoint:
63local_rank:
64logging_steps: 1
65xformers_attention:
66flash_attention: true
67
68
69evals_per_epoch: 0
70eval_table_size: 8 # Approximate number of predictions sent to wandb depending on batch size. Enabled above 0. Default is 0
71eval_table_max_new_tokens: 768 # Total number of tokens generated for predictions sent to wandb. Default is 128
72eval_sample_packing: false
73
74chat_template: chatml
75saves_per_epoch: 5
76save_total_limit: 1
77seed: 42
78debug:
79deepspeed:
80
81fsdp:
82fsdp_config:
83resize_token_embeddings_to_32x: true
84
85special_tokens:
86 eos_token: "<|im_end|>"
87 pad_token: "<|endoftext|>"
88tokens:
89 - "<|im_start|>"