Views
No views yet
0.4.11base_model: mistralai/Mistral-7B-v0.3
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9datasets:
10 - path: allenai/tulu-v2-sft-mixture
11 type: sharegpt.load_ultrachat
12 conversation: llama3
13
14chat_template: llama3
15
16dataset_prepared_path: ./datasets/tulu-v2-sft-2.0
17output_dir: ./outputs/m7b-tulu-v2-sft
18
19sequence_len: 8192
20sample_packing: true
21pad_to_sequence_len: true
22
23wandb_project: lm-evals
24wandb_entity:
25wandb_watch:
26wandb_name: Mistral-7B-tulu-v2
27wandb_log_model:
28hub_model_id: penfever/Mistral-7B-tulu-v2
29
30gradient_accumulation_steps: 8
31micro_batch_size: 1
32num_epochs: 2
33optimizer: paged_adamw_8bit
34lr_scheduler: cosine
35learning_rate: 2e-5
36
37train_on_inputs: false
38group_by_length: false
39bf16: auto
40fp16:
41tf32: false
42
43gradient_checkpointing: true
44gradient_checkpointing_kwargs:
45 use_reentrant: false
46early_stopping_patience:
47resume_from_checkpoint:
48logging_steps: 1
49xformers_attention:
50flash_attention: true
51
52warmup_steps: 100
53eval_table_size:
54saves_per_epoch: 1
55debug:
56deepspeed:
57weight_decay: 0.0
58fsdp:
59fsdp_config:
60special_tokens:
61 bos_token: <|begin_of_text|>
62 eos_token: <|end_of_text|>
63 pad_token: <|end_of_text|>
64tokens:
65 - "<|start_header_id|>"
66 - "<|end_header_id|>"
67 - "<|eot_id|>"