1base_model: mistralai/Mistral-7B-v0.1
2model_type: MistralForCausalLM
3tokenizer_type: LlamaTokenizer
4is_mistral_derived_model: true
5
6load_in_8bit: false
7load_in_4bit: false
8strict: false
9
10datasets:
11 - path: mhenrichsen/alpaca_2k_test
12 type: alpaca
13dataset_prepared_path: last_run_prepared
14val_set_size: 0.05
15output_dir: ./Mistral_FFT
16
17sequence_len: 4096
18sample_packing: true
19pad_to_sequence_len: true
20
21adapter:
22lora_model_dir:
23lora_r:
24lora_alpha:
25lora_dropout:
26lora_target_linear:
27lora_fan_in_fan_out:
28
29wandb_project:
30wandb_entity:
31wandb_watch:
32wandb_name:
33wandb_log_model:
34
35gradient_accumulation_steps: 1
36micro_batch_size: 1
37num_epochs: 1
38optimizer: adamw_bnb_8bit
39lr_scheduler: cosine
40learning_rate: 0.0002
41
42train_on_inputs: false
43group_by_length: false
44bf16: auto
45fp16:
46tf32: false
47
48gradient_checkpointing: true
49early_stopping_patience:
50resume_from_checkpoint:
51local_rank:
52logging_steps: 1
53xformers_attention:
54flash_attention: true
55flash_attn_cross_entropy: false
56flash_attn_rms_norm: true
57flash_attn_fuse_qkv: false
58flash_attn_fuse_mlp: true
59
60warmup_steps: 100
61evals_per_epoch: 4
62eval_table_size:
63eval_sample_packing: False
64saves_per_epoch: 1
65debug:
66deepspeed: deepspeed_configs/zero2.json
67weight_decay: 0.1
68fsdp:
69fsdp_config:
70special_tokens:
71