Views
No views yet
0.3.01base_model: Locutusque/TinyMistral-248M-v2.5
2model_type: MistralForCausalLM
3is_mistral_derived_model: true
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9dataset_processes: 20
10
11datasets:
12 - path: epfl-llm/guidelines
13 type: completion
14 field: clean_text
15 - path: JeanKaddour/minipile
16 type: completion
17 field: text
18
19dataset_prepared_path: TinyMistral-FFT-data
20val_set_size: 0.001
21output_dir: ./TinyMistral-FFT
22
23sequence_len: 2048
24sample_packing: false
25pad_to_sequence_len: true
26
27adapter:
28lora_model_dir:
29lora_r:
30lora_alpha:
31lora_dropout:
32lora_target_linear:
33lora_fan_in_fan_out:
34
35# wandb configuration
36wandb_project: TinyMistral-FFT
37wandb_watch:
38wandb_run_id:
39wandb_log_model:
40
41gradient_accumulation_steps: 2
42micro_batch_size: 4
43num_epochs: 1
44optimizer: paged_adamw_32bit
45lr_scheduler: constant
46cosine_min_lr_ratio:
47
48learning_rate: 0.00005
49
50train_on_inputs: true
51group_by_length: false
52bf16: true
53fp16: false
54tf32: false
55
56gradient_checkpointing: false
57early_stopping_patience:
58resume_from_checkpoint:
59auto_resume_from_checkpoints: True
60local_rank:
61logging_steps: 1
62xformers_attention:
63flash_attention: true
64flash_attn_cross_entropy: false
65flash_attn_rms_norm: true
66flash_attn_fuse_qkv: false
67flash_attn_fuse_mlp: true
68
69warmup_steps: 10
70evals_per_epoch: 100
71# eval_steps: 10
72eval_table_size:
73saves_per_epoch: 50
74debug:
75deepspeed: #deepspeed/zero2.json # multi-gpu only
76weight_decay: 0
77
78# tokens:
79
80
81special_tokens:
82 bos_token: "<|bos|>"
83 eos_token: "<|endoftext|>"
84 unk_token: "<unk>"