Views
No views yet


1base_model: TinyLlama/TinyLlama-1.1B-intermediate-step-1431k-3T
2model_type: LlamaForCausalLM
3tokenizer_type: LlamaTokenizer
4is_llama_derived_model: true
5
6load_in_8bit: true
7load_in_4bit: false
8strict: false
9
10datasets:
11 - path: teknium/openhermes
12 type: alpaca
13dataset_prepared_path:
14val_set_size: 0.05
15output_dir: ./tiny-llama-instruct-lora
16
17sequence_len: 4096
18sample_packing: true
19pad_to_sequence_len: true
20
21adapter: lora
22lora_model_dir:
23lora_r: 32
24lora_alpha: 16
25lora_dropout: 0.05
26lora_target_linear: true
27lora_fan_in_fan_out:
28
29gradient_accumulation_steps: 4
30micro_batch_size: 2
31num_epochs: 4
32optimizer: adamw_bnb_8bit
33lr_scheduler: cosine
34learning_rate: 0.0002
35
36train_on_inputs: false
37group_by_length: false
38bf16: true
39fp16: false
40tf32: false
41
42gradient_checkpointing: true
43early_stopping_patience:
44resume_from_checkpoint:
45local_rank:
46logging_steps: 1
47xformers_attention:
48flash_attention: true
49
50warmup_steps: 10
51evals_per_epoch: 4
52saves_per_epoch: 1
53debug:
54deepspeed:
55weight_decay: 0.0
56fsdp:
57fsdp_config:
58special_tokens: