1seed: 9
2auto_resume_from_checkpoints: True
3tokenizer_save_jinja_files: True
4trust_remote_code: True
5tokenizer_use_fast: True
6gradient_accumulation: True
7load_best_model_at_end: true
8
9base_model: PicoKittens/PicoMistral-23M
10model_type: AutoModelForCausalLM
11tokenizer_type: AutoTokenizer
12
13datasets:
14 - path: psychopenguin/indian_legal_dataset_qna
15 type: alpaca
16 split: train[:2%]
17
18
19sequence_len: 256
20fp16: True
21adapter: lora
22lora_target_linear: True
23lora_r: 4
24lora_alpha: 8
25lora_dropout: 0.05
26
27
28sdp_attention: True
29optimizer: adamw_bnb_8bit
30learning_rate: 0.0002
31lr_scheduler: cosine
32gradient_accumulation_steps: 2
33micro_batch_size: 2 #for gpu memory increase
34num_epochs: 3
35neftune_noise_alpha: 5
36early_stopping_patience: 3
37save_steps: 100
38
39
40val_set_size: 0.30
41eval_strategy: steps
42eval_steps: 100
43
44use_wandb: True
45wandb_project: tttt
46wandb_name: t1
47
48output_dir: ./final_model
49merge_lora: True
50hf_use_auth_token: True
51hub_model_id: psychopenguin/t1
52