Views
No views yet
0.13.0.dev01adapter: lora
2base_model: mistralai/Mistral-Nemo-Instruct-2407
3bf16: auto
4datasets:
5- path: quentintousart/vian-hierarchizer-training
6 data_files:
7 - training_data.jsonl
8 type: chat_template
9 ds_type: json
10chat_template: mistral_v2v3
11special_tokens:
12 pad_token: "<pad>"
13gradient_accumulation_steps: 4
14learning_rate: 0.0002
15load_in_8bit: true
16lora_alpha: 32
17lora_dropout: 0.05
18lora_r: 16
19lora_target_modules:
20- q_proj
21- v_proj
22- k_proj
23- o_proj
24- gate_proj
25- down_proj
26- up_proj
27micro_batch_size: 2
28num_epochs: 3
29optimizer: adamw_bnb_8bit
30output_dir: ./outputs/vian-nemo
31sequence_len: 4096
32train_on_inputs: false
33hub_model_id: quentintousart/mistral-nemo-vian-hierarchizer
34hub_strategy: end
35hf_use_auth_token: true
36save_safetensors: true
37logging_steps: 10
38warmup_steps: 10
39