Views
No views yet
0.8.11base_model: mistralai/Mistral-Nemo-Instruct-2407
2model_type: AutoModelForCausalLM
3tokenizer_type: AutoTokenizer
4
5model_config:
6 trust_remote_code: true
7 tokenizer:
8 pad_token: "</s>"
9 padding_side: "right"
10 add_bos_token: true
11 add_eos_token: false
12
13datasets:
14 - path: data/data.jsonl
15 type: chat_template
16 chat_template_strategy: tokenizer
17 field_messages: conversations
18 message_property_mappings:
19 role: role
20 content: content
21 roles:
22 user: ["user"]
23 assistant: ["assistant"]
24 system: ["system"]
25
26load_in_4bit: true
27adapter: qlora
28lora_r: 64
29lora_alpha: 32
30lora_dropout: 0.1
31lora_target_modules:
32 - q_proj
33 - k_proj
34 - v_proj
35 - o_proj
36 - gate_proj
37 - up_proj
38 - down_proj
39
40bf16: true
41flash_attention: true
42gradient_checkpointing: true
43deepspeed: deepspeed_configs/zero2.json
44
45gradient_accumulation_steps: 4
46micro_batch_size: 8
47num_epochs: 2
48optimizer: paged_adamw_8bit
49lr_scheduler: cosine
50learning_rate: 3e-6
51warmup_ratio: 0.02
52
53max_seq_length: 8192
54pad_to_sequence_len: true
55sample_packing: true
56max_grad_norm: 1.0
57
58output_dir: ./output
59save_steps: 100
60logging_steps: 10
61save_safetensors: true
62
63special_tokens:
64 pad_token: "</s>"
65