Views
No views yet
0.11.0.dev01adapter: lora
2base_model: MuXodious/Mistral-Nemo-Instruct-2407-absolute-heresy
3bf16: true
4datasets:
5- ds_type: json
6 path: DarkArtsForge/Poe_v1
7 type: alpaca
8flash_attention: true
9fp16: false
10gradient_accumulation_steps: 4
11gradient_checkpointing: true
12hub_always_push: true
13hub_model_id: Naphula-Archives/MN-Raven-12B-v0o-Instruct-LoRA
14hub_private_repo: true
15hub_strategy: checkpoint
16is_mistral_derived_model: true
17learning_rate: 1.0e-04
18load_best_model_at_end: true
19load_in_4bit: false
20logging_steps: 1
21lora_alpha: 256
22lora_dropout: 0.05
23lora_r: 128
24lora_target_linear: false
25lora_target_modules:
26- q_proj
27- k_proj
28- v_proj
29- o_proj
30- gate_proj
31- up_proj
32- down_proj
33lr_scheduler: cosine
34max_grad_norm: 0.3
35warmup_ratio: 0.03
36micro_batch_size: 1
37model_type: AutoModelForCausalLM
38num_epochs: 5
39optimizer: paged_adamw_32bit
40output_dir: /runpod-volume/fine-tuning/default_run_id
41pad_to_sequence_len: false
42push_to_hub: true
43resize_token_embeddings: false
44run_name: default_run_id
45runpod_job_id: 0
46sample_packing: false
47save_strategy: epoch
48save_total_limit: 5
49seed: 420
50sequence_len: 768
51special_tokens:
52 eos_token: </s>
53 pad_token: <pad>
54tf32: true
55tokenizer_type: AutoTokenizer
56val_set_size: 0
57weight_decay: '0.0'
581 {
2 "epoch": 3.0,
3 "grad_norm": 1.7338424921035767,
4 "learning_rate": 3.726644398793857e-05,
5 "loss": 0.1262,
6 "step": 75
7 }