Views
No views yet
0.12.21base_model: meta-llama/Llama-3.1-8B-Instruct
2
3#load_in_4bit: true
4
5#adapter: lora
6#lora_r: 16
7#lora_alpha: 32
8#lora_dropout: 0.05
9#lora_target_modules:
10# - q_proj
11# - v_proj
12# - k_proj
13# - o_proj
14
15
16plugins:
17 - axolotl.integrations.liger.LigerPlugin
18liger_rope: true
19liger_rms_norm: true
20liger_glu_activation: true
21liger_fused_linear_cross_entropy: true
22
23strict: false
24
25chat_template: llama3
26datasets:
27 - path: "Dataset_construction/tokenized_novelty_dataset_5_for_llama/train_full.parquet"
28 type:
29 ds_type: parquet
30
31dataset_prepared_path:
32val_set_size: 0.00
33output_dir: ./fine-tuned_models/Novelty_Reviewer
34
35dataset_processes: 16
36
37sequence_len: 32120
38sample_packing: false
39pad_to_sequence_len: true
40
41gradient_accumulation_steps: 1
42micro_batch_size: 1
43num_epochs: 3
44optimizer: adamw_torch
45lr_scheduler: cosine
46learning_rate: 2e-5
47
48train_on_inputs: false
49group_by_length: false
50bf16: auto
51fp16:
52tf32: true
53
54gradient_checkpointing: true
55gradient_checkpointing_kwargs:
56 use_reentrant: false
57early_stopping_patience:
58resume_from_checkpoint:
59logging_steps: 1
60flash_attention: true
61
62warmup_steps: 50
63evals_per_epoch: 0
64eval_table_size:
65saves_per_epoch: 2
66save_only_model: true
67debug:
68deepspeed: deepspeed_configs/zero3_bf16.json
69weight_decay: 0.0
70fsdp:
71fsdp_config:
72special_tokens:
73 pad_token: <|finetune_right_pad_id|>
74 eos_token: <|eot_id|>
75
76