Views
No views yet
0.8.01base_model: PocketDoc/Dans-PersonalityEngine-V1.1.0-12b
2## Liger+CCE
3plugins:
4 - axolotl.integrations.liger.LigerPlugin
5# - axolotl.integrations.cut_cross_entropy.CutCrossEntropyPlugin
6liger_rope: true
7liger_rms_norm: true
8liger_layer_norm: true
9liger_glu_activation: true
10liger_fused_linear_cross_entropy: false
11#cut_cross_entropy: false
12
13load_in_8bit: false
14load_in_4bit: false
15strict: false
16
17datasets:
18 - path: Personamaxx-VN.json
19 type: dan-chat-advanced
20 - path: NewEden/LIMARP-Complexity
21 type: dan-chat-advanced
22 - path: NewEden/PIPPA-Mega-Filtered
23 type: dan-chat-advanced
24 - path: NewEden/OpenCAI-ShareGPT
25 type: dan-chat-advanced
26 - path: NewEden/Creative_Writing-Complexity
27 type: dan-chat-advanced
28 - path: NewEden/Light-Novels-Roleplay-Logs-Books-Oh-My-duplicate-turns-removed
29 type: dan-chat-advanced
30 - path: prosemaxx-adventure-failuremaxx.json
31 type: dan-chat-advanced
32 - path: NewEden/Books-V2-ShareGPT
33 type: dan-chat-advanced
34 - path: NewEden/Deepseek-V3-RP-Filtered
35 type: dan-chat-advanced
36 - path: NewEden/BlueSky-10K-Complexity
37 type: dan-chat-advanced
38 - path: NewEden/Final-Alpindale-LNs-ShareGPT
39 type: dan-chat-advanced
40 - path: NewEden/DeepseekRP-Filtered
41 type: dan-chat-advanced
42 - path: NewEden/RP-logs-V2-Experimental
43 type: dan-chat-advanced
44 - path: anthracite-org/kalo_opus_misc_240827
45 type: dan-chat-advanced
46 - path: anthracite-org/kalo_misc_part2
47 type: dan-chat-advanced
48 - path: NewEden/vanilla-backrooms-claude-sharegpt
49 type: dan-chat-advanced
50 - path: NewEden/Storium-Prefixed-Clean
51 type: dan-chat-advanced
52
53
54## LOra so we dont fuck brains
55adapter: lora
56lora_model_dir:
57lora_r: 128
58lora_alpha: 16
59lora_dropout: 0.05
60peft_use_rslora: true
61lora_target_modules:
62 - gate_proj
63 - down_proj
64 - up_proj
65 - q_proj
66 - v_proj
67 - k_proj
68 - o_proj
69
70#lora_modules_to_save:
71# - embed_tokens
72# - lm_head
73shuffle_merged_datasets: true
74dataset_prepared_path: prepared_data
75output_dir: ./output/Francois-V2
76
77
78## Ctx Length
79sequence_len: 16384
80sample_packing: true
81eval_sample_packing: false
82pad_to_sequence_len: false
83#batch_flattening: true
84
85#torch_compile: auto # Optional[Union[Literal["auto"], bool]]
86#torch_compile_backend: # Optional[str]
87## Wandb
88wandb_project: Francois
89wandb_entity:
90wandb_watch:
91wandb_name: v3
92wandb_log_model:
93
94## Hparams
95gradient_accumulation_steps: 2
96micro_batch_size: 2
97num_epochs: 4
98optimizer: paged_ademamix_8bit
99lr_scheduler: cosine
100learning_rate: 3e-5
101max_grad_norm: 0.0001
102weight_decay: 0.02
103warmup_steps: 40
104
105train_on_inputs: false
106group_by_length: false
107bf16: auto
108fp16:
109tf32: false
110
111## Unsloth is broken, Use grad-ckpting.
112gradient_checkpointing: true
113early_stopping_patience:
114#resume_from_checkpoint: /home/ubuntu/Mango/axolotl/outputs/checkpoint-1088
115local_rank:
116logging_steps: 1
117xformers_attention: False
118flash_attention: True
119s2_attention:
120
121
122## Evals
123val_set_size: 0.0025
124evals_per_epoch: 4
125eval_table_size:
126eval_max_new_tokens: 128
127saves_per_epoch: 2
128debug:
129# Multi-GPU
130deepspeed: ./deepspeed_configs/zero2.json
131fsdp:
132fsdp_config:
133special_tokens:
134 pad_token: <pad>
135| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.731 | 0.0023 | 1 | 2.4143 |
| 1.451 | 0.2506 | 109 | 2.3014 |
| 1.4026 | 0.5011 | 218 | 2.2824 |
| 1.6573 | 0.7517 | 327 | 2.2581 |
| 1.587 | 1.0023 | 436 | 2.2424 |
| 1.2928 | 1.2529 | 545 | 2.2229 |
| 1.4023 | 1.5034 | 654 | 2.2034 |
| 1.6312 | 1.7540 | 763 | 2.1959 |
| 1.3044 | 2.0046 | 872 | 2.1909 |
| 1.4984 | 2.2552 | 981 | 2.1876 |
| 1.3767 | 2.5057 | 1090 | 2.1840 |
| 1.3972 | 2.7563 | 1199 | 2.1812 |
| 1.3663 | 3.0069 | 1308 | 2.1792 |
| 1.4958 | 3.2575 | 1417 | 2.1785 |
| 1.4214 | 3.5080 | 1526 | 2.1784 |
| 1.4001 | 3.7586 | 1635 | 2.1779 |