Views
No views yet
| Parameter | Value |
|---|---|
| Training Mode | ORPO |
| Base Model | google/gemma-4-26B-A4B-it |
| Learning Rate | 5e-05 |
| Epochs | 1 |
| Batch Size | 1 |
| Gradient Accumulation | 32 |
| Effective Batch Size | 32 |
| Max Sequence Length | 1536 |
| Optimizer | paged_adamw_8bit |
| LR Scheduler | cosine |
| Warmup Ratio | 0.05 |
| Weight Decay | 0.01 |
| Max Grad Norm | 0.5 |
| Seed | 42 |
| Beta | 0.1 |
| Max Prompt Length | 1024 |
| LoRA Rank (r) | 64 |
| LoRA Alpha | 32 |
| LoRA Dropout | 0.05 |
| Target Modules | language_model.layers.0.self_attn.q_proj, language_model.layers.0.self_attn.k_proj, language_model.layers.0.self_attn.v_proj, language_model.layers.0.self_attn.o_proj, language_model.layers.0.mlp.gate_proj, language_model.layers.0.mlp.up_proj, language_model.layers.0.mlp.down_proj, language_model.layers.1.self_attn.q_proj, language_model.layers.1.self_attn.k_proj, language_model.layers.1.self_attn.v_proj, language_model.layers.1.self_attn.o_proj, language_model.layers.1.mlp.gate_proj, language_model.layers.1.mlp.up_proj, language_model.layers.1.mlp.down_proj, language_model.layers.2.self_attn.q_proj, language_model.layers.2.self_attn.k_proj, language_model.layers.2.self_attn.v_proj, language_model.layers.2.self_attn.o_proj, language_model.layers.2.mlp.gate_proj, language_model.layers.2.mlp.up_proj, language_model.layers.2.mlp.down_proj, language_model.layers.3.self_attn.q_proj, language_model.layers.3.self_attn.k_proj, language_model.layers.3.self_attn.v_proj, language_model.layers.3.self_attn.o_proj, language_model.layers.3.mlp.gate_proj, language_model.layers.3.mlp.up_proj, language_model.layers.3.mlp.down_proj, language_model.layers.4.self_attn.q_proj, language_model.layers.4.self_attn.k_proj, language_model.layers.4.self_attn.v_proj, language_model.layers.4.self_attn.o_proj, language_model.layers.4.mlp.gate_proj, language_model.layers.4.mlp.up_proj, language_model.layers.4.mlp.down_proj, language_model.layers.5.self_attn.q_proj, language_model.layers.5.self_attn.k_proj, language_model.layers.5.self_attn.v_proj, language_model.layers.5.self_attn.o_proj, language_model.layers.5.mlp.gate_proj, language_model.layers.5.mlp.up_proj, language_model.layers.5.mlp.down_proj, language_model.layers.6.self_attn.q_proj, language_model.layers.6.self_attn.k_proj, language_model.layers.6.self_attn.v_proj, language_model.layers.6.self_attn.o_proj, language_model.layers.6.mlp.gate_proj, language_model.layers.6.mlp.up_proj, language_model.layers.6.mlp.down_proj, language_model.layers.7.self_attn.q_proj, language_model.layers.7.self_attn.k_proj, language_model.layers.7.self_attn.v_proj, language_model.layers.7.self_attn.o_proj, language_model.layers.7.mlp.gate_proj, language_model.layers.7.mlp.up_proj, language_model.layers.7.mlp.down_proj, language_model.layers.8.self_attn.q_proj, language_model.layers.8.self_attn.k_proj, language_model.layers.8.self_attn.v_proj, language_model.layers.8.self_attn.o_proj, language_model.layers.8.mlp.gate_proj, language_model.layers.8.mlp.up_proj, language_model.layers.8.mlp.down_proj, language_model.layers.9.self_attn.q_proj, language_model.layers.9.self_attn.k_proj, language_model.layers.9.self_attn.v_proj, language_model.layers.9.self_attn.o_proj, language_model.layers.9.mlp.gate_proj, language_model.layers.9.mlp.up_proj, language_model.layers.9.mlp.down_proj, language_model.layers.10.self_attn.q_proj, language_model.layers.10.self_attn.k_proj, language_model.layers.10.self_attn.v_proj, language_model.layers.10.self_attn.o_proj, language_model.layers.10.mlp.gate_proj, language_model.layers.10.mlp.up_proj, language_model.layers.10.mlp.down_proj, language_model.layers.11.self_attn.q_proj, language_model.layers.11.self_attn.k_proj, language_model.layers.11.self_attn.v_proj, language_model.layers.11.self_attn.o_proj, language_model.layers.11.mlp.gate_proj, language_model.layers.11.mlp.up_proj, language_model.layers.11.mlp.down_proj, language_model.layers.12.self_attn.q_proj, language_model.layers.12.self_attn.k_proj, language_model.layers.12.self_attn.v_proj, language_model.layers.12.self_attn.o_proj, language_model.layers.12.mlp.gate_proj, language_model.layers.12.mlp.up_proj, language_model.layers.12.mlp.down_proj, language_model.layers.13.self_attn.q_proj, language_model.layers.13.self_attn.k_proj, language_model.layers.13.self_attn.v_proj, language_model.layers.13.self_attn.o_proj, language_model.layers.13.mlp.gate_proj, language_model.layers.13.mlp.up_proj, language_model.layers.13.mlp.down_proj, language_model.layers.14.self_attn.q_proj, language_model.layers.14.self_attn.k_proj, language_model.layers.14.self_attn.v_proj, language_model.layers.14.self_attn.o_proj, language_model.layers.14.mlp.gate_proj, language_model.layers.14.mlp.up_proj, language_model.layers.14.mlp.down_proj, language_model.layers.15.self_attn.q_proj, language_model.layers.15.self_attn.k_proj, language_model.layers.15.self_attn.v_proj, language_model.layers.15.self_attn.o_proj, language_model.layers.15.mlp.gate_proj, language_model.layers.15.mlp.up_proj, language_model.layers.15.mlp.down_proj, language_model.layers.16.self_attn.q_proj, language_model.layers.16.self_attn.k_proj, language_model.layers.16.self_attn.v_proj, language_model.layers.16.self_attn.o_proj, language_model.layers.16.mlp.gate_proj, language_model.layers.16.mlp.up_proj, language_model.layers.16.mlp.down_proj, language_model.layers.17.self_attn.q_proj, language_model.layers.17.self_attn.k_proj, language_model.layers.17.self_attn.v_proj, language_model.layers.17.self_attn.o_proj, language_model.layers.17.mlp.gate_proj, language_model.layers.17.mlp.up_proj, language_model.layers.17.mlp.down_proj, language_model.layers.18.self_attn.q_proj, language_model.layers.18.self_attn.k_proj, language_model.layers.18.self_attn.v_proj, language_model.layers.18.self_attn.o_proj, language_model.layers.18.mlp.gate_proj, language_model.layers.18.mlp.up_proj, language_model.layers.18.mlp.down_proj, language_model.layers.19.self_attn.q_proj, language_model.layers.19.self_attn.k_proj, language_model.layers.19.self_attn.v_proj, language_model.layers.19.self_attn.o_proj, language_model.layers.19.mlp.gate_proj, language_model.layers.19.mlp.up_proj, language_model.layers.19.mlp.down_proj, language_model.layers.20.self_attn.q_proj, language_model.layers.20.self_attn.k_proj, language_model.layers.20.self_attn.v_proj, language_model.layers.20.self_attn.o_proj, language_model.layers.20.mlp.gate_proj, language_model.layers.20.mlp.up_proj, language_model.layers.20.mlp.down_proj, language_model.layers.21.self_attn.q_proj, language_model.layers.21.self_attn.k_proj, language_model.layers.21.self_attn.v_proj, language_model.layers.21.self_attn.o_proj, language_model.layers.21.mlp.gate_proj, language_model.layers.21.mlp.up_proj, language_model.layers.21.mlp.down_proj, language_model.layers.22.self_attn.q_proj, language_model.layers.22.self_attn.k_proj, language_model.layers.22.self_attn.v_proj, language_model.layers.22.self_attn.o_proj, language_model.layers.22.mlp.gate_proj, language_model.layers.22.mlp.up_proj, language_model.layers.22.mlp.down_proj, language_model.layers.23.self_attn.q_proj, language_model.layers.23.self_attn.k_proj, language_model.layers.23.self_attn.v_proj, language_model.layers.23.self_attn.o_proj, language_model.layers.23.mlp.gate_proj, language_model.layers.23.mlp.up_proj, language_model.layers.23.mlp.down_proj, language_model.layers.24.self_attn.q_proj, language_model.layers.24.self_attn.k_proj, language_model.layers.24.self_attn.v_proj, language_model.layers.24.self_attn.o_proj, language_model.layers.24.mlp.gate_proj, language_model.layers.24.mlp.up_proj, language_model.layers.24.mlp.down_proj, language_model.layers.25.self_attn.q_proj, language_model.layers.25.self_attn.k_proj, language_model.layers.25.self_attn.v_proj, language_model.layers.25.self_attn.o_proj, language_model.layers.25.mlp.gate_proj, language_model.layers.25.mlp.up_proj, language_model.layers.25.mlp.down_proj, language_model.layers.26.self_attn.q_proj, language_model.layers.26.self_attn.k_proj, language_model.layers.26.self_attn.v_proj, language_model.layers.26.self_attn.o_proj, language_model.layers.26.mlp.gate_proj, language_model.layers.26.mlp.up_proj, language_model.layers.26.mlp.down_proj, language_model.layers.27.self_attn.q_proj, language_model.layers.27.self_attn.k_proj, language_model.layers.27.self_attn.v_proj, language_model.layers.27.self_attn.o_proj, language_model.layers.27.mlp.gate_proj, language_model.layers.27.mlp.up_proj, language_model.layers.27.mlp.down_proj, language_model.layers.28.self_attn.q_proj, language_model.layers.28.self_attn.k_proj, language_model.layers.28.self_attn.v_proj, language_model.layers.28.self_attn.o_proj, language_model.layers.28.mlp.gate_proj, language_model.layers.28.mlp.up_proj, language_model.layers.28.mlp.down_proj, language_model.layers.29.self_attn.q_proj, language_model.layers.29.self_attn.k_proj, language_model.layers.29.self_attn.v_proj, language_model.layers.29.self_attn.o_proj, language_model.layers.29.mlp.gate_proj, language_model.layers.29.mlp.up_proj, language_model.layers.29.mlp.down_proj |
| Quantization | 4-bit (NF4) |
| GPU | NVIDIA GB10 |
data/configs/<name>.json (or import it via the Load Configuration dialog) to reproduce the exact training setup. Credentials are not included — Merlina will use your own HF_TOKEN and WANDB_API_KEY from .env or the form.1{
2 "_metadata": {
3 "name": "Gemma4-Gutenberg-26B-A4B",
4 "description": "Training configuration shared from a Merlina-trained model.",
5 "tags": [],
6 "schema": "merlina/training-config",
7 "schema_version": 1,
8 "merlina_version": "2.0.3"
9 },
10 "base_model": "google/gemma-4-26B-A4B-it",
11 "output_name": "Gemma4-Gutenberg-26B-A4B",
12 "use_lora": true,
13 "lora_r": 64,
14 "lora_alpha": 32,
15 "lora_dropout": 0.05,
16 "target_modules": [
17 "language_model.layers.0.self_attn.q_proj",
18 "language_model.layers.0.self_attn.k_proj",
19 "language_model.layers.0.self_attn.v_proj",
20 "language_model.layers.0.self_attn.o_proj",
21 "language_model.layers.0.mlp.gate_proj",
22 "language_model.layers.0.mlp.up_proj",
23 "language_model.layers.0.mlp.down_proj",
24 "language_model.layers.1.self_attn.q_proj",
25 "language_model.layers.1.self_attn.k_proj",
26 "language_model.layers.1.self_attn.v_proj",
27 "language_model.layers.1.self_attn.o_proj",
28 "language_model.layers.1.mlp.gate_proj",
29 "language_model.layers.1.mlp.up_proj",
30 "language_model.layers.1.mlp.down_proj",
31 "language_model.layers.2.self_attn.q_proj",
32 "language_model.layers.2.self_attn.k_proj",
33 "language_model.layers.2.self_attn.v_proj",
34 "language_model.layers.2.self_attn.o_proj",
35 "language_model.layers.2.mlp.gate_proj",
36 "language_model.layers.2.mlp.up_proj",
37 "language_model.layers.2.mlp.down_proj",
38 "language_model.layers.3.self_attn.q_proj",
39 "language_model.layers.3.self_attn.k_proj",
40 "language_model.layers.3.self_attn.v_proj",
41 "language_model.layers.3.self_attn.o_proj",
42 "language_model.layers.3.mlp.gate_proj",
43 "language_model.layers.3.mlp.up_proj",
44 "language_model.layers.3.mlp.down_proj",
45 "language_model.layers.4.self_attn.q_proj",
46 "language_model.layers.4.self_attn.k_proj",
47 "language_model.layers.4.self_attn.v_proj",
48 "language_model.layers.4.self_attn.o_proj",
49 "language_model.layers.4.mlp.gate_proj",
50 "language_model.layers.4.mlp.up_proj",
51 "language_model.layers.4.mlp.down_proj",
52 "language_model.layers.5.self_attn.q_proj",
53 "language_model.layers.5.self_attn.k_proj",
54 "language_model.layers.5.self_attn.v_proj",
55 "language_model.layers.5.self_attn.o_proj",
56 "language_model.layers.5.mlp.gate_proj",
57 "language_model.layers.5.mlp.up_proj",
58 "language_model.layers.5.mlp.down_proj",
59 "language_model.layers.6.self_attn.q_proj",
60 "language_model.layers.6.self_attn.k_proj",
61 "language_model.layers.6.self_attn.v_proj",
62 "language_model.layers.6.self_attn.o_proj",
63 "language_model.layers.6.mlp.gate_proj",
64 "language_model.layers.6.mlp.up_proj",
65 "language_model.layers.6.mlp.down_proj",
66 "language_model.layers.7.self_attn.q_proj",
67 "language_model.layers.7.self_attn.k_proj",
68 "language_model.layers.7.self_attn.v_proj",
69 "language_model.layers.7.self_attn.o_proj",
70 "language_model.layers.7.mlp.gate_proj",
71 "language_model.layers.7.mlp.up_proj",
72 "language_model.layers.7.mlp.down_proj",
73 "language_model.layers.8.self_attn.q_proj",
74 "language_model.layers.8.self_attn.k_proj",
75 "language_model.layers.8.self_attn.v_proj",
76 "language_model.layers.8.self_attn.o_proj",
77 "language_model.layers.8.mlp.gate_proj",
78 "language_model.layers.8.mlp.up_proj",
79 "language_model.layers.8.mlp.down_proj",
80 "language_model.layers.9.self_attn.q_proj",
81 "language_model.layers.9.self_attn.k_proj",
82 "language_model.layers.9.self_attn.v_proj",
83 "language_model.layers.9.self_attn.o_proj",
84 "language_model.layers.9.mlp.gate_proj",
85 "language_model.layers.9.mlp.up_proj",
86 "language_model.layers.9.mlp.down_proj",
87 "language_model.layers.10.self_attn.q_proj",
88 "language_model.layers.10.self_attn.k_proj",
89 "language_model.layers.10.self_attn.v_proj",
90 "language_model.layers.10.self_attn.o_proj",
91 "language_model.layers.10.mlp.gate_proj",
92 "language_model.layers.10.mlp.up_proj",
93 "language_model.layers.10.mlp.down_proj",
94 "language_model.layers.11.self_attn.q_proj",
95 "language_model.layers.11.self_attn.k_proj",
96 "language_model.layers.11.self_attn.v_proj",
97 "language_model.layers.11.self_attn.o_proj",
98 "language_model.layers.11.mlp.gate_proj",
99 "language_model.layers.11.mlp.up_proj",
100 "language_model.layers.11.mlp.down_proj",
101 "language_model.layers.12.self_attn.q_proj",
102 "language_model.layers.12.self_attn.k_proj",
103 "language_model.layers.12.self_attn.v_proj",
104 "language_model.layers.12.self_attn.o_proj",
105 "language_model.layers.12.mlp.gate_proj",
106 "language_model.layers.12.mlp.up_proj",
107 "language_model.layers.12.mlp.down_proj",
108 "language_model.layers.13.self_attn.q_proj",
109 "language_model.layers.13.self_attn.k_proj",
110 "language_model.layers.13.self_attn.v_proj",
111 "language_model.layers.13.self_attn.o_proj",
112 "language_model.layers.13.mlp.gate_proj",
113 "language_model.layers.13.mlp.up_proj",
114 "language_model.layers.13.mlp.down_proj",
115 "language_model.layers.14.self_attn.q_proj",
116 "language_model.layers.14.self_attn.k_proj",
117 "language_model.layers.14.self_attn.v_proj",
118 "language_model.layers.14.self_attn.o_proj",
119 "language_model.layers.14.mlp.gate_proj",
120 "language_model.layers.14.mlp.up_proj",
121 "language_model.layers.14.mlp.down_proj",
122 "language_model.layers.15.self_attn.q_proj",
123 "language_model.layers.15.self_attn.k_proj",
124 "language_model.layers.15.self_attn.v_proj",
125 "language_model.layers.15.self_attn.o_proj",
126 "language_model.layers.15.mlp.gate_proj",
127 "language_model.layers.15.mlp.up_proj",
128 "language_model.layers.15.mlp.down_proj",
129 "language_model.layers.16.self_attn.q_proj",
130 "language_model.layers.16.self_attn.k_proj",
131 "language_model.layers.16.self_attn.v_proj",
132 "language_model.layers.16.self_attn.o_proj",
133 "language_model.layers.16.mlp.gate_proj",
134 "language_model.layers.16.mlp.up_proj",
135 "language_model.layers.16.mlp.down_proj",
136 "language_model.layers.17.self_attn.q_proj",
137 "language_model.layers.17.self_attn.k_proj",
138 "language_model.layers.17.self_attn.v_proj",
139 "language_model.layers.17.self_attn.o_proj",
140 "language_model.layers.17.mlp.gate_proj",
141 "language_model.layers.17.mlp.up_proj",
142 "language_model.layers.17.mlp.down_proj",
143 "language_model.layers.18.self_attn.q_proj",
144 "language_model.layers.18.self_attn.k_proj",
145 "language_model.layers.18.self_attn.v_proj",
146 "language_model.layers.18.self_attn.o_proj",
147 "language_model.layers.18.mlp.gate_proj",
148 "language_model.layers.18.mlp.up_proj",
149 "language_model.layers.18.mlp.down_proj",
150 "language_model.layers.19.self_attn.q_proj",
151 "language_model.layers.19.self_attn.k_proj",
152 "language_model.layers.19.self_attn.v_proj",
153 "language_model.layers.19.self_attn.o_proj",
154 "language_model.layers.19.mlp.gate_proj",
155 "language_model.layers.19.mlp.up_proj",
156 "language_model.layers.19.mlp.down_proj",
157 "language_model.layers.20.self_attn.q_proj",
158 "language_model.layers.20.self_attn.k_proj",
159 "language_model.layers.20.self_attn.v_proj",
160 "language_model.layers.20.self_attn.o_proj",
161 "language_model.layers.20.mlp.gate_proj",
162 "language_model.layers.20.mlp.up_proj",
163 "language_model.layers.20.mlp.down_proj",
164 "language_model.layers.21.self_attn.q_proj",
165 "language_model.layers.21.self_attn.k_proj",
166 "language_model.layers.21.self_attn.v_proj",
167 "language_model.layers.21.self_attn.o_proj",
168 "language_model.layers.21.mlp.gate_proj",
169 "language_model.layers.21.mlp.up_proj",
170 "language_model.layers.21.mlp.down_proj",
171 "language_model.layers.22.self_attn.q_proj",
172 "language_model.layers.22.self_attn.k_proj",
173 "language_model.layers.22.self_attn.v_proj",
174 "language_model.layers.22.self_attn.o_proj",
175 "language_model.layers.22.mlp.gate_proj",
176 "language_model.layers.22.mlp.up_proj",
177 "language_model.layers.22.mlp.down_proj",
178 "language_model.layers.23.self_attn.q_proj",
179 "language_model.layers.23.self_attn.k_proj",
180 "language_model.layers.23.self_attn.v_proj",
181 "language_model.layers.23.self_attn.o_proj",
182 "language_model.layers.23.mlp.gate_proj",
183 "language_model.layers.23.mlp.up_proj",
184 "language_model.layers.23.mlp.down_proj",
185 "language_model.layers.24.self_attn.q_proj",
186 "language_model.layers.24.self_attn.k_proj",
187 "language_model.layers.24.self_attn.v_proj",
188 "language_model.layers.24.self_attn.o_proj",
189 "language_model.layers.24.mlp.gate_proj",
190 "language_model.layers.24.mlp.up_proj",
191 "language_model.layers.24.mlp.down_proj",
192 "language_model.layers.25.self_attn.q_proj",
193 "language_model.layers.25.self_attn.k_proj",
194 "language_model.layers.25.self_attn.v_proj",
195 "language_model.layers.25.self_attn.o_proj",
196 "language_model.layers.25.mlp.gate_proj",
197 "language_model.layers.25.mlp.up_proj",
198 "language_model.layers.25.mlp.down_proj",
199 "language_model.layers.26.self_attn.q_proj",
200 "language_model.layers.26.self_attn.k_proj",
201 "language_model.layers.26.self_attn.v_proj",
202 "language_model.layers.26.self_attn.o_proj",
203 "language_model.layers.26.mlp.gate_proj",
204 "language_model.layers.26.mlp.up_proj",
205 "language_model.layers.26.mlp.down_proj",
206 "language_model.layers.27.self_attn.q_proj",
207 "language_model.layers.27.self_attn.k_proj",
208 "language_model.layers.27.self_attn.v_proj",
209 "language_model.layers.27.self_attn.o_proj",
210 "language_model.layers.27.mlp.gate_proj",
211 "language_model.layers.27.mlp.up_proj",
212 "language_model.layers.27.mlp.down_proj",
213 "language_model.layers.28.self_attn.q_proj",
214 "language_model.layers.28.self_attn.k_proj",
215 "language_model.layers.28.self_attn.v_proj",
216 "language_model.layers.28.self_attn.o_proj",
217 "language_model.layers.28.mlp.gate_proj",
218 "language_model.layers.28.mlp.up_proj",
219 "language_model.layers.28.mlp.down_proj",
220 "language_model.layers.29.self_attn.q_proj",
221 "language_model.layers.29.self_attn.k_proj",
222 "language_model.layers.29.self_attn.v_proj",
223 "language_model.layers.29.self_attn.o_proj",
224 "language_model.layers.29.mlp.gate_proj",
225 "language_model.layers.29.mlp.up_proj",
226 "language_model.layers.29.mlp.down_proj"
227 ],
228 "modules_to_save": [],
229 "lora_task_type": "CAUSAL_LM",
230 "learning_rate": 5e-05,
231 "num_epochs": 1,
232 "batch_size": 1,
233 "gradient_accumulation_steps": 32,
234 "max_length": 1536,
235 "max_prompt_length": 1024,
236 "model_type": "auto",
237 "training_mode": "orpo",
238 "beta": 0.1,
239 "label_smoothing": 0.0,
240 "gamma": 0.5,
241 "vision_model_id": null,
242 "stage": null,
243 "unfreeze_vision_top_n": null,
244 "image_token_id": null,
245 "min_pixels": null,
246 "max_pixels": null,
247 "image_column": null,
248 "caption_column": null,
249 "instruction": null,
250 "streaming": null,
251 "model_name": null,
252 "image_resolution": null,
253 "lora_rank": null,
254 "lora_target_modules": null,
255 "lora_use_dora": null,
256 "mid_training_samples": null,
257 "dataset_jsonl_path": null,
258 "dataset_name": null,
259 "dataset_split": null,
260 "sample_prompts": null,
261 "sample_num_steps": null,
262 "dataset": {
263 "source": {
264 "source_type": "huggingface",
265 "repo_id": "schneewolflabs/Alembic-DPO",
266 "split": "train",
267 "file_path": null,
268 "file_format": null,
269 "dataset_id": null,
270 "streaming": false,
271 "streaming_batch_size": 10000,
272 "column_mapping": null
273 },
274 "additional_sources": [],
275 "format": {
276 "format_type": "chatml",
277 "custom_templates": null,
278 "enable_thinking": true,
279 "auto_detect_thinking": true
280 },
281 "model_name": null,
282 "column_mapping": null,
283 "convert_messages_format": true,
284 "deduplicate": false,
285 "dedupe_strategy": "prompt_chosen",
286 "test_size": 0.02,
287 "max_samples": null,
288 "system_prompt": null,
289 "system_prompt_mode": "fill_empty",
290 "training_mode": "orpo"
291 },
292 "seed": 42,
293 "max_grad_norm": 0.5,
294 "warmup_ratio": 0.05,
295 "eval_steps": 0.2,
296 "use_4bit": true,
297 "use_wandb": true,
298 "push_to_hub": false,
299 "merge_lora_before_upload": true,
300 "hf_hub_private": true,
301 "export_gguf": false,
302 "gguf_quant_types": [
303 "Q4_K_M"
304 ],
305 "keep_gguf_fp16": false,
306 "shuffle_dataset": true,
307 "weight_decay": 0.01,
308 "lr_scheduler_type": "cosine",
309 "gradient_checkpointing": true,
310 "logging_steps": 1,
311 "optimizer_type": "paged_adamw_8bit",
312 "adam_beta1": 0.9,
313 "adam_beta2": 0.999,
314 "adam_epsilon": 1e-08,
315 "adafactor_relative_step": false,
316 "adafactor_scale_parameter": false,
317 "adafactor_warmup_init": false,
318 "adafactor_decay_rate": -0.8,
319 "adafactor_beta1": null,
320 "adafactor_clip_threshold": 1.0,
321 "attn_implementation": "auto",
322 "use_liger": false,
323 "torch_compile": false,
324 "neftune_alpha": null,
325 "eval_on_start": false,
326 "gpu_ids": null,
327 "multi_gpu_strategy": "auto",
328 "wandb_project": "gutenberg",
329 "wandb_run_name": null,
330 "wandb_tags": null,
331 "wandb_notes": null
332}