Views
No views yet
1DATASET_FILE_NAME = 'QandA_2g_v01.json'
2adapter_name = "Lora-Meta-Llama2-7b-hf-QandA_2g_v01-v03"
3
4Full dataset size: 2011
5Eval dataset size: 403
6Epochs: 20
7Steps: 40220
8Total training time: 3.26 horas
9
10Start training at: 2024-01-04 14:34:08.062743
110%| | 0/40220 [00:00<?, ?it/s]
12{'loss': 0.7906, 'learning_rate': 4.75e-05, 'epoch': 1.0}
13{'eval_loss': 0.7224752902984619, 'eval_runtime': 41.5025, 'eval_samples_per_second': 9.71, 'eval_steps_per_second': 1.229, 'epoch': 1.0}
14{'loss': 0.6145, 'learning_rate': 4.5e-05, 'epoch': 2.0}
15{'eval_loss': 0.6293410062789917, 'eval_runtime': 41.4281, 'eval_samples_per_second': 9.728, 'eval_steps_per_second': 1.231, 'epoch': 2.0}
16{'loss': 0.5393, 'learning_rate': 4.25e-05, 'epoch': 3.0}
17{'eval_loss': 0.5556005239486694, 'eval_runtime': 41.4426, 'eval_samples_per_second': 9.724, 'eval_steps_per_second': 1.231, 'epoch': 3.0}
18{'loss': 0.4774, 'learning_rate': 4e-05, 'epoch': 4.0}
19{'eval_loss': 0.5019810199737549, 'eval_runtime': 41.4936, 'eval_samples_per_second': 9.712, 'eval_steps_per_second': 1.229, 'epoch': 4.0}
20{'loss': 0.4244, 'learning_rate': 3.7500000000000003e-05, 'epoch': 5.0}
21{'eval_loss': 0.4469846785068512, 'eval_runtime': 41.5516, 'eval_samples_per_second': 9.699, 'eval_steps_per_second': 1.227, 'epoch': 5.0}
22{'loss': 0.3797, 'learning_rate': 3.5e-05, 'epoch': 6.0}
23{'eval_loss': 0.4054427742958069, 'eval_runtime': 41.445, 'eval_samples_per_second': 9.724, 'eval_steps_per_second': 1.231, 'epoch': 6.0}
24{'loss': 0.3424, 'learning_rate': 3.2500000000000004e-05, 'epoch': 7.0}
25{'eval_loss': 0.3668522238731384, 'eval_runtime': 41.438, 'eval_samples_per_second': 9.725, 'eval_steps_per_second': 1.231, 'epoch': 7.0}
26{'loss': 0.3111, 'learning_rate': 3e-05, 'epoch': 8.0}
27{'eval_loss': 0.34070536494255066, 'eval_runtime': 41.4578, 'eval_samples_per_second': 9.721, 'eval_steps_per_second': 1.23, 'epoch': 8.0}
28{'loss': 0.2837, 'learning_rate': 2.7500000000000004e-05, 'epoch': 9.0}
29{'eval_loss': 0.3126145303249359, 'eval_runtime': 41.4312, 'eval_samples_per_second': 9.727, 'eval_steps_per_second': 1.231, 'epoch': 9.0}
30{'loss': 0.2599, 'learning_rate': 2.5e-05, 'epoch': 10.0}
31{'eval_loss': 0.28896018862724304, 'eval_runtime': 41.4486, 'eval_samples_per_second': 9.723, 'eval_steps_per_second': 1.23, 'epoch': 10.0}
32{'loss': 0.2393, 'learning_rate': 2.25e-05, 'epoch': 11.0}
33{'eval_loss': 0.26615414023399353, 'eval_runtime': 41.4467, 'eval_samples_per_second': 9.723, 'eval_steps_per_second': 1.23, 'epoch': 11.0}
34{'loss': 0.2203, 'learning_rate': 2e-05, 'epoch': 12.0}
35{'eval_loss': 0.24929480254650116, 'eval_runtime': 41.4549, 'eval_samples_per_second': 9.721, 'eval_steps_per_second': 1.23, 'epoch': 12.0}
36{'loss': 0.2031, 'learning_rate': 1.75e-05, 'epoch': 13.0}
37{'eval_loss': 0.23146237432956696, 'eval_runtime': 41.4637, 'eval_samples_per_second': 9.719, 'eval_steps_per_second': 1.23, 'epoch': 13.0}
38{'loss': 0.1879, 'learning_rate': 1.5e-05, 'epoch': 14.0}
39{'eval_loss': 0.216956228017807, 'eval_runtime': 41.4526, 'eval_samples_per_second': 9.722, 'eval_steps_per_second': 1.23, 'epoch': 14.0}
40{'loss': 0.1742, 'learning_rate': 1.25e-05, 'epoch': 15.0}
41{'eval_loss': 0.20527032017707825, 'eval_runtime': 41.4392, 'eval_samples_per_second': 9.725, 'eval_steps_per_second': 1.231, 'epoch': 15.0}
42{'loss': 0.1624, 'learning_rate': 1e-05, 'epoch': 16.0}
43{'eval_loss': 0.19351345300674438, 'eval_runtime': 41.402, 'eval_samples_per_second': 9.734, 'eval_steps_per_second': 1.232, 'epoch': 16.0}
44{'loss': 0.1517, 'learning_rate': 7.5e-06, 'epoch': 17.0}
45{'eval_loss': 0.1841140240430832, 'eval_runtime': 41.3718, 'eval_samples_per_second': 9.741, 'eval_steps_per_second': 1.233, 'epoch': 17.0}
46{'loss': 0.1428, 'learning_rate': 5e-06, 'epoch': 18.0}
47{'eval_loss': 0.17686299979686737, 'eval_runtime': 41.4581, 'eval_samples_per_second': 9.721, 'eval_steps_per_second': 1.23, 'epoch': 18.0}
48{'loss': 0.1356, 'learning_rate': 2.5e-06, 'epoch': 19.0}
49{'eval_loss': 0.17180992662906647, 'eval_runtime': 41.4578, 'eval_samples_per_second': 9.721, 'eval_steps_per_second': 1.23, 'epoch': 19.0}
50{'loss': 0.1301, 'learning_rate': 0.0, 'epoch': 20.0}
51{'eval_loss': 0.16986818611621857, 'eval_runtime': 41.4657, 'eval_samples_per_second': 9.719, 'eval_steps_per_second': 1.23, 'epoch': 20.0}
52{'train_runtime': 11767.2453, 'train_samples_per_second': 3.418, 'train_steps_per_second': 3.418, 'train_loss': 0.30853292274569943, 'epoch': 20.0}
53100%|██████████████████████████████████████████████████████████████████████████| 40220/40220 [3:16:07<00:00, 3.42it/s]
54Training done at: 2024-01-04 17:50:15.380360
55
56
57{
58 "best_metric": 0.16986818611621857,
59 "best_model_checkpoint": "./Lora-Meta-Llama2-7b-hf-QandA_2g_v01-v03\\checkpoint-40220",
60 "epoch": 20.0,
61 "eval_steps": 500,
62 "global_step": 40220,
63 "is_hyper_param_search": false,
64 "is_local_process_zero": true,
65 "is_world_process_zero": true,
66 "log_history": [
67 {
68 "epoch": 1.0,
69 "learning_rate": 4.75e-05,
70 "loss": 0.7906,
71 "step": 2011
72 },
73 {
74 "epoch": 1.0,
75 "eval_loss": 0.7224752902984619,
76 "eval_runtime": 41.5025,
77 "eval_samples_per_second": 9.71,
78 "eval_steps_per_second": 1.229,
79 "step": 2011
80 },
81 {
82 "epoch": 2.0,
83 "learning_rate": 4.5e-05,
84 "loss": 0.6145,
85 "step": 4022
86 },
87 {
88 "epoch": 2.0,
89 "eval_loss": 0.6293410062789917,
90 "eval_runtime": 41.4281,
91 "eval_samples_per_second": 9.728,
92 "eval_steps_per_second": 1.231,
93 "step": 4022
94 },
95 {
96 "epoch": 3.0,
97 "learning_rate": 4.25e-05,
98 "loss": 0.5393,
99 "step": 6033
100 },
101 {
102 "epoch": 3.0,
103 "eval_loss": 0.5556005239486694,
104 "eval_runtime": 41.4426,
105 "eval_samples_per_second": 9.724,
106 "eval_steps_per_second": 1.231,
107 "step": 6033
108 },
109 {
110 "epoch": 4.0,
111 "learning_rate": 4e-05,
112 "loss": 0.4774,
113 "step": 8044
114 },
115 {
116 "epoch": 4.0,
117 "eval_loss": 0.5019810199737549,
118 "eval_runtime": 41.4936,
119 "eval_samples_per_second": 9.712,
120 "eval_steps_per_second": 1.229,
121 "step": 8044
122 },
123 {
124 "epoch": 5.0,
125 "learning_rate": 3.7500000000000003e-05,
126 "loss": 0.4244,
127 "step": 10055
128 },
129 {
130 "epoch": 5.0,
131 "eval_loss": 0.4469846785068512,
132 "eval_runtime": 41.5516,
133 "eval_samples_per_second": 9.699,
134 "eval_steps_per_second": 1.227,
135 "step": 10055
136 },
137 {
138 "epoch": 6.0,
139 "learning_rate": 3.5e-05,
140 "loss": 0.3797,
141 "step": 12066
142 },
143 {
144 "epoch": 6.0,
145 "eval_loss": 0.4054427742958069,
146 "eval_runtime": 41.445,
147 "eval_samples_per_second": 9.724,
148 "eval_steps_per_second": 1.231,
149 "step": 12066
150 },
151 {
152 "epoch": 7.0,
153 "learning_rate": 3.2500000000000004e-05,
154 "loss": 0.3424,
155 "step": 14077
156 },
157 {
158 "epoch": 7.0,
159 "eval_loss": 0.3668522238731384,
160 "eval_runtime": 41.438,
161 "eval_samples_per_second": 9.725,
162 "eval_steps_per_second": 1.231,
163 "step": 14077
164 },
165 {
166 "epoch": 8.0,
167 "learning_rate": 3e-05,
168 "loss": 0.3111,
169 "step": 16088
170 },
171 {
172 "epoch": 8.0,
173 "eval_loss": 0.34070536494255066,
174 "eval_runtime": 41.4578,
175 "eval_samples_per_second": 9.721,
176 "eval_steps_per_second": 1.23,
177 "step": 16088
178 },
179 {
180 "epoch": 9.0,
181 "learning_rate": 2.7500000000000004e-05,
182 "loss": 0.2837,
183 "step": 18099
184 },
185 {
186 "epoch": 9.0,
187 "eval_loss": 0.3126145303249359,
188 "eval_runtime": 41.4312,
189 "eval_samples_per_second": 9.727,
190 "eval_steps_per_second": 1.231,
191 "step": 18099
192 },
193 {
194 "epoch": 10.0,
195 "learning_rate": 2.5e-05,
196 "loss": 0.2599,
197 "step": 20110
198 },
199 {
200 "epoch": 10.0,
201 "eval_loss": 0.28896018862724304,
202 "eval_runtime": 41.4486,
203 "eval_samples_per_second": 9.723,
204 "eval_steps_per_second": 1.23,
205 "step": 20110
206 },
207 {
208 "epoch": 11.0,
209 "learning_rate": 2.25e-05,
210 "loss": 0.2393,
211 "step": 22121
212 },
213 {
214 "epoch": 11.0,
215 "eval_loss": 0.26615414023399353,
216 "eval_runtime": 41.4467,
217 "eval_samples_per_second": 9.723,
218 "eval_steps_per_second": 1.23,
219 "step": 22121
220 },
221 {
222 "epoch": 12.0,
223 "learning_rate": 2e-05,
224 "loss": 0.2203,
225 "step": 24132
226 },
227 {
228 "epoch": 12.0,
229 "eval_loss": 0.24929480254650116,
230 "eval_runtime": 41.4549,
231 "eval_samples_per_second": 9.721,
232 "eval_steps_per_second": 1.23,
233 "step": 24132
234 },
235 {
236 "epoch": 13.0,
237 "learning_rate": 1.75e-05,
238 "loss": 0.2031,
239 "step": 26143
240 },
241 {
242 "epoch": 13.0,
243 "eval_loss": 0.23146237432956696,
244 "eval_runtime": 41.4637,
245 "eval_samples_per_second": 9.719,
246 "eval_steps_per_second": 1.23,
247 "step": 26143
248 },
249 {
250 "epoch": 14.0,
251 "learning_rate": 1.5e-05,
252 "loss": 0.1879,
253 "step": 28154
254 },
255 {
256 "epoch": 14.0,
257 "eval_loss": 0.216956228017807,
258 "eval_runtime": 41.4526,
259 "eval_samples_per_second": 9.722,
260 "eval_steps_per_second": 1.23,
261 "step": 28154
262 },
263 {
264 "epoch": 15.0,
265 "learning_rate": 1.25e-05,
266 "loss": 0.1742,
267 "step": 30165
268 },
269 {
270 "epoch": 15.0,
271 "eval_loss": 0.20527032017707825,
272 "eval_runtime": 41.4392,
273 "eval_samples_per_second": 9.725,
274 "eval_steps_per_second": 1.231,
275 "step": 30165
276 },
277 {
278 "epoch": 16.0,
279 "learning_rate": 1e-05,
280 "loss": 0.1624,
281 "step": 32176
282 },
283 {
284 "epoch": 16.0,
285 "eval_loss": 0.19351345300674438,
286 "eval_runtime": 41.402,
287 "eval_samples_per_second": 9.734,
288 "eval_steps_per_second": 1.232,
289 "step": 32176
290 },
291 {
292 "epoch": 17.0,
293 "learning_rate": 7.5e-06,
294 "loss": 0.1517,
295 "step": 34187
296 },
297 {
298 "epoch": 17.0,
299 "eval_loss": 0.1841140240430832,
300 "eval_runtime": 41.3718,
301 "eval_samples_per_second": 9.741,
302 "eval_steps_per_second": 1.233,
303 "step": 34187
304 },
305 {
306 "epoch": 18.0,
307 "learning_rate": 5e-06,
308 "loss": 0.1428,
309 "step": 36198
310 },
311 {
312 "epoch": 18.0,
313 "eval_loss": 0.17686299979686737,
314 "eval_runtime": 41.4581,
315 "eval_samples_per_second": 9.721,
316 "eval_steps_per_second": 1.23,
317 "step": 36198
318 },
319 {
320 "epoch": 19.0,
321 "learning_rate": 2.5e-06,
322 "loss": 0.1356,
323 "step": 38209
324 },
325 {
326 "epoch": 19.0,
327 "eval_loss": 0.17180992662906647,
328 "eval_runtime": 41.4578,
329 "eval_samples_per_second": 9.721,
330 "eval_steps_per_second": 1.23,
331 "step": 38209
332 },
333 {
334 "epoch": 20.0,
335 "learning_rate": 0.0,
336 "loss": 0.1301,
337 "step": 40220
338 },
339 {
340 "epoch": 20.0,
341 "eval_loss": 0.16986818611621857,
342 "eval_runtime": 41.4657,
343 "eval_samples_per_second": 9.719,
344 "eval_steps_per_second": 1.23,
345 "step": 40220
346 }
347 ],
348 "logging_steps": 500,
349 "max_steps": 40220,
350 "num_train_epochs": 20,
351 "save_steps": 500,
352 "total_flos": 2.344189529530368e+17,
353 "trial_name": null,
354 "trial_params": null
355}bitsandbytes quantization config was used during training:bitsandbytes quantization config was used during training:bitsandbytes quantization config was used during training: