Views
No views yet
1{
2 "alpha_pattern": {},
3 "auto_mapping": null,
4 "base_model_name_or_path": "meta-llama/Llama-2-13b-chat-hf",
5 "bias": "none",
6 "fan_in_fan_out": false,
7 "inference_mode": true,
8 "init_lora_weights": true,
9 "layers_pattern": null,
10 "layers_to_transform": null,
11 "lora_alpha": 16,
12 "lora_dropout": 0.05,
13 "modules_to_save": null,
14 "peft_type": "LORA",
15 "r": 8,
16 "rank_pattern": {},
17 "revision": null,
18 "target_modules": [
19 "q_proj",
20 "v_proj"
21 ],
22 "task_type": "CAUSAL_LM"
23}1{
2 "best_metric": 0.05725787207484245,
3 "best_model_checkpoint": "./Lora-Meta-Llama2-13b-chat-hf-QandA_2g_v01-v07\\checkpoint-80440",
4 "epoch": 40.0,
5 "eval_steps": 500,
6 "global_step": 80440,
7 "is_hyper_param_search": false,
8 "is_local_process_zero": true,
9 "is_world_process_zero": true,
10 "log_history": [
11 {
12 "epoch": 1.0,
13 "learning_rate": 4.875e-05,
14 "loss": 0.7946,
15 "step": 2011
16 },
17 {
18 "epoch": 1.0,
19 "eval_loss": 0.6483868360519409,
20 "eval_runtime": 69.9926,
21 "eval_samples_per_second": 5.758,
22 "eval_steps_per_second": 0.729,
23 "step": 2011
24 },
25 {
26 "epoch": 2.0,
27 "learning_rate": 4.75e-05,
28 "loss": 0.5829,
29 "step": 4022
30 },
31 {
32 "epoch": 2.0,
33 "eval_loss": 0.5402843356132507,
34 "eval_runtime": 70.0086,
35 "eval_samples_per_second": 5.756,
36 "eval_steps_per_second": 0.728,
37 "step": 4022
38 },
39 {
40 "epoch": 3.0,
41 "learning_rate": 4.6250000000000006e-05,
42 "loss": 0.4918,
43 "step": 6033
44 },
45 {
46 "epoch": 3.0,
47 "eval_loss": 0.45011985301971436,
48 "eval_runtime": 70.1392,
49 "eval_samples_per_second": 5.746,
50 "eval_steps_per_second": 0.727,
51 "step": 6033
52 },
53 {
54 "epoch": 4.0,
55 "learning_rate": 4.5e-05,
56 "loss": 0.419,
57 "step": 8044
58 },
59 {
60 "epoch": 4.0,
61 "eval_loss": 0.38660600781440735,
62 "eval_runtime": 70.1321,
63 "eval_samples_per_second": 5.746,
64 "eval_steps_per_second": 0.727,
65 "step": 8044
66 },
67 {
68 "epoch": 5.0,
69 "learning_rate": 4.375e-05,
70 "loss": 0.3644,
71 "step": 10055
72 },
73 {
74 "epoch": 5.0,
75 "eval_loss": 0.33983489871025085,
76 "eval_runtime": 69.9916,
77 "eval_samples_per_second": 5.758,
78 "eval_steps_per_second": 0.729,
79 "step": 10055
80 },
81 {
82 "epoch": 6.0,
83 "learning_rate": 4.25e-05,
84 "loss": 0.3211,
85 "step": 12066
86 },
87 {
88 "epoch": 6.0,
89 "eval_loss": 0.3004438281059265,
90 "eval_runtime": 70.0768,
91 "eval_samples_per_second": 5.751,
92 "eval_steps_per_second": 0.728,
93 "step": 12066
94 },
95 {
96 "epoch": 7.0,
97 "learning_rate": 4.125e-05,
98 "loss": 0.2854,
99 "step": 14077
100 },
101 {
102 "epoch": 7.0,
103 "eval_loss": 0.2634061574935913,
104 "eval_runtime": 70.2069,
105 "eval_samples_per_second": 5.74,
106 "eval_steps_per_second": 0.726,
107 "step": 14077
108 },
109 {
110 "epoch": 8.0,
111 "learning_rate": 4e-05,
112 "loss": 0.255,
113 "step": 16088
114 },
115 {
116 "epoch": 8.0,
117 "eval_loss": 0.23876915872097015,
118 "eval_runtime": 70.1721,
119 "eval_samples_per_second": 5.743,
120 "eval_steps_per_second": 0.727,
121 "step": 16088
122 },
123 {
124 "epoch": 9.0,
125 "learning_rate": 3.875e-05,
126 "loss": 0.2281,
127 "step": 18099
128 },
129 {
130 "epoch": 9.0,
131 "eval_loss": 0.21539266407489777,
132 "eval_runtime": 70.1355,
133 "eval_samples_per_second": 5.746,
134 "eval_steps_per_second": 0.727,
135 "step": 18099
136 },
137 {
138 "epoch": 10.0,
139 "learning_rate": 3.7500000000000003e-05,
140 "loss": 0.2052,
141 "step": 20110
142 },
143 {
144 "epoch": 10.0,
145 "eval_loss": 0.18904653191566467,
146 "eval_runtime": 70.1349,
147 "eval_samples_per_second": 5.746,
148 "eval_steps_per_second": 0.727,
149 "step": 20110
150 },
151 {
152 "epoch": 11.0,
153 "learning_rate": 3.625e-05,
154 "loss": 0.1853,
155 "step": 22121
156 },
157 {
158 "epoch": 11.0,
159 "eval_loss": 0.17202098667621613,
160 "eval_runtime": 69.9829,
161 "eval_samples_per_second": 5.759,
162 "eval_steps_per_second": 0.729,
163 "step": 22121
164 },
165 {
166 "epoch": 12.0,
167 "learning_rate": 3.5e-05,
168 "loss": 0.1673,
169 "step": 24132
170 },
171 {
172 "epoch": 12.0,
173 "eval_loss": 0.15875761210918427,
174 "eval_runtime": 70.1596,
175 "eval_samples_per_second": 5.744,
176 "eval_steps_per_second": 0.727,
177 "step": 24132
178 },
179 {
180 "epoch": 13.0,
181 "learning_rate": 3.375000000000001e-05,
182 "loss": 0.1526,
183 "step": 26143
184 },
185 {
186 "epoch": 13.0,
187 "eval_loss": 0.14447805285453796,
188 "eval_runtime": 70.1252,
189 "eval_samples_per_second": 5.747,
190 "eval_steps_per_second": 0.727,
191 "step": 26143
192 },
193 {
194 "epoch": 14.0,
195 "learning_rate": 3.2500000000000004e-05,
196 "loss": 0.1398,
197 "step": 28154
198 },
199 {
200 "epoch": 14.0,
201 "eval_loss": 0.13342420756816864,
202 "eval_runtime": 70.1196,
203 "eval_samples_per_second": 5.747,
204 "eval_steps_per_second": 0.727,
205 "step": 28154
206 },
207 {
208 "epoch": 15.0,
209 "learning_rate": 3.125e-05,
210 "loss": 0.1285,
211 "step": 30165
212 },
213 {
214 "epoch": 15.0,
215 "eval_loss": 0.12114470452070236,
216 "eval_runtime": 70.2112,
217 "eval_samples_per_second": 5.74,
218 "eval_steps_per_second": 0.726,
219 "step": 30165
220 },
221 {
222 "epoch": 16.0,
223 "learning_rate": 3e-05,
224 "loss": 0.1187,
225 "step": 32176
226 },
227 {
228 "epoch": 16.0,
229 "eval_loss": 0.11447372287511826,
230 "eval_runtime": 70.1257,
231 "eval_samples_per_second": 5.747,
232 "eval_steps_per_second": 0.727,
233 "step": 32176
234 },
235 {
236 "epoch": 17.0,
237 "learning_rate": 2.8749999999999997e-05,
238 "loss": 0.1104,
239 "step": 34187
240 },
241 {
242 "epoch": 17.0,
243 "eval_loss": 0.10539893060922623,
244 "eval_runtime": 70.1826,
245 "eval_samples_per_second": 5.742,
246 "eval_steps_per_second": 0.727,
247 "step": 34187
248 },
249 {
250 "epoch": 18.0,
251 "learning_rate": 2.7500000000000004e-05,
252 "loss": 0.1038,
253 "step": 36198
254 },
255 {
256 "epoch": 18.0,
257 "eval_loss": 0.09906744956970215,
258 "eval_runtime": 70.117,
259 "eval_samples_per_second": 5.748,
260 "eval_steps_per_second": 0.727,
261 "step": 36198
262 },
263 {
264 "epoch": 19.0,
265 "learning_rate": 2.625e-05,
266 "loss": 0.0974,
267 "step": 38209
268 },
269 {
270 "epoch": 19.0,
271 "eval_loss": 0.09452048689126968,
272 "eval_runtime": 70.1925,
273 "eval_samples_per_second": 5.741,
274 "eval_steps_per_second": 0.727,
275 "step": 38209
276 },
277 {
278 "epoch": 20.0,
279 "learning_rate": 2.5e-05,
280 "loss": 0.0927,
281 "step": 40220
282 },
283 {
284 "epoch": 20.0,
285 "eval_loss": 0.09014962613582611,
286 "eval_runtime": 69.9849,
287 "eval_samples_per_second": 5.758,
288 "eval_steps_per_second": 0.729,
289 "step": 40220
290 },
291 {
292 "epoch": 21.0,
293 "learning_rate": 2.375e-05,
294 "loss": 0.0878,
295 "step": 42231
296 },
297 {
298 "epoch": 21.0,
299 "eval_loss": 0.08503083884716034,
300 "eval_runtime": 70.1728,
301 "eval_samples_per_second": 5.743,
302 "eval_steps_per_second": 0.727,
303 "step": 42231
304 },
305 {
306 "epoch": 22.0,
307 "learning_rate": 2.25e-05,
308 "loss": 0.0838,
309 "step": 44242
310 },
311 {
312 "epoch": 22.0,
313 "eval_loss": 0.0820975974202156,
314 "eval_runtime": 70.0791,
315 "eval_samples_per_second": 5.751,
316 "eval_steps_per_second": 0.728,
317 "step": 44242
318 },
319 {
320 "epoch": 23.0,
321 "learning_rate": 2.125e-05,
322 "loss": 0.0801,
323 "step": 46253
324 },
325 {
326 "epoch": 23.0,
327 "eval_loss": 0.0777197927236557,
328 "eval_runtime": 69.9961,
329 "eval_samples_per_second": 5.757,
330 "eval_steps_per_second": 0.729,
331 "step": 46253
332 },
333 {
334 "epoch": 24.0,
335 "learning_rate": 2e-05,
336 "loss": 0.0775,
337 "step": 48264
338 },
339 {
340 "epoch": 24.0,
341 "eval_loss": 0.0748789981007576,
342 "eval_runtime": 69.905,
343 "eval_samples_per_second": 5.765,
344 "eval_steps_per_second": 0.73,
345 "step": 48264
346 },
347 {
348 "epoch": 25.0,
349 "learning_rate": 1.8750000000000002e-05,
350 "loss": 0.0751,
351 "step": 50275
352 },
353 {
354 "epoch": 25.0,
355 "eval_loss": 0.0729849636554718,
356 "eval_runtime": 70.0915,
357 "eval_samples_per_second": 5.75,
358 "eval_steps_per_second": 0.728,
359 "step": 50275
360 },
361 {
362 "epoch": 26.0,
363 "learning_rate": 1.75e-05,
364 "loss": 0.0727,
365 "step": 52286
366 },
367 {
368 "epoch": 26.0,
369 "eval_loss": 0.0698952004313469,
370 "eval_runtime": 70.0781,
371 "eval_samples_per_second": 5.751,
372 "eval_steps_per_second": 0.728,
373 "step": 52286
374 },
375 {
376 "epoch": 27.0,
377 "learning_rate": 1.6250000000000002e-05,
378 "loss": 0.0706,
379 "step": 54297
380 },
381 {
382 "epoch": 27.0,
383 "eval_loss": 0.06760543584823608,
384 "eval_runtime": 69.9618,
385 "eval_samples_per_second": 5.76,
386 "eval_steps_per_second": 0.729,
387 "step": 54297
388 },
389 {
390 "epoch": 28.0,
391 "learning_rate": 1.5e-05,
392 "loss": 0.0691,
393 "step": 56308
394 },
395 {
396 "epoch": 28.0,
397 "eval_loss": 0.06610006093978882,
398 "eval_runtime": 70.1085,
399 "eval_samples_per_second": 5.748,
400 "eval_steps_per_second": 0.727,
401 "step": 56308
402 },
403 {
404 "epoch": 29.0,
405 "learning_rate": 1.3750000000000002e-05,
406 "loss": 0.0678,
407 "step": 58319
408 },
409 {
410 "epoch": 29.0,
411 "eval_loss": 0.06433883309364319,
412 "eval_runtime": 70.1363,
413 "eval_samples_per_second": 5.746,
414 "eval_steps_per_second": 0.727,
415 "step": 58319
416 },
417 {
418 "epoch": 30.0,
419 "learning_rate": 1.25e-05,
420 "loss": 0.0666,
421 "step": 60330
422 },
423 {
424 "epoch": 30.0,
425 "eval_loss": 0.06277326494455338,
426 "eval_runtime": 70.0925,
427 "eval_samples_per_second": 5.75,
428 "eval_steps_per_second": 0.728,
429 "step": 60330
430 },
431 {
432 "epoch": 31.0,
433 "learning_rate": 1.125e-05,
434 "loss": 0.0652,
435 "step": 62341
436 },
437 {
438 "epoch": 31.0,
439 "eval_loss": 0.06192418932914734,
440 "eval_runtime": 69.9357,
441 "eval_samples_per_second": 5.762,
442 "eval_steps_per_second": 0.729,
443 "step": 62341
444 },
445 {
446 "epoch": 32.0,
447 "learning_rate": 1e-05,
448 "loss": 0.0644,
449 "step": 64352
450 },
451 {
452 "epoch": 32.0,
453 "eval_loss": 0.0610126368701458,
454 "eval_runtime": 70.061,
455 "eval_samples_per_second": 5.752,
456 "eval_steps_per_second": 0.728,
457 "step": 64352
458 },
459 {
460 "epoch": 33.0,
461 "learning_rate": 8.75e-06,
462 "loss": 0.0635,
463 "step": 66363
464 },
465 {
466 "epoch": 33.0,
467 "eval_loss": 0.060028236359357834,
468 "eval_runtime": 69.9253,
469 "eval_samples_per_second": 5.763,
470 "eval_steps_per_second": 0.729,
471 "step": 66363
472 },
473 {
474 "epoch": 34.0,
475 "learning_rate": 7.5e-06,
476 "loss": 0.0629,
477 "step": 68374
478 },
479 {
480 "epoch": 34.0,
481 "eval_loss": 0.05925382673740387,
482 "eval_runtime": 69.9042,
483 "eval_samples_per_second": 5.765,
484 "eval_steps_per_second": 0.73,
485 "step": 68374
486 },
487 {
488 "epoch": 35.0,
489 "learning_rate": 6.25e-06,
490 "loss": 0.0622,
491 "step": 70385
492 },
493 {
494 "epoch": 35.0,
495 "eval_loss": 0.05860263481736183,
496 "eval_runtime": 69.8706,
497 "eval_samples_per_second": 5.768,
498 "eval_steps_per_second": 0.73,
499 "step": 70385
500 },
501 {
502 "epoch": 36.0,
503 "learning_rate": 5e-06,
504 "loss": 0.0616,
505 "step": 72396
506 },
507 {
508 "epoch": 36.0,
509 "eval_loss": 0.05808304622769356,
510 "eval_runtime": 69.9999,
511 "eval_samples_per_second": 5.757,
512 "eval_steps_per_second": 0.729,
513 "step": 72396
514 },
515 {
516 "epoch": 37.0,
517 "learning_rate": 3.75e-06,
518 "loss": 0.061,
519 "step": 74407
520 },
521 {
522 "epoch": 37.0,
523 "eval_loss": 0.057825859636068344,
524 "eval_runtime": 69.9835,
525 "eval_samples_per_second": 5.758,
526 "eval_steps_per_second": 0.729,
527 "step": 74407
528 },
529 {
530 "epoch": 38.0,
531 "learning_rate": 2.5e-06,
532 "loss": 0.0605,
533 "step": 76418
534 },
535 {
536 "epoch": 38.0,
537 "eval_loss": 0.057523321360349655,
538 "eval_runtime": 69.9943,
539 "eval_samples_per_second": 5.758,
540 "eval_steps_per_second": 0.729,
541 "step": 76418
542 },
543 {
544 "epoch": 39.0,
545 "learning_rate": 1.25e-06,
546 "loss": 0.06,
547 "step": 78429
548 },
549 {
550 "epoch": 39.0,
551 "eval_loss": 0.05731285735964775,
552 "eval_runtime": 70.0036,
553 "eval_samples_per_second": 5.757,
554 "eval_steps_per_second": 0.729,
555 "step": 78429
556 },
557 {
558 "epoch": 40.0,
559 "learning_rate": 0.0,
560 "loss": 0.0595,
561 "step": 80440
562 },
563 {
564 "epoch": 40.0,
565 "eval_loss": 0.05725787207484245,
566 "eval_runtime": 69.9176,
567 "eval_samples_per_second": 5.764,
568 "eval_steps_per_second": 0.729,
569 "step": 80440
570 }
571 ],
572 "logging_steps": 500,
573 "max_steps": 80440,
574 "num_train_epochs": 40,
575 "save_steps": 500,
576 "total_flos": 9.118285061492736e+17,
577 "trial_name": null,
578 "trial_params": null
579}bitsandbytes quantization config was used during training: