Views
No views yet
| Parameter | Value |
|---|---|
| LoRA rank | 256 |
| LoRA alpha | 512 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 4 |
| Gradient accumulation | 4 |
| Epochs | 10 |
| Max seq length | 1024 |
| Warmup ratio | 0.1 |
| Dtype | bf16 |
{"loss": 2.333456611633301, "grad_norm": 2.100236177444458, "learning_rate": 2.4e-05, "entropy": 0.9848623737692833, "mean_token_accuracy": 0.5555324845016003, "num_tokens": 25919.0, "epoch": 0.13377926421404682, "step": 10}
{"loss": 0.3857757568359375, "grad_norm": 1.0778498649597168, "learning_rate": 5.0666666666666674e-05, "entropy": 0.4023094970732927, "mean_token_accuracy": 0.9023626074194908, "num_tokens": 52102.0, "epoch": 0.26755852842809363, "step": 20}
{"loss": 0.18216390609741212, "grad_norm": 0.555475115776062, "learning_rate": 7.733333333333333e-05, "entropy": 0.19321647509932519, "mean_token_accuracy": 0.9501925781369209, "num_tokens": 78452.0, "epoch": 0.4013377926421405, "step": 30}
{"loss": 0.10521388053894043, "grad_norm": 0.33322012424468994, "learning_rate": 0.00010400000000000001, "entropy": 0.10403623431921005, "mean_token_accuracy": 0.9690966844558716, "num_tokens": 104473.0, "epoch": 0.5351170568561873, "step": 40}
{"loss": 0.09792811870574951, "grad_norm": 0.2882387042045593, "learning_rate": 0.00013066666666666668, "entropy": 0.09928775765001774, "mean_token_accuracy": 0.970770700275898, "num_tokens": 130897.0, "epoch": 0.6688963210702341, "step": 50}
{"loss": 0.08995749354362488, "grad_norm": 0.6092769503593445, "learning_rate": 0.00015733333333333333, "entropy": 0.087036148365587, "mean_token_accuracy": 0.9715741500258446, "num_tokens": 156671.0, "epoch": 0.802675585284281, "step": 60}
{"loss": 0.07674040794372558, "grad_norm": 0.47908738255500793, "learning_rate": 0.00018400000000000003, "entropy": 0.07589430417865514, "mean_token_accuracy": 0.975873313844204, "num_tokens": 182885.0, "epoch": 0.9364548494983278, "step": 70}
{"loss": 0.07737719416618347, "grad_norm": 0.3380332291126251, "learning_rate": 0.00019881481481481483, "entropy": 0.07119672382489228, "mean_token_accuracy": 0.9765385694992847, "num_tokens": 208832.0, "epoch": 1.0668896321070234, "step": 80}
{"loss": 0.07666231989860535, "grad_norm": 0.29181429743766785, "learning_rate": 0.00019585185185185187, "entropy": 0.07469541737809778, "mean_token_accuracy": 0.9749954164028167, "num_tokens": 234951.0, "epoch": 1.2006688963210703, "step": 90}
{"loss": 0.080861896276474, "grad_norm": 1.0903865098953247, "learning_rate": 0.0001928888888888889, "entropy": 0.07653379952535033, "mean_token_accuracy": 0.9763917028903961, "num_tokens": 261400.0, "epoch": 1.334448160535117, "step": 100}
{"loss": 0.08669487833976745, "grad_norm": 0.2751341760158539, "learning_rate": 0.00018992592592592593, "entropy": 0.08102411804720759, "mean_token_accuracy": 0.9749145388603211, "num_tokens": 287571.0, "epoch": 1.468227424749164, "step": 110}
{"loss": 0.06908226013183594, "grad_norm": 0.3611105978488922, "learning_rate": 0.00018696296296296297, "entropy": 0.06624647676944732, "mean_token_accuracy": 0.9773063033819198, "num_tokens": 313548.0, "epoch": 1.6020066889632107, "step": 120}
{"loss": 0.05965976715087891, "grad_norm": 0.17292338609695435, "learning_rate": 0.00018400000000000003, "entropy": 0.06104917107149958, "mean_token_accuracy": 0.97911117374897, "num_tokens": 340225.0, "epoch": 1.7357859531772575, "step": 130}
{"loss": 0.06083930134773254, "grad_norm": 0.1658528447151184, "learning_rate": 0.00018103703703703706, "entropy": 0.06031512878835201, "mean_token_accuracy": 0.9782785162329674, "num_tokens": 366069.0, "epoch": 1.8695652173913042, "step": 140}
{"loss": 0.061213898658752444, "grad_norm": 0.2859327495098114, "learning_rate": 0.0001780740740740741, "entropy": 0.06040069823845839, "mean_token_accuracy": 0.9780197678468167, "num_tokens": 390948.0, "epoch": 2.0, "step": 150}
{"loss": 0.05546190738677979, "grad_norm": 0.14041753113269806, "learning_rate": 0.00017511111111111113, "entropy": 0.05398803604766726, "mean_token_accuracy": 0.9799056202173233, "num_tokens": 417051.0, "epoch": 2.1337792642140467, "step": 160}
{"loss": 0.054560279846191405, "grad_norm": 0.1629175990819931, "learning_rate": 0.00017214814814814816, "entropy": 0.052576581854373215, "mean_token_accuracy": 0.9800425380468368, "num_tokens": 443546.0, "epoch": 2.2675585284280935, "step": 170}
{"loss": 0.052338284254074094, "grad_norm": 0.21214041113853455, "learning_rate": 0.0001691851851851852, "entropy": 0.05330579150468111, "mean_token_accuracy": 0.9797388017177582, "num_tokens": 469627.0, "epoch": 2.4013377926421406, "step": 180}
{"loss": 0.051088809967041016, "grad_norm": 0.08933965861797333, "learning_rate": 0.00016622222222222223, "entropy": 0.048776681441813706, "mean_token_accuracy": 0.9798363357782364, "num_tokens": 496078.0, "epoch": 2.5351170568561874, "step": 190}
{"loss": 0.05260315537452698, "grad_norm": 0.055703964084386826, "learning_rate": 0.00016325925925925926, "entropy": 0.05353123405948281, "mean_token_accuracy": 0.9809376016259194, "num_tokens": 522219.0, "epoch": 2.668896321070234, "step": 200}
{"loss": 0.051258647441864015, "grad_norm": 0.23288026452064514, "learning_rate": 0.0001602962962962963, "entropy": 0.049139842949807645, "mean_token_accuracy": 0.9810081824660302, "num_tokens": 548085.0, "epoch": 2.802675585284281, "step": 210}
{"loss": 0.05015755295753479, "grad_norm": 0.061591196805238724, "learning_rate": 0.00015733333333333333, "entropy": 0.04981076763942838, "mean_token_accuracy": 0.9814969033002854, "num_tokens": 574184.0, "epoch": 2.936454849498328, "step": 220}
{"loss": 0.05148796439170837, "grad_norm": 0.08102353662252426, "learning_rate": 0.0001543703703703704, "entropy": 0.048234074257123165, "mean_token_accuracy": 0.9804905500167456, "num_tokens": 599622.0, "epoch": 3.0668896321070234, "step": 230}
{"loss": 0.05265617370605469, "grad_norm": 0.23442475497722626, "learning_rate": 0.00015140740740740742, "entropy": 0.05109882242977619, "mean_token_accuracy": 0.9813646718859672, "num_tokens": 625925.0, "epoch": 3.20066889632107, "step": 240}
{"loss": 0.05020827054977417, "grad_norm": 0.06953296065330505, "learning_rate": 0.00014844444444444445, "entropy": 0.05077859265729785, "mean_token_accuracy": 0.9805981770157814, "num_tokens": 651734.0, "epoch": 3.334448160535117, "step": 250}
{"loss": 0.05183341503143311, "grad_norm": 0.15939077734947205, "learning_rate": 0.0001454814814814815, "entropy": 0.05000888155773282, "mean_token_accuracy": 0.9803215205669403, "num_tokens": 678237.0, "epoch": 3.468227424749164, "step": 260}
{"loss": 0.04886130690574646, "grad_norm": 0.05941146984696388, "learning_rate": 0.00014251851851851852, "entropy": 0.04741075159981847, "mean_token_accuracy": 0.9814455792307853, "num_tokens": 704315.0, "epoch": 3.6020066889632107, "step": 270}
{"loss": 0.05047199726104736, "grad_norm": 0.09982413798570633, "learning_rate": 0.00013955555555555558, "entropy": 0.04998683538287878, "mean_token_accuracy": 0.9816837400197983, "num_tokens": 730745.0, "epoch": 3.7357859531772575, "step": 280}
{"loss": 0.05052418708801269, "grad_norm": 0.23623596131801605, "learning_rate": 0.00013659259259259261, "entropy": 0.050056893937289716, "mean_token_accuracy": 0.981443528831005, "num_tokens": 756696.0, "epoch": 3.869565217391304, "step": 290}
{"loss": 0.0494631290435791, "grad_norm": 0.07156683504581451, "learning_rate": 0.00013362962962962965, "entropy": 0.04879980104473921, "mean_token_accuracy": 0.9814773431191077, "num_tokens": 781896.0, "epoch": 4.0, "step": 300}
{"loss": 0.04601808488368988, "grad_norm": 0.060433875769376755, "learning_rate": 0.00013066666666666668, "entropy": 0.044055515946820376, "mean_token_accuracy": 0.9817805781960487, "num_tokens": 808428.0, "epoch": 4.133779264214047, "step": 310}
{"loss": 0.047679629921913144, "grad_norm": 0.04685833677649498, "learning_rate": 0.00012770370370370371, "entropy": 0.04594032969325781, "mean_token_accuracy": 0.9815194875001907, "num_tokens": 834658.0, "epoch": 4.2675585284280935, "step": 320}
{"loss": 0.04677574634552002, "grad_norm": 0.05513549596071243, "learning_rate": 0.00012474074074074075, "entropy": 0.04902802463620901, "mean_token_accuracy": 0.9818839743733406, "num_tokens": 860793.0, "epoch": 4.40133779264214, "step": 330}
{"loss": 0.047543841600418094, "grad_norm": 0.05170706659555435, "learning_rate": 0.0001217777777777778, "entropy": 0.045699743740260604, "mean_token_accuracy": 0.9817322447896004, "num_tokens": 886755.0, "epoch": 4.535117056856187, "step": 340}
{"loss": 0.04689686894416809, "grad_norm": 0.05158119276165962, "learning_rate": 0.00011881481481481483, "entropy": 0.04774944195523858, "mean_token_accuracy": 0.9807899489998817, "num_tokens": 912701.0, "epoch": 4.668896321070234, "step": 350}
{"loss": 0.04699905812740326, "grad_norm": 0.06513512879610062, "learning_rate": 0.00011585185185185186, "entropy": 0.046083882357925175, "mean_token_accuracy": 0.9815786674618721, "num_tokens": 938949.0, "epoch": 4.802675585284281, "step": 360}
{"loss": 0.0466790646314621, "grad_norm": 0.05723624303936958, "learning_rate": 0.0001128888888888889, "entropy": 0.04662480922415853, "mean_token_accuracy": 0.9814187169075013, "num_tokens": 965223.0, "epoch": 4.936454849498328, "step": 370}
{"loss": 0.04686478972434997, "grad_norm": 0.05132736638188362, "learning_rate": 0.00010992592592592593, "entropy": 0.04748494961322882, "mean_token_accuracy": 0.9816818420703595, "num_tokens": 990340.0, "epoch": 5.066889632107023, "step": 380}
{"loss": 0.04514282941818237, "grad_norm": 0.06154056265950203, "learning_rate": 0.00010696296296296297, "entropy": 0.04397230865433812, "mean_token_accuracy": 0.982451730966568, "num_tokens": 1016979.0, "epoch": 5.20066889632107, "step": 390}
{"loss": 0.04669376909732818, "grad_norm": 0.04756288602948189, "learning_rate": 0.00010400000000000001, "entropy": 0.046457508485764264, "mean_token_accuracy": 0.9811229631304741, "num_tokens": 1043156.0, "epoch": 5.334448160535117, "step": 400}
{"loss": 0.04642898440361023, "grad_norm": 0.05559574067592621, "learning_rate": 0.00010103703703703704, "entropy": 0.04600662933662534, "mean_token_accuracy": 0.9814727157354355, "num_tokens": 1069066.0, "epoch": 5.468227424749164, "step": 410}
{"loss": 0.046815142035484314, "grad_norm": 0.0765208899974823, "learning_rate": 9.807407407407407e-05, "entropy": 0.046540699899196625, "mean_token_accuracy": 0.9821144327521324, "num_tokens": 1095300.0, "epoch": 5.602006688963211, "step": 420}
{"loss": 0.0459826797246933, "grad_norm": 0.054549023509025574, "learning_rate": 9.511111111111112e-05, "entropy": 0.044381289184093474, "mean_token_accuracy": 0.9816006392240524, "num_tokens": 1121644.0, "epoch": 5.735785953177258, "step": 430}
{"loss": 0.045603659749031064, "grad_norm": 0.05118231475353241, "learning_rate": 9.214814814814815e-05, "entropy": 0.04678849773481488, "mean_token_accuracy": 0.9826463356614112, "num_tokens": 1148085.0, "epoch": 5.869565217391305, "step": 440}
{"loss": 0.04739760756492615, "grad_norm": 0.06610974669456482, "learning_rate": 8.918518518518519e-05, "entropy": 0.047066532935087495, "mean_token_accuracy": 0.9810050603670951, "num_tokens": 1172844.0, "epoch": 6.0, "step": 450}
{"loss": 0.044394922256469724, "grad_norm": 0.0401078462600708, "learning_rate": 8.622222222222222e-05, "entropy": 0.04434570064768195, "mean_token_accuracy": 0.9830354079604149, "num_tokens": 1199136.0, "epoch": 6.133779264214047, "step": 460}
{"loss": 0.04463147222995758, "grad_norm": 0.044714752584695816, "learning_rate": 8.325925925925925e-05, "entropy": 0.043299450725317004, "mean_token_accuracy": 0.9817440360784531, "num_tokens": 1225948.0, "epoch": 6.2675585284280935, "step": 470}
{"loss": 0.04590661823749542, "grad_norm": 0.04327947646379471, "learning_rate": 8.02962962962963e-05, "entropy": 0.04544559856876731, "mean_token_accuracy": 0.9818532645702363, "num_tokens": 1251878.0, "epoch": 6.40133779264214, "step": 480}
{"loss": 0.04485759735107422, "grad_norm": 0.045268647372722626, "learning_rate": 7.733333333333333e-05, "entropy": 0.04553802879527211, "mean_token_accuracy": 0.9832968473434448, "num_tokens": 1278539.0, "epoch": 6.535117056856187, "step": 490}
{"loss": 0.045733729004859926, "grad_norm": 0.055019479244947433, "learning_rate": 7.437037037037038e-05, "entropy": 0.04587807944044471, "mean_token_accuracy": 0.9819129392504692, "num_tokens": 1304914.0, "epoch": 6.668896321070234, "step": 500}
{"loss": 0.04619724452495575, "grad_norm": 0.03921324759721756, "learning_rate": 7.140740740740741e-05, "entropy": 0.04730347627773881, "mean_token_accuracy": 0.9815327763557434, "num_tokens": 1330792.0, "epoch": 6.802675585284281, "step": 510}
{"loss": 0.04701476991176605, "grad_norm": 0.04790337756276131, "learning_rate": 6.844444444444445e-05, "entropy": 0.04526328779757023, "mean_token_accuracy": 0.9806558951735497, "num_tokens": 1356389.0, "epoch": 6.936454849498328, "step": 520}
{"loss": 0.04535368382930756, "grad_norm": 0.05221050605177879, "learning_rate": 6.54814814814815e-05, "entropy": 0.04650072753429413, "mean_token_accuracy": 0.9820646307407281, "num_tokens": 1381476.0, "epoch": 7.066889632107023, "step": 530}
{"loss": 0.04606861174106598, "grad_norm": 0.05709005147218704, "learning_rate": 6.251851851851853e-05, "entropy": 0.04671155996620655, "mean_token_accuracy": 0.9816484361886978, "num_tokens": 1406975.0, "epoch": 7.20066889632107, "step": 540}
{"loss": 0.04483829140663147, "grad_norm": 0.04249070584774017, "learning_rate": 5.9555555555555554e-05, "entropy": 0.043450713623315096, "mean_token_accuracy": 0.9828404799103737, "num_tokens": 1433489.0, "epoch": 7.334448160535117, "step": 550}
{"loss": 0.044387218356132505, "grad_norm": 0.03745650500059128, "learning_rate": 5.6592592592592594e-05, "entropy": 0.04426444508135319, "mean_token_accuracy": 0.982863312959671, "num_tokens": 1459934.0, "epoch": 7.468227424749164, "step": 560}
{"loss": 0.045737871527671815, "grad_norm": 0.037206266075372696, "learning_rate": 5.362962962962963e-05, "entropy": 0.045948256459087136, "mean_token_accuracy": 0.9809497982263565, "num_tokens": 1486067.0, "epoch": 7.602006688963211, "step": 570}
{"loss": 0.04574190378189087, "grad_norm": 0.04351735860109329, "learning_rate": 5.0666666666666674e-05, "entropy": 0.04633543202653527, "mean_token_accuracy": 0.9814269348978997, "num_tokens": 1511990.0, "epoch": 7.735785953177258, "step": 580}
{"loss": 0.04587266743183136, "grad_norm": 0.04624152183532715, "learning_rate": 4.770370370370371e-05, "entropy": 0.04529349934309721, "mean_token_accuracy": 0.9816018745303154, "num_tokens": 1537922.0, "epoch": 7.869565217391305, "step": 590}
{"loss": 0.04437578320503235, "grad_norm": 0.040831226855516434, "learning_rate": 4.474074074074075e-05, "entropy": 0.04341630881222395, "mean_token_accuracy": 0.9817978862004403, "num_tokens": 1563792.0, "epoch": 8.0, "step": 600}
{"loss": 0.04484516084194183, "grad_norm": 0.047756411135196686, "learning_rate": 4.177777777777778e-05, "entropy": 0.04679809929803014, "mean_token_accuracy": 0.9820674404501915, "num_tokens": 1589717.0, "epoch": 8.133779264214047, "step": 610}
{"loss": 0.04443695843219757, "grad_norm": 0.04340463504195213, "learning_rate": 3.8814814814814814e-05, "entropy": 0.04564524469897151, "mean_token_accuracy": 0.9820684522390366, "num_tokens": 1616024.0, "epoch": 8.267558528428093, "step": 620}
{"loss": 0.04470597505569458, "grad_norm": 0.04217043146491051, "learning_rate": 3.5851851851851854e-05, "entropy": 0.04492345619946718, "mean_token_accuracy": 0.9820092603564262, "num_tokens": 1642054.0, "epoch": 8.40133779264214, "step": 630}
{"loss": 0.04453657567501068, "grad_norm": 0.03866538777947426, "learning_rate": 3.2888888888888894e-05, "entropy": 0.044699020124971865, "mean_token_accuracy": 0.9823292180895805, "num_tokens": 1668483.0, "epoch": 8.535117056856187, "step": 640}
{"loss": 0.04420640468597412, "grad_norm": 0.034648630768060684, "learning_rate": 2.992592592592593e-05, "entropy": 0.044554309267550704, "mean_token_accuracy": 0.9823271661996842, "num_tokens": 1694950.0, "epoch": 8.668896321070234, "step": 650}
{"loss": 0.04528497755527496, "grad_norm": 0.036505118012428284, "learning_rate": 2.696296296296296e-05, "entropy": 0.04471444431692362, "mean_token_accuracy": 0.9815712168812751, "num_tokens": 1720886.0, "epoch": 8.80267558528428, "step": 660}
{"loss": 0.0444941520690918, "grad_norm": 0.03727864474058151, "learning_rate": 2.4e-05, "entropy": 0.044028689991682766, "mean_token_accuracy": 0.982644784450531, "num_tokens": 1747189.0, "epoch": 8.936454849498327, "step": 670}
{"loss": 0.04483833611011505, "grad_norm": 0.03038371540606022, "learning_rate": 2.1037037037037037e-05, "entropy": 0.04507437386573889, "mean_token_accuracy": 0.9818174839019775, "num_tokens": 1772260.0, "epoch": 9.066889632107024, "step": 680}
{"loss": 0.04370395839214325, "grad_norm": 0.035819001495838165, "learning_rate": 1.8074074074074074e-05, "entropy": 0.04642890952527523, "mean_token_accuracy": 0.9825195044279098, "num_tokens": 1798609.0, "epoch": 9.200668896321071, "step": 690}
{"loss": 0.043523979187011716, "grad_norm": 0.03384142369031906, "learning_rate": 1.5111111111111112e-05, "entropy": 0.04397309180349111, "mean_token_accuracy": 0.9828238025307655, "num_tokens": 1824991.0, "epoch": 9.334448160535118, "step": 700}
{"loss": 0.04526695311069488, "grad_norm": 0.03778361901640892, "learning_rate": 1.2148148148148149e-05, "entropy": 0.044328450225293636, "mean_token_accuracy": 0.9812616273760796, "num_tokens": 1850628.0, "epoch": 9.468227424749164, "step": 710}
{"loss": 0.04400339126586914, "grad_norm": 0.03287288919091225, "learning_rate": 9.185185185185186e-06, "entropy": 0.0446832437068224, "mean_token_accuracy": 0.9826791554689407, "num_tokens": 1876919.0, "epoch": 9.602006688963211, "step": 720}
{"loss": 0.044032156467437744, "grad_norm": 0.03609819710254669, "learning_rate": 6.222222222222222e-06, "entropy": 0.04512580344453454, "mean_token_accuracy": 0.9824404388666153, "num_tokens": 1903234.0, "epoch": 9.735785953177258, "step": 730}
{"loss": 0.043946114182472226, "grad_norm": 0.03155915439128876, "learning_rate": 3.259259259259259e-06, "entropy": 0.04431167049333453, "mean_token_accuracy": 0.982151736319065, "num_tokens": 1929678.0, "epoch": 9.869565217391305, "step": 740}
{"loss": 0.04471402764320374, "grad_norm": 0.03877895325422287, "learning_rate": 2.962962962962963e-07, "entropy": 0.04511234603631191, "mean_token_accuracy": 0.9819383361400702, "num_tokens": 1954740.0, "epoch": 10.0, "step": 750}
{"train_runtime": 3262.9991, "train_samples_per_second": 3.662, "train_steps_per_second": 0.23, "total_flos": 3.66506638056576e+17, "train_loss": 0.0888503471215566, "epoch": 10.0, "step": 750}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.14.1 |
| trl | 1.9.2 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.2 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.0 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |