Views
No views yet
| Parameter | Value |
|---|---|
| LoRA rank | 16 |
| LoRA alpha | 32 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 4 |
| Gradient accumulation | 4 |
| Epochs | 3 |
| Max seq length | 1024 |
| Warmup ratio | 0.1 |
| Dtype | bf16 |
{"loss": 4.4684814453125, "grad_norm": 9.619709014892578, "learning_rate": 7.82608695652174e-05, "entropy": 0.6021250784397125, "mean_token_accuracy": 0.540911665558815, "num_tokens": 24649.0, "epoch": 0.13245033112582782, "step": 10}
{"eval_loss": 0.5035159587860107, "eval_runtime": 18.434, "eval_samples_per_second": 8.137, "eval_steps_per_second": 2.061, "eval_entropy": 0.35170808395272807, "eval_mean_token_accuracy": 0.8650375965394472, "eval_num_tokens": 24649.0, "epoch": 0.13245033112582782, "step": 10}
{"loss": 0.2857654571533203, "grad_norm": 1.8498746156692505, "learning_rate": 0.00016521739130434784, "entropy": 0.31457153540104626, "mean_token_accuracy": 0.8891811698675156, "num_tokens": 48980.0, "epoch": 0.26490066225165565, "step": 20}
{"eval_loss": 0.37936344742774963, "eval_runtime": 18.4535, "eval_samples_per_second": 8.129, "eval_steps_per_second": 2.059, "eval_entropy": 0.2832848155184796, "eval_mean_token_accuracy": 0.8642857168850145, "eval_num_tokens": 48980.0, "epoch": 0.26490066225165565, "step": 20}
{"loss": 0.203959059715271, "grad_norm": 3.6350529193878174, "learning_rate": 0.00019414634146341464, "entropy": 0.15692595737054943, "mean_token_accuracy": 0.925978884100914, "num_tokens": 73206.0, "epoch": 0.3973509933774834, "step": 30}
{"eval_loss": 0.5378259420394897, "eval_runtime": 18.3885, "eval_samples_per_second": 8.157, "eval_steps_per_second": 2.067, "eval_entropy": 0.19832695083766194, "eval_mean_token_accuracy": 0.8445332105222502, "eval_num_tokens": 73206.0, "epoch": 0.3973509933774834, "step": 30}
{"loss": 0.16900832653045655, "grad_norm": 1.5623637437820435, "learning_rate": 0.00018439024390243903, "entropy": 0.1384442513808608, "mean_token_accuracy": 0.9235776454210282, "num_tokens": 97155.0, "epoch": 0.5298013245033113, "step": 40}
{"eval_loss": 0.45591676235198975, "eval_runtime": 18.3813, "eval_samples_per_second": 8.16, "eval_steps_per_second": 2.067, "eval_entropy": 0.15607128324183195, "eval_mean_token_accuracy": 0.8645206783947191, "eval_num_tokens": 97155.0, "epoch": 0.5298013245033113, "step": 40}
{"loss": 0.10740952491760254, "grad_norm": 1.0196150541305542, "learning_rate": 0.00017463414634146342, "entropy": 0.09403432453982533, "mean_token_accuracy": 0.9690509960055351, "num_tokens": 121379.0, "epoch": 0.6622516556291391, "step": 50}
{"eval_loss": 0.3910195231437683, "eval_runtime": 18.5411, "eval_samples_per_second": 8.09, "eval_steps_per_second": 2.049, "eval_entropy": 0.15105230763468794, "eval_mean_token_accuracy": 0.8765507528656408, "eval_num_tokens": 121379.0, "epoch": 0.6622516556291391, "step": 50}
{"loss": 0.0695081114768982, "grad_norm": 0.7041437029838562, "learning_rate": 0.00016487804878048782, "entropy": 0.0627466789796017, "mean_token_accuracy": 0.9780161648988723, "num_tokens": 145565.0, "epoch": 0.7947019867549668, "step": 60}
{"eval_loss": 0.39498788118362427, "eval_runtime": 18.4009, "eval_samples_per_second": 8.152, "eval_steps_per_second": 2.065, "eval_entropy": 0.14672874398897157, "eval_mean_token_accuracy": 0.8832706777673018, "eval_num_tokens": 145565.0, "epoch": 0.7947019867549668, "step": 60}
{"loss": 0.10054994821548462, "grad_norm": 4.91701602935791, "learning_rate": 0.0001551219512195122, "entropy": 0.06378098363056779, "mean_token_accuracy": 0.9711185693740845, "num_tokens": 170619.0, "epoch": 0.9271523178807947, "step": 70}
{"eval_loss": 0.4510810375213623, "eval_runtime": 18.3829, "eval_samples_per_second": 8.16, "eval_steps_per_second": 2.067, "eval_entropy": 0.1150564574866286, "eval_mean_token_accuracy": 0.888753133384805, "eval_num_tokens": 170619.0, "epoch": 0.9271523178807947, "step": 70}
{"loss": 0.06143869161605835, "grad_norm": 0.41974490880966187, "learning_rate": 0.0001453658536585366, "entropy": 0.05352682134099795, "mean_token_accuracy": 0.9776208447782617, "num_tokens": 193723.0, "epoch": 1.0529801324503312, "step": 80}
{"eval_loss": 0.37008780241012573, "eval_runtime": 18.5226, "eval_samples_per_second": 8.098, "eval_steps_per_second": 2.052, "eval_entropy": 0.12499882252029094, "eval_mean_token_accuracy": 0.8932487478381709, "eval_num_tokens": 193723.0, "epoch": 1.0529801324503312, "step": 80}
{"loss": 0.01962831914424896, "grad_norm": 0.13990475237369537, "learning_rate": 0.000135609756097561, "entropy": 0.03200856430339627, "mean_token_accuracy": 0.9930523425340653, "num_tokens": 218578.0, "epoch": 1.185430463576159, "step": 90}
{"eval_loss": 0.6636162400245667, "eval_runtime": 18.4198, "eval_samples_per_second": 8.143, "eval_steps_per_second": 2.063, "eval_entropy": 0.07622176293348036, "eval_mean_token_accuracy": 0.844783836289456, "eval_num_tokens": 218578.0, "epoch": 1.185430463576159, "step": 90}
{"loss": 0.04950625896453857, "grad_norm": 0.010820542462170124, "learning_rate": 0.00012585365853658536, "entropy": 0.018681391897553114, "mean_token_accuracy": 0.988294368982315, "num_tokens": 243328.0, "epoch": 1.3178807947019868, "step": 100}
{"eval_loss": 0.49627384543418884, "eval_runtime": 18.327, "eval_samples_per_second": 8.185, "eval_steps_per_second": 2.073, "eval_entropy": 0.08262823526073541, "eval_mean_token_accuracy": 0.880200500551023, "eval_num_tokens": 243328.0, "epoch": 1.3178807947019868, "step": 100}
{"loss": 0.03160466253757477, "grad_norm": 0.49678096175193787, "learning_rate": 0.00011609756097560975, "entropy": 0.020633282663766295, "mean_token_accuracy": 0.9899404749274254, "num_tokens": 267754.0, "epoch": 1.4503311258278146, "step": 110}
{"eval_loss": 0.3876141905784607, "eval_runtime": 18.4347, "eval_samples_per_second": 8.137, "eval_steps_per_second": 2.061, "eval_entropy": 0.09184784858677487, "eval_mean_token_accuracy": 0.9049812037693826, "eval_num_tokens": 267754.0, "epoch": 1.4503311258278146, "step": 110}
{"loss": 0.02502947747707367, "grad_norm": 0.08712831884622574, "learning_rate": 0.00010634146341463416, "entropy": 0.02238986831798684, "mean_token_accuracy": 0.9952083334326745, "num_tokens": 292285.0, "epoch": 1.5827814569536423, "step": 120}
{"eval_loss": 0.42998605966567993, "eval_runtime": 18.4029, "eval_samples_per_second": 8.151, "eval_steps_per_second": 2.065, "eval_entropy": 0.08027837373542991, "eval_mean_token_accuracy": 0.8968671685770938, "eval_num_tokens": 292285.0, "epoch": 1.5827814569536423, "step": 120}
{"loss": 0.01844410300254822, "grad_norm": 0.08500629663467407, "learning_rate": 9.658536585365854e-05, "entropy": 0.016610875079641117, "mean_token_accuracy": 0.9930620416998863, "num_tokens": 316466.0, "epoch": 1.7152317880794703, "step": 130}
{"eval_loss": 0.48298436403274536, "eval_runtime": 18.5667, "eval_samples_per_second": 8.079, "eval_steps_per_second": 2.047, "eval_entropy": 0.0781515430518132, "eval_mean_token_accuracy": 0.8891917294577548, "eval_num_tokens": 316466.0, "epoch": 1.7152317880794703, "step": 130}
{"loss": 0.021124455332756042, "grad_norm": 4.557602405548096, "learning_rate": 8.682926829268293e-05, "entropy": 0.011079569367575459, "mean_token_accuracy": 0.9949374988675117, "num_tokens": 340861.0, "epoch": 1.847682119205298, "step": 140}
{"eval_loss": 0.4992500841617584, "eval_runtime": 18.3536, "eval_samples_per_second": 8.173, "eval_steps_per_second": 2.07, "eval_entropy": 0.07390618013481512, "eval_mean_token_accuracy": 0.8973057662185869, "eval_num_tokens": 340861.0, "epoch": 1.847682119205298, "step": 140}
{"loss": 0.029478204250335694, "grad_norm": 0.9156091213226318, "learning_rate": 7.707317073170732e-05, "entropy": 0.015240089170401917, "mean_token_accuracy": 0.9898677960038185, "num_tokens": 364933.0, "epoch": 1.980132450331126, "step": 150}
{"eval_loss": 0.4256781041622162, "eval_runtime": 18.4423, "eval_samples_per_second": 8.133, "eval_steps_per_second": 2.06, "eval_entropy": 0.06046687734181576, "eval_mean_token_accuracy": 0.9038847120184648, "eval_num_tokens": 364933.0, "epoch": 1.980132450331126, "step": 150}
{"loss": 0.016902083158493043, "grad_norm": 0.006135523319244385, "learning_rate": 6.731707317073171e-05, "entropy": 0.015487243859464988, "mean_token_accuracy": 0.9958532703550238, "num_tokens": 387577.0, "epoch": 2.1059602649006623, "step": 160}
{"eval_loss": 0.43620431423187256, "eval_runtime": 18.4898, "eval_samples_per_second": 8.113, "eval_steps_per_second": 2.055, "eval_entropy": 0.0916054633807538, "eval_mean_token_accuracy": 0.9016917300851721, "eval_num_tokens": 387577.0, "epoch": 2.1059602649006623, "step": 160}
{"loss": 0.013036642968654633, "grad_norm": 0.0901140421628952, "learning_rate": 5.756097560975609e-05, "entropy": 0.016306127814459614, "mean_token_accuracy": 0.9932169124484063, "num_tokens": 412473.0, "epoch": 2.23841059602649, "step": 170}
{"eval_loss": 0.42615747451782227, "eval_runtime": 18.4014, "eval_samples_per_second": 8.152, "eval_steps_per_second": 2.065, "eval_entropy": 0.09244704810292828, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 412473.0, "epoch": 2.23841059602649, "step": 170}
{"loss": 0.013906355202198028, "grad_norm": 0.13488158583641052, "learning_rate": 4.7804878048780485e-05, "entropy": 0.015221780948922969, "mean_token_accuracy": 0.9929429933428764, "num_tokens": 436968.0, "epoch": 2.370860927152318, "step": 180}
{"eval_loss": 0.43320730328559875, "eval_runtime": 18.4081, "eval_samples_per_second": 8.149, "eval_steps_per_second": 2.064, "eval_entropy": 0.08311578456241957, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 436968.0, "epoch": 2.370860927152318, "step": 180}
{"loss": 0.00691165030002594, "grad_norm": 0.11786526441574097, "learning_rate": 3.804878048780488e-05, "entropy": 0.009859403091832064, "mean_token_accuracy": 0.9967708334326744, "num_tokens": 461406.0, "epoch": 2.5033112582781456, "step": 190}
{"eval_loss": 0.4476719796657562, "eval_runtime": 18.4131, "eval_samples_per_second": 8.146, "eval_steps_per_second": 2.064, "eval_entropy": 0.07685716904234141, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 461406.0, "epoch": 2.5033112582781456, "step": 190}
{"loss": 0.008034075051546097, "grad_norm": 0.005820910912007093, "learning_rate": 2.8292682926829267e-05, "entropy": 0.010289531637681648, "mean_token_accuracy": 0.9947794124484062, "num_tokens": 485446.0, "epoch": 2.6357615894039736, "step": 200}
{"eval_loss": 0.4665413498878479, "eval_runtime": 18.3878, "eval_samples_per_second": 8.158, "eval_steps_per_second": 2.067, "eval_entropy": 0.07245497081902086, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 485446.0, "epoch": 2.6357615894039736, "step": 200}
{"loss": 0.005670687928795814, "grad_norm": 0.0061874487437307835, "learning_rate": 1.853658536585366e-05, "entropy": 0.008472755795810371, "mean_token_accuracy": 0.9956127449870109, "num_tokens": 509991.0, "epoch": 2.7682119205298013, "step": 210}
{"eval_loss": 0.4753707945346832, "eval_runtime": 18.3833, "eval_samples_per_second": 8.16, "eval_steps_per_second": 2.067, "eval_entropy": 0.07007920450134981, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 509991.0, "epoch": 2.7682119205298013, "step": 210}
{"loss": 0.010937271267175674, "grad_norm": 0.011499536223709583, "learning_rate": 8.780487804878048e-06, "entropy": 0.011839934498129877, "mean_token_accuracy": 0.9911309525370597, "num_tokens": 534331.0, "epoch": 2.9006622516556293, "step": 220}
{"eval_loss": 0.47853147983551025, "eval_runtime": 18.4585, "eval_samples_per_second": 8.126, "eval_steps_per_second": 2.059, "eval_entropy": 0.06963576738723389, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 534331.0, "epoch": 2.9006622516556293, "step": 220}
{"eval_loss": 0.4796658456325531, "eval_runtime": 18.7981, "eval_samples_per_second": 7.98, "eval_steps_per_second": 2.021, "eval_entropy": 0.06943943050167659, "eval_mean_token_accuracy": 0.9082706774535932, "eval_num_tokens": 552465.0, "epoch": 3.0, "step": 228}
{"train_runtime": 2712.3961, "train_samples_per_second": 1.334, "train_steps_per_second": 0.084, "total_flos": 1.02575547016704e+17, "train_loss": 0.2516634967096411, "epoch": 3.0, "step": 228}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.14.1 |
| trl | 1.9.2 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.2 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.0 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |