Views
No views yet
| Parameter | Value |
|---|---|
| LoRA rank | 16 |
| LoRA alpha | 32 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 4 |
| Gradient accumulation | 4 |
| Epochs | 3 |
| Max seq length | 1024 |
| Warmup ratio | 0.1 |
| Dtype | bf16 |
{"loss": 4.480490112304688, "grad_norm": 7.594893932342529, "learning_rate": 7.82608695652174e-05, "entropy": 0.6253664560616017, "mean_token_accuracy": 0.5154734294861555, "num_tokens": 24658.0, "epoch": 0.13245033112582782, "step": 10}
{"eval_loss": 0.7059837579727173, "eval_runtime": 18.5132, "eval_samples_per_second": 8.102, "eval_steps_per_second": 2.053, "eval_entropy": 0.4162300497685608, "eval_mean_token_accuracy": 0.7859335878961965, "eval_num_tokens": 24658.0, "epoch": 0.13245033112582782, "step": 10}
{"loss": 0.4507080078125, "grad_norm": 2.1310629844665527, "learning_rate": 0.00016521739130434784, "entropy": 0.4252598252147436, "mean_token_accuracy": 0.8284948468208313, "num_tokens": 48994.0, "epoch": 0.26490066225165565, "step": 20}
{"eval_loss": 0.5395920872688293, "eval_runtime": 18.6135, "eval_samples_per_second": 8.059, "eval_steps_per_second": 2.042, "eval_entropy": 0.3751298522478656, "eval_mean_token_accuracy": 0.7904918570267526, "eval_num_tokens": 48994.0, "epoch": 0.26490066225165565, "step": 20}
{"loss": 0.3621645212173462, "grad_norm": 1.7542128562927246, "learning_rate": 0.00019414634146341464, "entropy": 0.3427898479625583, "mean_token_accuracy": 0.8608327582478523, "num_tokens": 73216.0, "epoch": 0.3973509933774834, "step": 30}
{"eval_loss": 0.6602321267127991, "eval_runtime": 18.7665, "eval_samples_per_second": 7.993, "eval_steps_per_second": 2.025, "eval_entropy": 0.2785391737461874, "eval_mean_token_accuracy": 0.7687030113057086, "eval_num_tokens": 73216.0, "epoch": 0.3973509933774834, "step": 30}
{"loss": 0.3172240495681763, "grad_norm": 1.0524991750717163, "learning_rate": 0.00018439024390243903, "entropy": 0.2561139756813645, "mean_token_accuracy": 0.8677357256412506, "num_tokens": 97165.0, "epoch": 0.5298013245033113, "step": 40}
{"eval_loss": 0.6309642791748047, "eval_runtime": 19.4164, "eval_samples_per_second": 7.725, "eval_steps_per_second": 1.957, "eval_entropy": 0.3258523433224151, "eval_mean_token_accuracy": 0.8133615318097567, "eval_num_tokens": 97165.0, "epoch": 0.5298013245033113, "step": 40}
{"loss": 0.30851519107818604, "grad_norm": 1.3749570846557617, "learning_rate": 0.00017463414634146342, "entropy": 0.2805394181981683, "mean_token_accuracy": 0.878353463113308, "num_tokens": 121376.0, "epoch": 0.6622516556291391, "step": 50}
{"eval_loss": 0.6423019170761108, "eval_runtime": 18.5786, "eval_samples_per_second": 8.074, "eval_steps_per_second": 2.045, "eval_entropy": 0.3149536170653607, "eval_mean_token_accuracy": 0.7697525126369376, "eval_num_tokens": 121376.0, "epoch": 0.6622516556291391, "step": 50}
{"loss": 0.25025866031646726, "grad_norm": 1.1150211095809937, "learning_rate": 0.00016487804878048782, "entropy": 0.2665820291265845, "mean_token_accuracy": 0.8993780449032783, "num_tokens": 145557.0, "epoch": 0.7947019867549668, "step": 60}
{"eval_loss": 0.6828566193580627, "eval_runtime": 18.7482, "eval_samples_per_second": 8.001, "eval_steps_per_second": 2.027, "eval_entropy": 0.2638676632195711, "eval_mean_token_accuracy": 0.7652882259143027, "eval_num_tokens": 145557.0, "epoch": 0.7947019867549668, "step": 60}
{"loss": 0.17711867094039918, "grad_norm": 3.413618803024292, "learning_rate": 0.0001551219512195122, "entropy": 0.14283903050236404, "mean_token_accuracy": 0.9382406517863273, "num_tokens": 170605.0, "epoch": 0.9271523178807947, "step": 70}
{"eval_loss": 0.7566420435905457, "eval_runtime": 18.5268, "eval_samples_per_second": 8.096, "eval_steps_per_second": 2.051, "eval_entropy": 0.195127198570653, "eval_mean_token_accuracy": 0.7838502549811414, "eval_num_tokens": 170605.0, "epoch": 0.9271523178807947, "step": 70}
{"loss": 0.16802334785461426, "grad_norm": 1.1351215839385986, "learning_rate": 0.0001453658536585366, "entropy": 0.16479523308379085, "mean_token_accuracy": 0.9336656692780947, "num_tokens": 193719.0, "epoch": 1.0529801324503312, "step": 80}
{"eval_loss": 0.6928573846817017, "eval_runtime": 18.5526, "eval_samples_per_second": 8.085, "eval_steps_per_second": 2.048, "eval_entropy": 0.277672087087443, "eval_mean_token_accuracy": 0.8268640402116274, "eval_num_tokens": 193719.0, "epoch": 1.0529801324503312, "step": 80}
{"loss": 0.09430139660835266, "grad_norm": 1.3146662712097168, "learning_rate": 0.000135609756097561, "entropy": 0.1283066717442125, "mean_token_accuracy": 0.9637581333518028, "num_tokens": 218542.0, "epoch": 1.185430463576159, "step": 90}
{"eval_loss": 0.8101337552070618, "eval_runtime": 18.5348, "eval_samples_per_second": 8.093, "eval_steps_per_second": 2.05, "eval_entropy": 0.1929488328873719, "eval_mean_token_accuracy": 0.8210526375394118, "eval_num_tokens": 218542.0, "epoch": 1.185430463576159, "step": 90}
{"loss": 0.11303552389144897, "grad_norm": 0.396829754114151, "learning_rate": 0.00012585365853658536, "entropy": 0.05764024908712599, "mean_token_accuracy": 0.9714476495981217, "num_tokens": 243302.0, "epoch": 1.3178807947019868, "step": 100}
{"eval_loss": 1.116403579711914, "eval_runtime": 18.5267, "eval_samples_per_second": 8.096, "eval_steps_per_second": 2.051, "eval_entropy": 0.16044150802343593, "eval_mean_token_accuracy": 0.8100563962208597, "eval_num_tokens": 243302.0, "epoch": 1.3178807947019868, "step": 100}
{"loss": 0.05997655391693115, "grad_norm": 0.8448278307914734, "learning_rate": 0.00011609756097560975, "entropy": 0.059745849709725005, "mean_token_accuracy": 0.9757732450962067, "num_tokens": 267729.0, "epoch": 1.4503311258278146, "step": 110}
{"eval_loss": 1.0053564310073853, "eval_runtime": 18.5889, "eval_samples_per_second": 8.069, "eval_steps_per_second": 2.044, "eval_entropy": 0.1515295450931023, "eval_mean_token_accuracy": 0.7930451168825752, "eval_num_tokens": 267729.0, "epoch": 1.4503311258278146, "step": 110}
{"loss": 0.09714307785034179, "grad_norm": 1.3731671571731567, "learning_rate": 0.00010634146341463416, "entropy": 0.05799857659148984, "mean_token_accuracy": 0.9786460787057877, "num_tokens": 292279.0, "epoch": 1.5827814569536423, "step": 120}
{"eval_loss": 1.0419341325759888, "eval_runtime": 18.599, "eval_samples_per_second": 8.065, "eval_steps_per_second": 2.043, "eval_entropy": 0.1506052642852362, "eval_mean_token_accuracy": 0.8096178001479098, "eval_num_tokens": 292279.0, "epoch": 1.5827814569536423, "step": 120}
{"loss": 0.08905421495437622, "grad_norm": 1.5181751251220703, "learning_rate": 9.658536585365854e-05, "entropy": 0.07750182251329533, "mean_token_accuracy": 0.9682142049074173, "num_tokens": 316471.0, "epoch": 1.7152317880794703, "step": 130}
{"eval_loss": 0.9100268483161926, "eval_runtime": 18.6615, "eval_samples_per_second": 8.038, "eval_steps_per_second": 2.036, "eval_entropy": 0.18898500283524444, "eval_mean_token_accuracy": 0.8068765715548867, "eval_num_tokens": 316471.0, "epoch": 1.7152317880794703, "step": 130}
{"loss": 0.028749734163284302, "grad_norm": 0.2840723693370819, "learning_rate": 8.682926829268293e-05, "entropy": 0.06592260235920548, "mean_token_accuracy": 0.9961842104792595, "num_tokens": 340856.0, "epoch": 1.847682119205298, "step": 140}
{"eval_loss": 1.0337369441986084, "eval_runtime": 18.9606, "eval_samples_per_second": 7.911, "eval_steps_per_second": 2.004, "eval_entropy": 0.1587749811036414, "eval_mean_token_accuracy": 0.8231829624426993, "eval_num_tokens": 340856.0, "epoch": 1.847682119205298, "step": 140}
{"loss": 0.031157472729682924, "grad_norm": 0.0719650536775589, "learning_rate": 7.707317073170732e-05, "entropy": 0.027841030294075607, "mean_token_accuracy": 0.9886389657855034, "num_tokens": 364928.0, "epoch": 1.980132450331126, "step": 150}
{"eval_loss": 1.093207597732544, "eval_runtime": 18.7522, "eval_samples_per_second": 7.999, "eval_steps_per_second": 2.026, "eval_entropy": 0.14133616881812677, "eval_mean_token_accuracy": 0.8247493787815696, "eval_num_tokens": 364928.0, "epoch": 1.980132450331126, "step": 150}
{"loss": 0.010752036422491073, "grad_norm": 0.0857713371515274, "learning_rate": 6.731707317073171e-05, "entropy": 0.02073765617464424, "mean_token_accuracy": 0.9960960087023283, "num_tokens": 387571.0, "epoch": 2.1059602649006623, "step": 160}
{"eval_loss": 1.206086277961731, "eval_runtime": 19.2832, "eval_samples_per_second": 7.779, "eval_steps_per_second": 1.971, "eval_entropy": 0.11423629041344516, "eval_mean_token_accuracy": 0.8181704314131486, "eval_num_tokens": 387571.0, "epoch": 2.1059602649006623, "step": 160}
{"loss": 0.006982241570949554, "grad_norm": 0.07292219996452332, "learning_rate": 5.756097560975609e-05, "entropy": 0.012754761859105202, "mean_token_accuracy": 0.9949396684765816, "num_tokens": 412476.0, "epoch": 2.23841059602649, "step": 170}
{"eval_loss": 1.3100497722625732, "eval_runtime": 18.5755, "eval_samples_per_second": 8.075, "eval_steps_per_second": 2.046, "eval_entropy": 0.10171815007925034, "eval_mean_token_accuracy": 0.8137844675465634, "eval_num_tokens": 412476.0, "epoch": 2.23841059602649, "step": 170}
{"loss": 0.006335002928972244, "grad_norm": 0.14538367092609406, "learning_rate": 4.7804878048780485e-05, "entropy": 0.009691098683106247, "mean_token_accuracy": 0.9959935903549194, "num_tokens": 436969.0, "epoch": 2.370860927152318, "step": 180}
{"eval_loss": 1.2651771306991577, "eval_runtime": 18.6772, "eval_samples_per_second": 8.031, "eval_steps_per_second": 2.035, "eval_entropy": 0.12055248577349917, "eval_mean_token_accuracy": 0.8012531391884151, "eval_num_tokens": 436969.0, "epoch": 2.370860927152318, "step": 180}
{"loss": 0.01123659908771515, "grad_norm": 0.12023007124662399, "learning_rate": 3.804878048780488e-05, "entropy": 0.010964674533170182, "mean_token_accuracy": 0.9912500008940697, "num_tokens": 461400.0, "epoch": 2.5033112582781456, "step": 190}
{"eval_loss": 1.312994122505188, "eval_runtime": 18.5941, "eval_samples_per_second": 8.067, "eval_steps_per_second": 2.044, "eval_entropy": 0.11495978039640345, "eval_mean_token_accuracy": 0.7986215596136294, "eval_num_tokens": 461400.0, "epoch": 2.5033112582781456, "step": 190}
{"loss": 0.005846058949828148, "grad_norm": 0.009895045310258865, "learning_rate": 2.8292682926829267e-05, "entropy": 0.008657517316169105, "mean_token_accuracy": 0.9954380333423615, "num_tokens": 485443.0, "epoch": 2.6357615894039736, "step": 200}
{"eval_loss": 1.394866943359375, "eval_runtime": 19.2094, "eval_samples_per_second": 7.809, "eval_steps_per_second": 1.978, "eval_entropy": 0.11105594273095976, "eval_mean_token_accuracy": 0.7986215596136294, "eval_num_tokens": 485443.0, "epoch": 2.6357615894039736, "step": 200}
{"loss": 0.001968498528003693, "grad_norm": 0.007106007542461157, "learning_rate": 1.853658536585366e-05, "entropy": 0.0046002456918358805, "mean_token_accuracy": 1.0, "num_tokens": 509990.0, "epoch": 2.7682119205298013, "step": 210}
{"eval_loss": 1.4095346927642822, "eval_runtime": 18.5725, "eval_samples_per_second": 8.076, "eval_steps_per_second": 2.046, "eval_entropy": 0.10769117351523355, "eval_mean_token_accuracy": 0.7986215596136294, "eval_num_tokens": 509990.0, "epoch": 2.7682119205298013, "step": 210}
{"loss": 0.009649304300546646, "grad_norm": 0.004330737981945276, "learning_rate": 8.780487804878048e-06, "entropy": 0.010914272570880712, "mean_token_accuracy": 0.9914425507187843, "num_tokens": 534335.0, "epoch": 2.9006622516556293, "step": 220}
{"eval_loss": 1.4074745178222656, "eval_runtime": 18.5545, "eval_samples_per_second": 8.084, "eval_steps_per_second": 2.048, "eval_entropy": 0.10394712408551161, "eval_mean_token_accuracy": 0.7986215596136294, "eval_num_tokens": 534335.0, "epoch": 2.9006622516556293, "step": 220}
{"eval_loss": 1.409055471420288, "eval_runtime": 18.6538, "eval_samples_per_second": 8.041, "eval_steps_per_second": 2.037, "eval_entropy": 0.1042155110664776, "eval_mean_token_accuracy": 0.7986215596136294, "eval_num_tokens": 552465.0, "epoch": 3.0, "step": 228}
{"train_runtime": 2730.2056, "train_samples_per_second": 1.325, "train_steps_per_second": 0.084, "total_flos": 1.0255950753859584e+17, "train_loss": 0.3106330657426856, "epoch": 3.0, "step": 228}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.14.1 |
| trl | 1.9.2 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.2 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.0 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |