Views
No views yet
| Parameter | Value |
|---|---|
| LoRA rank | 16 |
| LoRA alpha | 32 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 4 |
| Gradient accumulation | 4 |
| Epochs | 3 |
| Max seq length | 1024 |
| Warmup ratio | 0.1 |
| Dtype | bf16 |
{"loss": 4.137715148925781, "grad_norm": 3.578164577484131, "learning_rate": 7.82608695652174e-05, "entropy": 1.108377468585968, "mean_token_accuracy": 0.4547427803277969, "num_tokens": 24649.0, "epoch": 0.13245033112582782, "step": 10}
{"eval_loss": 0.47979146242141724, "eval_runtime": 8.6283, "eval_samples_per_second": 17.385, "eval_steps_per_second": 4.404, "eval_entropy": 0.5136331641360333, "eval_mean_token_accuracy": 0.8476190496432153, "eval_num_tokens": 24649.0, "epoch": 0.13245033112582782, "step": 10}
{"loss": 0.29046063423156737, "grad_norm": 5.299753189086914, "learning_rate": 0.00016521739130434784, "entropy": 0.3298689903691411, "mean_token_accuracy": 0.8826262801885605, "num_tokens": 48980.0, "epoch": 0.26490066225165565, "step": 20}
{"eval_loss": 0.34851008653640747, "eval_runtime": 8.767, "eval_samples_per_second": 17.11, "eval_steps_per_second": 4.334, "eval_entropy": 0.21605984268611983, "eval_mean_token_accuracy": 0.8467261932398144, "eval_num_tokens": 48980.0, "epoch": 0.26490066225165565, "step": 20}
{"loss": 0.22352590560913085, "grad_norm": 5.225202560424805, "learning_rate": 0.00019414634146341464, "entropy": 0.18189044557511808, "mean_token_accuracy": 0.9112017184495926, "num_tokens": 73206.0, "epoch": 0.3973509933774834, "step": 30}
{"eval_loss": 0.39393797516822815, "eval_runtime": 8.8316, "eval_samples_per_second": 16.984, "eval_steps_per_second": 4.303, "eval_entropy": 0.22758272807358912, "eval_mean_token_accuracy": 0.8529605285117501, "eval_num_tokens": 73206.0, "epoch": 0.3973509933774834, "step": 30}
{"loss": 0.2083740472793579, "grad_norm": 2.5306382179260254, "learning_rate": 0.00018439024390243903, "entropy": 0.15804960038512944, "mean_token_accuracy": 0.9105144232511521, "num_tokens": 97155.0, "epoch": 0.5298013245033113, "step": 40}
{"eval_loss": 0.3582124710083008, "eval_runtime": 8.8451, "eval_samples_per_second": 16.959, "eval_steps_per_second": 4.296, "eval_entropy": 0.1967227415359383, "eval_mean_token_accuracy": 0.906077692383214, "eval_num_tokens": 97155.0, "epoch": 0.5298013245033113, "step": 40}
{"loss": 0.11426657438278198, "grad_norm": 0.5601229667663574, "learning_rate": 0.00017463414634146342, "entropy": 0.1300681948196143, "mean_token_accuracy": 0.9546462342143058, "num_tokens": 121379.0, "epoch": 0.6622516556291391, "step": 50}
{"eval_loss": 0.31629678606987, "eval_runtime": 8.8533, "eval_samples_per_second": 16.943, "eval_steps_per_second": 4.292, "eval_entropy": 0.1454015489710544, "eval_mean_token_accuracy": 0.9043233112285012, "eval_num_tokens": 121379.0, "epoch": 0.6622516556291391, "step": 50}
{"loss": 0.1124344825744629, "grad_norm": 1.4530612230300903, "learning_rate": 0.00016487804878048782, "entropy": 0.07413667796645314, "mean_token_accuracy": 0.975075577199459, "num_tokens": 145565.0, "epoch": 0.7947019867549668, "step": 60}
{"eval_loss": 0.31900450587272644, "eval_runtime": 8.9346, "eval_samples_per_second": 16.789, "eval_steps_per_second": 4.253, "eval_entropy": 0.13950603828370253, "eval_mean_token_accuracy": 0.9029761929261056, "eval_num_tokens": 145565.0, "epoch": 0.7947019867549668, "step": 60}
{"loss": 0.07377697229385376, "grad_norm": 0.5243533253669739, "learning_rate": 0.0001551219512195122, "entropy": 0.04959495570510626, "mean_token_accuracy": 0.9868653029203415, "num_tokens": 170619.0, "epoch": 0.9271523178807947, "step": 70}
{"eval_loss": 0.47314128279685974, "eval_runtime": 8.8729, "eval_samples_per_second": 16.905, "eval_steps_per_second": 4.283, "eval_entropy": 0.11197341426189891, "eval_mean_token_accuracy": 0.8637531352670569, "eval_num_tokens": 170619.0, "epoch": 0.9271523178807947, "step": 70}
{"loss": 0.03286294937133789, "grad_norm": 0.5723479986190796, "learning_rate": 0.0001453658536585366, "entropy": 0.04651820704365443, "mean_token_accuracy": 0.9799541470251585, "num_tokens": 193723.0, "epoch": 1.0529801324503312, "step": 80}
{"eval_loss": 0.4713692367076874, "eval_runtime": 8.8337, "eval_samples_per_second": 16.98, "eval_steps_per_second": 4.302, "eval_entropy": 0.08497535785978758, "eval_mean_token_accuracy": 0.8823934856214022, "eval_num_tokens": 193723.0, "epoch": 1.0529801324503312, "step": 80}
{"loss": 0.03750455379486084, "grad_norm": 0.6608796715736389, "learning_rate": 0.000135609756097561, "entropy": 0.02709558209753595, "mean_token_accuracy": 0.9883466333150863, "num_tokens": 218578.0, "epoch": 1.185430463576159, "step": 90}
{"eval_loss": 0.7097430229187012, "eval_runtime": 8.7627, "eval_samples_per_second": 17.118, "eval_steps_per_second": 4.337, "eval_entropy": 0.08488526922347343, "eval_mean_token_accuracy": 0.876911030003899, "eval_num_tokens": 218578.0, "epoch": 1.185430463576159, "step": 90}
{"loss": 0.04708841741085053, "grad_norm": 0.011745394207537174, "learning_rate": 0.00012585365853658536, "entropy": 0.036736444372218104, "mean_token_accuracy": 0.986753235757351, "num_tokens": 243328.0, "epoch": 1.3178807947019868, "step": 100}
{"eval_loss": 0.5288086533546448, "eval_runtime": 8.8325, "eval_samples_per_second": 16.983, "eval_steps_per_second": 4.302, "eval_entropy": 0.09432978304577869, "eval_mean_token_accuracy": 0.9216478717954535, "eval_num_tokens": 243328.0, "epoch": 1.3178807947019868, "step": 100}
{"loss": 0.01708022356033325, "grad_norm": 0.1503247767686844, "learning_rate": 0.00011609756097560975, "entropy": 0.023959319648565725, "mean_token_accuracy": 0.9951785698533058, "num_tokens": 267754.0, "epoch": 1.4503311258278146, "step": 110}
{"eval_loss": 0.6275109648704529, "eval_runtime": 8.8195, "eval_samples_per_second": 17.008, "eval_steps_per_second": 4.309, "eval_entropy": 0.08617604082591195, "eval_mean_token_accuracy": 0.882471806124637, "eval_num_tokens": 267754.0, "epoch": 1.4503311258278146, "step": 110}
{"loss": 0.03441386520862579, "grad_norm": 0.05452306568622589, "learning_rate": 0.00010634146341463416, "entropy": 0.023857683854294008, "mean_token_accuracy": 0.9934226185083389, "num_tokens": 292285.0, "epoch": 1.5827814569536423, "step": 120}
{"eval_loss": 0.4466598629951477, "eval_runtime": 8.8826, "eval_samples_per_second": 16.887, "eval_steps_per_second": 4.278, "eval_entropy": 0.09836453814090132, "eval_mean_token_accuracy": 0.8980576458730196, "eval_num_tokens": 292285.0, "epoch": 1.5827814569536423, "step": 120}
{"loss": 0.02712029218673706, "grad_norm": 0.3573029041290283, "learning_rate": 9.658536585365854e-05, "entropy": 0.02442039727466181, "mean_token_accuracy": 0.9883611872792244, "num_tokens": 316466.0, "epoch": 1.7152317880794703, "step": 130}
{"eval_loss": 0.4627215564250946, "eval_runtime": 8.8415, "eval_samples_per_second": 16.965, "eval_steps_per_second": 4.298, "eval_entropy": 0.09049836356280139, "eval_mean_token_accuracy": 0.9029135358961005, "eval_num_tokens": 316466.0, "epoch": 1.7152317880794703, "step": 130}
{"loss": 0.0053515095263719555, "grad_norm": 0.16909706592559814, "learning_rate": 8.682926829268293e-05, "entropy": 0.009377326293906663, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 340861.0, "epoch": 1.847682119205298, "step": 140}
{"eval_loss": 0.5036122798919678, "eval_runtime": 8.8835, "eval_samples_per_second": 16.885, "eval_steps_per_second": 4.278, "eval_entropy": 0.07626265965135597, "eval_mean_token_accuracy": 0.908944236604791, "eval_num_tokens": 340861.0, "epoch": 1.847682119205298, "step": 140}
{"loss": 0.024126440286636353, "grad_norm": 0.2385103851556778, "learning_rate": 7.707317073170732e-05, "entropy": 0.009928701985336375, "mean_token_accuracy": 0.9911177963018417, "num_tokens": 364933.0, "epoch": 1.980132450331126, "step": 150}
{"eval_loss": 0.4761695861816406, "eval_runtime": 8.8152, "eval_samples_per_second": 17.016, "eval_steps_per_second": 4.311, "eval_entropy": 0.07504772339588701, "eval_mean_token_accuracy": 0.9286967421832838, "eval_num_tokens": 364933.0, "epoch": 1.980132450331126, "step": 150}
{"loss": 0.009099118411540985, "grad_norm": 0.004047279246151447, "learning_rate": 6.731707317073171e-05, "entropy": 0.011489493390974147, "mean_token_accuracy": 0.996600877297552, "num_tokens": 387577.0, "epoch": 2.1059602649006623, "step": 160}
{"eval_loss": 0.5329549908638, "eval_runtime": 8.8205, "eval_samples_per_second": 17.006, "eval_steps_per_second": 4.308, "eval_entropy": 0.07921461634731186, "eval_mean_token_accuracy": 0.8907268188501659, "eval_num_tokens": 387577.0, "epoch": 2.1059602649006623, "step": 160}
{"loss": 0.008338786661624908, "grad_norm": 0.08880332857370377, "learning_rate": 5.756097560975609e-05, "entropy": 0.010476558250229574, "mean_token_accuracy": 0.9953002452850341, "num_tokens": 412473.0, "epoch": 2.23841059602649, "step": 170}
{"eval_loss": 0.6161889433860779, "eval_runtime": 8.8016, "eval_samples_per_second": 17.042, "eval_steps_per_second": 4.317, "eval_entropy": 0.06489291446958209, "eval_mean_token_accuracy": 0.8922619066740337, "eval_num_tokens": 412473.0, "epoch": 2.23841059602649, "step": 170}
{"loss": 0.030521836876869202, "grad_norm": 0.12691327929496765, "learning_rate": 4.7804878048780485e-05, "entropy": 0.007891324193406036, "mean_token_accuracy": 0.9894906118512153, "num_tokens": 436968.0, "epoch": 2.370860927152318, "step": 180}
{"eval_loss": 0.5923683643341064, "eval_runtime": 8.8241, "eval_samples_per_second": 16.999, "eval_steps_per_second": 4.306, "eval_entropy": 0.08000879909578591, "eval_mean_token_accuracy": 0.8867794510565306, "eval_num_tokens": 436968.0, "epoch": 2.370860927152318, "step": 180}
{"loss": 0.008349917083978652, "grad_norm": 0.1538800746202469, "learning_rate": 3.804878048780488e-05, "entropy": 0.009203472785884514, "mean_token_accuracy": 0.9967708334326744, "num_tokens": 461406.0, "epoch": 2.5033112582781456, "step": 190}
{"eval_loss": 0.5923483371734619, "eval_runtime": 8.9101, "eval_samples_per_second": 16.835, "eval_steps_per_second": 4.265, "eval_entropy": 0.08169161927377756, "eval_mean_token_accuracy": 0.8845864675546947, "eval_num_tokens": 461406.0, "epoch": 2.5033112582781456, "step": 190}
{"loss": 0.008332868665456772, "grad_norm": 0.008859106339514256, "learning_rate": 2.8292682926829267e-05, "entropy": 0.01003202985812095, "mean_token_accuracy": 0.9947794124484062, "num_tokens": 485446.0, "epoch": 2.6357615894039736, "step": 200}
{"eval_loss": 0.6056787371635437, "eval_runtime": 8.8157, "eval_samples_per_second": 17.015, "eval_steps_per_second": 4.311, "eval_entropy": 0.07842601522727484, "eval_mean_token_accuracy": 0.8867794510565306, "eval_num_tokens": 485446.0, "epoch": 2.6357615894039736, "step": 200}
{"loss": 0.0068413645029067995, "grad_norm": 0.008693443611264229, "learning_rate": 1.853658536585366e-05, "entropy": 0.011400218316703103, "mean_token_accuracy": 0.9987499997019768, "num_tokens": 509991.0, "epoch": 2.7682119205298013, "step": 210}
{"eval_loss": 0.6019129157066345, "eval_runtime": 8.8158, "eval_samples_per_second": 17.015, "eval_steps_per_second": 4.31, "eval_entropy": 0.07929543261410513, "eval_mean_token_accuracy": 0.8867794510565306, "eval_num_tokens": 509991.0, "epoch": 2.7682119205298013, "step": 210}
{"loss": 0.00979231223464012, "grad_norm": 0.015315144322812557, "learning_rate": 8.780487804878048e-06, "entropy": 0.01070182620678679, "mean_token_accuracy": 0.9932142853736877, "num_tokens": 534331.0, "epoch": 2.9006622516556293, "step": 220}
{"eval_loss": 0.6030516624450684, "eval_runtime": 8.8199, "eval_samples_per_second": 17.007, "eval_steps_per_second": 4.308, "eval_entropy": 0.078918077561531, "eval_mean_token_accuracy": 0.8889724329898232, "eval_num_tokens": 534331.0, "epoch": 2.9006622516556293, "step": 220}
{"eval_loss": 0.6042520999908447, "eval_runtime": 8.8576, "eval_samples_per_second": 16.935, "eval_steps_per_second": 4.29, "eval_entropy": 0.0787776106948226, "eval_mean_token_accuracy": 0.8867794510565306, "eval_num_tokens": 552465.0, "epoch": 3.0, "step": 228}
{"train_runtime": 1089.7089, "train_samples_per_second": 3.32, "train_steps_per_second": 0.209, "total_flos": 3.17882517562368e+16, "train_loss": 0.23987276277815303, "epoch": 3.0, "step": 228}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.14.1 |
| trl | 1.9.2 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.2 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.0 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |