Views
No views yet
| Parameter | Value |
|---|---|
| LoRA rank | 16 |
| LoRA alpha | 32 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 4 |
| Gradient accumulation | 4 |
| Epochs | 3 |
| Max seq length | 1024 |
| Warmup ratio | |
| Dtype | bf16 |
{"loss": 4.444166564941407, "grad_norm": 9.206933975219727, "learning_rate": 7.500000000000001e-05, "entropy": 0.645375307276845, "mean_token_accuracy": 0.5346891149878502, "num_tokens": 24284.0, "epoch": 0.12987012987012986, "step": 10}
{"eval_loss": 0.451629102230072, "eval_runtime": 33.0695, "eval_samples_per_second": 8.346, "eval_steps_per_second": 2.087, "eval_entropy": 0.3446921180339827, "eval_mean_token_accuracy": 0.8707792871240256, "eval_num_tokens": 24284.0, "epoch": 0.12987012987012986, "step": 10}
{"loss": 0.3289835453033447, "grad_norm": 2.360955238342285, "learning_rate": 0.00015833333333333332, "entropy": 0.3251605603843927, "mean_token_accuracy": 0.8829290181398392, "num_tokens": 49006.0, "epoch": 0.2597402597402597, "step": 20}
{"eval_loss": 0.29662981629371643, "eval_runtime": 33.4819, "eval_samples_per_second": 8.243, "eval_steps_per_second": 2.061, "eval_entropy": 0.3327622462225997, "eval_mean_token_accuracy": 0.881530509478804, "eval_num_tokens": 49006.0, "epoch": 0.2597402597402597, "step": 20}
{"loss": 0.24044320583343506, "grad_norm": 2.1164023876190186, "learning_rate": 0.00019516908212560387, "entropy": 0.2279191999696195, "mean_token_accuracy": 0.9140091925859452, "num_tokens": 72913.0, "epoch": 0.38961038961038963, "step": 30}
{"eval_loss": 0.26802772283554077, "eval_runtime": 32.6079, "eval_samples_per_second": 8.464, "eval_steps_per_second": 2.116, "eval_entropy": 0.15703444269931185, "eval_mean_token_accuracy": 0.9062135115913723, "eval_num_tokens": 72913.0, "epoch": 0.38961038961038963, "step": 30}
{"loss": 0.16023241281509398, "grad_norm": 0.8614342212677002, "learning_rate": 0.0001855072463768116, "entropy": 0.1531456507742405, "mean_token_accuracy": 0.9284332767128944, "num_tokens": 97047.0, "epoch": 0.5194805194805194, "step": 40}
{"eval_loss": 0.18666386604309082, "eval_runtime": 32.6805, "eval_samples_per_second": 8.445, "eval_steps_per_second": 2.111, "eval_entropy": 0.11728924472370873, "eval_mean_token_accuracy": 0.9361781754355499, "eval_num_tokens": 97047.0, "epoch": 0.5194805194805194, "step": 40}
{"loss": 0.1677055239677429, "grad_norm": 0.9515531659126282, "learning_rate": 0.00017584541062801935, "entropy": 0.1268852840177715, "mean_token_accuracy": 0.9482691943645477, "num_tokens": 121400.0, "epoch": 0.6493506493506493, "step": 50}
{"eval_loss": 0.15643401443958282, "eval_runtime": 32.7918, "eval_samples_per_second": 8.417, "eval_steps_per_second": 2.104, "eval_entropy": 0.13549835083034376, "eval_mean_token_accuracy": 0.9432093345600626, "eval_num_tokens": 121400.0, "epoch": 0.6493506493506493, "step": 50}
{"loss": 0.14309800863265992, "grad_norm": 0.7371547222137451, "learning_rate": 0.00016618357487922707, "entropy": 0.11503846868872643, "mean_token_accuracy": 0.9464323207736015, "num_tokens": 146373.0, "epoch": 0.7792207792207793, "step": 60}
{"eval_loss": 0.10929129272699356, "eval_runtime": 32.9842, "eval_samples_per_second": 8.368, "eval_steps_per_second": 2.092, "eval_entropy": 0.0864130747605763, "eval_mean_token_accuracy": 0.9645158493000529, "eval_num_tokens": 146373.0, "epoch": 0.7792207792207793, "step": 60}
{"loss": 0.0831656813621521, "grad_norm": 0.07884837687015533, "learning_rate": 0.0001565217391304348, "entropy": 0.076457205042243, "mean_token_accuracy": 0.9766758978366852, "num_tokens": 170780.0, "epoch": 0.9090909090909091, "step": 70}
{"eval_loss": 0.08916809409856796, "eval_runtime": 32.6719, "eval_samples_per_second": 8.448, "eval_steps_per_second": 2.112, "eval_entropy": 0.0845634756926987, "eval_mean_token_accuracy": 0.965032822843911, "eval_num_tokens": 170780.0, "epoch": 0.9090909090909091, "step": 70}
{"loss": 0.0635761559009552, "grad_norm": 0.20769323408603668, "learning_rate": 0.00014685990338164252, "entropy": 0.07077853010268882, "mean_token_accuracy": 0.9771196991205215, "num_tokens": 195197.0, "epoch": 1.0389610389610389, "step": 80}
{"eval_loss": 0.0882432609796524, "eval_runtime": 32.5857, "eval_samples_per_second": 8.47, "eval_steps_per_second": 2.117, "eval_entropy": 0.0704611960960471, "eval_mean_token_accuracy": 0.9634385411290155, "eval_num_tokens": 195197.0, "epoch": 1.0389610389610389, "step": 80}
{"loss": 0.0466880202293396, "grad_norm": 1.0741468667984009, "learning_rate": 0.00013719806763285024, "entropy": 0.03993943954119459, "mean_token_accuracy": 0.9830787390470505, "num_tokens": 219592.0, "epoch": 1.1688311688311688, "step": 90}
{"eval_loss": 0.18396520614624023, "eval_runtime": 32.5719, "eval_samples_per_second": 8.474, "eval_steps_per_second": 2.118, "eval_entropy": 0.04608783381695832, "eval_mean_token_accuracy": 0.9462843839673029, "eval_num_tokens": 219592.0, "epoch": 1.1688311688311688, "step": 90}
{"loss": 0.02537091076374054, "grad_norm": 1.0321540832519531, "learning_rate": 0.00012753623188405797, "entropy": 0.033436382675427014, "mean_token_accuracy": 0.9880836084485054, "num_tokens": 244226.0, "epoch": 1.2987012987012987, "step": 100}
{"eval_loss": 0.07381325215101242, "eval_runtime": 32.6039, "eval_samples_per_second": 8.465, "eval_steps_per_second": 2.116, "eval_entropy": 0.03137723067049882, "eval_mean_token_accuracy": 0.9829617790553881, "eval_num_tokens": 244226.0, "epoch": 1.2987012987012987, "step": 100}
{"loss": 0.02989010512828827, "grad_norm": 0.12283733487129211, "learning_rate": 0.00011787439613526569, "entropy": 0.038492675751331265, "mean_token_accuracy": 0.9910216420888901, "num_tokens": 268323.0, "epoch": 1.4285714285714286, "step": 110}
{"eval_loss": 0.09795603901147842, "eval_runtime": 32.725, "eval_samples_per_second": 8.434, "eval_steps_per_second": 2.108, "eval_entropy": 0.03620950896478514, "eval_mean_token_accuracy": 0.9726314933403678, "eval_num_tokens": 268323.0, "epoch": 1.4285714285714286, "step": 110}
{"loss": 0.017630048096179962, "grad_norm": 0.04150259494781494, "learning_rate": 0.00010821256038647343, "entropy": 0.01461837078386452, "mean_token_accuracy": 0.9932072132825851, "num_tokens": 292572.0, "epoch": 1.5584415584415585, "step": 120}
{"eval_loss": 0.020643606781959534, "eval_runtime": 32.7328, "eval_samples_per_second": 8.432, "eval_steps_per_second": 2.108, "eval_entropy": 0.02241724077359085, "eval_mean_token_accuracy": 0.9898033530815787, "eval_num_tokens": 292572.0, "epoch": 1.5584415584415585, "step": 120}
{"loss": 0.04183124005794525, "grad_norm": 0.2082831859588623, "learning_rate": 9.855072463768117e-05, "entropy": 0.013634643987461458, "mean_token_accuracy": 0.9884266763925552, "num_tokens": 317071.0, "epoch": 1.6883116883116882, "step": 130}
{"eval_loss": 0.020377736538648605, "eval_runtime": 32.7497, "eval_samples_per_second": 8.428, "eval_steps_per_second": 2.107, "eval_entropy": 0.022070893675529234, "eval_mean_token_accuracy": 0.9908168989679088, "eval_num_tokens": 317071.0, "epoch": 1.6883116883116882, "step": 130}
{"loss": 0.024335066974163055, "grad_norm": 0.12890857458114624, "learning_rate": 8.888888888888889e-05, "entropy": 0.03231137808907079, "mean_token_accuracy": 0.9862666994333267, "num_tokens": 341393.0, "epoch": 1.8181818181818183, "step": 140}
{"eval_loss": 0.011884532868862152, "eval_runtime": 32.6255, "eval_samples_per_second": 8.46, "eval_steps_per_second": 2.115, "eval_entropy": 0.02783753815975101, "eval_mean_token_accuracy": 0.9965915187545444, "eval_num_tokens": 341393.0, "epoch": 1.8181818181818183, "step": 140}
{"loss": 0.006625840812921524, "grad_norm": 0.02266734652221203, "learning_rate": 7.922705314009662e-05, "entropy": 0.017742845352040605, "mean_token_accuracy": 1.0, "num_tokens": 365798.0, "epoch": 1.948051948051948, "step": 150}
{"eval_loss": 0.007537568919360638, "eval_runtime": 32.5761, "eval_samples_per_second": 8.472, "eval_steps_per_second": 2.118, "eval_entropy": 0.01751432842127911, "eval_mean_token_accuracy": 0.9982018246166948, "eval_num_tokens": 365798.0, "epoch": 1.948051948051948, "step": 150}
{"loss": 0.008044324815273285, "grad_norm": 0.09755880385637283, "learning_rate": 6.956521739130436e-05, "entropy": 0.0103861581577803, "mean_token_accuracy": 0.9963573709130287, "num_tokens": 389705.0, "epoch": 2.0779220779220777, "step": 160}
{"eval_loss": 0.00781114399433136, "eval_runtime": 32.7505, "eval_samples_per_second": 8.427, "eval_steps_per_second": 2.107, "eval_entropy": 0.013823693011954016, "eval_mean_token_accuracy": 0.9965915187545444, "eval_num_tokens": 389705.0, "epoch": 2.0779220779220777, "step": 160}
{"loss": 0.010857760906219482, "grad_norm": 0.09806662052869797, "learning_rate": 5.990338164251208e-05, "entropy": 0.014656537261362245, "mean_token_accuracy": 0.9903375238180161, "num_tokens": 413692.0, "epoch": 2.207792207792208, "step": 170}
{"eval_loss": 0.006243611685931683, "eval_runtime": 32.5503, "eval_samples_per_second": 8.479, "eval_steps_per_second": 2.12, "eval_entropy": 0.011874454250652849, "eval_mean_token_accuracy": 0.9982018246166948, "eval_num_tokens": 413692.0, "epoch": 2.207792207792208, "step": 170}
{"loss": 0.005728444084525108, "grad_norm": 0.0031313085928559303, "learning_rate": 5.024154589371981e-05, "entropy": 0.006722149976121727, "mean_token_accuracy": 0.9956699341535569, "num_tokens": 438398.0, "epoch": 2.3376623376623376, "step": 180}
{"eval_loss": 0.005972334183752537, "eval_runtime": 32.5383, "eval_samples_per_second": 8.482, "eval_steps_per_second": 2.121, "eval_entropy": 0.010665633526725182, "eval_mean_token_accuracy": 0.9982018246166948, "eval_num_tokens": 438398.0, "epoch": 2.3376623376623376, "step": 180}
{"loss": 0.004393152520060539, "grad_norm": 0.02150188758969307, "learning_rate": 4.057971014492754e-05, "entropy": 0.007234718959080055, "mean_token_accuracy": 1.0, "num_tokens": 463186.0, "epoch": 2.4675324675324677, "step": 190}
{"eval_loss": 0.005621384363621473, "eval_runtime": 32.6312, "eval_samples_per_second": 8.458, "eval_steps_per_second": 2.115, "eval_entropy": 0.009864209615034928, "eval_mean_token_accuracy": 0.9980139559593754, "eval_num_tokens": 463186.0, "epoch": 2.4675324675324677, "step": 190}
{"loss": 0.004904188960790634, "grad_norm": 0.0213631521910429, "learning_rate": 3.0917874396135266e-05, "entropy": 0.006359850597800687, "mean_token_accuracy": 0.9969669118523597, "num_tokens": 486550.0, "epoch": 2.5974025974025974, "step": 200}
{"eval_loss": 0.005406329408288002, "eval_runtime": 32.8273, "eval_samples_per_second": 8.408, "eval_steps_per_second": 2.102, "eval_entropy": 0.009203516716640308, "eval_mean_token_accuracy": 0.9980139559593754, "eval_num_tokens": 486550.0, "epoch": 2.5974025974025974, "step": 200}
{"loss": 0.006159796193242073, "grad_norm": 0.0886092483997345, "learning_rate": 2.1256038647342997e-05, "entropy": 0.005853421265783254, "mean_token_accuracy": 0.9961106598377227, "num_tokens": 511253.0, "epoch": 2.7272727272727275, "step": 210}
{"eval_loss": 0.005450766999274492, "eval_runtime": 32.5522, "eval_samples_per_second": 8.479, "eval_steps_per_second": 2.12, "eval_entropy": 0.009032139660490246, "eval_mean_token_accuracy": 0.9974771867627683, "eval_num_tokens": 511253.0, "epoch": 2.7272727272727275, "step": 210}
{"loss": 0.005591617897152901, "grad_norm": 0.118864506483078, "learning_rate": 1.1594202898550725e-05, "entropy": 0.005896643756204867, "mean_token_accuracy": 0.9965001910924911, "num_tokens": 536143.0, "epoch": 2.857142857142857, "step": 220}
{"eval_loss": 0.005338566843420267, "eval_runtime": 32.7104, "eval_samples_per_second": 8.438, "eval_steps_per_second": 2.109, "eval_entropy": 0.008958659966795138, "eval_mean_token_accuracy": 0.9982018246166948, "eval_num_tokens": 536143.0, "epoch": 2.857142857142857, "step": 220}
{"loss": 0.007001098245382309, "grad_norm": 0.15580545365810394, "learning_rate": 1.932367149758454e-06, "entropy": 0.0064674134848246466, "mean_token_accuracy": 0.9956890314817428, "num_tokens": 560446.0, "epoch": 2.987012987012987, "step": 230}
{"eval_loss": 0.005391938611865044, "eval_runtime": 32.5477, "eval_samples_per_second": 8.48, "eval_steps_per_second": 2.12, "eval_entropy": 0.008932408023162903, "eval_mean_token_accuracy": 0.9982018246166948, "eval_num_tokens": 560446.0, "epoch": 2.987012987012987, "step": 230}
{"eval_loss": 0.005437243729829788, "eval_runtime": 32.4662, "eval_samples_per_second": 8.501, "eval_steps_per_second": 2.125, "eval_entropy": 0.008915785484334818, "eval_mean_token_accuracy": 0.9982018246166948, "eval_num_tokens": 562590.0, "epoch": 3.0, "step": 231}
{"train_runtime": 3163.4065, "train_samples_per_second": 1.166, "train_steps_per_second": 0.073, "total_flos": 1.051141028788224e+17, "train_loss": 0.25439085107353654, "epoch": 3.0, "step": 231}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.15.0 |
| trl | 1.10.0 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.2 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.0 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |