Views
No views yet
finetune_config.json):finetune.py --model Qwen/Qwen3.8-27B --dataset sampled_response --subpopulation overall --upload-to-hf --lora-r 128 --lora-alpha 248 --batch-size 8 --gradient-accumulation-steps 2| Parameter | Value |
|---|---|
| LoRA rank | 128 |
| LoRA alpha | 248 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 8 |
| Gradient accumulation | 2 |
| Epochs | 3 |
| Max seq length | 1024 |
| Warmup ratio | |
| Dtype | bf16 |
| Trainable parameters (LoRA) | 637,534,208 |
| Adapter size on disk | 2,550,206,840 bytes |
{"loss": 0.5159638881683349, "grad_norm": 1.530214548110962, "learning_rate": 5.4545454545454546e-05, "entropy": 0.3735047049820423, "mean_token_accuracy": 0.813092178106308, "num_tokens": 24038.0, "epoch": 0.09302325581395349, "step": 10}
{"eval_loss": 0.4248459041118622, "eval_runtime": 19.298, "eval_samples_per_second": 15.183, "eval_steps_per_second": 1.917, "eval_entropy": 0.439275833853596, "eval_mean_token_accuracy": 0.8248945732374449, "eval_num_tokens": 24038.0, "epoch": 0.09302325581395349, "step": 10}
{"loss": 0.4119410037994385, "grad_norm": 3.49934458732605, "learning_rate": 0.00011515151515151516, "entropy": 0.36738512516021726, "mean_token_accuracy": 0.8477762341499329, "num_tokens": 47765.0, "epoch": 0.18604651162790697, "step": 20}
{"eval_loss": 0.4256972372531891, "eval_runtime": 19.5922, "eval_samples_per_second": 14.955, "eval_steps_per_second": 1.889, "eval_entropy": 0.2565292139613145, "eval_mean_token_accuracy": 0.8562391883618122, "eval_num_tokens": 47765.0, "epoch": 0.18604651162790697, "step": 20}
{"loss": 0.37042531967163084, "grad_norm": 2.29105281829834, "learning_rate": 0.00017575757575757578, "entropy": 0.3073122389614582, "mean_token_accuracy": 0.8490931391716003, "num_tokens": 71687.0, "epoch": 0.27906976744186046, "step": 30}
{"eval_loss": 0.4181455671787262, "eval_runtime": 19.6867, "eval_samples_per_second": 14.883, "eval_steps_per_second": 1.879, "eval_entropy": 0.4635183251387364, "eval_mean_token_accuracy": 0.8530157288989505, "eval_num_tokens": 71687.0, "epoch": 0.27906976744186046, "step": 30}
{"loss": 0.41306228637695314, "grad_norm": 3.1653518676757812, "learning_rate": 0.00019587628865979381, "entropy": 0.3064588434994221, "mean_token_accuracy": 0.8590908795595169, "num_tokens": 95548.0, "epoch": 0.37209302325581395, "step": 40}
{"eval_loss": 0.3788790702819824, "eval_runtime": 19.6081, "eval_samples_per_second": 14.943, "eval_steps_per_second": 1.887, "eval_entropy": 0.25199481583124883, "eval_mean_token_accuracy": 0.8776944617967348, "eval_num_tokens": 95548.0, "epoch": 0.37209302325581395, "step": 40}
{"loss": 0.324968957901001, "grad_norm": 0.9822137951850891, "learning_rate": 0.00018900343642611685, "entropy": 0.23558676354587077, "mean_token_accuracy": 0.882213893532753, "num_tokens": 119867.0, "epoch": 0.46511627906976744, "step": 50}
{"eval_loss": 0.40407902002334595, "eval_runtime": 19.9232, "eval_samples_per_second": 14.706, "eval_steps_per_second": 1.857, "eval_entropy": 0.22107659116689418, "eval_mean_token_accuracy": 0.8875100822062105, "eval_num_tokens": 119867.0, "epoch": 0.46511627906976744, "step": 50}
{"loss": 0.3504864454269409, "grad_norm": 3.1987922191619873, "learning_rate": 0.00018213058419243986, "entropy": 0.2799935773015022, "mean_token_accuracy": 0.8834393411874771, "num_tokens": 144381.0, "epoch": 0.5581395348837209, "step": 60}
{"eval_loss": 0.37815821170806885, "eval_runtime": 19.6045, "eval_samples_per_second": 14.946, "eval_steps_per_second": 1.887, "eval_entropy": 0.22328005600217227, "eval_mean_token_accuracy": 0.8975872107454248, "eval_num_tokens": 144381.0, "epoch": 0.5581395348837209, "step": 60}
{"loss": 0.30288422107696533, "grad_norm": 1.5142046213150024, "learning_rate": 0.0001752577319587629, "entropy": 0.2343510027974844, "mean_token_accuracy": 0.9052642017602921, "num_tokens": 168554.0, "epoch": 0.6511627906976745, "step": 70}
{"eval_loss": 0.2942861318588257, "eval_runtime": 20.05, "eval_samples_per_second": 14.613, "eval_steps_per_second": 1.845, "eval_entropy": 0.29279086084381956, "eval_mean_token_accuracy": 0.8928956002802462, "eval_num_tokens": 168554.0, "epoch": 0.6511627906976745, "step": 70}
{"loss": 0.2197200298309326, "grad_norm": 1.2334901094436646, "learning_rate": 0.00016838487972508593, "entropy": 0.18340204954147338, "mean_token_accuracy": 0.908824673295021, "num_tokens": 192065.0, "epoch": 0.7441860465116279, "step": 80}
{"eval_loss": 0.32606041431427, "eval_runtime": 19.643, "eval_samples_per_second": 14.916, "eval_steps_per_second": 1.884, "eval_entropy": 0.15489993173931096, "eval_mean_token_accuracy": 0.9198859511195002, "eval_num_tokens": 192065.0, "epoch": 0.7441860465116279, "step": 80}
{"loss": 0.2541114330291748, "grad_norm": 0.753905713558197, "learning_rate": 0.00016151202749140894, "entropy": 0.23240528292953969, "mean_token_accuracy": 0.930286294221878, "num_tokens": 216241.0, "epoch": 0.8372093023255814, "step": 90}
{"eval_loss": 0.26331689953804016, "eval_runtime": 19.7835, "eval_samples_per_second": 14.81, "eval_steps_per_second": 1.87, "eval_entropy": 0.2073945350743629, "eval_mean_token_accuracy": 0.9280025894577438, "eval_num_tokens": 216241.0, "epoch": 0.8372093023255814, "step": 90}
{"loss": 0.1675843119621277, "grad_norm": 0.7576951384544373, "learning_rate": 0.00015463917525773197, "entropy": 0.13087193612009287, "mean_token_accuracy": 0.9556289166212082, "num_tokens": 240226.0, "epoch": 0.9302325581395349, "step": 100}
{"eval_loss": 0.2995809316635132, "eval_runtime": 19.6033, "eval_samples_per_second": 14.946, "eval_steps_per_second": 1.887, "eval_entropy": 0.1141195641956418, "eval_mean_token_accuracy": 0.9431772087071393, "eval_num_tokens": 240226.0, "epoch": 0.9302325581395349, "step": 100}
{"loss": 0.19747004508972169, "grad_norm": 4.629343032836914, "learning_rate": 0.000147766323024055, "entropy": 0.12945637106895447, "mean_token_accuracy": 0.9548673316052085, "num_tokens": 261938.0, "epoch": 1.0186046511627906, "step": 110}
{"eval_loss": 0.35294172167778015, "eval_runtime": 19.7183, "eval_samples_per_second": 14.859, "eval_steps_per_second": 1.876, "eval_entropy": 0.13795686593732318, "eval_mean_token_accuracy": 0.9502010860958615, "eval_num_tokens": 261938.0, "epoch": 1.0186046511627906, "step": 110}
{"loss": 0.09366444945335388, "grad_norm": 0.7428712844848633, "learning_rate": 0.00014089347079037802, "entropy": 0.10753497732803226, "mean_token_accuracy": 0.9683742672204971, "num_tokens": 285963.0, "epoch": 1.1116279069767443, "step": 120}
{"eval_loss": 0.21211016178131104, "eval_runtime": 19.6865, "eval_samples_per_second": 14.883, "eval_steps_per_second": 1.879, "eval_entropy": 0.12404413747827749, "eval_mean_token_accuracy": 0.963455986332249, "eval_num_tokens": 285963.0, "epoch": 1.1116279069767443, "step": 120}
{"loss": 0.04479093551635742, "grad_norm": 1.125025749206543, "learning_rate": 0.00013402061855670103, "entropy": 0.052272117929533124, "mean_token_accuracy": 0.9797587931156159, "num_tokens": 310136.0, "epoch": 1.2046511627906977, "step": 130}
{"eval_loss": 0.24735595285892487, "eval_runtime": 19.7998, "eval_samples_per_second": 14.798, "eval_steps_per_second": 1.869, "eval_entropy": 0.045120439869729245, "eval_mean_token_accuracy": 0.9630486691320265, "eval_num_tokens": 310136.0, "epoch": 1.2046511627906977, "step": 130}
{"loss": 0.0937559425830841, "grad_norm": 1.167476773262024, "learning_rate": 0.00012714776632302406, "entropy": 0.038701755891088395, "mean_token_accuracy": 0.9760822474956512, "num_tokens": 333822.0, "epoch": 1.2976744186046512, "step": 140}
{"eval_loss": 0.2644186019897461, "eval_runtime": 19.6668, "eval_samples_per_second": 14.898, "eval_steps_per_second": 1.881, "eval_entropy": 0.04403869981399259, "eval_mean_token_accuracy": 0.9710400201178886, "eval_num_tokens": 333822.0, "epoch": 1.2976744186046512, "step": 140}
{"loss": 0.037709271907806395, "grad_norm": 0.8906442523002625, "learning_rate": 0.00012027491408934708, "entropy": 0.05498476852662861, "mean_token_accuracy": 0.9864881604909896, "num_tokens": 357619.0, "epoch": 1.3906976744186046, "step": 150}
{"eval_loss": 0.28617048263549805, "eval_runtime": 19.6983, "eval_samples_per_second": 14.874, "eval_steps_per_second": 1.878, "eval_entropy": 0.039071192650275456, "eval_mean_token_accuracy": 0.9703774226678384, "eval_num_tokens": 357619.0, "epoch": 1.3906976744186046, "step": 150}
{"loss": 0.08006892800331115, "grad_norm": 2.467890501022339, "learning_rate": 0.0001134020618556701, "entropy": 0.054009919380769135, "mean_token_accuracy": 0.9752343595027924, "num_tokens": 381886.0, "epoch": 1.483720930232558, "step": 160}
{"eval_loss": 0.24503904581069946, "eval_runtime": 19.7484, "eval_samples_per_second": 14.837, "eval_steps_per_second": 1.874, "eval_entropy": 0.04749998037476797, "eval_mean_token_accuracy": 0.970904300341735, "eval_num_tokens": 381886.0, "epoch": 1.483720930232558, "step": 160}
{"loss": 0.02613396942615509, "grad_norm": 0.1541912704706192, "learning_rate": 0.00010652920962199313, "entropy": 0.04129025526344776, "mean_token_accuracy": 0.9948111057281495, "num_tokens": 405398.0, "epoch": 1.5767441860465117, "step": 170}
{"eval_loss": 0.2503706216812134, "eval_runtime": 19.698, "eval_samples_per_second": 14.875, "eval_steps_per_second": 1.878, "eval_entropy": 0.02799694299559436, "eval_mean_token_accuracy": 0.971828734552538, "eval_num_tokens": 405398.0, "epoch": 1.5767441860465117, "step": 170}
{"loss": 0.03940140902996063, "grad_norm": 0.11992989480495453, "learning_rate": 9.965635738831616e-05, "entropy": 0.020252651511691512, "mean_token_accuracy": 0.9928339451551438, "num_tokens": 429824.0, "epoch": 1.669767441860465, "step": 180}
{"eval_loss": 0.27530911564826965, "eval_runtime": 19.7638, "eval_samples_per_second": 14.825, "eval_steps_per_second": 1.872, "eval_entropy": 0.025015428618251068, "eval_mean_token_accuracy": 0.9678192299765509, "eval_num_tokens": 429824.0, "epoch": 1.669767441860465, "step": 180}
{"loss": 0.001573542132973671, "grad_norm": 2.4151525497436523, "learning_rate": 9.278350515463918e-05, "entropy": 0.006463549612089991, "mean_token_accuracy": 1.0, "num_tokens": 453913.0, "epoch": 1.7627906976744185, "step": 190}
{"eval_loss": 0.30647027492523193, "eval_runtime": 19.8397, "eval_samples_per_second": 14.768, "eval_steps_per_second": 1.865, "eval_entropy": 0.019101105249688232, "eval_mean_token_accuracy": 0.9619782244836962, "eval_num_tokens": 453913.0, "epoch": 1.7627906976744185, "step": 190}
{"loss": 0.005226227268576622, "grad_norm": 0.005756889004260302, "learning_rate": 8.591065292096219e-05, "entropy": 0.009561520779971033, "mean_token_accuracy": 0.9982758611440659, "num_tokens": 478037.0, "epoch": 1.8558139534883722, "step": 200}
{"eval_loss": 0.33500707149505615, "eval_runtime": 19.7364, "eval_samples_per_second": 14.846, "eval_steps_per_second": 1.875, "eval_entropy": 0.01882232226843543, "eval_mean_token_accuracy": 0.9657866342647655, "eval_num_tokens": 478037.0, "epoch": 1.8558139534883722, "step": 200}
{"loss": 0.0031086793169379234, "grad_norm": 0.0039563910104334354, "learning_rate": 7.903780068728523e-05, "entropy": 0.003569585524383001, "mean_token_accuracy": 0.9977272719144821, "num_tokens": 502137.0, "epoch": 1.9488372093023256, "step": 210}
{"eval_loss": 0.24520333111286163, "eval_runtime": 19.7035, "eval_samples_per_second": 14.87, "eval_steps_per_second": 1.878, "eval_entropy": 0.020784921053721494, "eval_mean_token_accuracy": 0.9652637903754776, "eval_num_tokens": 502137.0, "epoch": 1.9488372093023256, "step": 210}
{"loss": 0.01605428457260132, "grad_norm": 0.003151198150590062, "learning_rate": 7.216494845360825e-05, "entropy": 0.003899197097205998, "mean_token_accuracy": 0.9939030252004925, "num_tokens": 524298.0, "epoch": 2.0372093023255813, "step": 220}
{"eval_loss": 0.2018781155347824, "eval_runtime": 19.6653, "eval_samples_per_second": 14.899, "eval_steps_per_second": 1.881, "eval_entropy": 0.01760401778911064, "eval_mean_token_accuracy": 0.9811306193068221, "eval_num_tokens": 524298.0, "epoch": 2.0372093023255813, "step": 220}
{"loss": 0.006631582975387573, "grad_norm": 0.3071659207344055, "learning_rate": 6.529209621993127e-05, "entropy": 0.006496289256028831, "mean_token_accuracy": 0.9966517865657807, "num_tokens": 548223.0, "epoch": 2.130232558139535, "step": 230}
{"eval_loss": 0.2034931182861328, "eval_runtime": 19.7592, "eval_samples_per_second": 14.829, "eval_steps_per_second": 1.873, "eval_entropy": 0.01622431564169961, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 548223.0, "epoch": 2.130232558139535, "step": 230}
{"loss": 0.01243293210864067, "grad_norm": 0.0035905782133340836, "learning_rate": 5.84192439862543e-05, "entropy": 0.0014529001200571656, "mean_token_accuracy": 0.9985294103622436, "num_tokens": 572322.0, "epoch": 2.2232558139534886, "step": 240}
{"eval_loss": 0.18294726312160492, "eval_runtime": 19.6494, "eval_samples_per_second": 14.911, "eval_steps_per_second": 1.883, "eval_entropy": 0.016045370027485833, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 572322.0, "epoch": 2.2232558139534886, "step": 240}
{"loss": 0.0009996910579502583, "grad_norm": 0.15491770207881927, "learning_rate": 5.1546391752577315e-05, "entropy": 0.003260598029009998, "mean_token_accuracy": 1.0, "num_tokens": 596325.0, "epoch": 2.316279069767442, "step": 250}
{"eval_loss": 0.1770322173833847, "eval_runtime": 19.9816, "eval_samples_per_second": 14.663, "eval_steps_per_second": 1.852, "eval_entropy": 0.015944633783137024, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 596325.0, "epoch": 2.316279069767442, "step": 250}
{"loss": 0.0045130085200071335, "grad_norm": 0.003933964297175407, "learning_rate": 4.467353951890035e-05, "entropy": 0.0051633947616210206, "mean_token_accuracy": 0.9983333319425582, "num_tokens": 620366.0, "epoch": 2.4093023255813955, "step": 260}
{"eval_loss": 0.1764458864927292, "eval_runtime": 19.6231, "eval_samples_per_second": 14.931, "eval_steps_per_second": 1.886, "eval_entropy": 0.015622706806155023, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 620366.0, "epoch": 2.4093023255813955, "step": 260}
{"loss": 0.011322809755802155, "grad_norm": 0.2023588865995407, "learning_rate": 3.7800687285223366e-05, "entropy": 0.00795689744700212, "mean_token_accuracy": 0.9917051166296005, "num_tokens": 644676.0, "epoch": 2.5023255813953487, "step": 270}
{"eval_loss": 0.1762348711490631, "eval_runtime": 19.598, "eval_samples_per_second": 14.95, "eval_steps_per_second": 1.888, "eval_entropy": 0.01575001038853205, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 644676.0, "epoch": 2.5023255813953487, "step": 270}
{"loss": 0.003857157751917839, "grad_norm": 0.11012840270996094, "learning_rate": 3.0927835051546395e-05, "entropy": 0.006212446672725492, "mean_token_accuracy": 0.9961481481790543, "num_tokens": 668762.0, "epoch": 2.5953488372093023, "step": 280}
{"eval_loss": 0.17648760974407196, "eval_runtime": 19.6076, "eval_samples_per_second": 14.943, "eval_steps_per_second": 1.887, "eval_entropy": 0.01549554371190056, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 668762.0, "epoch": 2.5953488372093023, "step": 280}
{"loss": 0.00021297484636306763, "grad_norm": 0.005922872107475996, "learning_rate": 2.4054982817869417e-05, "entropy": 0.002021011133911088, "mean_token_accuracy": 1.0, "num_tokens": 692140.0, "epoch": 2.688372093023256, "step": 290}
{"eval_loss": 0.177124485373497, "eval_runtime": 19.6445, "eval_samples_per_second": 14.915, "eval_steps_per_second": 1.883, "eval_entropy": 0.015336939471150824, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 692140.0, "epoch": 2.688372093023256, "step": 290}
{"loss": 0.0068933114409446715, "grad_norm": 0.0024047500919550657, "learning_rate": 1.7182130584192442e-05, "entropy": 0.007569711052929052, "mean_token_accuracy": 0.9938754200935364, "num_tokens": 716370.0, "epoch": 2.781395348837209, "step": 300}
{"eval_loss": 0.1783066838979721, "eval_runtime": 19.661, "eval_samples_per_second": 14.903, "eval_steps_per_second": 1.882, "eval_entropy": 0.015056857794391093, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 716370.0, "epoch": 2.781395348837209, "step": 300}
{"loss": 0.003029005788266659, "grad_norm": 0.0016119274077937007, "learning_rate": 1.0309278350515464e-05, "entropy": 0.0034084874161635524, "mean_token_accuracy": 0.9971690595149993, "num_tokens": 740204.0, "epoch": 2.874418604651163, "step": 310}
{"eval_loss": 0.1782124936580658, "eval_runtime": 19.6728, "eval_samples_per_second": 14.894, "eval_steps_per_second": 1.881, "eval_entropy": 0.015041735818895913, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 740204.0, "epoch": 2.874418604651163, "step": 310}
{"loss": 0.004825233668088913, "grad_norm": 0.0025786308106034994, "learning_rate": 3.4364261168384886e-06, "entropy": 0.006620967711205595, "mean_token_accuracy": 1.0, "num_tokens": 764448.0, "epoch": 2.967441860465116, "step": 320}
{"eval_loss": 0.1785578429698944, "eval_runtime": 19.5809, "eval_samples_per_second": 14.964, "eval_steps_per_second": 1.89, "eval_entropy": 0.015173186286119744, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 764448.0, "epoch": 2.967441860465116, "step": 320}
{"eval_loss": 0.17849338054656982, "eval_runtime": 20.027, "eval_samples_per_second": 14.63, "eval_steps_per_second": 1.848, "eval_entropy": 0.015097838612131749, "eval_mean_token_accuracy": 0.9831353699838793, "eval_num_tokens": 771960.0, "epoch": 3.0, "step": 324}
{"train_runtime": 2205.5506, "train_samples_per_second": 2.333, "train_steps_per_second": 0.147, "total_flos": 1.5008258231628288e+17, "train_loss": 0.12426726837401036, "epoch": 3.0, "step": 324}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.15.1 |
| trl | 1.10.0 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.3 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.1 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |