Views
No views yet
finetune_config.json):finetune.py --model Qwen/Qwen3.8-27B --dataset modal_response --subpopulation overall --upload-to-hf --lora-r 128 --lora-alpha 248 --batch-size 8 --gradient-accumulation-steps 2| Parameter | Value |
|---|---|
| LoRA rank | 128 |
| LoRA alpha | 248 |
| LoRA dropout | 0.05 |
| DoRA | False |
| Learning rate | 0.0002 |
| Batch size | 8 |
| Gradient accumulation | 2 |
| Epochs | 3 |
| Max seq length | 1024 |
| Warmup ratio | |
| Dtype | bf16 |
| Trainable parameters (LoRA) | 637,534,208 |
| Adapter size on disk | 2,550,206,840 bytes |
{"loss": 0.329724383354187, "grad_norm": 1.9910746812820435, "learning_rate": 5.4545454545454546e-05, "entropy": 0.3021730914711952, "mean_token_accuracy": 0.9030252873897553, "num_tokens": 24028.0, "epoch": 0.09302325581395349, "step": 10}
{"eval_loss": 0.27080491185188293, "eval_runtime": 19.1969, "eval_samples_per_second": 15.263, "eval_steps_per_second": 1.927, "eval_entropy": 0.2967428049525699, "eval_mean_token_accuracy": 0.8930550298175296, "eval_num_tokens": 24028.0, "epoch": 0.09302325581395349, "step": 10}
{"loss": 0.22088291645050048, "grad_norm": 1.6724066734313965, "learning_rate": 0.00011515151515151516, "entropy": 0.20918917879462243, "mean_token_accuracy": 0.9101159811019898, "num_tokens": 47751.0, "epoch": 0.18604651162790697, "step": 20}
{"eval_loss": 0.2287943959236145, "eval_runtime": 19.5504, "eval_samples_per_second": 14.987, "eval_steps_per_second": 1.893, "eval_entropy": 0.13980238033911666, "eval_mean_token_accuracy": 0.9316166655437367, "eval_num_tokens": 47751.0, "epoch": 0.18604651162790697, "step": 20}
{"loss": 0.2991976499557495, "grad_norm": 2.619951009750366, "learning_rate": 0.00017575757575757578, "entropy": 0.2245017409324646, "mean_token_accuracy": 0.9058723658323288, "num_tokens": 71663.0, "epoch": 0.27906976744186046, "step": 30}
{"eval_loss": 0.28335368633270264, "eval_runtime": 19.6252, "eval_samples_per_second": 14.93, "eval_steps_per_second": 1.885, "eval_entropy": 0.2827987839039919, "eval_mean_token_accuracy": 0.913529452439901, "eval_num_tokens": 71663.0, "epoch": 0.27906976744186046, "step": 30}
{"loss": 0.24588932991027831, "grad_norm": 1.9827759265899658, "learning_rate": 0.00019587628865979381, "entropy": 0.17721829675137996, "mean_token_accuracy": 0.9104876846075058, "num_tokens": 95524.0, "epoch": 0.37209302325581395, "step": 40}
{"eval_loss": 0.23790086805820465, "eval_runtime": 19.8348, "eval_samples_per_second": 14.772, "eval_steps_per_second": 1.865, "eval_entropy": 0.11762823748427469, "eval_mean_token_accuracy": 0.9394729459607923, "eval_num_tokens": 95524.0, "epoch": 0.37209302325581395, "step": 40}
{"loss": 0.1315160870552063, "grad_norm": 0.7682068347930908, "learning_rate": 0.00018900343642611685, "entropy": 0.08868255969136954, "mean_token_accuracy": 0.965380945801735, "num_tokens": 119820.0, "epoch": 0.46511627906976744, "step": 50}
{"eval_loss": 0.3058825433254242, "eval_runtime": 19.6827, "eval_samples_per_second": 14.886, "eval_steps_per_second": 1.88, "eval_entropy": 0.18830492055496653, "eval_mean_token_accuracy": 0.9020126188123548, "eval_num_tokens": 119820.0, "epoch": 0.46511627906976744, "step": 50}
{"loss": 0.2213534116744995, "grad_norm": 1.3078958988189697, "learning_rate": 0.00018213058419243986, "entropy": 0.1566828690469265, "mean_token_accuracy": 0.932983785867691, "num_tokens": 144337.0, "epoch": 0.5581395348837209, "step": 60}
{"eval_loss": 0.30585309863090515, "eval_runtime": 19.5208, "eval_samples_per_second": 15.01, "eval_steps_per_second": 1.895, "eval_entropy": 0.08884951610722251, "eval_mean_token_accuracy": 0.9429989795427065, "eval_num_tokens": 144337.0, "epoch": 0.5581395348837209, "step": 60}
{"loss": 0.4561625003814697, "grad_norm": 0.8676272630691528, "learning_rate": 0.0001752577319587629, "entropy": 0.19624804137274623, "mean_token_accuracy": 0.917233121395111, "num_tokens": 168506.0, "epoch": 0.6511627906976745, "step": 70}
{"eval_loss": 0.3006272614002228, "eval_runtime": 19.4772, "eval_samples_per_second": 15.043, "eval_steps_per_second": 1.9, "eval_entropy": 0.11512738209519838, "eval_mean_token_accuracy": 0.9198935740702862, "eval_num_tokens": 168506.0, "epoch": 0.6511627906976745, "step": 70}
{"loss": 0.19200708866119384, "grad_norm": 0.8818100690841675, "learning_rate": 0.00016838487972508593, "entropy": 0.08728377930819989, "mean_token_accuracy": 0.9518962293863297, "num_tokens": 191999.0, "epoch": 0.7441860465116279, "step": 80}
{"eval_loss": 0.22223712503910065, "eval_runtime": 19.5195, "eval_samples_per_second": 15.011, "eval_steps_per_second": 1.896, "eval_entropy": 0.14328007148327054, "eval_mean_token_accuracy": 0.9267691567137435, "eval_num_tokens": 191999.0, "epoch": 0.7441860465116279, "step": 80}
{"loss": 0.1611369252204895, "grad_norm": 1.885201096534729, "learning_rate": 0.00016151202749140894, "entropy": 0.13094116616994142, "mean_token_accuracy": 0.9664290517568588, "num_tokens": 216161.0, "epoch": 0.8372093023255814, "step": 90}
{"eval_loss": 0.22924108803272247, "eval_runtime": 19.7194, "eval_samples_per_second": 14.858, "eval_steps_per_second": 1.876, "eval_entropy": 0.15043630184152643, "eval_mean_token_accuracy": 0.9395286521396121, "eval_num_tokens": 216161.0, "epoch": 0.8372093023255814, "step": 90}
{"loss": 0.12828669548034669, "grad_norm": 5.210169792175293, "learning_rate": 0.00015463917525773197, "entropy": 0.09360866751521826, "mean_token_accuracy": 0.965234911441803, "num_tokens": 240131.0, "epoch": 0.9302325581395349, "step": 100}
{"eval_loss": 0.13432586193084717, "eval_runtime": 19.5888, "eval_samples_per_second": 14.958, "eval_steps_per_second": 1.889, "eval_entropy": 0.0622741765204213, "eval_mean_token_accuracy": 0.9646575821412576, "eval_num_tokens": 240131.0, "epoch": 0.9302325581395349, "step": 100}
{"loss": 0.09570819139480591, "grad_norm": 0.20976415276527405, "learning_rate": 0.000147766323024055, "entropy": 0.037251970877772884, "mean_token_accuracy": 0.9812971039822227, "num_tokens": 261845.0, "epoch": 1.0186046511627906, "step": 110}
{"eval_loss": 0.25236979126930237, "eval_runtime": 19.4565, "eval_samples_per_second": 15.059, "eval_steps_per_second": 1.902, "eval_entropy": 0.04954028127060549, "eval_mean_token_accuracy": 0.9579016630714005, "eval_num_tokens": 261845.0, "epoch": 1.0186046511627906, "step": 110}
{"loss": 0.021135905385017396, "grad_norm": 0.15844818949699402, "learning_rate": 0.00014089347079037802, "entropy": 0.031156624486902727, "mean_token_accuracy": 0.9942363411188125, "num_tokens": 285862.0, "epoch": 1.1116279069767443, "step": 120}
{"eval_loss": 0.2681749761104584, "eval_runtime": 19.645, "eval_samples_per_second": 14.915, "eval_steps_per_second": 1.883, "eval_entropy": 0.0398551107484948, "eval_mean_token_accuracy": 0.9569891352911253, "eval_num_tokens": 285862.0, "epoch": 1.1116279069767443, "step": 120}
{"loss": 0.14354212284088136, "grad_norm": 0.2864812910556793, "learning_rate": 0.00013402061855670103, "entropy": 0.06774548756657169, "mean_token_accuracy": 0.977207338809967, "num_tokens": 310014.0, "epoch": 1.2046511627906977, "step": 130}
{"eval_loss": 0.1120707243680954, "eval_runtime": 19.6349, "eval_samples_per_second": 14.922, "eval_steps_per_second": 1.884, "eval_entropy": 0.1803303802436268, "eval_mean_token_accuracy": 0.9639788495527731, "eval_num_tokens": 310014.0, "epoch": 1.2046511627906977, "step": 130}
{"loss": 0.07983369827270508, "grad_norm": 0.15304426848888397, "learning_rate": 0.00012714776632302406, "entropy": 0.1294464621692896, "mean_token_accuracy": 0.9800083607435226, "num_tokens": 333701.0, "epoch": 1.2976744186046512, "step": 140}
{"eval_loss": 0.10580317676067352, "eval_runtime": 19.657, "eval_samples_per_second": 14.906, "eval_steps_per_second": 1.882, "eval_entropy": 0.0720483947457192, "eval_mean_token_accuracy": 0.966224678464838, "eval_num_tokens": 333701.0, "epoch": 1.2976744186046512, "step": 140}
{"loss": 0.07050570249557495, "grad_norm": 0.18284183740615845, "learning_rate": 0.00012027491408934708, "entropy": 0.036879632039926946, "mean_token_accuracy": 0.9763295322656631, "num_tokens": 357490.0, "epoch": 1.3906976744186046, "step": 150}
{"eval_loss": 0.4587225317955017, "eval_runtime": 19.5838, "eval_samples_per_second": 14.961, "eval_steps_per_second": 1.889, "eval_entropy": 0.02009937999969839, "eval_mean_token_accuracy": 0.9627308394457843, "eval_num_tokens": 357490.0, "epoch": 1.3906976744186046, "step": 150}
{"loss": 0.13674649000167846, "grad_norm": 0.08568482100963593, "learning_rate": 0.0001134020618556701, "entropy": 0.025695199519395827, "mean_token_accuracy": 0.9787289679050446, "num_tokens": 381760.0, "epoch": 1.483720930232558, "step": 160}
{"eval_loss": 0.10584218800067902, "eval_runtime": 19.6349, "eval_samples_per_second": 14.922, "eval_steps_per_second": 1.884, "eval_entropy": 0.048083367619059375, "eval_mean_token_accuracy": 0.9781292258082209, "eval_num_tokens": 381760.0, "epoch": 1.483720930232558, "step": 160}
{"loss": 0.01521637886762619, "grad_norm": 1.0704776048660278, "learning_rate": 0.00010652920962199313, "entropy": 0.03326663034968078, "mean_token_accuracy": 0.9922943413257599, "num_tokens": 405264.0, "epoch": 1.5767441860465117, "step": 170}
{"eval_loss": 0.10048998892307281, "eval_runtime": 19.6297, "eval_samples_per_second": 14.926, "eval_steps_per_second": 1.885, "eval_entropy": 0.025417408927947888, "eval_mean_token_accuracy": 0.982019930272489, "eval_num_tokens": 405264.0, "epoch": 1.5767441860465117, "step": 170}
{"loss": 0.03723442852497101, "grad_norm": 0.40748435258865356, "learning_rate": 9.965635738831616e-05, "entropy": 0.017275732808047905, "mean_token_accuracy": 0.9879871636629105, "num_tokens": 429673.0, "epoch": 1.669767441860465, "step": 180}
{"eval_loss": 0.11403553187847137, "eval_runtime": 19.5462, "eval_samples_per_second": 14.99, "eval_steps_per_second": 1.893, "eval_entropy": 0.024594690122113034, "eval_mean_token_accuracy": 0.9768580004975602, "eval_num_tokens": 429673.0, "epoch": 1.669767441860465, "step": 180}
{"loss": 0.0034700997173786165, "grad_norm": 0.025362450629472733, "learning_rate": 9.278350515463918e-05, "entropy": 0.01327418913715519, "mean_token_accuracy": 1.0, "num_tokens": 453754.0, "epoch": 1.7627906976744185, "step": 190}
{"eval_loss": 0.14837799966335297, "eval_runtime": 19.49, "eval_samples_per_second": 15.033, "eval_steps_per_second": 1.898, "eval_entropy": 0.01769831631257123, "eval_mean_token_accuracy": 0.9779479004241325, "eval_num_tokens": 453754.0, "epoch": 1.7627906976744185, "step": 190}
{"loss": 0.014192087948322296, "grad_norm": 0.3015872538089752, "learning_rate": 8.591065292096219e-05, "entropy": 0.014170228771399706, "mean_token_accuracy": 0.9953290581703186, "num_tokens": 477858.0, "epoch": 1.8558139534883722, "step": 200}
{"eval_loss": 0.16739776730537415, "eval_runtime": 19.4695, "eval_samples_per_second": 15.049, "eval_steps_per_second": 1.9, "eval_entropy": 0.015600144609846678, "eval_mean_token_accuracy": 0.9718105132515366, "eval_num_tokens": 477858.0, "epoch": 1.8558139534883722, "step": 200}
{"loss": 0.0050114687532186505, "grad_norm": 0.0015182781498879194, "learning_rate": 7.903780068728523e-05, "entropy": 0.008592777809826656, "mean_token_accuracy": 0.9968245953321457, "num_tokens": 501949.0, "epoch": 1.9488372093023256, "step": 210}
{"eval_loss": 0.1382344514131546, "eval_runtime": 19.5446, "eval_samples_per_second": 14.991, "eval_steps_per_second": 1.893, "eval_entropy": 0.010662467951250792, "eval_mean_token_accuracy": 0.9806765913963318, "eval_num_tokens": 501949.0, "epoch": 1.9488372093023256, "step": 210}
{"loss": 0.04858941733837128, "grad_norm": 0.0033587529323995113, "learning_rate": 7.216494845360825e-05, "entropy": 0.004860639431219744, "mean_token_accuracy": 0.9904158993771202, "num_tokens": 524108.0, "epoch": 2.0372093023255813, "step": 220}
{"eval_loss": 0.08982640504837036, "eval_runtime": 19.9113, "eval_samples_per_second": 14.715, "eval_steps_per_second": 1.858, "eval_entropy": 0.014281262701842934, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 524108.0, "epoch": 2.0372093023255813, "step": 220}
{"loss": 0.007085715234279632, "grad_norm": 0.20956315100193024, "learning_rate": 6.529209621993127e-05, "entropy": 0.013815993932075799, "mean_token_accuracy": 0.9970959603786469, "num_tokens": 548036.0, "epoch": 2.130232558139535, "step": 230}
{"eval_loss": 0.07764531672000885, "eval_runtime": 19.6197, "eval_samples_per_second": 14.934, "eval_steps_per_second": 1.886, "eval_entropy": 0.017076930808331316, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 548036.0, "epoch": 2.130232558139535, "step": 230}
{"loss": 0.0024182578548789025, "grad_norm": 0.0018677707994356751, "learning_rate": 5.84192439862543e-05, "entropy": 0.0054093754210043695, "mean_token_accuracy": 0.9982142865657806, "num_tokens": 572110.0, "epoch": 2.2232558139534886, "step": 240}
{"eval_loss": 0.07732325792312622, "eval_runtime": 19.5754, "eval_samples_per_second": 14.968, "eval_steps_per_second": 1.89, "eval_entropy": 0.016394756476369662, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 572110.0, "epoch": 2.2232558139534886, "step": 240}
{"loss": 0.007268018275499344, "grad_norm": 0.5773428082466125, "learning_rate": 5.1546391752577315e-05, "entropy": 0.005389756828662939, "mean_token_accuracy": 0.9966517865657807, "num_tokens": 596112.0, "epoch": 2.316279069767442, "step": 250}
{"eval_loss": 0.07719052582979202, "eval_runtime": 19.4902, "eval_samples_per_second": 15.033, "eval_steps_per_second": 1.898, "eval_entropy": 0.015954890968026342, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 596112.0, "epoch": 2.316279069767442, "step": 250}
{"loss": 0.010858021676540375, "grad_norm": 0.11676104366779327, "learning_rate": 4.467353951890035e-05, "entropy": 0.011530557851074263, "mean_token_accuracy": 0.9929181903600692, "num_tokens": 620141.0, "epoch": 2.4093023255813955, "step": 260}
{"eval_loss": 0.07730410993099213, "eval_runtime": 19.6217, "eval_samples_per_second": 14.932, "eval_steps_per_second": 1.886, "eval_entropy": 0.015905727900570963, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 620141.0, "epoch": 2.4093023255813955, "step": 260}
{"loss": 0.010217704623937608, "grad_norm": 0.1725618839263916, "learning_rate": 3.7800687285223366e-05, "entropy": 0.012017592918709852, "mean_token_accuracy": 0.9911013871431351, "num_tokens": 644443.0, "epoch": 2.5023255813953487, "step": 270}
{"eval_loss": 0.07911934703588486, "eval_runtime": 19.5902, "eval_samples_per_second": 14.956, "eval_steps_per_second": 1.889, "eval_entropy": 0.01527047812281101, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 644443.0, "epoch": 2.5023255813953487, "step": 270}
{"loss": 0.0057005051523447035, "grad_norm": 0.22248080372810364, "learning_rate": 3.0927835051546395e-05, "entropy": 0.008258577817468905, "mean_token_accuracy": 0.9965144217014312, "num_tokens": 668512.0, "epoch": 2.5953488372093023, "step": 280}
{"eval_loss": 0.07937609404325485, "eval_runtime": 19.4761, "eval_samples_per_second": 15.044, "eval_steps_per_second": 1.9, "eval_entropy": 0.014989001566317637, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 668512.0, "epoch": 2.5953488372093023, "step": 280}
{"loss": 0.004545645043253899, "grad_norm": 0.0008318600594066083, "learning_rate": 2.4054982817869417e-05, "entropy": 0.0061296094412682574, "mean_token_accuracy": 0.9967741906642914, "num_tokens": 691867.0, "epoch": 2.688372093023256, "step": 290}
{"eval_loss": 0.08043927699327469, "eval_runtime": 19.4623, "eval_samples_per_second": 15.055, "eval_steps_per_second": 1.901, "eval_entropy": 0.014611023588332574, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 691867.0, "epoch": 2.688372093023256, "step": 290}
{"loss": 0.007996787130832673, "grad_norm": 0.1073792427778244, "learning_rate": 1.7182130584192442e-05, "entropy": 0.009588884192635306, "mean_token_accuracy": 0.9911408305168152, "num_tokens": 716107.0, "epoch": 2.781395348837209, "step": 300}
{"eval_loss": 0.08033730089664459, "eval_runtime": 19.4997, "eval_samples_per_second": 15.026, "eval_steps_per_second": 1.897, "eval_entropy": 0.014407109258369216, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 716107.0, "epoch": 2.781395348837209, "step": 300}
{"loss": 0.003480597212910652, "grad_norm": 0.0014989329501986504, "learning_rate": 1.0309278350515464e-05, "entropy": 0.005034083963255398, "mean_token_accuracy": 0.9969223499298095, "num_tokens": 739936.0, "epoch": 2.874418604651163, "step": 310}
{"eval_loss": 0.08072787523269653, "eval_runtime": 19.864, "eval_samples_per_second": 14.75, "eval_steps_per_second": 1.863, "eval_entropy": 0.014182917349751585, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 739936.0, "epoch": 2.874418604651163, "step": 310}
{"loss": 0.007947015762329101, "grad_norm": 0.0012255216715857387, "learning_rate": 3.4364261168384886e-06, "entropy": 0.010128511357470416, "mean_token_accuracy": 0.991339048743248, "num_tokens": 764168.0, "epoch": 2.967441860465116, "step": 320}
{"eval_loss": 0.08037032186985016, "eval_runtime": 19.5462, "eval_samples_per_second": 14.99, "eval_steps_per_second": 1.893, "eval_entropy": 0.01407529946693496, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 764168.0, "epoch": 2.967441860465116, "step": 320}
{"eval_loss": 0.08045438677072525, "eval_runtime": 19.6785, "eval_samples_per_second": 14.889, "eval_steps_per_second": 1.88, "eval_entropy": 0.014062740073879124, "eval_mean_token_accuracy": 0.9815211859909264, "eval_num_tokens": 771666.0, "epoch": 3.0, "step": 324}
{"train_runtime": 2195.2436, "train_samples_per_second": 2.344, "train_steps_per_second": 0.148, "total_flos": 1.4999638999160218e+17, "train_loss": 0.09648852406449064, "epoch": 3.0, "step": 324}| Package | Version |
|---|---|
| torch | 2.13.0 |
| transformers | 5.15.1 |
| trl | 1.10.0 |
| datasets | 5.0.1 |
| accelerate | 1.14.0 |
| python-dotenv | 1.2.3 |
| peft | 0.20.0 |
| bitsandbytes | 0.50.1 |
| huggingface-hub | ? |
| jinja2 | ? |
| torchvision | 0.28.0 |
| pillow | 12.3.0 |