Views
No views yet
openai/whisper-large-v3-turbosq)transformers library. Below are the key training arguments:| Argument | Value | Description |
|---|---|---|
per_device_train_batch_size | 8 | Training batch size per GPU |
per_device_eval_batch_size | 2 | Evaluation batch size per GPU |
gradient_accumulation_steps | 1 | Steps to accumulate gradients (effective batch size = 8) |
num_train_epochs | 3 | Number of training epochs |
learning_rate | 1e-5 | Initial learning rate |
warmup_steps | 300 | Number of warmup steps for learning rate |
evaluation_strategy | "steps" | Evaluate every eval_steps during training |
eval_steps | 250 | Frequency of evaluation (every 250 steps) |
fp16 | True | Use mixed precision training (16-bit floats) |
| Step | Training Loss | Validation Loss | WER |
|---|---|---|---|
| 250 | 0.4744 | 0.3991 | 34.03% |
| 500 | 0.3421 | 0.3426 | 30.42% |
| 750 | 0.2871 | 0.2808 | 26.09% |
| 1000 | 0.2401 | 0.2258 | 21.31% |
| 1250 | 0.1809 | 0.1998 | 19.15% |
| 1500 | 0.1142 | 0.1827 | 17.33% |
| 1750 | 0.1051 | 0.1611 | 15.19% |
| 2000 | 0.0930 | 0.1464 | 13.82% |
| 2250 | 0.0827 | 0.1313 | 11.79% |
| 2500 | 0.0420 | 0.1139 | 10.50% |
| 2750 | 0.0330 | 0.1124 | 9.58% |
| 3000 | 0.0255 | 0.1006 | 8.38% |
| 3250 | 0.0256 | 0.0905 | 7.48% |
| 3500 | 0.0204 | 0.0889 | 6.98% |