Views
No views yet
1import torch
2import torchaudio
3from datasets import load_dataset
4from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
5
6test_dataset = load_dataset("common_voice", "tr", split="test[:2%]")
7
8processor = Wav2Vec2Processor.from_pretrained("emre/wav2vec-tr-lite-AG")
9model = Wav2Vec2ForCTC.from_pretrained("emre/wav2vec-tr-lite-AG")
10
11resampler = torchaudio.transforms.Resample(48_000, 16_000)
12
13### Training hyperparameters
14The following hyperparameters were used during training:
15- learning_rate: 0.00005
16- train_batch_size: 2
17- eval_batch_size: 8
18- seed: 42
19- distributed_type: multi-GPU
20- num_devices: 2
21- gradient_accumulation_steps: 8
22- total_train_batch_size: 32
23- total_eval_batch_size: 16
24- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
25- lr_scheduler_type: linear
26- lr_scheduler_warmup_steps: 500
27- num_epochs: 30.0
28- mixed_precision_training: Native AMP
29### Training results
30| Training Loss | Epoch | Step | Validation Loss | Wer |
31|:-------------:|:-----:|:----:|:---------------:|:------:|
32| 0.4388 | 3.7 | 400 | 1.366 | 0.9701 |
33| 0.3766 | 7.4 | 800 | 0.4914 | 0.5374 |
34| 0.2295 | 11.11 | 1200 | 0.3934 | 0.4125 |
35| 0.1121 | 14.81 | 1600 | 0.3264 | 0.2904 |
36| 0.1473 | 18.51 | 2000 | 0.3103 | 0.2671 |
37| 0.1013 | 22.22 | 2400 | 0.2589 | 0.2324 |
38| 0.0704 | 25.92 | 2800 | 0.2826 | 0.2339 |
39| 0.0537 | 29.63 | 3200 | 0.2704 | 0.2309 |
40### Framework versions
41- Transformers 4.12.0.dev0
42- Pytorch 1.8.1
43- Datasets 1.14.1.dev0
44- Tokenizers 0.10.3
45