Views
No views yet

Disclaimer / Notice: Details for these are in Peer Review and publications of the paper will be made available soon for more details.
1import torch
2import librosa
3from transformers import Wav2Vec2Processor, Wav2Vec2ForCTC
4
5device = "cuda" if torch.cuda.is_available() else "cpu"
6
7processor = Wav2Vec2Processor.from_pretrained("andrewbawitlung/xlsr-1b-mizonal3-E1-lus-v2026.06")
8model = Wav2Vec2ForCTC.from_pretrained("andrewbawitlung/xlsr-1b-mizonal3-E1-lus-v2026.06").to(device)
9
10audio, sr = librosa.load("your_audio.wav", sr=16000)
11input_values = processor(audio, sampling_rate=16000, return_tensors="pt").input_values.to(device)
12
13with torch.no_grad():
14 logits = model(input_values).logits
15
16predicted_ids = torch.argmax(logits, dim=-1)
17transcription = processor.batch_decode(predicted_ids)[0]
18print(transcription)| Experiment | Hugging Face Repository |
|---|---|
| E1 (Baseline) | andrewbawitlung/xlsr-1b-mizonal3-E1-lus-v2026.06 |
| E2 (Noise) | andrewbawitlung/xlsr-1b-mizonal3-E2-lus-v2026.06 |
| E3 (Speed) | andrewbawitlung/xlsr-1b-mizonal3-E3-lus-v2026.06 |
| E4 (SpecAug) | andrewbawitlung/xlsr-1b-mizonal3-E4-lus-v2026.06 |
| E5 (Combined) | andrewbawitlung/xlsr-1b-mizonal3-E5-lus-v2026.06 |
| step | epoch | train_loss | eval_loss | eval_wer | eval_cer | learning_rate | grad_norm |
|---|---|---|---|---|---|---|---|
| 250 | 0.91 | 0.7216 | 0.4092 | 44.89 | 11.00 | 1.49e-04 | 0.98 |
| 500 | 1.82 | 0.4480 | 0.3468 | 36.16 | 8.89 | 2.99e-04 | 0.95 |
| 750 | 2.73 | 0.3050 | 0.2677 | 30.79 | 7.14 | 2.56e-04 | 0.56 |
| 1000 | 3.64 | 0.2185 | 0.2114 | 24.51 | 5.46 | 2.12e-04 | 0.73 |
| 1250 | 4.55 | 0.1286 | 0.2020 | 22.41 | 4.84 | 1.68e-04 | 0.54 |
| 1500 | 5.46 | 0.0908 | 0.1779 | 19.68 | 4.13 | 1.24e-04 | 0.29 |
| 1750 | 6.36 | 0.0647 | 0.1608 | 18.22 | 3.74 | 7.96e-05 | 0.33 |
| 2000 | 7.27 | 0.0431 | 0.1621 | 18.69 | 3.77 | 3.55e-05 | 0.33 |