Views
No views yet
1import torch
2import soundfile as sf
3from transformers import AutoModelForCTC, AutoProcessor
4
5model_id = "thaivanphat95/wav2vec2-large-l2-arctic-supcon-repeated-arabic-holdout"
6processor = AutoProcessor.from_pretrained(model_id)
7model = AutoModelForCTC.from_pretrained(model_id).eval()
8
9audio, sample_rate = sf.read("audio.wav")
10inputs = processor(audio, sampling_rate=sample_rate, return_tensors="pt")
11
12with torch.no_grad():
13 logits = model(**inputs).logits
14
15print(processor.batch_decode(torch.argmax(logits, dim=-1))[0])1@article{thai2026contrastive,
2 title={Contrastive Regularization for Accent-Robust ASR},
3 author={Thai, Van-Phat and Dhruv, Aradhya and Pham, Duc-Thinh and Alam, Sameer},
4 journal={arXiv preprint arXiv:2605.03297},
5 year={2026},
6 doi={10.48550/arXiv.2605.03297}
7}