Views
No views yet
arijitx/wav2vec2-xls-r-300m-bengalipyctcdecode) + small punctuation rule1from transformers import Wav2Vec2Processor, AutoModelForCTC
2import torch, torchaudio
3
4processor = Wav2Vec2Processor.from_pretrained("your-username/your-repo")
5model = AutoModelForCTC.from_pretrained("your-username/your-repo").to("cuda").eval()
6
7waveform, sr = torchaudio.load("example.wav")
8# resample to 16k if needed...
9
10inputs = processor(waveform.squeeze().numpy(), sampling_rate=16000, return_tensors="pt")
11with torch.no_grad():
12 logits = model(inputs.input_values.to("cuda")).logits
13pred_ids = torch.argmax(logits, dim=-1)
14transcript = processor.batch_decode(pred_ids)[0]
15print(transcript)