Views
No views yet
1from transformers import AutoProcessor, Data2VecAudioForCTC
2import torch
3from datasets import load_dataset, Audio
4
5dataset = load_dataset("mozilla-foundation/common_voice_11_0", "uk", split="test")
6# Resample
7dataset = dataset.cast_column("audio", Audio(sampling_rate=16_000))
8
9processor = AutoProcessor.from_pretrained("Respeecher/ukrainian-data2vec-asr")
10model = Data2VecAudioForCTC.from_pretrained("Respeecher/ukrainian-data2vec-asr")
11model.eval()
12
13sampling_rate = dataset.features["audio"].sampling_rate
14inputs = processor(dataset[1]["audio"]["array"], sampling_rate=sampling_rate, return_tensors="pt")
15with torch.no_grad():
16 logits = model(**inputs).logits
17predicted_ids = torch.argmax(logits, dim=-1)
18
19transcription = processor.batch_decode(predicted_ids)
20transcription[0]