Views
No views yet
1from transformers import AutoProcessor, Data2VecAudioModel
2import torch
3from datasets import load_dataset, Audio
4
5dataset = load_dataset("mozilla-foundation/common_voice_11_0", "uk", split="validation")
6# Resample
7dataset = dataset.cast_column("audio", Audio(sampling_rate=16_000))
8
9processor = AutoProcessor.from_pretrained("Respeecher/ukrainian-data2vec")
10model = Data2VecAudioModel.from_pretrained("Respeecher/ukrainian-data2vec")
11
12# audio file is decoded on the fly
13inputs = processor(dataset[0]["audio"]["array"], sampling_rate=sampling_rate, return_tensors="pt")
14with torch.no_grad():
15 outputs = model(**inputs)
16
17last_hidden_states = outputs.last_hidden_state
18list(last_hidden_states.shape)