Views
No views yet
1from transformers import Wav2Vec2Model, Wav2Vec2FeatureExtractor
2import torchaudio
3
4feature_extractor = Wav2Vec2FeatureExtractor.from_pretrained("fav-kky/wav2vec2-base-sk-17k")
5model = Wav2Vec2Model.from_pretrained("fav-kky/wav2vec2-base-sk-17k")
6
7speech_array, sampling_rate = torchaudio.load("/path/to/audio/file.wav")
8inputs = feature_extractor(
9 speech_array,
10 sampling_rate=16_000,
11 return_tensors="pt"
12)["input_values"][0]
13
14output = model(inputs)
15embeddings = output.last_hidden_state.detach().numpy()[0]@inproceedings{wav2vec2-base-sk-17k,
author = {
Lehe\v{c}ka, Jan and
Psutka, Josef V. and
Psutka, Josef
},
title = {{Transfer Learning of Transformer-Based Speech Recognition Models from Czech to Slovak}},
year = {2023},
isbn = {978-3-031-40497-9},
publisher = {Springer Nature Switzerland},
address = {Cham},
url = {https://doi.org/10.1007/978-3-031-40498-6_29},
doi = {10.1007/978-3-031-40498-6_29},
booktitle = {Text, Speech, and Dialogue: 26th International Conference, TSD 2023, Pilsen, Czech Republic, September 4–6, 2023, Proceedings},
pages = {328–338},
numpages = {11},
}