Views
No views yet
1import torch
2import librosa
3from transformers import AutoModelForAudioClassification, AutoFeatureExtractor
4
5## Load an audio file
6audio_array, sr = librosa.load("path_to_audio.wav", sr=16000)
7
8## Load model and feature extractor
9model = AutoModelForAudioClassification.from_pretrained("alkiskoudounas/xls-r-128-italic-massive")
10feature_extractor = AutoFeatureExtractor.from_pretrained("facebook/wav2vec2-xls-r-300m")
11
12## Extract features
13inputs = feature_extractor(audio_array.squeeze(), sampling_rate=feature_extractor.sampling_rate, padding=True, return_tensors="pt")
14
15## Compute logits
16logits = model(**inputs).logits1@inproceedings{koudounas2023italic,
2 title={ITALIC: An Italian Intent Classification Dataset},
3 author={Koudounas, Alkis and La Quatra, Moreno and Vaiani, Lorenzo and Colomba, Luca and Attanasio, Giuseppe and Pastor, Eliana and Cagliero, Luca and Baralis, Elena},
4 booktitle={Proc. Interspeech 2023},
5 pages={2153--2157},
6 year={2023}
7}