Views
No views yet
from transformers import AutoModelForAudioClassification, Wav2Vec2FeatureExtractor
import librosa
model_path = "Booberjacob/wav2vec2-lg-xlsr-en-speech-circumplex-emotion-recognition"
model = AutoModelForAudioClassification.from_pretrained(model_path)
feature_extractor = Wav2Vec2FeatureExtractor.from_pretrained("facebook/wav2vec2-large-xlsr-53")
wav_path = "sample.wav"
wav, _ = librosa.load(wav_path, sr=16000)
inputs = feature_extractor(raw_speech=wav, sampling_rate=16000, padding=True, return_tensors='pt')
outputs = model(**inputs)
sentiment, arousal = outputs['logits'][0]
print(sentiment, arousal)