facebook/wav2vec2-base for an emotion classification task with 8 output labels.python
from transformers import Wav2Vec2Processor
import torch
from model import FineTunedWav2Vec2Model
# Load processor and model
processor = Wav2Vec2Processor.from_pretrained("facebook/wav2vec2-base")
model = FineTunedWav2Vec2Model.from_pretrained("path_to_model")
# Perform inference
input_values = processor("audio_file_path", return_tensors="pt", sampling_rate=16000).input_values
logits = model(input_values)
predictions = torch.argmax(logits, dim=-1)