Views
No views yet
best_model_epoch_161.pth
Classes: ['neutral', 'calm', 'happy', 'sad', 'angry', 'fearful', 'disgust', 'surprised']| Modality | Shape | Notes |
|---|---|---|
audio_waveform | [B, 2, 88000] | stereo, 22000 Hz, 4 s |
mel_spectrogram | [B, 320, 343] | 160 mels per channel, stereo concatenated |
mfcc | [B, 40, 343] | 20 MFCC per channel, stereo concatenated |
video | [B, 3, 12, 180, 320] | 12 uniformly sampled frames, ImageNet-normalised |
models/averformer.py.1import torch
2from huggingface_hub import hf_hub_download
3from models.averformer import AVERFormer
4
5ckpt_path = hf_hub_download(repo_id="mhussainahmad/averformer-ravdess", filename="pytorch_model.pth")
6model = AVERFormer(num_classes=8)
7state = torch.load(ckpt_path, map_location="cpu", weights_only=False)
8model.load_state_dict(state.get("model_state_dict", state), strict=False)
9model.eval()