Views
No views yet
microsoft/wavlm-large (16 kHz mono waveform)MCG-NJU/videomae-large (16 frames @ 224x224 RGB)microsoft/deberta-v3-large (speaker-aware ctx encoder)1import json, torch
2from huggingface_hub import hf_hub_download
3from models.averformer_v4 import AVERFormerV4
4
5cfg = json.load(open(hf_hub_download(repo_id="mhussainahmad/averformer-meld-v4", filename="config.json")))
6ckpt = hf_hub_download(repo_id="mhussainahmad/averformer-meld-v4", filename="pytorch_model.pth")
7
8model = AVERFormerV4(
9 audio_backbone=cfg["audio_backbone"],
10 video_backbone=cfg["video_backbone"],
11 text_backbone=cfg["text_backbone"],
12 num_classes=cfg["num_classes"],
13 fusion_layers=cfg["fusion_layers"],
14 lora_r=cfg["lora_r"],
15 use_text=True,
16)
17state = torch.load(ckpt, map_location="cpu", weights_only=False)
18model.load_state_dict(state["model"], strict=False)
19model.eval()python live_emotion_v4.py --repo_id mhussainahmad/averformer-meld-v4LIVE_INFERENCE_README.md in the GitHub repo for full setup.