Views
No views yet
microsoft/wavlm-large (16 kHz mono waveform)MCG-NJU/videomae-large (16 frames @ 224×224 RGB)microsoft/deberta-v3-large (speaker-aware ctx encoder)1import json, torch
2from huggingface_hub import hf_hub_download
3from models.averformer_v4 import AVERFormerV4
4
5cfg = json.load(open(hf_hub_download(repo_id="mhussainahmad/averformer-cremad-v4", filename="config.json")))
6ckpt = hf_hub_download(repo_id="mhussainahmad/averformer-cremad-v4", filename="pytorch_model.pth")
7
8model = AVERFormerV4(
9 audio_backbone=cfg["audio_backbone"],
10 video_backbone=cfg["video_backbone"],
11 text_backbone=cfg["text_backbone"],
12 num_classes=cfg["num_classes"],
13 fusion_layers=cfg["fusion_layers"],
14 lora_r=cfg["lora_r"],
15 use_text=True,
16)
17state = torch.load(ckpt, map_location="cpu", weights_only=False)
18model.load_state_dict(state["model"], strict=False)
19model.eval()python live_emotion_v4.py --repo_id mhussainahmad/averformer-cremad-v4LIVE_INFERENCE_README.md in the GitHub repo for full setup.python train_v5_spec.py --corpus CREMA-D --classes 6 \
--audio microsoft/wavlm-large \
--video MCG-NJU/videomae-large \
--text microsoft/deberta-v3-large \
--lora_r 16 \
--epochs 20 --bs 4 \
--grad_accum 4 \
--lr_head 0.0001 --lr_backbone 2e-05 \
--loss ce --class_weights sqrt-inv \
--select_metric wF1 \
--seed 100