Views
No views yet
1import torch
2from transformers import AutoModel
3from whisper import load_audio, log_mel_spectrogram, pad_or_trim
4from whisAID import WhisAIDConfig
5
6repo_id = "walston/whisaid-medium-grl"
7model = AutoModel.from_config(
8 WhisAIDConfig.from_pretrained(repo_id)
9).cuda().eval()
10
11audio = torch.from_numpy(load_audio("/path/to/audio.wav"))
12mel = log_mel_spectrogram(
13 pad_or_trim(audio), n_mels=model.config.n_mels
14).unsqueeze(0).cuda()
15
16with torch.no_grad():
17 output = model(input_ids=mel)
18
19accent_embedding = output.features[0].cpu().numpy()
20accent_id = output.logits.argmax(dim=-1).item()