Views
No views yet
UTMOS22 strong learner, ported to use only torch, torchaudio, and transformers, with reference to the SpeechMOS implementation.1import soundfile as sf
2import torch
3from transformers import AutoModel
4
5device = "cuda" if torch.cuda.is_available() else "cpu"
6wav, sr = sf.read("audio.wav", dtype="float32")
7wav = torch.from_numpy(wav)
8model = AutoModel.from_pretrained(
9 "prj-beatrice/utmos22-torch-native", trust_remote_code=True
10).eval().to(device)
11
12with torch.inference_mode():
13 score = model(wav.to(device), sampling_rate=sr).scores[0]
14print(score)1reference_model = torch.hub.load(
2 "tarepan/SpeechMOS:v1.2.0", "utmos22_strong", trust_repo=True
3)
4reference = reference_model(wav.unsqueeze(0), sr)[0]
5torch.testing.assert_close(score.cpu(), reference)[batch_size, max_length] and an input_lengths tensor [batch_size].LICENSE.