Views
No views yet
1import soundfile as sf
2import torch
3from transformers import AutoModel
4
5device = "cuda" if torch.cuda.is_available() else "cpu"
6wav, sr = sf.read("audio.wav", dtype="float32")
7wav = torch.from_numpy(wav)
8model = AutoModel.from_pretrained(
9 "prj-beatrice/resemblyzer-torch-native", trust_remote_code=True
10).eval().to(device)
11
12with torch.inference_mode():
13 embedding = model(wav.to(device), sampling_rate=sr).embeddings[0]1from resemblyzer import VoiceEncoder, preprocess_wav
2
3# Non-16 kHz input is resampled differently, so exact agreement is not expected.
4assert sr == 16_000
5reference = torch.from_numpy(
6 VoiceEncoder().embed_utterance(preprocess_wav("audio.wav"))
7)
8torch.testing.assert_close(embedding.cpu(), reference)[batch_size, max_length] and an input_lengths tensor [batch_size].LICENSE.