Views
No views yet
| Model | Context Length | Generation Length | Weight |
|---|---|---|---|
| VibeVoice-1.5B | 64K | ~90 min | HF link |
| VibeVoice-7B | 32K | ~45 min | HF link |
| VibeVoice-AcousticTokenizer | - | - | HF link |
| VibeVoice-SemanticTokenizer | - | - | This model |
1import torch
2from transformers import AutoFeatureExtractor, VibeVoiceSemanticTokenizerModel
3from transformers.audio_utils import load_audio_librosa
4
5
6model_id = "bezzam/VibeVoice-SemanticTokenizer"
7sampling_rate = 24000
8
9# load audio
10audio = load_audio_librosa(
11 "https://hf.co/datasets/bezzam/vibevoice_samples/resolve/main/voices/en-Alice_woman.wav",
12 sampling_rate=sampling_rate,
13)
14
15# load model
16device = "cuda" if torch.cuda.is_available() else "cpu"
17feature_extractor = AutoFeatureExtractor.from_pretrained(model_id)
18model = VibeVoiceSemanticTokenizerModel.from_pretrained(
19 model_id,
20 device_map=device,
21).eval()
22
23# preprocess audio
24inputs = feature_extractor(
25 audio,
26 sampling_rate=sampling_rate,
27 padding=True,
28 pad_to_multiple_of=3200,
29 return_attention_mask=False,
30 return_tensors="pt",
31).to(device)
32print("Input audio shape:", inputs.input_features.shape)
33# Input audio shape: torch.Size([1, 1, 224000])
34
35# encode
36with torch.no_grad():
37 encoded_outputs = model.encode(inputs.input_features)
38print("Latent shape:", encoded_outputs.latents.shape)
39# Latent shape: torch.Size([1, 70, 128])