Views
No views yet
1from transformers import AutoModel
2import torch
3import torchaudio
4
5# Load the processor/tokenizer
6processor = AutoModel.from_pretrained("your-username/hubert-kmeans-200", trust_remote_code=True)
7
8# Load audio
9audio, sr = torchaudio.load("audio.wav")
10if sr != 16000:
11 resampler = torchaudio.transforms.Resample(sr, 16000)
12 audio = resampler(audio)
13
14# Process audio to get tokens
15outputs = processor(audio, return_tensors="pt", sample_rate=16000)
16tokens = outputs.input_values # or outputs.input_ids
17
18print(f"Tokens shape: {tokens.shape}")