Views
No views yet
1import torchaudio
2from transformers import AutoModel
3
4# Load model
5model = AutoModel.from_pretrained("timofeiiz/soundstream-impl", trust_remote_code=True)
6model.eval()
7
8waveform, sr = torchaudio.load("audio.wav")
9assert sr == 16000 # Only 16 kHz sample rate is supported
10
11# Encode to discrete tokens
12indices = model.encode(waveform.unsqueeze(0)) # (1, 8, T)
13
14# Decode back to audio
15reconstructed = model.decode(indices, original_length=waveform.size(-1))
16
17torchaudio.save("reconstructed.wav", reconstructed.squeeze(0).cpu(), 16000)