Views
No views yet
stable-audio-3 inference and fine-tuning librarystable-audio-tools research librarystable-audio-31import torchaudio
2from stable_audio_3 import AutoencoderModel
3
4ae = AutoencoderModel.from_pretrained("same-s")
5waveform, sr = torchaudio.load("audio.wav")
6latents = ae.encode(waveform, sr)
7audio_out = ae.decode(latents)stable-audio-tools1import torch
2import torchaudio
3from einops import rearrange
4from stable_audio_tools import get_pretrained_model
5from stable_audio_tools.inference.generation import generate_diffusion_cond
6
7device = "cuda" if torch.cuda.is_available() else "cpu"
8if device == "cuda":
9 model_half = True
10
11# Download model
12model, model_config = get_pretrained_model("stabilityai/SAME-S")
13sample_rate = model_config["sample_rate"]
14sample_size = model_config["sample_size"]
15
16model = model.to(device)
17if model_half:
18 model = model.to(torch.float16)
19
20audio, sr = torchaudio.load(/path/to/audiofile) # [channels, samples]
21if audio.shape[0] == 1:
22 audio = audio.repeat(2, 1)
23
24audio = audio.unsqueeze(0).to(device)
25if model_half:
26 audio = audio.half()
27with torch.no_grad():
28 latents = model.encode_audio(audio)
29 reconstructed = model.decode_audio(latents)
30reconstructed = reconstructed.squeeze(0).cpu()
31reconstructed = reconstructed.to(torch.float32).clamp(-1, 1).mul(32767).to(torch.int16).cpu()
32SAME is a continuous autoencoder model based on a transformer architecture.