Views
No views yet
1import torch
2import torchaudio
3from stable_audio_tools import get_pretrained_model
4from stable_audio_tools.inference.generation import generate_diffusion_cond_inpaint
5from peft import PeftModel
6
7# Load base model
8model, model_config = get_pretrained_model("stabilityai/stable-audio-3-medium")
9model = model.cuda()
10
11# Load LoRA adapter
12model.model.model = PeftModel.from_pretrained(
13 model.model.model,
14 "motiftechnologies/stable-audio-3-maqam-lora"
15)
16model.model.model.merge_and_unload()
17model = model.eval()
18
19# Generate
20with torch.no_grad():
21 audio = generate_diffusion_cond_inpaint(
22 model,
23 steps=50,
24 cfg_scale=6.0,
25 conditioning=[{"prompt": "Maqam Bayati on <oud>, <qanun>, <ney>; slow tempo; taqsim form", "seconds_total": 30}],
26 sample_size=44100 * 30,
27 device="cuda",
28 inpaint_mask=torch.zeros(1, 44100 * 30, device="cuda"),
29 )
30
31torchaudio.save("output.wav", audio.squeeze(0).cpu(), 44100)