Views
No views yet
| Model Name | Model Path |
|---|---|
| Auffusion | https://huggingface.co/auffusion/auffusion |
| Auffusion-Full | https://huggingface.co/auffusion/auffusion-full |
| Auffusion-Full-no-adapter | https://huggingface.co/auffusion/auffusion-full-no-adapter |
1git clone https://github.com/happylittlecat2333/Auffusion/
2cd Auffusion
3pip install -r requirements.txt1import IPython, torch
2import soundfile as sf
3from auffusion_pipeline import AuffusionPipeline
4
5pipeline = AuffusionPipeline.from_pretrained("auffusion/auffusion")
6
7prompt = "Birds singing sweetly in a blooming garden"
8output = pipeline(prompt=prompt)
9audio = output.audios[0]
10sf.write(f"{prompt}.wav", audio, samplerate=16000)
11IPython.display.Audio(data=audio, rate=16000)generate function uses 100 steps and 7.5 guidance_scale by default to sample from the latent diffusion model. You can also vary parameters for different results.1prompt = "Rolling thunder with lightning strikes"
2output = pipeline(prompt=prompt, num_inference_steps=100, guidance_scale=7.5)
3audio = output.audios[0]
4IPython.display.Audio(data=audio, rate=16000)1@article{xue2024auffusion,
2 title={Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation},
3 author={Jinlong Xue and Yayue Deng and Yingming Gao and Ya Li},
4 journal={arXiv preprint arXiv:2401.01044},
5 year={2024}
6}