Views
No views yet
1from transformers import CsmForConditionalGeneration, AutoProcessor
2import torch
3import soundfile as sf
4
5# Load the model
6model_id = "keanteng/sesame-csm-elise" # Replace with your model
7device = "cuda" if torch.cuda.is_available() else "cpu"
8
9processor = AutoProcessor.from_pretrained(model_id)
10model = CsmForConditionalGeneration.from_pretrained(model_id, device_map=device)1# Simple text generation
2conversation = [
3 {"role": "0", "content": [{"type": "text", "text": "Hello, this is a test!"}]}
4]
5
6inputs = processor.apply_chat_template(
7 conversation,
8 tokenize=True,
9 return_dict=True,
10).to(device)
11
12# Generate audio
13audio = model.generate(**inputs, output_audio=True)
14audio_cpu = audio[0].to(torch.float32).cpu().numpy()
15
16# Save to file
17sf.write("output.wav", audio_cpu, 24000)