Views
No views yet
pip install transformers torch soundfile ipython1from transformers import CsmForConditionalGeneration, AutoProcessor
2import torch
3from IPython.display import Audio, display
4import soundfile as sf
5
6# Load model dan processor
7model = CsmForConditionalGeneration.from_pretrained("Ellbendls/csm-1b-indonesian-fine-tuned")
8processor = AutoProcessor.from_pretrained("Ellbendls/csm-1b-indonesian-fine-tuned")
9
10# Move to GPU if available
11device = "cuda" if torch.cuda.is_available() else "cpu"
12model = model.to(device)
13
14# Generate audio
15text = "Selamat pagi, nama saya adalah Budi. Bagaimana kabar Anda hari ini?"
16speaker_id = 0 # Use speaker ID 0-80
17
18inputs = processor(f"[{speaker_id}]{text}", add_special_tokens=True).to(device)
19audio_values = model.generate(
20 **inputs,
21 max_new_tokens=125, # ~10 seconds of audio
22 output_audio=True
23)
24
25# Convert and save audio
26audio = audio_values[0].to(torch.float32).cpu().numpy()
27sf.write("indonesian_tts_output.wav", audio, 24000)
28display(Audio(audio, rate=24000))1# Generate with custom parameters for better quality
2audio_values = model.generate(
3 **inputs,
4 max_new_tokens=200, # For longer text
5 depth_decoder_top_p=0.9,
6 depth_decoder_do_sample=True,
7 depth_decoder_temperature=0.9,
8 output_audio=True
9)1@model{csm-1b-indonesian-fine-tuned,
2 title={CSM-1B Indonesian Fine-tuned TTS Model},
3 author={Ellbendls},
4 year={2025},
5 base_model={unsloth/csm-1b},
6 dataset={octava/indonesian-voice-transcription-1.1.85}
7}