Views
No views yet
1import torch
2from transformers import CsmForConditionalGeneration, AutoProcessor
3
4model_id = "Nadhari/swa-csm-1b"
5device = "cuda" if torch.cuda.is_available() else "cpu"
6
7processor = AutoProcessor.from_pretrained(model_id)
8model = CsmForConditionalGeneration.from_pretrained(model_id, device_map=device)
9
10# Generate Swahili speech
11text = "[0]Mambo vipi?."
12inputs = processor(text, add_special_tokens=True).to(device)
13
14audio = model.generate(**inputs, output_audio=True)
15processor.save_audio(audio, "swahili_output.wav")1conversation = [
2 {"role": "0", "content": [{"type": "text", "text": "Habari yako?"}]},
3]
4inputs = processor.apply_chat_template(
5 conversation,
6 tokenize=True,
7 return_dict=True,
8).to(device)
9
10audio = model.generate(**inputs, output_audio=True)
11processor.save_audio(audio, "swahili_conversation.wav")1@misc{swa-csm-1b,
2 author = {Nadhari AI Lab},
3 title = {Swa-CSM-1B: Swahili Text-to-Speech Model},
4 year = {2025},
5 publisher = {Hugging Face},
6 url = {https://huggingface.co/Nadhari/swa-csm-1b}
7}