Views
No views yet
1from transformers import SpeechT5Processor, SpeechT5ForTextToSpeech, SpeechT5HifiGan
2import torch
3import soundfile as sf
4
5# Load models
6processor = SpeechT5Processor.from_pretrained("HAMMALE/speecht5-darija")
7model = SpeechT5ForTextToSpeech.from_pretrained("HAMMALE/speecht5-darija")
8vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan")
9
10# Load speaker embedding (replace with your own speaker embedding)
11speaker_embedding = torch.randn(1, 512) # Example embedding
12
13# Process text
14text = "Salam, kifach nta lyoum?"
15inputs = processor(text=text, return_tensors="pt")
16
17# Generate speech
18speech = model.generate_speech(inputs["input_ids"], speaker_embedding, vocoder=vocoder)
19
20# Save audio file
21sf.write("output.wav", speech.numpy(), 16000)