Views
No views yet
Aynkader/Balochi-TTS-Three-SpeakersBalochiT5-Fine-Tuned-Model2-Newsmicrosoft/speecht5_hifiganAynkader/Balochi-TTS| Voice | Key | Embedding file | Description |
|---|---|---|---|
| Ayn Káder | ayn_kader | speaker_embedding_ayn_kader.pt | Original news reader |
| Dódá | doda | speaker_embedding_doda.pt | Male voice |
| Dódén | doden | speaker_embedding_doden.pt | Female voice |
1import torch
2import soundfile as sf
3from huggingface_hub import hf_hub_download
4from transformers import SpeechT5ForTextToSpeech, SpeechT5HifiGan, SpeechT5Processor
5
6MODEL_ID = "Aynkader/Balochi-TTS-Three-Speakers"
7device = "cuda" if torch.cuda.is_available() else "cpu"
8
9processor = SpeechT5Processor.from_pretrained(MODEL_ID)
10model = SpeechT5ForTextToSpeech.from_pretrained(MODEL_ID).to(device).eval()
11vocoder = SpeechT5HifiGan.from_pretrained("microsoft/speecht5_hifigan").to(device).eval()
12
13emb_path = hf_hub_download(MODEL_ID, "speaker_embedding_ayn_kader.pt")
14speaker = torch.load(emb_path, map_location="cpu", weights_only=False)
15if speaker.dim() == 1:
16 speaker = speaker.unsqueeze(0)
17
18text = "Gwáderá tyáb dapá sharábay proshtagén bótalán daryáward paréshán kotagant."
19inputs = processor(text=text, return_tensors="pt").to(device)
20
21with torch.no_grad():
22 speech = model.generate_speech(
23 inputs["input_ids"],
24 speaker.to(device),
25 vocoder=vocoder,
26 threshold=0.62,
27 minlenratio=0.10,
28 maxlenratio=6.0,
29 )
30
31sf.write("output.wav", speech.cpu().numpy(), 16000)a b c d e g h i j k l m n o p r s t u w y z
á é ó (and uppercase)
. , : ? ! ' -
digits 0-9| File | Description |
|---|---|
config.json | SpeechT5 architecture |
model.safetensors | Fine-tuned weights (~578 MB) |
preprocessor_config.json | Mel spectrogram settings |
spm_char.model | SentencePiece tokenizer |
speaker_embedding_ayn_kader.pt | News reader embedding |
speaker_embedding_doda.pt | Male speaker embedding |
speaker_embedding_doden.pt | Female speaker embedding |
BalochiT5-Fine-Tuned-Model2-News (25 news clips)train_tts_three_speakers.py in the upstream TTS projectAynkader/Balochi-TTS-Three-Speakers — https://huggingface.co/Aynkader/Balochi-TTS-Three-Speakers