Views
No views yet
zalopay/vietnamese-ttsvi)1from f5_tts.infer.utils_infer import (
2 preprocess_ref_audio_text,
3 load_vocoder,
4 load_model,
5 infer_process,
6 save_spectrogram,
7)
8
9
10vocoder = load_vocoder()
11# dim: 1024
12# depth: 22
13# heads: 16
14# ff_mult: 2
15# text_dim: 512
16model = load_model(
17 DiT,
18 dict(dim=1024, depth=22, heads=16, ff_mult=2, text_dim=512, conv_layers=4),
19 ckpt_path=str(
20 cached_path("hf://zalopay/vietnamese-tts/model_960000.pt")
21 ),
22 mel_spec_type="vocos",
23 vocab_file=str(cached_path("hf://zalopay/vietnamese-tts/vocab.txt")),
24)
25
26...
27
28ref_audio, ref_text = preprocess_ref_audio_text(ref_audio_orig, ref_text)
29 gr.Info("Generated audio text: {} with audio file {} ".format(ref_text, ref_audio_orig))
30 final_wave, final_sample_rate, combined_spectrogram = infer_process(
31 ref_audio,
32 ref_text,
33 gen_text,
34 model,
35 vocoder,
36 cross_fade_duration=0.15,
37 nfe_step=32,
38 speed=speed,
39 )
401@misc{zalopay-vietnamese-tts,
2 title={Zalopay Vietnamese Text-to-Speech Model},
3 author={Zalopay},
4 year={2025},
5 publisher={Hugging Face},
6 url={https://huggingface.co/zalopay/vietnamese-tts}
7}