Views
No views yet
| Base model | XTTS v2 (coqui/XTTS-v2) |
| Language | English (Nigerian accent) |
| Architecture | GPT + VITS decoder |
| Task | Text-to-speech, zero-shot voice cloning |
| Sample rate | 24 kHz |
| License | Coqui Public Model License (CPML) |
pip install TTS1from TTS.api import TTS
2
3tts = TTS("yusasif/nigerian-accent-english", gpu=True)
4
5tts.tts_to_file(
6 text="Welcome to Nigeria. How can I assist you today?",
7 file_path="output.wav",
8 speaker_wav="reference_speaker.wav", # ~6 seconds of clean Nigerian-accented English
9 language="en",
10)1from TTS.tts.configs.xtts_config import XttsConfig
2from TTS.tts.models.xtts import Xtts
3import soundfile as sf
4
5config = XttsConfig()
6config.load_json("/path/to/model/config.json")
7model = Xtts.init_from_config(config)
8model.load_checkpoint(config, checkpoint_dir="/path/to/model/", eval=True)
9model.cuda()
10
11# Extract voice characteristics from reference audio
12gpt_cond_latent, speaker_embedding = model.get_conditioning_latents(
13 audio_path="reference_speaker.wav"
14)
15
16# Synthesize
17outputs = model.inference(
18 text="Welcome to Nigeria. How can I assist you today?",
19 language="en",
20 gpt_cond_latent=gpt_cond_latent,
21 speaker_embedding=speaker_embedding,
22 temperature=0.7,
23 speed=1.0,
24)
25
26sf.write("output.wav", outputs["wav"], 24000)| Condition | Result |
|---|---|
| Clean studio recording | Best quality |
| Phone recording, quiet room | Good quality |
| Noisy background | Reduced quality |
| Less than 3 seconds | May not clone correctly |
| 6–12 seconds | Optimal |