Views
No views yet
aka_asr subset of google/WaxalNLP
with 101 speakers and ~10,000 utterances.1from huggingface_hub import snapshot_download
2from cosyvoice.cli.cosyvoice import CosyVoice2
3from cosyvoice.utils.file_utils import load_wav
4import torchaudio
5
6model_dir = snapshot_download('prince4332/CosyVoice2-0.5B-Akan')
7model = CosyVoice2(model_dir, load_jit=False, load_trt=False, fp16=True)
8
9# Zero-shot voice cloning
10prompt_wav, sr = torchaudio.load('reference_akan.wav') # 16 kHz mono
11if sr != 16000:
12 prompt_wav = torchaudio.functional.resample(prompt_wav, sr, 16000)
13
14for chunk in model.inference_zero_shot(
15 tts_text='Meda wo ase.',
16 prompt_text='Akwaaba!',
17 prompt_speech_16k=prompt_wav,
18 stream=False,
19):
20 torchaudio.save('output.wav', chunk['tts_speech'], 22050)aka_asr split