Views
No views yet
speech-conversionAny‑to‑any voice conversion (speech‑to‑speech) powered by Microsoft’s SpeechT5 voice‑conversion model. Convert a source utterance into the timbre of a target speaker using a short reference clip.
microsoft/speecht5_vc (with microsoft/speecht5_hifigan as vocoder); speaker embeddings via speechbrain/spkrec-ecapa-voxceleb1,571,716,275,216,842,8001,688.2899 seconds1# Requirements (Python 3.10+)
2pip install "transformers>=4.42" "datasets>=2.20" "torch>=2.1" \
3 "numpy>=1.24" "sentencepiece>=0.1.99" "protobuf>=4.23" \
4 "speechbrain>=1.0.0" soundfile
5
6# One‑shot conversion (mono 16 kHz WAVs)
7python scripts/convert_once.py \
8 --checkpoint microsoft/speecht5_vc \
9 --src path/to/src.wav \
10 --ref path/to/ref.wav \
11 --out converted.wav