Views
No views yet
bicodec engine of vconnx —
a pure-ONNX multi-engine voice-cloning library.1from vconnx import VoiceCloner
2
3cloner = VoiceCloner(engine="bicodec")
4out = cloner.clone_voice("source.wav", "reference.wav", "out.wav")
5print(cloner.sample_rate) # 16000pip install vconnx| File | Description | Size (fp32) | Size (INT8) |
|---|---|---|---|
wav2vec2_encoder.onnx | Wav2Vec2-XLSR-53 encoder (layers 11/14/16 avg) | 819 MB | 206 MB |
semantic_encoder.onnx | Conv encoder + FactorizedVQ → semantic tokens | 116 MB | 30 MB |
global_encoder.onnx | ECAPA-TDNN + Perceiver + FSQ → global tokens | 22 MB | 6 MB |
decoder.onnx | Token decoder → waveform | 368 MB | 158 MB |
mel_filterbank.npy | 128-bin Slaney mel filterbank (numpy, 128×513) | 256 KB | — |
mel_config.json | STFT parameters (n_fft=1024, hop=320, win=640) | ~1 KB | — |
| Component | Metric | Value | Result |
|---|---|---|---|
| wav2vec2_encoder | max_abs | 6.71e-4 | PASS |
| semantic_encoder | exact int match | True | PASS |
| global_encoder | exact int match | True | PASS |
| mel numpy vs torchaudio | max_abs | 0.00e+0 | PASS |
| decoder | max_abs | 2.53e-6 | PASS |