Views
No views yet
1import { pipeline } from '@huggingface/transformers';
2
3const tts = await pipeline('text-to-speech', 'Hydramus/Simba-TTS-tsn-onnx', { dtype: 'fp32' });
4const { audio, sampling_rate } = await tts('Dumela rra, o tsogile jang?');
5// `audio` is a Float32Array at `sampling_rate` (16000 Hz)onnx/model.onnx — fp32 (~109 MB). VITS is Conv-dominated and onnxruntime-web has no
ConvInteger, so int8 quantization saves almost nothing here; fp32 is shipped for
simplicity and quality.config.json, vocab.json, tokenizer_config.json, etc. — VITS char tokenizer.