Views
No views yet
ibo)ibo).| WAXAL dataset config | google/WaxalNLP — ibo_tts |
| Data provider | Media Trust |
| WAXAL data license | CC-BY-SA-4.0 |
| Base model | facebook/mms-tts-yor |
| Model license | CC-BY-NC 4.0 (MMS base; governs fine-tuned model) |
facebook/mms-tts-ibo does not exist in MMS-TTS coverage (1107 languages). This repository fine-tunes from the closest available linguistic donor:| Proxy donor | facebook/mms-tts-yor |
| Ranked alternatives | yor, pcm, hau |
| Other WAXAL languages sharing this donor | none |
Each recipient language is fine-tuned independently from the same donor base. Donor weights provide acoustic/prosodic warm-start; WAXAL fine-tuning adapts them to the target language.
facebook/mms-tts-* Hub checkpoints are inference-only releases that crash run_vits_finetuning.py. This repository applies three patches:| File | Change |
|---|---|
config.json | pad_token_id set to 0 (was null) |
tokenizer_config.json | pad_token entry added |
preprocessor_config.json | Added — VitsFeatureExtractor config from ylacombe/mms-tts-eng-train |
Model weights are not stored here._name_or_pathinconfig.jsonpoints tofacebook/mms-tts-yor, sorun_vits_finetuning.pyloads weights from that checkpoint at training time.
ylacombe/mms-tts-eng-train.
Values are VITS architecture constants shared by all MMS-TTS languages.| Field | Value |
|---|---|
feature_extractor_type | VitsFeatureExtractor |
feature_size | 80 |
hop_length | 256 |
max_wav_value | 32768.0 |
n_fft | 1024 |
padding_side | right |
padding_value | 0.0 |
return_attention_mask | False |
sampling_rate | 16000 |
spec_gain | 1 |
1{
2 "model_name_or_path": "rnjema-unima/mms-tts-ibo-baseline",
3 "feature_extractor_name": "rnjema-unima/mms-tts-ibo-baseline",
4 "dataset_name": "google/WaxalNLP",
5 "dataset_config_name": "ibo_tts",
6 "audio_column_name": "audio",
7 "text_column_name": "text",
8 "train_split_name": "train",
9 "eval_split_name": "validation"
10}1from transformers import VitsModel, VitsTokenizer
2import torch, scipy
3
4model = VitsModel.from_pretrained("your-org/your-finetuned-model")
5tokenizer = VitsTokenizer.from_pretrained("your-org/your-finetuned-model")
6
7inputs = tokenizer("Your text in Igbo.", return_tensors="pt")
8with torch.no_grad():
9 out = model(**inputs)
10
11scipy.io.wavfile.write("output.wav", model.config.sampling_rate,
12 out.waveform.squeeze().numpy())| Architecture | VITS (end-to-end, no separate vocoder) |
| MMS match type | proxy |
pad_token_id | 0 |
vocab_size | 43 |
is_uroman | false |
sampling_rate | 16000 Hz |
@article{pratap2023mms, title={Scaling Speech Technology to 1,000+ Languages}, author={Vineel Pratap and Andros Tjandra and Bowen Shi and Paden Tomasello and Arun Babu and Sayani Kundu and Ali Elkahky and Zhaoheng Ni and Apoorv Vyas and Maryam Fazel-Zarandi and Alexei Baevski and Yossi Adi and Xiaohui Zhang and Wei-Ning Hsu and Alexis Conneau and Michael Auli}, journal={arXiv}, year={2023} }