Views
No views yet
OpenMOSS-Team/MOSS-TTS-Nano-100M using mlx-audio version 0.4.0.
python infer.py, python app.py, and packaged CLI support| Language | Code | Flag | Language | Code | Flag | Language | Code | Flag |
|---|---|---|---|---|---|---|---|---|
| Chinese | zh | 🇨🇳 | English | en | 🇺🇸 | German | de | 🇩🇪 |
| Spanish | es | 🇪🇸 | French | fr | 🇫🇷 | Japanese | ja | 🇯🇵 |
| Italian | it | 🇮🇹 | Hungarian | hu | 🇭🇺 | Korean | ko | 🇰🇷 |
| Russian | ru | 🇷🇺 | Persian (Farsi) | fa | 🇮🇷 | Arabic | ar | 🇸🇦 |
| Polish | pl | 🇵🇱 | Portuguese | pt | 🇵🇹 | Czech | cs | 🇨🇿 |
| Danish | da | 🇩🇰 | Swedish | sv | 🇸🇪 | Greek | el | 🇬🇷 |
| Turkish | tr | 🇹🇷 |
moss-tts-nano command becomes available locally.
The examples below intentionally keep arguments minimal and rely on the repository defaults.
By default, the code loads OpenMOSS-Team/MOSS-TTS-Nano and OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano.1conda create -n moss-tts-nano python=3.12 -y
2conda activate moss-tts-nano
3
4git clone https://github.com/OpenMOSS/MOSS-TTS-Nano.git
5cd MOSS-TTS-Nano
6
7pip install -r requirements.txt
8pip install -e .WeTextProcessing fails to install from requirements.txt, try installing it manually in the same environment:1conda install -c conda-forge pynini=2.1.6.post1 -y
2pip install git+https://github.com/WhizZest/WeTextProcessing.gitinfer.py1python infer.py \
2 --prompt-audio-path assets/audio/zh_1.wav \
3 --text "欢迎关注模思智能、上海创智学院与复旦大学自然语言处理实验室。"generated_audio/infer_output.wav by default.app.pypython app.pyhttp://127.0.0.1:18083 in your browser.moss-tts-nano generatepip install -e ., you can call the packaged CLI directly:1moss-tts-nano generate \
2 --prompt-speech assets/audio/zh_1.wav \
3 --text "欢迎关注模思智能、上海创智学院与复旦大学自然语言处理实验室。"moss-tts-nano generate writes to generated_audio/moss_tts_nano_output.wav by default.--prompt-speech is the friendly alias for the reference audio path used by voice cloning.--text-file is supported for long-form synthesis.moss-tts-nano servemoss-tts-nano serveapp.py, keeps the model loaded in memory, and serves the local browser demo plus HTTP generation endpoints.
| Model | Hugging Face | ModelScope |
|---|---|---|
| MOSS-Audio-Tokenizer-Nano |
LICENSE file. If you are reading this before that file is published, please treat the repository as not yet licensed for redistribution.1@misc{openmoss2026mossttsnano,
2 title={MOSS-TTS-Nano},
3 author={OpenMOSS Team},
4 year={2026},
5 howpublished={GitHub repository},
6 url={https://github.com/OpenMOSS/MOSS-TTS-Nano}
7}1@misc{gong2026mossttstechnicalreport,
2 title={MOSS-TTS Technical Report},
3 author={Yitian Gong and Botian Jiang and Yiwei Zhao and Yucheng Yuan and Kuangwei Chen and Yaozhou Jiang and Cheng Chang and Dong Hong and Mingshu Chen and Ruixiao Li and Yiyang Zhang and Yang Gao and Hanfu Chen and Ke Chen and Songlin Wang and Xiaogui Yang and Yuqian Zhang and Kexin Huang and ZhengYuan Lin and Kang Yu and Ziqi Chen and Jin Wang and Zhaoye Fei and Qinyuan Cheng and Shimin Li and Xipeng Qiu},
4 year={2026},
5 eprint={2603.18090},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2603.18090}
9}1@misc{gong2026mossaudiotokenizerscalingaudiotokenizers,
2 title={MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models},
3 author={Yitian Gong and Kuangwei Chen and Zhaoye Fei and Xiaogui Yang and Ke Chen and Yang Wang and Kexin Huang and Mingshu Chen and Ruixiao Li and Qingyuan Cheng and Shimin Li and Xipeng Qiu},
4 year={2026},
5 eprint={2602.10934},
6 archivePrefix={arXiv},
7 primaryClass={cs.SD},
8 url={https://arxiv.org/abs/2602.10934},
9}