1from transformers import AutoModel, AutoTokenizer
2m = AutoModel.from_pretrained("marcosremar2/iaratts-sft-v4", trust_remote_code=True)
3t = AutoTokenizer.from_pretrained("marcosremar2/iaratts-sft-v4", trust_remote_code=True)
4# Tags as single tokens:
5ids = t.encode("<laugh> Que dia! Estou exausto.", add_special_tokens=False)
1python infer.py --checkpoint marcosremar2/iaratts-sft-v4 \
2 --audio-tokenizer-pretrained-name-or-path OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano \
3 --text "<sigh> Encontrei um erro no código." \
4 --output-audio-path out.wav --mode continuation --seed 42
Phase 4 wave complete. Next: Phase 4.4 (IndexTTS2 instruction LM)
or Phase 5.5 (CosyVoice-2 distill to 150M streaming).
License: MIT (same as upstream MOSS-TTS-Nano).