MOSS-TTS-Nano (100M, CPU) fine-tunado em 4 vozes PT-BR (3M+1F, refs reais CML-TTS, ~5k clips/voz via Qwen3-TTS-1.7B clone, 3 epocas). WER por voz: 05=0.10, 07=0.08, 11=0.05, 12=0.03 (Whisper-large-v3). Modo voice_clone: passe o audio de referencia da voz desejada.