Views
No views yet
codigo/ neste repositório)⚠️ Isto não é um modelo pronto para uso. É um estudo de caso em progresso. Os checkpoints aqui foram treinados por poucas dezenas de milhares de passos e ainda não produzem fala de qualidade utilizável. Estão publicados para registrar o processo e permitir que outras pessoas retomem o trabalho, não para serem usados em produção.
| Símbolos fonéticos novos necessários | 0 (dos 219 existentes) |
| Slots de idioma livres no checkpoint | 3 (language_emb é 10×192, só 7 em uso) |
| Slots de tom livres | 2 (tone_emb é 16×192, 14 em uso) |
PT entra como language_id=7 e tone_start=14. O inventário do gruut em
modo brasileiro cabe inteiro na tabela existente depois de uma normalização
Unicode NFD — as vogais nasais pré-compostas (õ ĩ ẽ ũ) se decompõem em vogal +
til combinante (U+0303), símbolo que já existia. Isso preserva os índices do
embedding e permite carregar o checkpoint pré-treinado com strict=True.use_espeak_phonemes=False. Esse detalhe é decisivo: com True o gruut
produz português europeu (de → dɨ); com False usa o léxico próprio,
que é brasileiro (de → dʒi, leite → lejtʃi, calma → kɐwmɐ).
O código de idioma não muda nada — pt-br é apenas alias de pt no gruut.15h30 como data e
ignora R$).myshell-public-repo-host.s3.amazonaws.com/openvoice/basespeakers/pretrained/)
saíram do ar — devolvem 404 para G.pth, D.pth e DUR.pth. Por isso:myshell-ai/MeloTTS-Spanish,
idioma mais próximo (34 dos 42 símbolos observados em comum).texts.csv original.G_*.pth — gerador (é o necessário para inferência)D_*.pth, DUR_*.pth — discriminadores (necessários apenas para retomar o treino)config.json — configuração do modelo; precisa acompanhar o checkpointamostras/ — a mesma frase sintetizada em cada checkpoint, para ouvir a
evolução da pronúncia ao longo do treinocodigo/. Instruções completas em codigo/COMO_USAR.md.1from melo.api import TTS
2
3modelo = TTS(language='PT', device='cpu',
4 config_path='config.json',
5 ckpt_path='checkpoints/G_44695.pth')
6modelo.tts_to_file('O rato roeu a roupa do rei de Roma.',
7 modelo.hps.data.spk2id['PT-BR'], 'saida.wav')codigo/melo/ — arquivos novos, deste projeto (frontend PT completo)codigo/melotts-ptbr.patch — as alterações nos arquivos do MeloTTS upstream,
como diff, em vez de redistribuir arquivos de terceiros como se fossem meuscodigo/ferramentas/ — preparação de corpus, painel de acompanhamento,
geração de amostras, teste de generalização (não precisa para inferência)ESTUDO_PT_BR.md.1@software{zhao2024melo,
2 author = {Zhao, Wenliang and Yu, Xumin and Qin, Zengyi},
3 title = {MeloTTS: High-quality Multi-lingual Multi-accent Text-to-Speech},
4 url = {https://github.com/myshell-ai/MeloTTS},
5 year = {2023}
6}1@article{casanova2022tts,
2 title = {TTS-Portuguese Corpus: a corpus for speech synthesis in Brazilian Portuguese},
3 author = {Casanova, Edresson and Candido Junior, Arnaldo and Shulby, Christopher
4 and Oliveira, Frederico Santos de and Teixeira, Jo{\~a}o Paulo and
5 Ponti, Moacir Antonelli and Alu{\'i}sio, Sandra Maria},
6 journal = {Language Resources and Evaluation},
7 year = {2022},
8 doi = {10.1007/s10579-021-09570-4}
9}1@inproceedings{souza2020bertimbau,
2 author = {F\'abio Souza and Rodrigo Nogueira and Roberto Lotufo},
3 title = {{BERT}imbau: pretrained {BERT} models for {B}razilian {P}ortuguese},
4 booktitle = {9th Brazilian Conference on Intelligent Systems, {BRACIS}},
5 year = {2020}
6}