PT-BR Omni Tucano2 + Mimi
Export do prototipo Omni PT-BR modular:
1 audio PT-BR -> Whisper medium PT encoder -> projector -> Tucano2 Q4/MLX
2 -> hidden states contextuais -> Talker diagonal 8-codebooks -> Mimi decoder -> audio
O checkpoint promovido nesta versao e o Talker MLX-aligned v1 . A continuacao v2 foi treinada e validada, mas nao foi promovida porque manteve a mesma qualidade e ficou mais lenta no gate local Core ML.
Status
Funcionando no gate local em Mac/Core ML:
Core ML Talker + Mimi + Whisper medium: 50/50 passou.
Audio vazio: 0.
Mistura de idioma: 0.
WER medio vs resposta: 0.0633.
CER medio vs resposta: 0.0307.
Talker Core ML medio: 0.0863s.
Mimi decode local medio: 0.0403s.
Gate end-to-end 50Q:
Pipeline: audio -> Whisper encoder -> projector -> Tucano2 Q4 -> Talker -> Mimi -> WAV.
Passed: 50/50.
Entrada -> 1o audio medio: 0.7702s.
Apos 3 warmups: medio 0.7563s, p95 0.9134s, max 0.9686s.
Observacao: o gate e nao-streaming; o primeiro chunk foi medido como WAV completo nesse harness.
Checkpoints
Checkpoint principal:
1 checkpoints/mlx_tucano_talker_alignment/talker.pt
2 checkpoints/mlx_tucano_talker_alignment/config.json
3 checkpoints/mlx_tucano_talker_alignment/tokenizer/
Checkpoint legado gate10:
checkpoints/tucano_bridge_diagonal_gate10_q4_exact_ss_lr5e5_ptbr/talker.pt
Core ML
Export Core ML promovido:
1 coreml/coreml_mlx_aligned_parts/TucanoMimiTalkerStep.mlpackage
2 coreml/coreml_mlx_aligned_parts/WhisperTucanoProjector.mlpackage
3 coreml/coreml_mlx_aligned_parts/manifest.json
O Mimi decoder continua congelado. Este pacote nao treina nem altera o Mimi; ele usa o Mimi como codec neural.
Avaliacao Incluida
1 eval/mlx_tucano_coreml_aligned_talker_mimi_50q_mac/
2 eval/projector_mimi_e2e_50q_cycle04/
3 eval/talker_audio_repair_agents_50q_status.json
Os WAVs gerados nos gates estao incluidos para auditoria com Whisper/escuta manual.
O Que Foi Treinado
Foi treinado/ajustado o Talker/adapter:
Tucano2 hidden states contextuais -> 8 tokens Mimi
Nao e um fine-tune completo do Tucano2. O Tucano2 e o Mimi decoder ficam congelados.
Reproducao Do Gate Core ML
1 TRANSFORMERS_NO_TORCHVISION = 1 python3.11 tools_ptbr/talker_text_mimi/run_coreml_talker_mimi_50q_gate.py \
2 --hidden-npz eval_ptbr/mlx_tucano_hidden_50q_mac/mlx_tucano_hidden_50q_fp32.npz \
3 --talker-mlpackage coreml/coreml_mlx_aligned_parts/TucanoMimiTalkerStep.mlpackage \
4 --mimi-path model/mimi \
5 --out-dir eval/mlx_tucano_coreml_aligned_talker_mimi_50q_mac \
6 --frames 24
Escopo
Este e um pipeline Omni modular para PT-BR, nao um unico transformer nativo de audio. A meta atual e iPhone/latencia com 8 codebooks Mimi. A versao de 16 codebooks fica para outra fase.