Imported from guidi/benchmark_ia (
benchmarks/tts_models/AGENTS.md). Install upstream withnpx skills add guidi/benchmark_ia --skill tts_models. Copyright stays with the author.
AGENTS
Objetivo
Este diretório contém o benchmark de modelos locais de TTS do repositório benchmark_ia.
O benchmark existe para medir, neste host, quais modelos de texto para fala entregam melhor equilíbrio entre português brasileiro, naturalidade, latência, uso de recursos e, quando aplicável, clonagem de voz.
Arquivos que todo agente deve ler primeiro
Antes de iniciar qualquer trabalho neste benchmark, leia nesta ordem:
- ../../HANDOFF.md
- ../../AGENTS.md
- HANDOFF.md
- BENCHMARK_PLAN.md
- MODEL_RESEARCH.md
- ENVIRONMENT_INVENTORY.md
- GLOSSARY.md
- SMOKE_RESULTS.md
- PARTIAL_RESULTS.md
- README.md
Regra obrigatória de handoff
O arquivo de continuidade deste projeto é:
Todo agente deve:
- consultar o
HANDOFF.mdantes de tomar decisões; - atualizar o
HANDOFF.mdao parar o trabalho; - registrar o que foi feito, o que não foi feito, onde o trabalho parou e qual é o próximo passo recomendado;
- manter o handoff aderente ao estado real do repositório.
Não encerrar uma sessão deixando contexto relevante apenas na conversa.
Diretrizes de execução
- Não baixar modelos grandes antes de verificar espaço em disco, VRAM, RAM, runtime e licença.
- Não assumir suporte real a português brasileiro sem gerar e ouvir amostras padronizadas.
- Não misturar avaliação de baixa latência com avaliação de clonagem de voz sem registrar a classe de execução.
- Integrar um modelo primeiro, validar ponta a ponta e só depois expandir.
- Registrar checkpoint, versão do runtime, comando executado, sample rate, formato de saída, tempo de geração, pico de VRAM e pico de RAM.
- Guardar áudio de referência e áudio gerado em artefatos separados por modelo e run.
- Para clonagem de voz, usar apenas áudios com consentimento explícito da pessoa dona da voz.
- Nunca publicar, compartilhar ou versionar amostras de voz sensíveis sem revisão manual prévia.
Ordem recomendada de trabalho
- Registrar o ambiente real do host.
- Confirmar documentação oficial atual dos modelos candidatos.
- Escolher um modelo leve para smoke test.
- Criar ambiente isolado do benchmark.
- Gerar amostras com frases padronizadas.
- Medir latência, RTF, VRAM, RAM e estabilidade.
- Adicionar F5-TTS ou XTTS-v2 para clonagem de voz.
- Consolidar os resultados em tabela comparável.
Critério de qualidade
O objetivo não é apenas provar que um modelo gera qualquer WAV.
O objetivo é responder:
qual modelo local de TTS entrega a melhor experiência prática em português brasileiro neste computador, considerando qualidade, latência, custo operacional e necessidade ou não de clonagem de voz?