Chatterbox TTS: clonar voz com licença de uso comercial
Clone vozes em PT-BR com 5s de áudio — licença MIT, uso comercial liberado
- Memória de vídeo
- 8 GB
- Instalação
- ~10 min
- Acesso
- porta 7860
- Cobrança
- por hora, em reais
O Chatterbox, da Resemble AI, clona uma voz com 5 a 15 segundos de amostra, fala mais de 20 idiomas incluindo português do Brasil e tem um controle de expressividade que quase nenhum concorrente aberto oferece. O ponto decisivo: licença MIT, ou seja, você pode usar o áudio comercialmente sem amarra.
Clonagem de voz da Resemble AI, com licença MIT: pode usar comercialmente sem restrição. Suporta mais de 20 idiomas incluindo português do Brasil, tem controle de expressividade e clona uma voz com 5 a 15 segundos de amostra. Interface web pronta, com os áudios salvos na própria máquina.
Para que serve
- Voz de marca consistente para vídeo, podcast e URA
- Controle de expressividade para leitura mais viva ou mais neutra
- Licença MIT: pode vender o que você gerar, sem cláusula de uso pessoal
- Tudo roda na sua máquina — o áudio de referência não sai dali
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template Chatterbox TTS e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 10 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 7860.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Qual a diferença para o F5-TTS?
O Chatterbox tem licença MIT e controle de expressividade; o F5-TTS costuma soar mais neutro e tem pesos específicos para português. Vale testar os dois na mesma máquina.
Por que não usar o XTTS-v2?
Os pesos do XTTS-v2 são de licença não comercial e a empresa que o mantinha fechou em 2024. Para uso profissional, o Chatterbox é a escolha segura.
Quanto tempo leva a primeira geração?
A instalação leva cerca de 10 minutos e o primeiro clique baixa os modelos (mais uns 3 minutos). Depois disso, cada áudio sai em segundos.