F5-TTS na nuvem, com interface pronta
Clone qualquer voz em PT-BR com apenas 5 segundos de áudio
- Memória de vídeo
- 8 GB
- Instalação
- ~4 min
- Acesso
- porta 7860
- Cobrança
- por hora, em reais
O F5-TTS clona uma voz a partir de poucos segundos de áudio e gera narração em português com qualidade de estúdio. Você sobe a máquina, abre a interface no navegador e começa a gerar — sem instalar nada no seu computador.
Modelo state-of-the-art de Text-to-Speech com clonagem de voz instantânea. Suporta português brasileiro, inglês e mais 6 idiomas. Interface web pronta para uso.
Para que serve
- Narração de vídeo e audiobook na sua própria voz
- Locução para anúncio e treinamento corporativo sem estúdio
- Geração em lote pela API, para catálogos com milhares de textos
- O áudio fica na sua máquina: nada sobe para serviço de terceiro
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template F5-TTS e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 4 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 7860.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Qual GPU é suficiente?
A partir de 8 GB de memória de vídeo o modelo roda bem. Placas de 16 a 24 GB deixam a geração mais rápida em lote.
Funciona bem em português do Brasil?
Sim, há pesos treinados para português e o resultado é natural para locução. Amostras limpas, sem ruído de fundo, fazem a maior diferença.
Quanto custa gerar uma hora de áudio?
Você paga a máquina por hora, não por caractere. Uma GPU de entrada gera muitos minutos de áudio por hora de aluguel, o que costuma sair bem abaixo do preço por caractere das assinaturas.