O modo de voz é a funcionalidade que mais parece mágica e a que mais claramente revela a arquitetura de peças desta série. Porque não tem nada de uma coisa só: são três modelos em sequência, e o usuário percebe cada milissegundo somado.
1. O que tem dentro · 2. O cérebro · 3. Os olhos (OCR) · 4. A memória (documentos) · 5. Imagem · 6. Vídeo · 7. Voz ← você está aqui · 8. Ferramentas e agentes · 9. Juntando tudo e a conta
O ciclo completo
Você fala. O que acontece:
- Ouvir — um modelo de transcrição converte o áudio em texto.
- Pensar — o modelo de texto recebe a transcrição e escreve a resposta. Ele nunca ouviu nada.
- Falar — um modelo de síntese converte a resposta em áudio.
Três modelos, três máquinas possíveis, três latências que se somam. E aqui está o número que rege esse projeto inteiro: acima de 1,5 segundo de silêncio, a conversa deixa de parecer conversa. É o limiar em que o cérebro humano interpreta a pausa como "travou".
| Etapa | Latência típica | Onde economizar |
|---|---|---|
| Detectar que você parou de falar | 200–300 ms | Detecção de silêncio local, no dispositivo |
| Transcrever | 200–400 ms | Modelo médio em vez do maior; transcrever enquanto fala |
| Primeira palavra do modelo de texto | 300–800 ms | Resposta em fluxo contínuo, prompt curto, modelo menor |
| Primeiro som sintetizado | 200–500 ms | Sintetizar a primeira frase enquanto o resto é escrito |
| Total percebido | 0,9 a 2,0 s |
A implementação ingênua é sequencial: transcreve tudo, espera a resposta inteira, sintetiza tudo, toca. Somando os piores casos, dá 4 segundos de silêncio.
A implementação certa encavala as etapas: assim que o modelo de texto escreve a primeira frase completa (fluxo contínuo, parte 2), essa frase já vai para a síntese e começa a tocar — enquanto o modelo ainda escreve a segunda. O usuário ouve a resposta começar em menos de um segundo, mesmo que ela leve seis para terminar.
Ouvir: o Whisper e as suas versões
Transcrição é a peça mais resolvida de toda esta série. O Whisper é aberto, entende português muito bem, e a escolha é só de tamanho:
| Versão | VRAM | Velocidade | Quando usar |
|---|---|---|---|
| small | ~2 GB | ~12× o tempo real | Áudio limpo, um locutor, você só quer o assunto |
| medium | ~5 GB | ~6× o tempo real | Reunião com áudio decente |
| large | ~10 GB | ~2,5× o tempo real | Padrão para português com sotaque, ruído ou jargão |
| turbo | ~6 GB | ~8× o tempo real | O melhor equilíbrio para lote grande |
"8× o tempo real" quer dizer que uma hora de áudio é transcrita em 7 minutos e meio. Numa placa de R$ 2,78 por hora, isso dá R$ 0,35 por hora de áudio.
Mil horas de gravação de reunião ou de central de atendimento: cerca de R$ 350 e uns cinco dias de placa ligada — ou uma tarde, se você dividir o lote em várias máquinas em paralelo. É a peça com melhor retorno de toda a série, e a que menos gente sabe que é tão barata.
O que quebra em português
- Sobreposição de falantes. Duas pessoas falando junto viram texto embaralhado. A correção é separação de falantes antes da transcrição, que custa mais um pouco de máquina.
- Jargão e nome próprio. Nome de produto, sigla interna e sobrenome saem errados. Tem correção barata — está logo abaixo.
- Números e valores. "Um seis cinco zero" em vez de "1.650". Mesma correção.
- Áudio de telefone. 8 kHz corta as frequências altas e derruba a precisão. Use o modelo grande nesses casos.
Depois de transcrever, passe o texto pelo modelo econômico com uma lista dos seus termos: "corrija nomes próprios, siglas e números nesta transcrição. Vocabulário do cliente: [lista]. Não reescreva o estilo, só corrija erros de reconhecimento."
Uma hora de fala dá umas 9 mil palavras, ou ~13 mil tokens. No modelo mais barato, custa R$ 0,02 por hora de áudio corrigida. É a melhor troca de qualidade por real da série.
Falar: síntese em português
Do lado da fala há mais opções abertas maduras, todas rodando em placa pequena:
| Modelo | Forte em | VRAM |
|---|---|---|
| XTTS v2 | Português nativo, clonagem com poucos segundos de referência | ~8 GB |
| F5-TTS | Naturalidade e velocidade | ~8 GB |
| OpenVoice v2 | Controle de estilo e emoção | ~10 GB |
| Chatterbox | Conversa, com prosódia mais solta | ~8 GB |
Um minuto de narração leva de 4 a 8 segundos para ser gerado. Numa placa de R$ 1,27 por hora, sai por R$ 0,002 o minuto de áudio — dois milésimos de real. Um audiolivro de 10 horas custa pouco mais de um real de máquina.
Preços de agosto de 2026, para uma GPU avulsa, sem interrupção programada. O catálogo muda: confira a vitrine antes de fechar a conta.
A etapa que quase todo mundo pula
Modelo de síntese lê o que está escrito, literalmente. "R$ 1.250,00" vira "erre cifrão um ponto dois cinco zero". "CNPJ" vira uma tentativa de pronunciar a sigla como palavra.
Antes de sintetizar, normalize o texto — e essa é outra tarefa perfeita para o modelo econômico: transformar números em extenso, expandir siglas, quebrar frases longas em frases faláveis. Custa centavos por hora de áudio e é a diferença entre uma narração profissional e uma leitura de robô.
Os modelos abertos clonam uma voz com 10 a 30 segundos de referência. A tecnologia não pergunta de quem é a voz — a lei pergunta.
Voz é dado biométrico e identifica uma pessoa. Clonar sem autorização expressa e registrada é risco jurídico direto, sob a LGPD e além dela. Regra do produto: só clone voz com autorização documentada de quem é, guarde essa autorização junto do modelo de voz, e permita revogação.
O caso que realmente paga a conta
Conversar por voz com um assistente é o que aparece nos vídeos de lançamento. O que os clientes compram, na prática, é isto:
Uma empresa com 40 reuniões por semana, de uma hora cada, grava tudo. Transcrever essas 160 horas mensais custa R$ 56 de máquina. Passar cada transcrição pelo cérebro para gerar resumo, decisões e lista de pendências com responsável — duas passadas no modelo intermediário — custa cerca de R$ 0,03 por reunião — R$ 5 por mês.
Sessenta e um reais por mês para que nenhuma decisão de reunião se perca. Esse é o produto. O modo de voz bonitinho é a demonstração.
Repare no padrão que se repete em todas as partes: a captura é barata e em rajada; o entendimento é constante e é o que vale.
Transcrever é uma placa ligada por algumas horas no fim de semana. Resumir, classificar, extrair pendência e responder pergunta sobre o acervo acontece todo dia, o dia inteiro — e é isso que se paga por token.
A captura é sua; o entendimento é por token
Whisper e síntese de voz sobem em 1 clique numa placa por hora e desligam quando o lote termina. O que vem depois — resumir, corrigir, extrair, responder — é chamada de API cobrada por token, em reais.
Ver a API por token →Próxima parte: as mãos — ferramentas, busca na web e agentes.
Continue: transcrever mil horas · narração e custo por minuto · Whisper em 1 clique