Whisper como servidor, com API própria
Transcrição de áudio PT-BR via API OpenAI-compatível
- Memória de vídeo
- 8 GB
- Instalação
- ~4 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
O Whisper transcreve áudio em português com precisão alta, inclusive com ruído e sotaque. Rodando na sua máquina, você paga a hora da GPU e transcreve quantas horas de áudio couberem nela — não há cobrança por minuto transcrito.
faster-whisper-server expõe o modelo Whisper large-v3 em uma API 100% compatível com OpenAI (/v1/audio/transcriptions). Transcrição PT-BR de alta qualidade, suporte a diarização e diversos formatos.
Para que serve
- Ata automática de reunião, com marcação de tempo
- Legenda de vídeo em lote para catálogos inteiros
- Transcrição de ligações de atendimento para análise de qualidade
- Áudio sensível processado dentro da sua própria máquina
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template Whisper Server e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 4 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Quantas horas de áudio dá para transcrever em uma hora de GPU?
Com o modelo grande em uma GPU de 8 a 16 GB, a transcrição roda várias vezes mais rápido que o tempo real, o que costuma render dezenas de horas de áudio por hora alugada.
Ele identifica quem está falando?
O Whisper puro transcreve sem separar locutores. Para separar, combine com uma etapa de diarização no seu fluxo.
Tem API compatível?
Sim, o servidor expõe uma API HTTP que você pode chamar do n8n, de um script ou do seu backend.