Oito partes, nove peças. Falta a mais importante: juntar tudo sem que o custo saia do controle. Esta parte fecha a série com a arquitetura completa, o mecanismo que mais economiza dinheiro, e a conta mensal de três produtos que existem de verdade.
1. O que tem dentro · 2. O cérebro · 3. Os olhos (OCR) · 4. A memória (documentos) · 5. Imagem · 6. Vídeo · 7. Voz · 8. Ferramentas e agentes · 9. Juntando tudo e a conta ← você está aqui
A arquitetura completa
┌─────────────────┐
pedido do usuário ──▶│ ORQUESTRADOR │ (código seu — não é modelo)
└────────┬────────┘
│ classifica a intenção e roteia
┌────────────────────────┼─────────────────────────┐
│ │ │
┌────▼─────┐ ┌───────▼────────┐ ┌───────▼────────┐
│ BUSCA │ │ CÉREBRO │ │ ESPECIALISTAS │
│ nos docs │─trechos─▶│ por token │◀──────▶│ sob demanda │
│ (Qdrant) │ │ 5 modelos │ │ OCR · imagem │
└──────────┘ └───────┬────────┘ │ vídeo · voz │
▲ │ └────────────────┘
│ ▼ liga · roda · desliga
sempre ligado resposta em fluxo
(pequeno) ┌────────────────┐
│ FERRAMENTAS │
│ dado atual, │
│ APIs, agentes │
└────────────────┘
A regra que organiza a conta inteira
Toda a série pode ser resumida numa linha: separe o que precisa estar ligado do que só precisa existir quando é chamado.
| Categoria | Peças | Modelo de custo | Como pagar |
|---|---|---|---|
| Sempre ligado | Banco vetorial, orquestrador, sua aplicação | Custo fixo mensal — mantenha essa lista curta | Máquina pequena, sua ou alugada |
| Por chamada | Cérebro, classificação, moderação, reescrita | Proporcional ao uso, sem piso | Por token |
| Em rajada | OCR, indexação, imagem, vídeo, voz | Proporcional ao trabalho, zero quando ocioso | GPU por hora, ligada só na fila |
O erro estrutural mais caro — e o mais comum — é colocar o cérebro na primeira linha. Ele é a peça de maior frequência e menor previsibilidade: é exatamente o pior candidato a uma máquina ligada 24 horas.
Uma placa pequena rodando o mês inteiro custa ~R$ 780. Uma média, ~R$ 2.030. São valores que aparecem no seu extrato mesmo em um mês sem nenhum usuário.
Por isso a recomendação: mantenha na coluna "sempre ligado" só o banco vetorial e a sua aplicação — que rodam bem numa máquina modesta, muitas vezes a que você já tem. Todo o resto entra em "por chamada" ou "em rajada".
O roteador de modelos: onde o dinheiro é feito
Na parte 2 vimos que o mesmo produto custa R$ 112 ou R$ 4.973 por mês dependendo do modelo escolhido. O roteador é o que permite ficar perto do primeiro número entregando qualidade próxima do segundo.
A ideia: a maioria esmagadora das chamadas de um produto real é trabalho simples — classificar, extrair, reformular, responder pergunta direta. Só uma fatia pequena exige raciocínio difícil.
SIMPLES = ("classificar", "extrair", "resumir", "traduzir",
"reescrever", "corrigir", "moderar", "titulo")
def escolher_modelo(tarefa: str, texto: str, tentativa: int = 0) -> str:
# 1) Tarefa mecânica declarada pelo seu código: sempre o mais barato.
if tarefa in SIMPLES:
return "gpub-fast"
# 2) Reprocessamento: se a primeira resposta falhou na validação, suba um degrau.
if tentativa > 0:
return "gpub-base"
# 3) Conversa: heurística barata sobre o tamanho e o tipo do pedido.
dificil = len(texto) > 4000 or any(
p in texto.lower() for p in ("por que", "compare", "analise", "código", "erro")
)
return "gpub-base" if dificil else "gpub-plus"
O padrão que funciona melhor que qualquer heurística de entrada: chame o modelo econômico, valide a resposta com uma regra sua (o JSON é válido? os campos obrigatórios vieram? a resposta cita a fonte?) e só reprocesse no modelo maior quando a validação falhar.
Você paga o modelo caro apenas nos casos em que ele realmente era necessário — e descobre, medindo, que essa fatia é bem menor do que o medo sugeria.
Três produtos, com a conta fechada
Produto A — Assistente interno para 40 pessoas
Conversa sobre a base de documentos da empresa, com leitura de PDFs. 44.000 mensagens por mês, 2.000 páginas digitalizadas por mês.
| Peça | Volume | Onde roda | Custo/mês |
|---|---|---|---|
| Texto roteado (85% econômico, 12% médio, 3% alto) | 44.000 mensagens | Por token | R$ 174 |
| OCR + estruturação | 2.000 páginas | GPU 0,7 h + token | R$ 2 |
| Indexação de novos documentos | rajada semanal | GPU ~1 h | R$ 5 |
| Banco vetorial + aplicação | 24/7 | Máquina modesta | sua infraestrutura |
| Total de IA | R$ 181/mês |
Para comparar: o mesmo produto usando só o modelo mais capaz em tudo custaria R$ 4.980. O roteador é responsável por 96% da diferença.
Produto B — Atendimento ao cliente
5.000 conversas por mês, 8 mensagens por conversa, com busca na base de ajuda e moderação de entrada.
| Peça | Volume | Custo/mês |
|---|---|---|
| Respostas com janela deslizante e trechos recuperados | 40.000 mensagens | R$ 131 |
| Moderação de entrada | 40.000 chamadas | R$ 8 |
| Classificação e etiquetagem dos atendimentos | 5.000 chamadas | R$ 3 |
| Total | R$ 142/mês |
Isso dá R$ 0,028 por conversa atendida. E o detalhe que vale mais que a tabela: sem janela deslizante, mandando a conversa inteira toda vez, a mesma operação custaria R$ 379 — quase três vezes mais, pela mesma qualidade de resposta.
Produto C — Estúdio de conteúdo
3.000 imagens, 20 vídeos de 30 segundos e 200 minutos de narração por mês.
| Peça | Volume | Onde roda | Custo/mês |
|---|---|---|---|
| Reescrita de prompt, roteiros e legendas | ~3.300 chamadas | Por token | R$ 1,20 |
| Geração de imagem | 3.000 imagens | GPU 1,8 h | R$ 5 |
| Geração de vídeo | 120 clipes de 5 s | GPU grande, 16 h | R$ 113 |
| Narração | 200 minutos | GPU 0,3 h | R$ 1 |
| Total | R$ 120/mês |
Preços de agosto de 2026, para uma GPU avulsa, sem interrupção programada. O catálogo muda: confira a vitrine antes de fechar a conta.
Repare na distribuição: o vídeo é 94% da conta com apenas 20 peças por mês. Se esse produto crescer, é a peça de vídeo que precisa de atenção — não o resto.
Os cinco erros que estouram o orçamento
- Modelo caro como padrão. Custo de 20 a 45 vezes maior pela mesma entrega. É o erro número um, sempre.
- Histórico inteiro em toda mensagem. Triplica o custo de conversas longas e ainda piora a qualidade da resposta.
- Documento inteiro no contexto. Até 95 vezes mais caro que buscar os trechos certos (parte 4).
- GPU ligada esperando pedido. R$ 780 a R$ 2.030 por mês de ociosidade — some sozinho quando você liga a máquina pela fila.
- Agente sem teto. Um laço que trava roda a noite inteira consumindo saldo. Sempre defina máximo de passos e de tokens.
Antes de ir para produção, três coisas honestas
- Meça desde o primeiro dia. Registre tokens, modelo, latência e custo por chamada. Sem isso você não sabe qual funcionalidade está consumindo o quê — e vai otimizar no lugar errado.
- Tenha plano B de modelo. Como a API segue o padrão OpenAI, trocar de modelo é trocar uma string. Deixe isso configurável, não escrito no meio do código.
- Fale com a gente antes do lançamento se o volume for grande. Existe um teto de chamadas simultâneas por conta, pensado para uso normal. Um aplicativo com centenas de usuários ativos ao mesmo tempo precisa que esse teto seja ajustado antes de entrar no ar — é uma conversa de cinco minutos, e é muito melhor tê-la antes do que descobrir no dia do lançamento.
O caminho inteiro, em uma tabela
| Semana | O que montar | Peça | Custo para começar |
|---|---|---|---|
| 1 | Conversa funcionando com o seu prompt | Cérebro | centavos por dia |
| 2 | Seus documentos indexados e citados | Memória | poucos reais de indexação |
| 3 | Leitura de PDF e imagem no fluxo | Olhos | centavos por lote |
| 4 | Duas ou três ferramentas de leitura | Mãos | centavos |
| Depois | Imagem, voz e vídeo — quando alguém pedir | Especialistas | GPU por hora, sob demanda |
Nove peças, nenhuma delas fechada, todas com equivalente aberto maduro. O que era um projeto de milhões há três anos hoje é uma questão de montar as peças na ordem certa e pagar cada uma pelo modelo de custo que combina com ela.
Comece pelo cérebro, hoje
Cinco modelos abertos por uma API compatível com o padrão OpenAI, cobrados por token em reais, sem assinatura e sem máquina para administrar. Quando alguma peça precisar de placa, ela sobe em 1 clique, roda e desliga.
Ver a API por token →Voltar ao começo: parte 1 — o que existe dentro dessas plataformas.
Continue: parte 2: o cérebro · checklist de produção · observabilidade de LLM