Oito partes, nove peças. Falta a mais importante: juntar tudo sem que o custo saia do controle. Esta parte fecha a série com a arquitetura completa, o mecanismo que mais economiza dinheiro, e a conta mensal de três produtos que existem de verdade.

📚 Série "Monte o seu próprio ChatGPT" — 9 partes

1. O que tem dentro · 2. O cérebro · 3. Os olhos (OCR) · 4. A memória (documentos) · 5. Imagem · 6. Vídeo · 7. Voz · 8. Ferramentas e agentes · 9. Juntando tudo e a conta ← você está aqui

A arquitetura completa

                        ┌─────────────────┐
   pedido do usuário ──▶│  ORQUESTRADOR   │  (código seu — não é modelo)
                        └────────┬────────┘
                                 │  classifica a intenção e roteia
        ┌────────────────────────┼─────────────────────────┐
        │                        │                         │
   ┌────▼─────┐          ┌───────▼────────┐        ┌───────▼────────┐
   │  BUSCA   │          │    CÉREBRO     │        │ ESPECIALISTAS  │
   │ nos docs │─trechos─▶│  por token     │◀──────▶│  sob demanda   │
   │ (Qdrant) │          │  5 modelos     │        │ OCR · imagem   │
   └──────────┘          └───────┬────────┘        │ vídeo · voz    │
        ▲                        │                 └────────────────┘
        │                        ▼                    liga · roda · desliga
   sempre ligado           resposta em fluxo
   (pequeno)                                    ┌────────────────┐
                                                │  FERRAMENTAS   │
                                                │ dado atual,    │
                                                │ APIs, agentes  │
                                                └────────────────┘

A regra que organiza a conta inteira

Toda a série pode ser resumida numa linha: separe o que precisa estar ligado do que só precisa existir quando é chamado.

CategoriaPeçasModelo de custoComo pagar
Sempre ligadoBanco vetorial, orquestrador, sua aplicaçãoCusto fixo mensal — mantenha essa lista curtaMáquina pequena, sua ou alugada
Por chamadaCérebro, classificação, moderação, reescritaProporcional ao uso, sem pisoPor token
Em rajadaOCR, indexação, imagem, vídeo, vozProporcional ao trabalho, zero quando ociosoGPU por hora, ligada só na fila

O erro estrutural mais caro — e o mais comum — é colocar o cérebro na primeira linha. Ele é a peça de maior frequência e menor previsibilidade: é exatamente o pior candidato a uma máquina ligada 24 horas.

⚠️ O custo do "sempre ligado" é o que decide se o seu produto fecha

Uma placa pequena rodando o mês inteiro custa ~R$ 780. Uma média, ~R$ 2.030. São valores que aparecem no seu extrato mesmo em um mês sem nenhum usuário.

Por isso a recomendação: mantenha na coluna "sempre ligado" só o banco vetorial e a sua aplicação — que rodam bem numa máquina modesta, muitas vezes a que você já tem. Todo o resto entra em "por chamada" ou "em rajada".

O roteador de modelos: onde o dinheiro é feito

Na parte 2 vimos que o mesmo produto custa R$ 112 ou R$ 4.973 por mês dependendo do modelo escolhido. O roteador é o que permite ficar perto do primeiro número entregando qualidade próxima do segundo.

A ideia: a maioria esmagadora das chamadas de um produto real é trabalho simples — classificar, extrair, reformular, responder pergunta direta. Só uma fatia pequena exige raciocínio difícil.

SIMPLES = ("classificar", "extrair", "resumir", "traduzir",
           "reescrever", "corrigir", "moderar", "titulo")

def escolher_modelo(tarefa: str, texto: str, tentativa: int = 0) -> str:
    # 1) Tarefa mecânica declarada pelo seu código: sempre o mais barato.
    if tarefa in SIMPLES:
        return "gpub-fast"

    # 2) Reprocessamento: se a primeira resposta falhou na validação, suba um degrau.
    if tentativa > 0:
        return "gpub-base"

    # 3) Conversa: heurística barata sobre o tamanho e o tipo do pedido.
    dificil = len(texto) > 4000 or any(
        p in texto.lower() for p in ("por que", "compare", "analise", "código", "erro")
    )
    return "gpub-base" if dificil else "gpub-plus"
💡 Comece pelo mais barato e suba quando falhar

O padrão que funciona melhor que qualquer heurística de entrada: chame o modelo econômico, valide a resposta com uma regra sua (o JSON é válido? os campos obrigatórios vieram? a resposta cita a fonte?) e só reprocesse no modelo maior quando a validação falhar.

Você paga o modelo caro apenas nos casos em que ele realmente era necessário — e descobre, medindo, que essa fatia é bem menor do que o medo sugeria.

Três produtos, com a conta fechada

Produto A — Assistente interno para 40 pessoas

Conversa sobre a base de documentos da empresa, com leitura de PDFs. 44.000 mensagens por mês, 2.000 páginas digitalizadas por mês.

PeçaVolumeOnde rodaCusto/mês
Texto roteado (85% econômico, 12% médio, 3% alto)44.000 mensagensPor tokenR$ 174
OCR + estruturação2.000 páginasGPU 0,7 h + tokenR$ 2
Indexação de novos documentosrajada semanalGPU ~1 hR$ 5
Banco vetorial + aplicação24/7Máquina modestasua infraestrutura
Total de IAR$ 181/mês

Para comparar: o mesmo produto usando só o modelo mais capaz em tudo custaria R$ 4.980. O roteador é responsável por 96% da diferença.

Produto B — Atendimento ao cliente

5.000 conversas por mês, 8 mensagens por conversa, com busca na base de ajuda e moderação de entrada.

PeçaVolumeCusto/mês
Respostas com janela deslizante e trechos recuperados40.000 mensagensR$ 131
Moderação de entrada40.000 chamadasR$ 8
Classificação e etiquetagem dos atendimentos5.000 chamadasR$ 3
TotalR$ 142/mês

Isso dá R$ 0,028 por conversa atendida. E o detalhe que vale mais que a tabela: sem janela deslizante, mandando a conversa inteira toda vez, a mesma operação custaria R$ 379 — quase três vezes mais, pela mesma qualidade de resposta.

Produto C — Estúdio de conteúdo

3.000 imagens, 20 vídeos de 30 segundos e 200 minutos de narração por mês.

PeçaVolumeOnde rodaCusto/mês
Reescrita de prompt, roteiros e legendas~3.300 chamadasPor tokenR$ 1,20
Geração de imagem3.000 imagensGPU 1,8 hR$ 5
Geração de vídeo120 clipes de 5 sGPU grande, 16 hR$ 113
Narração200 minutosGPU 0,3 hR$ 1
TotalR$ 120/mês

Preços de agosto de 2026, para uma GPU avulsa, sem interrupção programada. O catálogo muda: confira a vitrine antes de fechar a conta.

Repare na distribuição: o vídeo é 94% da conta com apenas 20 peças por mês. Se esse produto crescer, é a peça de vídeo que precisa de atenção — não o resto.

Os cinco erros que estouram o orçamento

  1. Modelo caro como padrão. Custo de 20 a 45 vezes maior pela mesma entrega. É o erro número um, sempre.
  2. Histórico inteiro em toda mensagem. Triplica o custo de conversas longas e ainda piora a qualidade da resposta.
  3. Documento inteiro no contexto. Até 95 vezes mais caro que buscar os trechos certos (parte 4).
  4. GPU ligada esperando pedido. R$ 780 a R$ 2.030 por mês de ociosidade — some sozinho quando você liga a máquina pela fila.
  5. Agente sem teto. Um laço que trava roda a noite inteira consumindo saldo. Sempre defina máximo de passos e de tokens.

Antes de ir para produção, três coisas honestas

O caminho inteiro, em uma tabela

SemanaO que montarPeçaCusto para começar
1Conversa funcionando com o seu promptCérebrocentavos por dia
2Seus documentos indexados e citadosMemóriapoucos reais de indexação
3Leitura de PDF e imagem no fluxoOlhoscentavos por lote
4Duas ou três ferramentas de leituraMãoscentavos
DepoisImagem, voz e vídeo — quando alguém pedirEspecialistasGPU por hora, sob demanda

Nove peças, nenhuma delas fechada, todas com equivalente aberto maduro. O que era um projeto de milhões há três anos hoje é uma questão de montar as peças na ordem certa e pagar cada uma pelo modelo de custo que combina com ela.

Comece pelo cérebro, hoje

Cinco modelos abertos por uma API compatível com o padrão OpenAI, cobrados por token em reais, sem assinatura e sem máquina para administrar. Quando alguma peça precisar de placa, ela sobe em 1 clique, roda e desliga.

Ver a API por token →

Voltar ao começo: parte 1 — o que existe dentro dessas plataformas.

Continue: parte 2: o cérebro · checklist de produção · observabilidade de LLM