Comparar preço de API de LLM em 2026 é mais difícil do que parece: cada fornecedor cobra em moeda diferente, conta entrada e saída em faixas diferentes, alguns dobram o preço acima de certo contexto e quase nenhum diz quanto custou aquela chamada. Este artigo resolve isso com números convertidos para reais, comparações por tarefa completa e código que você roda para medir o seu próprio caso.

⚡ Metodologia (leia antes de usar os números)

Preços internacionais são os de tabela publicados em agosto de 2026. Conversão pelo dólar comercial de R$ 5,22 (14/08/2026). Para o custo real de quem paga do Brasil, somamos o IOF de 3,5% de compra internacional no cartão, chegando a um efetivo de R$ 5,40 por dólar. Os nossos preços já são publicados em reais e não passam por câmbio nem IOF de compra internacional. Os totais das tarefas usam as tarifas por milhão já arredondadas da Tabela 1. Preço de terceiro muda sem aviso — confirme na fonte antes de fechar orçamento.

Tabela 1 — Preço por milhão de tokens, tudo em reais

ModeloEntrada (R$/1M)Saída (R$/1M)Observação
gpub-fast · DeepSeek V4 FlashR$ 0,49R$ 1,091M de contexto
gpub-mini · Qwen 3.6 35BR$ 0,59R$ 3,49200 mil de contexto
gpub-plus · Qwen 3.8 27BR$ 0,69R$ 3,99250 mil de contexto
gpub-base · GLM 5.2R$ 7,90R$ 17,90200 mil de contexto
gpub-max · Kimi K3R$ 17,90R$ 84,901M de contexto
Gemini 3.1 Pro (US$ 2 / 12)R$ 10,81R$ 64,83Dobra acima de 200 mil tokens
GPT-5.6 Sol (US$ 5 / 30)R$ 27,01R$ 162,08
Claude Fable 5 (US$ 10 / 50)R$ 54,03R$ 270,14

Valores de terceiros convertidos a R$ 5,40/US$ (dólar + IOF). A leitura rápida: gpub-plus sai 16× mais barato na saída que o Gemini 3.1 Pro e 68× mais barato que o Claude Fable 5; gpub-max, que é um modelo de fronteira aberto, sai 3,2× mais barato que o Fable 5 e 1,9× mais barato que o GPT-5.6 Sol.

Tabela 2 — O que importa: custo da tarefa inteira

Preço por token engana, porque cada tarefa tem uma proporção diferente entre entrada e saída. Comparar por trabalho completo é o único jeito honesto.

Tarefa A — Assistente de atendimento com RAG

50.000 perguntas por mês · 4.000 tokens de entrada (pergunta + trechos) · 400 de saída → 200M de entrada, 20M de saída.

ModeloEntradaSaídaTotal/mêsPor pergunta
gpub-fastR$ 98,00R$ 21,80R$ 119,80R$ 0,0024
gpub-plusR$ 138,00R$ 79,80R$ 217,80R$ 0,0044
Gemini 3.1 ProR$ 2.162,00R$ 1.296,60R$ 3.458,60R$ 0,069
gpub-maxR$ 3.580,00R$ 1.698,00R$ 5.278,00R$ 0,106
GPT-5.6 SolR$ 5.402,00R$ 3.241,60R$ 8.643,60R$ 0,173
Claude Fable 5R$ 10.806,00R$ 5.402,80R$ 16.208,80R$ 0,324

Mesmo trabalho, de R$ 119,80 a R$ 16.208,80 — uma diferença de 135×. Para atendimento com contexto recuperado, o modelo de fronteira quase nunca se justifica: a qualidade da resposta vem principalmente dos trechos que você recuperou, não do tamanho do modelo.

Tarefa B — Agente que lê a base de código

200 execuções por mês · 200.000 tokens de entrada · 5.000 de saída → 40M de entrada, 1M de saída.

ModeloTotal/mêsPor execuçãoRessalva
gpub-plusR$ 31,59R$ 0,16Contexto de 250 mil — cabe, mas sem folga
Gemini 3.1 ProR$ 961,65R$ 4,81Já na faixa dobrada, acima de 200 mil tokens
gpub-maxR$ 800,90R$ 4,001M de contexto, sem faixa dobrada
GPT-5.6 SolR$ 1.242,48R$ 6,21
Claude Fable 5R$ 2.431,34R$ 12,16

Repare na armadilha do preço por faixa de contexto: um agente que lê 200 mil tokens cruza exatamente o limite em que o Gemini dobra a tarifa. Duas linhas antes na tabela de preços, ele parecia o mais barato dos internacionais; na tarefa real, ficou mais caro que o gpub-max.

Meça o seu caso — o script

Nenhuma tabela substitui o seu prompt real. Este script roda a mesma tarefa em vários modelos, mede latência e custo, e imprime um comparativo. Como a nossa API devolve usage.cost_brl, o custo não é estimado: é o valor cobrado.

import time
from openai import OpenAI

cliente = OpenAI(api_key="gpub_live_suachaveaqui",
                 base_url="https://gpubrasil.com.br/v1")

MODELOS = ["gpub-fast", "gpub-mini", "gpub-plus", "gpub-base", "gpub-max"]

CASOS = [
    {"nome": "classificacao", "sistema": "Classifique em: cobranca, acesso, bug, duvida.",
     "usuario": "Paguei ontem e o sistema ainda diz que estou inadimplente.", "teto": 16},
    {"nome": "extracao", "sistema": "Extraia CNPJ, numero e valor total. Responda so JSON.",
     "usuario": "NF 1234, emitida por ACME LTDA CNPJ 00.000.000/0001-00, total R$ 1.234,56", "teto": 200},
    {"nome": "raciocinio", "sistema": "Explique o passo a passo antes de concluir.",
     "usuario": "Se 3 maquinas processam 300 itens em 2h, quanto tempo 5 maquinas levam para 1000?",
     "teto": 1000},          # teto folgado: modelo de raciocinio gasta token pensando
]

print(f"{'caso':<14}{'modelo':<12}{'seg':>7}{'tokens':>9}{'R$':>12}")
for caso in CASOS:
    for modelo in MODELOS:
        t0 = time.time()
        try:
            r = cliente.chat.completions.create(
                model=modelo,
                messages=[{"role": "system", "content": caso["sistema"]},
                          {"role": "user", "content": caso["usuario"]}],
                temperature=0,
                max_tokens=caso["teto"],
            )
        except Exception as e:
            print(f"{caso['nome']:<14}{modelo:<12}  erro: {e}")
            continue
        dt = time.time() - t0
        print(f"{caso['nome']:<14}{modelo:<12}{dt:>7.2f}"
              f"{r.usage.total_tokens:>9}{r.usage.cost_brl:>12.6f}")

Rodar isso inteiro custa alguns centavos. Guarde a saída: ela é a base para decidir com dado em vez de manchete. E some a qualidade na conta — o mais barato que erra 20% das vezes não é barato.

API por token ou GPU dedicada? A conta do ponto de virada

Esta é a pergunta que mais recebemos, e ela tem resposta aritmética. Alugando GPU por hora, você paga a hora, não o token. Então a GPU empata com a API quando o seu volume de tokens por hora chega a:

tokens_por_segundo_de_equilibrio = preco_hora_gpu / (preco_saida_por_token * 3600)
GPUPreço/horaEquilíbrio vs. gpub-plus (R$ 3,99/1M)Equilíbrio vs. gpub-fast (R$ 1,09/1M)
RTX 5090 32 GBR$ 4,77~332 tokens/s sustentados~1.215 tokens/s
RTX 6000 Ada 48 GBR$ 6,01~418 tokens/s~1.532 tokens/s
RTX PRO 6000 96 GBR$ 10,26~714 tokens/s~2.615 tokens/s
H100 80 GBR$ 17,89~1.245 tokens/s~4.559 tokens/s

Como ler: se você sustenta mais que o número da coluna, a GPU sai mais barata; se sustenta menos, o token vence. A conta considera só os tokens de saída, o que é conservador a favor da API — contando também a entrada, a GPU empata antes.

⚠️ Os dois erros que estragam essa conta

1. Confundir pico com média. "Meu servidor faz 2.000 tokens/s" costuma ser o pico com lote cheio. O que importa é a média das 24 horas, incluindo madrugada e fim de semana. Uma GPU ocupada 8 horas por dia custa, na prática, três vezes mais por token do que a conta acima sugere.

2. Esquecer o trabalho de operar. Servir modelo é serviço em produção: atualização, monitoramento, plantão, fila. Some esse custo antes de decidir. Se ninguém no time quer esse pager, a API por token já venceu.

Quando a GPU dedicada ganha, e ganha com folga

Os custos que não aparecem na tabela de preço

Custo escondidoOnde apareceComo evitar
IOF de 3,5%Fatura do cartão internacionalPagar em reais, via Pix ou cartão nacional
Variação cambialEntre orçar e pagarPreço publicado em reais
Faixa de contexto dobradaAcima de certo número de tokensConferir a faixa antes de projetar agente de contexto longo
Tokens de raciocínioSaída que você não vê, mas pagaMedir com usage real, não com contagem do prompt
Resposta vazia por teto baixoCobrada mesmo assimTeto folgado em modelo que raciocina (≥ 800 tokens no gpub-max)
Compromisso mínimo mensalContratoSem assinatura e sem mínimo de tokens aqui

Resumo para quem só quer a resposta

  1. Tarefa objetiva em volume (classificar, extrair, moderar, rotear): gpub-fast ou gpub-mini. É onde a diferença de preço vira ordem de grandeza.
  2. Conversa, código e RAG do dia a dia: gpub-plus. Melhor relação qualidade/preço do catálogo.
  3. Raciocínio longo e contexto gigante: gpub-max, com teto de saída folgado.
  4. Volume alto e constante, modelo próprio ou dado sensível: GPU dedicada por hora.
  5. Na dúvida: rode o script deste artigo com os seus casos reais. Custa centavos e substitui semanas de discussão.

Compare com os seus próprios prompts

Cinco modelos, preços em reais, custo de cada chamada na resposta. E, se a conta virar, a GPU dedicada está no mesmo saldo.

Ver preços por token →

Perguntas frequentes

Qual é a API de LLM mais barata em 2026 para quem paga em reais?

Depende da tarefa, mas a diferença é de ordem de grandeza. Num assistente de atendimento com RAG de 50 mil perguntas por mês, o mesmo trabalho custa R$ 119,80 com gpub-fast, R$ 217,80 com gpub-plus, R$ 3.458,60 com Gemini 3.1 Pro, R$ 8.643,60 com GPT-5.6 Sol e R$ 16.208,80 com Claude Fable 5, considerando o dólar a R$ 5,22 mais IOF de 3,5%.

Quando a GPU dedicada fica mais barata que a API por token?

Quando o volume sustentado passa do ponto de equilíbrio, calculado como preço da hora dividido pelo preço do token de saída vezes 3.600. Contra o gpub-plus, a R$ 3,99 por milhão de tokens de saída, uma RTX 5090 a R$ 4,77 por hora empata em torno de 332 tokens por segundo sustentados, e uma H100 a R$ 17,89 por hora empata perto de 1.245 tokens por segundo. O que conta é a média das 24 horas, não o pico.

Quais custos não aparecem na tabela de preços das APIs internacionais?

IOF de 3,5% na compra internacional no cartão, variação cambial entre orçar e pagar, faixa de contexto com preço dobrado acima de certo número de tokens, tokens de raciocínio que você paga sem ver, resposta vazia cobrada quando o teto de saída é baixo demais, e compromisso mínimo mensal em contrato.

Leia também: 10 casos de uso com código e custo real · Rodar modelos abertos sai mais barato que API? · Economia de tokens com self-hosting