Em 17 de setembro de 2026 mexemos em duas coisas ao mesmo tempo na nossa API de LLM por token: baixamos preços em até 66% e passamos a repassar o desconto de cache de prompt, que até ontem ficava com a casa. Este artigo mostra os números novos e, mais importante, de onde eles saem — porque "mais barato" sem conta aberta não vale nada.
No tier Essenciais, o DeepSeek V4 Flash sai a R$ 0,49 por milhão de tokens de entrada e R$ 1,09 de saída — a própria DeepSeek cobra o equivalente a R$ 2,27 e R$ 6,80 pelo mesmo modelo. Token lido de cache agora custa a partir de 2,5% do preço de entrada (10% na maioria dos modelos). Cobrança por token em reais, sem assinatura, sem IOF de 3,5% e sem spread de cartão.
O preço, sem rodeio
Todos os valores abaixo são por milhão de tokens, em reais, e são os que a API cobra de verdade — a nossa página de preços é regenerada de hora em hora a partir do catálogo vivo, justamente para que o número anunciado e o cobrado nunca divirjam.
Tier Essenciais — modelos de pesos abertos
| Modelo | Entrada | Cache | Saída | Contexto |
|---|---|---|---|---|
| DeepSeek V4 Flash | R$ 0,49 | R$ 0,098 | R$ 1,09 | 1M |
| Qwen 3.6 35B | R$ 0,59 | R$ 0,197 | R$ 3,49 | 200 mil |
| Qwen 3.8 27B | R$ 0,69 | R$ 0,23 | R$ 3,99 | 1M |
| GLM 5.3 Flash | R$ 1,89 | R$ 0,378 | R$ 5,90 | 250 mil |
| GLM 5.2 | R$ 7,90 | R$ 2,09 | R$ 17,90 | 250 mil |
E o piso do catálogo inteiro está no tier Confidenciais: o Nemotron 3 Nano, a R$ 0,15 de entrada e R$ 0,60 de saída por milhão — dentro de um enclave lacrado por hardware, em que nem o operador da máquina lê o seu prompt.
A comparação que interessa: o mesmo modelo, no criador dele
O DeepSeek V4 Flash é um modelo de pesos abertos, e a DeepSeek vende o próprio modelo pela API dela. Dá para comparar maçã com maçã. Convertendo o preço de lista dela pelo câmbio do dia (R$ 5,15):
| DeepSeek V4 Flash | Entrada / 1M | Saída / 1M |
|---|---|---|
| No GPUBrasil | R$ 0,49 | R$ 1,09 |
| Na API da DeepSeek (horário de pico) | R$ 2,27 | R$ 6,80 |
| Na API da DeepSeek (fora de pico) | R$ 1,13 | R$ 3,40 |
São 4,6× menos na entrada e 6,2× menos na saída comparando com o horário de pico dela — e ainda 2,3× e 3,1× menos comparando com a tarifa reduzida de fora de pico, que só vale em algumas horas do dia. Aqui não existe horário de pico: o preço é o mesmo às 3h e às 15h.
O cache deixou de ficar com a casa
Quando você reenvia a mesma instrução de sistema, o mesmo arquivo ou o mesmo histórico de conversa, boa parte desses tokens de entrada não é reprocessada — vem de cache. Até ontem nós cobrávamos entrada cheia nesses tokens e a economia ficava com a casa. Isso mudou.
Token lido de cache passa a custar uma fração do preço de entrada, na mesma proporção em que ele nos custa menos — 10% na maioria dos 48 modelos, chegando a 2,5% nos mais descontados e a 33% nos menos:
| Modelo | Entrada nova | Entrada em cache | Desconto |
|---|---|---|---|
| DeepSeek V4 Flash | R$ 0,49 | R$ 0,098 | −80% |
| GLM 5.3 Flash | R$ 1,89 | R$ 0,378 | −80% |
| Claude Sonnet 5 | R$ 15,45 | R$ 1,545 | −90% |
| Gemini 3.8 Flash | R$ 5,79 | R$ 0,579 | −90% |
Quanto isso vale na prática depende do seu padrão de uso, e medimos o nosso: em 8.812 chamadas reais de clientes com perfil de assistente de código, 77,7% de todos os tokens de entrada vieram de cache. Para esse perfil, a fatura efetiva cai perto de 60% — sem mudar uma linha de código.
O número vem na própria resposta da API, então você audita sem depender de nós:
"usage": {
"prompt_tokens": 51204,
"prompt_tokens_details": { "cached_tokens": 39781 },
"completion_tokens": 412,
"total_tokens": 51616,
"cost_brl": 0.0072
}
Medido no nosso tráfego: em chamadas com mais de 50% de cache, o tempo até o primeiro token caiu de 14,8s para 3,0s — cinco vezes mais rápido, mesmo com prompts maiores. Prompt grande e estável deixou de ser um problema de custo e de latência ao mesmo tempo.
Os cortes de hoje, modelo por modelo
Na prateleira Fronteira — os modelos de marca — a mudança foi de tamanho:
| Modelo | Saída antes | Saída agora | Corte |
|---|---|---|---|
| Claude Opus 5 | R$ 573,52 | R$ 193,15 | −66% |
| Claude Haiku 4.5 | R$ 115,29 | R$ 38,63 | −66% |
| o3 | R$ 162,38 | R$ 61,81 | −62% |
| GPT-5.5 Pro | R$ 2.919,52 | R$ 1.390,68 | −52% |
| Claude Sonnet 5 | R$ 89,96 | R$ 77,26 | −14% |
A causa é menos glamourosa do que uma promoção: o nosso cálculo de custo usava um fator de roteamento medido à mão que estava até 2,5× errado para alguns modelos. Remedimos com chamadas reais, trocamos o número escrito à mão pelo valor que o próprio catálogo publica a cada leitura, e o preço caiu junto. Preço errado para cima é problema nosso, não do cliente — então corrigimos e estamos contando.
Onde nós não somos os mais baratos
Nos modelos de marca (Claude, GPT, Gemini) o nosso preço por token fica acima do preço de lista do fabricante. Não vamos fingir o contrário: se o seu único critério é o menor preço por token nesses modelos, comprar direto do fabricante custa menos.
O que você ganha aqui é outra coisa: cobrança em reais por Pix, sem o IOF de 3,5% da compra internacional e sem o spread de câmbio do cartão (que costuma somar 2% a 4% e não vem discriminado na fatura), preço que não muda quando o dólar sobe, o mesmo saldo das máquinas GPU, nota fiscal brasileira e suporte em português. Para quem não tem cartão internacional corporativo ou precisa de NF para prestar contas, isso resolve um problema que desconto de centavo não resolve.
Já nos modelos de pesos abertos do tier Essenciais, o preço aqui é uma fração do que o criador do modelo cobra — e é lá que a maior parte do nosso volume acontece.
Como começar
A API é compatível com a da OpenAI. Trocar a URL base e a chave basta:
from openai import OpenAI
cliente = OpenAI(
base_url="https://gpubrasil.com.br/v1",
api_key="gpub_live_sua_chave",
)
r = cliente.chat.completions.create(
model="gpub-fast",
messages=[{"role": "user", "content": "Resuma este contrato em 5 tópicos."}],
)
print(r.choices[0].message.content)
print("Custo desta chamada: R$", r.usage.cost_brl)
Não há assinatura, mensalidade nem compromisso mínimo: você gasta o que consumir, descontado do mesmo saldo em reais das máquinas GPU. O playground no painel deixa testar os modelos antes, e a API programática é liberada depois do primeiro depósito.
Veja a tabela completa, sempre atualizada
48 modelos com preço por token em reais, regenerado de hora em hora a partir do catálogo vivo.
Ver preços por tokenPerguntas frequentes
Qual é a API de LLM mais barata por token em reais?
No nosso catálogo, o piso é o Nemotron 3 Nano, a R$ 0,15 de entrada e R$ 0,60 de saída por milhão. Para uso geral com janela de 1 milhão de tokens, o DeepSeek V4 Flash a R$ 0,49 / R$ 1,09 é a melhor relação — cerca de 6× abaixo do que a própria DeepSeek cobra pelo mesmo modelo.
O desconto de cache é repassado?
Sim, desde 17 de setembro de 2026. Token de entrada em cache custa uma fração do token novo — 10% na maioria dos modelos, de 2,5% a 33% nos extremos — e a quantidade vem em usage.prompt_tokens_details.cached_tokens na resposta.
É mais barato que comprar direto do fabricante?
Nos modelos de pesos abertos, sim, por uma margem grande. Nos modelos de marca do tier Fronteira, não — ali a vantagem é a cobrança em reais sem IOF nem spread, o saldo único com as GPUs, a nota fiscal brasileira e o suporte em português.
Preciso de assinatura?
Não. Cobrança por token consumido, sem mensalidade, franquia ou mínimo. Criar conta é grátis.
A API é compatível com a da OpenAI?
Sim, incluindo streaming. Base URL https://gpubrasil.com.br/v1, chave gpub_live_, e o custo de cada chamada volta em usage.cost_brl.
Conclusão
Preço de IA por token só significa algo com a conta aberta: qual modelo, qual token, comparado com quem. Nos pesos abertos nós somos uma fração do preço do criador do modelo, e agora o cache derruba mais uma vez a fatura de quem reenvia contexto grande. Nos modelos de marca nós não competimos por centavo, e preferimos dizer isso a inventar uma tabela que não se sustenta.
Leia também: Comparativo de preços de API de LLM 2026 · Como funciona a API por token · 10 casos de uso com código e custo