Até agora, quem queria rodar um modelo de linguagem aqui tinha um caminho: subir uma GPU e servir o modelo. É um caminho excelente — e é excessivo quando você só quer classificar mil tickets por dia. Por isso lançamos a nossa API de LLM por token: modelos de pesos abertos, cobrados em reais, compatíveis com a API da OpenAI, sem assinatura e debitados do mesmo saldo que já paga as suas instâncias de GPU.

⚡ O essencial

URL base https://gpubrasil.com.br/v1. Autenticação com a mesma API key gpub_live_ que você já usa para provisionar GPU. Cinco modelos, de R$ 0,49 por milhão de tokens de entrada até a linha de raciocínio longo com 1 milhão de tokens de contexto. Toda resposta traz usage.cost_brl — o custo em reais daquela chamada. Sem mensalidade, sem franquia, sem mínimo de compra de tokens.

Por que criamos isso

Três reclamações apareciam sempre nas conversas com clientes:

  1. "Pago máquina parada." Uso intermitente com GPU dedicada significa hora comprada e não usada.
  2. "A fatura vem em dólar." Além do câmbio, compra internacional no cartão leva IOF de 3,5%. Você fecha o orçamento com um número e paga outro.
  3. "Não sei quanto custou aquela chamada." Painel de terceiro atualiza a cada horas, quando atualiza.

A API por token responde às três: você paga o que consumiu, em reais, e cada resposta já vem com o custo dentro.

O catálogo e os preços

IdentificadorModeloContextoEntrada (R$/1M)Saída (R$/1M)
gpub-fastDeepSeek V4 Flash1.000.000R$ 0,49R$ 1,09
gpub-miniQwen 3.6 35B200.000R$ 0,59R$ 3,49
gpub-plusQwen 3.8 27B250.000R$ 0,69R$ 3,99
gpub-baseGLM 5.2200.000R$ 7,90R$ 17,90
gpub-maxKimi K31.000.000R$ 17,90R$ 84,90

Valores vigentes em 15/08/2026. A tabela ao vivo, que é a mesma fonte usada para cobrar, fica em gpubrasil.com.br/br/llm-api.html — consulte lá antes de fechar um orçamento.

Os identificadores são estáveis: quando o modelo por trás de um deles for atualizado para uma geração melhor, o seu código continua funcionando sem alteração. É de propósito — a última coisa que você precisa é reescrever integração porque um fornecedor renomeou um modelo.

Trocar de provedor é uma linha

Se o seu código já usa o SDK da OpenAI, a migração é literalmente a base_url:

from openai import OpenAI

cliente = OpenAI(
    api_key="gpub_live_suachaveaqui",
    base_url="https://gpubrasil.com.br/v1",     # unica mudanca
)

r = cliente.chat.completions.create(
    model="gpub-plus",
    messages=[
        {"role": "system", "content": "Responda em portugues do Brasil, direto ao ponto."},
        {"role": "user", "content": "Explique o que e um token de LLM em duas frases."},
    ],
)

print(r.choices[0].message.content)
print("Custo desta chamada: R$", r.usage.cost_brl)

Em Node, o mesmo:

import OpenAI from "openai";

const cliente = new OpenAI({
  apiKey: process.env.GPUB_API_KEY,
  baseURL: "https://gpubrasil.com.br/v1",
});

const r = await cliente.chat.completions.create({
  model: "gpub-fast",
  messages: [{ role: "user", content: "Classifique este ticket: 'nao consigo logar'." }],
  max_tokens: 16,
});

console.log(r.choices[0].message.content, "| R$", r.usage.cost_brl);

Em fluxo contínuo (streaming), peça o bloco de uso no último evento:

fluxo = cliente.chat.completions.create(
    model="gpub-plus",
    messages=[{"role": "user", "content": "Escreva um resumo executivo."}],
    stream=True,
    stream_options={"include_usage": True},
)

for parte in fluxo:
    if parte.choices and parte.choices[0].delta.content:
        print(parte.choices[0].delta.content, end="")
    if parte.usage:                       # ultimo evento: uso e custo
        print("\nCusto em R$:", parte.usage.cost_brl)

Como começar

  1. Crie a conta e faça o primeiro depósito. O acesso programático é liberado depois do primeiro depósito confirmado — antes disso, você testa os modelos pelo playground dentro do painel.
  2. Gere a API key na seção API Keys do painel. A chave em claro aparece uma única vez: guarde como senha.
  3. Troque a base_url e rode. É isso.
💡 O playground busca dado atual sozinho

No playground do painel, quando a sua pergunta depende de informação de agora — cotação, preço de cripto, notícia de mercado — o dado é buscado antes de a pergunta chegar ao modelo, e a resposta cita o valor e o horário da consulta. Nesses casos há uma taxa de acesso de R$ 0,05 por mensagem, somada ao custo dos tokens; conversa que não depende de dado atual não consulta nada e não paga taxa. Na API, o controle é seu: as chamadas para /v1/chat/completions não consultam a internet — você monta o contexto que quiser, ou declara uma ferramenta de busca em tools e executa você mesmo.

Três detalhes que evitam surpresa

Ferramentas não funcionam igual em todo modelo

Testamos e documentamos: gpub-max e gpub-plus pedem a ferramenta e usam o resultado corretamente. O gpub-fast pede, mas nem sempre aproveita bem o retorno. O gpub-mini não suporta ferramentas — ignora o pedido mesmo quando obrigado. Para agente com ferramentas, use gpub-max ou gpub-plus.

Modelo que raciocina precisa de teto de saída folgado

gpub-max e gpub-plus gastam tokens "pensando" antes de responder. Com max_tokens apertado, o raciocínio pode consumir a cota inteira e a resposta voltar vazia — e os tokens gastos são cobrados, porque foram gerados. Com gpub-max, use pelo menos 800 tokens de saída.

Erros seguem o padrão que você já conhece

CódigoSignificadoO que fazer
402Saldo insuficienteDepositar e repetir a chamada
403API ainda não liberadaFazer o primeiro depósito; usar o playground enquanto isso
429Limite de requisiçõesEsperar e repetir com recuo exponencial
503Indisponível no momentoRepetir; considerar um modelo alternativo no seu código

O envelope de erro é o mesmo formato da OpenAI: {"error":{"message","type","param","code"}}. Bibliotecas de retry que você já usa funcionam sem adaptação.

Um saldo só, duas formas de rodar IA

Essa é a parte que consideramos a mais útil do lançamento. O mesmo saldo em reais paga:

Na prática, a maioria dos projetos usa os dois: começa na API para validar em dias, e migra para GPU dedicada a parte que virou volume. A conta de quando migrar está em Comparativo de preços de API de LLM em 2026, e uma lista de casos prontos com código está em 10 casos de uso com código e custo real.

Uma última coisa, porque perguntam sempre: não usamos os seus prompts nem as respostas para treinar modelos. Se o seu requisito é controle total sobre pesos, logs e retenção, o caminho é a GPU dedicada — lá o modelo roda dentro de uma instância que é só sua.

Comece com uma chamada de centavos

Sem assinatura, sem mínimo de tokens, cobrado em reais no mesmo saldo das suas GPUs.

Ver preços e documentação →

Perguntas frequentes

Como funciona a API de LLM por token do GPUBrasil?

A URL base é https://gpubrasil.com.br/v1 e os endpoints seguem o formato da API da OpenAI, incluindo respostas em fluxo contínuo. A autenticação usa a mesma API key gpub_live_ que provisiona GPUs, no header Authorization. Toda resposta traz usage.cost_brl, o custo em reais daquela chamada, e o consumo é debitado do mesmo saldo das instâncias de GPU.

Quais modelos estão disponíveis e quanto custam?

São cinco, com preço por milhão de tokens de entrada e de saída: gpub-fast a R$ 0,49 e R$ 1,09, gpub-mini a R$ 0,59 e R$ 3,49, gpub-plus a R$ 0,69 e R$ 3,99, gpub-base a R$ 7,90 e R$ 17,90, e gpub-max a R$ 17,90 e R$ 84,90. Os valores vigentes ficam na página de preços, que é carregada da mesma fonte usada para cobrar.

Preciso assinar um plano ou comprar um pacote de tokens?

Não. Não há assinatura, mensalidade, franquia nem mínimo de compra de tokens: a cobrança é proporcional ao que a chamada consumiu. Os únicos mínimos são os de depósito, que já valem para as GPUs, sendo R$ 100 no primeiro depósito, com bônus de R$ 12, ou R$ 25 a partir de R$ 300, e R$ 5 nas recargas seguintes.

Leia também: 10 casos de uso com código e custo real · Comparativo de preços de API de LLM em 2026 · LiteLLM: um proxy para vários modelos