Em 14 de agosto de 2026, a Zhipu (Z.ai) liberou o GLM-5.3 pelo serviço de codificação dela e anunciou que os pesos abertos saem cerca de duas semanas depois, após uma revisão de risco. A empresa afirma ser hoje o modelo aberto mais forte em código, com o primeiro lugar entre abertos no Terminal Bench 3.0 e no Agents' Last Exam, e desempenho de codificação e agente se aproximando do Claude Fable 5.

⚡ Resumo

O GLM-5.3 não é um modelo novo do zero: é a mesma base MoE de ~744 bilhões de parâmetros do GLM-5.2, com ~40 B ativos por token, melhorada por pós-treino estendido. A Zhipu reporta +50% de capacidade em código nas avaliações internas. A parte que quase ninguém comenta: um modelo de 744 B, mesmo aberto, exige cluster de várias GPUs para servir — e é aí que a decisão entre API por token e GPU dedicada deixa de ser ideológica e vira aritmética.

O que mudou do 5.2 para o 5.3

ItemGLM-5.2GLM-5.3
Base~744 B MoE, ~40 B ativosA mesma — sem novo pré-treino
GanhoPós-treino estendido: +50% em código (medição interna)
Benchmarks abertosTopo do índice de inteligência aberto1º lugar entre abertos em Terminal Bench 3.0 e Agents' Last Exam
PesosPublicadosPrevistos ~2 semanas após o lançamento

Vale reter o detalhe técnico, porque ele desmonta um mito: o salto veio de pós-treino, não de mais parâmetros. Isso é a norma desde o ano passado — o ganho de qualidade está migrando do tamanho para o treino de raciocínio e de uso de ferramentas. Para quem paga a conta, é ótima notícia: modelo melhor sem ficar mais caro de servir.

A conta de hospedar um modelo de 744 B

"Aberto" não quer dizer "barato de rodar". Um MoE de 744 B precisa de todos os pesos residentes em memória, mesmo ativando só 40 B por token. Em FP8, isso é da ordem de 750 GB de VRAM antes de contar o cache de contexto — na prática, 8 GPUs de data center.

ConfiguraçãoVRAM totalCusto/horaCusto/mês (24×7)
8× H200 141 GB1.128 GB~R$ 228~R$ 164.000
8× H100 80 GB640 GB~R$ 143~R$ 103.000
1× B200 180 GB180 GBR$ 46,51Não cabe o modelo inteiro — serve para versões menores

Preços de catálogo de 15/08/2026, por hora. Um bloco de 8 H200 sustenta o modelo inteiro — e faz sentido se você tiver demanda constante para ocupá-lo. Se as suas chamadas são intermitentes, você estará pagando cluster ocioso: o pior negócio possível.

💡 Onde está a economia real do modelo aberto

Não é no preço da GPU. É em três coisas: (1) você não fica refém do roadmap de ninguém — se o modelo for aposentado, os pesos continuam com você; (2) você pode especializar o modelo por fine-tuning para a sua tarefa, o que costuma bater o modelo genérico maior; (3) você controla pesos, logs e retenção dentro de uma instância que é só sua, o que sustenta a sua política de governança. Escrevemos sobre o item (1) em Plano B: o modelo sumiu.

O que fazer nesta janela de duas semanas

Hoje: use o GLM 5.2 pela API por token

Ele está no nosso catálogo como gpub-base, a R$ 7,90 por milhão de tokens de entrada e R$ 17,90 por milhão de saída, com 200 mil tokens de contexto — cobrado em reais, no mesmo saldo das suas GPUs. Testar custa centavos:

curl https://gpubrasil.com.br/v1/chat/completions \
  -H "Authorization: Bearer gpub_live_suachaveaqui" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpub-base",
    "messages": [
      {"role": "system", "content": "Voce e um revisor de codigo senior."},
      {"role": "user", "content": "Revise esta funcao e aponte bugs: ..."}
    ]
  }'

Enquanto isso: monte a sua avaliação

O erro mais caro em troca de modelo é migrar por manchete. Separe 50 a 100 casos reais da sua operação — pull requests que você já revisou, tickets que já classificou, documentos que já extraiu — e transforme em um script que roda a mesma entrada em dois modelos e compara. Com a API por token, rodar essa avaliação inteira custa alguns reais. Quando os pesos do 5.3 saírem, você troca uma linha e mede em vez de adivinhar.

Quando os pesos saírem: decida por volume, não por hype

Fizemos essa conta em detalhe, com os dois lados numerados, em Comparativo de preços de API de LLM em 2026.

Casos de uso que este modelo destrava

Revisor de código interno, com o seu padrão

Um modelo forte em código, rodando na sua infraestrutura, pode revisar pull request contra o seu guia de estilo, o seu histórico de bugs e as suas regras de segurança — coisas que nenhum serviço genérico conhece. Comece pela API, meça a taxa de acerto e só então decida hospedar.

Agente de terminal para operação

Terminal Bench mede exatamente a habilidade de executar tarefas de shell em várias etapas sem se perder. Na prática: migração de dados, diagnóstico de servidor, rotina de deploy assistida. Rodando numa instância dedicada, o agente atua dentro do seu perímetro, com as chaves e o acesso que você definir.

Modernização de sistema legado

Ler 200 mil linhas de Delphi, COBOL ou PL/SQL e propor equivalentes é uma tarefa de contexto longo e paciência — o tipo de trabalho em que um modelo aberto rodando por hora sai muito mais barato que licença por assento.

Teste modelos abertos de código agora

Pela API por token, em reais, sem provisionar nada — ou numa GPU dedicada com vLLM em 1 clique. O mesmo saldo paga os dois.

Ver modelos e preços →

Perguntas frequentes

O que muda do GLM-5.2 para o GLM-5.3?

O GLM-5.3 usa a mesma base Mixture-of-Experts de cerca de 744 bilhões de parâmetros do GLM-5.2, com aproximadamente 40 bilhões ativos por token. O ganho veio de pós-treino estendido, não de um novo pré-treino: a Zhipu reporta 50% mais capacidade em código nas avaliações internas e o primeiro lugar entre modelos abertos em Terminal Bench 3.0 e Agents Last Exam.

Quanto custa hospedar um modelo de 744 bilhões de parâmetros?

Em FP8, os pesos ocupam algo próximo de 750 GB de VRAM antes do cache de contexto, o que na prática significa 8 GPUs de data center. Um bloco de 8 H200 sai por cerca de R$ 228 por hora, ou aproximadamente R$ 164 mil por mês rodando 24 horas por dia. Só compensa com demanda constante suficiente para ocupar o cluster.

Vale a pena esperar os pesos abertos do GLM-5.3?

Não é preciso parar enquanto isso. O GLM 5.2 já está disponível na API por token como gpub-base, a R$ 7,90 por milhão de tokens de entrada e R$ 17,90 de saída. O melhor uso dessa janela é montar uma avaliação com casos reais da sua operação, para que a troca de modelo seja decidida por medição e não por manchete.

Leia também: Qwen3.8-Max: 2,4 trilhões de parâmetros abertos · Comparativo de preços de API de LLM em 2026 · Quando self-hosting compensa