InícioTemplates › GLM-5.2 (vLLM)
🧠 LLM Self-hosted

GLM-5.2 em máquina própria

O open-source SOTA da Z.ai: 753B, 1M de contexto, licença MIT

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
800 GB
Instalação
~15 min
Acesso
porta 8000
Cobrança
por hora, em reais

O GLM-5.2 é um dos modelos abertos de contexto muito longo, e por isso exige máquina multi-GPU. Este template já sobe o vLLM com o particionamento entre placas configurado.

Sirva o GLM-5.2 (Z.ai) via vLLM com API OpenAI-compatível. Modelo MoE de 753B (~40B ativos), contexto de 1M, forte em agentes e código. ATENÇÃO: o modelo completo exige múltiplas GPUs H100/H200 (alta VRAM) ou variante quantizada — ajuste tensor-parallel e o modelo via variáveis de ambiente.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template GLM-5.2 (vLLM) e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Quanta memória de vídeo preciso?

Cerca de 320 GB, ou seja, um bloco de várias placas de 80 a 141 GB. Confira a disponibilidade no console antes de reservar.

Quanto tempo leva para subir?

O download dos pesos é a parte demorada: conte alguns minutos até o servidor responder.

Vale a pena frente à API por token?

Só com uso pesado e contínuo. Para volume baixo, o custo da máquina multi-GPU não se paga.

GLM-5.2 (vLLM) rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando