InícioTemplates › Kimi K2 (Moonshot)
🧠 LLM Self-hosted

Kimi K2 para agentes e código

Modelo agêntico open-weight para código e tarefas multi-step

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
1000 GB
Instalação
~15 min
Acesso
porta 8000
Cobrança
por hora, em reais

O Kimi K2 se destaca em chamada de ferramenta e em código — as duas coisas que quebram a maioria dos modelos abertos quando você monta um agente de verdade. Aqui ele sobe já servido pelo vLLM.

Kimi K2 da Moonshot AI servido via vLLM com API OpenAI-compatível — focado em agentes, uso de ferramentas e código multi-step. ATENÇÃO: modelo grande — exige múltiplas GPUs H100/H200 ou quantização. Ajuste o modelo (ex.: K2.6) via variável VLLM_MODEL.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template Kimi K2 (Moonshot) e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Quanta memória de vídeo?

Cerca de 480 GB, em bloco de placas grandes.

Ele chama ferramentas de forma confiável?

É um dos modelos abertos mais consistentes nisso, embora ainda exija prompt bem definido.

Existe versão menor?

Não do próprio K2. Para caber em uma placa, considere o Qwen3 ou o DeepSeek-R1 Distill.

Kimi K2 (Moonshot) rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando