InícioTemplates › Llama 4 Scout
🧠 LLM Self-hosted

Llama 4 Scout com contexto longo

Meta Llama 4 Scout — MoE com contexto ultralongo

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
200 GB
Instalação
~15 min
Acesso
porta 8000
Cobrança
por hora, em reais

O Scout é a variante da Meta pensada para contexto muito longo: documentos inteiros, repositórios, históricos completos. Precisa de acesso liberado no repositório de modelos antes do primeiro download.

Llama 4 Scout (Meta) servido via vLLM com API OpenAI-compatível — MoE com janela de contexto enorme (até ~10M tokens). IMPORTANTE: modelo GATED no Hugging Face → defina HF_TOKEN com acesso aprovado. Modelo grande: prefira múltiplas GPUs H100/H200; contexto longo consome muita VRAM.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template Llama 4 Scout e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Preciso pedir acesso ao modelo?

Sim, é um modelo com acesso controlado. Aceite os termos na sua conta do repositório e informe o token no template.

Quanta memória de vídeo?

Cerca de 200 GB, ou seja, um bloco de placas grandes.

Dá para usar contexto máximo desde o início?

Contexto muito longo consome memória extra. Comece menor e aumente conforme a placa aguentar.

Llama 4 Scout rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando