Em 31 de maio de 2026 a NVIDIA publicou o Cosmos 3 com pesos abertos e licença comercial. É o modelo mais ambicioso da categoria: uma coisa só que recebe texto, imagem, vídeo, áudio e trajetória de ação de robô, e devolve qualquer combinação disso de volta.

Este artigo é a leitura da ficha técnica sem o release de imprensa — o que a arquitetura realmente faz, o que a própria NVIDIA admite que não funciona, e quanto custa a hora.

🌍 Série "Modelos de Mundo" — 5 partes

1. O que é um world model · 2. Cosmos 3 por dentro ← você está aqui · 3. Dados sintéticos · 4. Dividir entre GPUs · 5. Do texto à ação

A arquitetura: duas torres, não uma

O detalhe que explica todo o resto: o Cosmos 3 é um Mixture-of-Transformers (MoT). Não é um transformer que faz tudo — são dois, complementares, num modelo só.

Isso resolve um problema real. Texto é discreto e sequencial: gerar token a token é natural. Vídeo é contínuo e simultâneo: 120 quadros que precisam ser coerentes entre si não são bem servidos por geração sequencial. Modelos que forçam tudo num mecanismo só pagam caro por isso. O Cosmos 3 usa o mecanismo adequado a cada modalidade e paga o preço de carregar as duas torres.

💡 Por que isso importa na hora de servir

Como as duas torres vivem no mesmo checkpoint, você carrega o modelo inteiro na memória mesmo que só vá usar uma delas.

É por isso que a NVIDIA publicou checkpoints especializados além do generalista: se você só quer imagem para vídeo, existe uma versão dedicada e você não paga a conta do resto.

Os cinco checkpoints

CheckpointParâmetrosPara quê
Cosmos3-Nano16BO generalista leve — mesma lista de entradas e saídas, cabendo em muito menos memória.
Cosmos3-Super64BO generalista completo. É dele que trata o resto deste artigo.
Cosmos3-Nano-Policy-DROID16BRecebe instrução em linguagem + o que a câmera vê, devolve trajetória de ação para a plataforma robótica DROID.
Cosmos3-Super-Image2Video64BEspecializado: uma imagem + instrução → vídeo coerente com ela.
Cosmos3-Super-Text2Image64BEspecializado: texto → imagem.

A recomendação prática é começar pelo Nano. 16B contra 64B é uma diferença de quatro vezes na conta, e para descobrir se a categoria resolve o seu problema o Nano responde a mesma pergunta.

O que entra e o que sai

A ficha tem dois modos distintos, e confundi-los é o erro mais comum:

O "raciocinador" recebe texto, imagem ou vídeo e devolve só texto — com contexto de até 256 mil tokens. Não é só descrição: ele devolve cadeia de raciocínio estruturada, localização de pontos em 2D e 3D e caixas delimitadoras. É o modo de entender a cena.

O "gerador" recebe texto, imagem, vídeo e trajetória de ação, e devolve imagem, vídeo, áudio ou ação. É o modo de criar a cena.

ParâmetroLimite real
Prompt de texto (gerador)4.096 tokens
Contexto do raciocinador256.000 tokens
Resolução256p, 480p ou 720p — em 16:9, 4:3, 1:1, 3:4 ou 9:16
Duração do vídeo gerado5 a 400 quadros (padrão: 189)
Vídeo de entradano máximo 5 quadros
Áudio de entradano máximo 0,5 segundo
Áudio de saídaAAC 48 kHz estéreo, embutido no MP4
Vídeo de entrada para o raciocinadorrecomendado a 4 quadros por segundo

Repare no assimétrico: 5 quadros de vídeo de entrada, até 400 de saída. Ele não é feito para editar um vídeo existente — é feito para continuar a partir de um instante.

A parte que ninguém comenta: ação

É o que torna o Cosmos 3 um modelo de mundo e não um gerador de vídeo. A entrada de ação é uma sequência, quadro a quadro, do estado ou do comando do agente — posição das juntas, estado da garra, pose da câmera. Formalmente uma matriz (T, D): T quadros por D dimensões.

E D não é livre. Só existem valores para corpos que o modelo conhece:

Corpo (embodiment)Dimensões
Movimento de câmera genérico9D
Veículo autônomo9D
Movimento egocêntrico (câmera na cabeça)57D
Braço Franka Panda + garra RobotiQ10D
Dois braços Franka Panda + garra20D
AgiBot29D
UR · Google robot · WidowX 25010D
UMI9D

Se o seu robô não está nessa lista, a entrada de ação não te serve diretamente — e essa é a limitação mais concreta de todo o pacote. A parte 5 trata disso.

Licença: dá para usar comercialmente

O modelo saiu sob OpenMDW 1.1, e a ficha diz de forma explícita que está pronto para uso comercial e não comercial. Não é uma licença de "pesquisa apenas" nem tem cláusula de faturamento máximo. Para quem avalia adoção em produto, isso é metade da decisão — e é raro nessa faixa de tamanho.

Quanto custa rodar — e a conta contraintuitiva

Aqui está o número que ninguém publica: o repositório do Cosmos3-Super pesa 132,7 GB, distribuídos em 27 arquivos. São 64 bilhões de parâmetros em BF16 — e a ficha avisa que só BF16 foi testado: FP8, FP4 e FP16 não são oficialmente suportados. Ou seja, a saída fácil de "quantiza e cabe" não está disponível.

132,7 GB de pesos não cabem em nenhuma placa única do mercado. A configuração de referência da NVIDIA é 8 placas de 141 GB, 80 GB ou 80 GB (H200, H100 ou A100). Com o catálogo de hoje:

ConfiguraçãoPreço por horaTempo por vídeo (número da NVIDIA)Custo por vídeo
8 × 141 GBR$ 228,40~55 segundosR$ 3,49
2 × 141 GBR$ 57,10~3 minutosR$ 2,86
8 × 80 GBR$ 114,48não publicado
1 × 141 GBR$ 28,55não roda — pesos não cabem

Preços consultados no catálogo em 1º de setembro de 2026, por GPU avulsa, sem interrupção programada. O catálogo se move dentro do mesmo dia — confira a vitrine antes de fechar a conta.

📈 Oito placas compram tempo, não economia

Repare na terceira coluna. Passar de 2 para 8 placas deixa o vídeo 3 vezes mais rápido, mas o custo por vídeo sobe — de R$ 2,86 para R$ 3,49, cerca de 22% a mais.

O paralelismo nunca é perfeitamente eficiente: quadruplicar as placas não quadruplica a velocidade. Você paga a diferença em dinheiro e recebe em latência.

A regra prática: bloco grande é para quando o tempo de resposta importa (alguém esperando, uma fila com prazo). Para gerar um lote de mil clipes de madrugada, a configuração menor entrega mais vídeo pelo mesmo dinheiro.

Como se serve, na prática

Quatro runtimes funcionam: PyTorch direto, vLLM-Omni, Hugging Face Diffusers e SGLang Diffusion. O caminho mais curto é o vLLM-Omni, que sobe um endpoint compatível com a API da OpenAI:

docker pull vllm/vllm-omni:cosmos3

vllm serve nvidia/Cosmos3-Super \
  --omni --host 0.0.0.0 --port 8000 \
  --cfg-parallel-size 2 --ulysses-degree 4 \
  --use-hsdp --hsdp-shard-size 8 \
  --init-timeout 1800

Para 2 placas, troque por --cfg-parallel-size 2 --use-hsdp --hsdp-shard-size 2. Em máquina com menos memória, --enable-layerwise-offload ajuda. O que cada uma dessas flags realmente faz é o assunto da parte 4.

Três detalhes que economizam uma tarde:

  1. O --init-timeout 1800 não é decoração. São 132,7 GB para baixar e carregar; o padrão do vLLM estoura antes. Provisione disco com folga — 200 GB é o mínimo confortável.
  2. Só Linux. A NVIDIA declara que não testou em outro sistema. Arquiteturas suportadas: Ampere, Hopper e Blackwell.
  3. O prompt precisa ser "aumentado" antes. Para qualidade decente, o texto curto tem que virar um JSON estruturado — e o exemplo oficial da própria NVIDIA faz isso chamando um LLM de fronteira por API. É um passo separado, com custo próprio, que nenhuma demonstração mostra.
⚠️ Não existe instalação em 1 clique para este modelo

Os nossos templates de 1 clique cobrem os modelos que testamos ponta a ponta. O Cosmos 3 não é um deles: as máquinas de bloco não aceitam template, e a instalação é manual — subir a máquina, baixar os pesos, rodar o contêiner.

Preferimos dizer isso do que vender um botão que não existe. Se você quer o caminho de 1 clique, ele existe para os modelos de linguagem, imagem e voz do catálogo — não para este.

O que a NVIDIA admite que não funciona

A seção de limitações da ficha técnica é honesta o bastante para merecer tradução direta. Os defeitos declarados: inconsistência temporal, movimento instável de câmera ou objeto, interação física imprecisa, sincronia áudio-vídeo errada e deriva de estado — especialmente em saída longa ou de alta resolução.

No modo de raciocínio: estado de objeto, relação causal, geometria espacial, ordem temporal e intenção do agente podem ser inferidos errado; contexto longo pode produzir entidade alucinada.

E a causa raiz, declarada: não há simulador de física no modelo. Geometria 3D, evolução no espaço-tempo, permanência de objeto, dinâmica de contato e leis físicas são apenas aproximadas.

Vale a pena?

Depende inteiramente de qual das três perguntas é a sua:

Testar sem contratar um bloco de oito placas

Dá para começar pelo checkpoint de 16B numa placa só, medir se a saída serve para o seu caso e só então dimensionar. Cobrança por hora de uso, em reais, sem contrato e sem compromisso mínimo.

Ver o catálogo →

Continue: parte 1: o que é um world model · parte 4: dividir entre GPUs