Em 31 de maio de 2026 a NVIDIA publicou o Cosmos 3 com pesos abertos e licença comercial. É o modelo mais ambicioso da categoria: uma coisa só que recebe texto, imagem, vídeo, áudio e trajetória de ação de robô, e devolve qualquer combinação disso de volta.
Este artigo é a leitura da ficha técnica sem o release de imprensa — o que a arquitetura realmente faz, o que a própria NVIDIA admite que não funciona, e quanto custa a hora.
1. O que é um world model · 2. Cosmos 3 por dentro ← você está aqui · 3. Dados sintéticos · 4. Dividir entre GPUs · 5. Do texto à ação
A arquitetura: duas torres, não uma
O detalhe que explica todo o resto: o Cosmos 3 é um Mixture-of-Transformers (MoT). Não é um transformer que faz tudo — são dois, complementares, num modelo só.
- Uma torre autorregressiva, que gera texto do jeito clássico: um token de cada vez, prevendo o próximo.
- Uma torre de difusão, que gera imagem, vídeo, áudio e ação por refinamento iterativo — partindo de ruído e limpando aos poucos.
Isso resolve um problema real. Texto é discreto e sequencial: gerar token a token é natural. Vídeo é contínuo e simultâneo: 120 quadros que precisam ser coerentes entre si não são bem servidos por geração sequencial. Modelos que forçam tudo num mecanismo só pagam caro por isso. O Cosmos 3 usa o mecanismo adequado a cada modalidade e paga o preço de carregar as duas torres.
Como as duas torres vivem no mesmo checkpoint, você carrega o modelo inteiro na memória mesmo que só vá usar uma delas.
É por isso que a NVIDIA publicou checkpoints especializados além do generalista: se você só quer imagem para vídeo, existe uma versão dedicada e você não paga a conta do resto.
Os cinco checkpoints
| Checkpoint | Parâmetros | Para quê |
|---|---|---|
| Cosmos3-Nano | 16B | O generalista leve — mesma lista de entradas e saídas, cabendo em muito menos memória. |
| Cosmos3-Super | 64B | O generalista completo. É dele que trata o resto deste artigo. |
| Cosmos3-Nano-Policy-DROID | 16B | Recebe instrução em linguagem + o que a câmera vê, devolve trajetória de ação para a plataforma robótica DROID. |
| Cosmos3-Super-Image2Video | 64B | Especializado: uma imagem + instrução → vídeo coerente com ela. |
| Cosmos3-Super-Text2Image | 64B | Especializado: texto → imagem. |
A recomendação prática é começar pelo Nano. 16B contra 64B é uma diferença de quatro vezes na conta, e para descobrir se a categoria resolve o seu problema o Nano responde a mesma pergunta.
O que entra e o que sai
A ficha tem dois modos distintos, e confundi-los é o erro mais comum:
O "raciocinador" recebe texto, imagem ou vídeo e devolve só texto — com contexto de até 256 mil tokens. Não é só descrição: ele devolve cadeia de raciocínio estruturada, localização de pontos em 2D e 3D e caixas delimitadoras. É o modo de entender a cena.
O "gerador" recebe texto, imagem, vídeo e trajetória de ação, e devolve imagem, vídeo, áudio ou ação. É o modo de criar a cena.
| Parâmetro | Limite real |
|---|---|
| Prompt de texto (gerador) | 4.096 tokens |
| Contexto do raciocinador | 256.000 tokens |
| Resolução | 256p, 480p ou 720p — em 16:9, 4:3, 1:1, 3:4 ou 9:16 |
| Duração do vídeo gerado | 5 a 400 quadros (padrão: 189) |
| Vídeo de entrada | no máximo 5 quadros |
| Áudio de entrada | no máximo 0,5 segundo |
| Áudio de saída | AAC 48 kHz estéreo, embutido no MP4 |
| Vídeo de entrada para o raciocinador | recomendado a 4 quadros por segundo |
Repare no assimétrico: 5 quadros de vídeo de entrada, até 400 de saída. Ele não é feito para editar um vídeo existente — é feito para continuar a partir de um instante.
A parte que ninguém comenta: ação
É o que torna o Cosmos 3 um modelo de mundo e não um gerador de vídeo. A entrada de ação é uma sequência, quadro a quadro, do estado ou do comando do agente — posição das juntas, estado da garra, pose da câmera. Formalmente uma matriz (T, D): T quadros por D dimensões.
E D não é livre. Só existem valores para corpos que o modelo conhece:
| Corpo (embodiment) | Dimensões |
|---|---|
| Movimento de câmera genérico | 9D |
| Veículo autônomo | 9D |
| Movimento egocêntrico (câmera na cabeça) | 57D |
| Braço Franka Panda + garra RobotiQ | 10D |
| Dois braços Franka Panda + garra | 20D |
| AgiBot | 29D |
| UR · Google robot · WidowX 250 | 10D |
| UMI | 9D |
Se o seu robô não está nessa lista, a entrada de ação não te serve diretamente — e essa é a limitação mais concreta de todo o pacote. A parte 5 trata disso.
Licença: dá para usar comercialmente
O modelo saiu sob OpenMDW 1.1, e a ficha diz de forma explícita que está pronto para uso comercial e não comercial. Não é uma licença de "pesquisa apenas" nem tem cláusula de faturamento máximo. Para quem avalia adoção em produto, isso é metade da decisão — e é raro nessa faixa de tamanho.
Quanto custa rodar — e a conta contraintuitiva
Aqui está o número que ninguém publica: o repositório do Cosmos3-Super pesa 132,7 GB, distribuídos em 27 arquivos. São 64 bilhões de parâmetros em BF16 — e a ficha avisa que só BF16 foi testado: FP8, FP4 e FP16 não são oficialmente suportados. Ou seja, a saída fácil de "quantiza e cabe" não está disponível.
132,7 GB de pesos não cabem em nenhuma placa única do mercado. A configuração de referência da NVIDIA é 8 placas de 141 GB, 80 GB ou 80 GB (H200, H100 ou A100). Com o catálogo de hoje:
| Configuração | Preço por hora | Tempo por vídeo (número da NVIDIA) | Custo por vídeo |
|---|---|---|---|
| 8 × 141 GB | R$ 228,40 | ~55 segundos | R$ 3,49 |
| 2 × 141 GB | R$ 57,10 | ~3 minutos | R$ 2,86 |
| 8 × 80 GB | R$ 114,48 | não publicado | — |
| 1 × 141 GB | R$ 28,55 | não roda — pesos não cabem | — |
Preços consultados no catálogo em 1º de setembro de 2026, por GPU avulsa, sem interrupção programada. O catálogo se move dentro do mesmo dia — confira a vitrine antes de fechar a conta.
Repare na terceira coluna. Passar de 2 para 8 placas deixa o vídeo 3 vezes mais rápido, mas o custo por vídeo sobe — de R$ 2,86 para R$ 3,49, cerca de 22% a mais.
O paralelismo nunca é perfeitamente eficiente: quadruplicar as placas não quadruplica a velocidade. Você paga a diferença em dinheiro e recebe em latência.
A regra prática: bloco grande é para quando o tempo de resposta importa (alguém esperando, uma fila com prazo). Para gerar um lote de mil clipes de madrugada, a configuração menor entrega mais vídeo pelo mesmo dinheiro.
Como se serve, na prática
Quatro runtimes funcionam: PyTorch direto, vLLM-Omni, Hugging Face Diffusers e SGLang Diffusion. O caminho mais curto é o vLLM-Omni, que sobe um endpoint compatível com a API da OpenAI:
docker pull vllm/vllm-omni:cosmos3
vllm serve nvidia/Cosmos3-Super \
--omni --host 0.0.0.0 --port 8000 \
--cfg-parallel-size 2 --ulysses-degree 4 \
--use-hsdp --hsdp-shard-size 8 \
--init-timeout 1800
Para 2 placas, troque por --cfg-parallel-size 2 --use-hsdp --hsdp-shard-size 2. Em máquina com menos memória, --enable-layerwise-offload ajuda. O que cada uma dessas flags realmente faz é o assunto da parte 4.
Três detalhes que economizam uma tarde:
- O
--init-timeout 1800não é decoração. São 132,7 GB para baixar e carregar; o padrão do vLLM estoura antes. Provisione disco com folga — 200 GB é o mínimo confortável. - Só Linux. A NVIDIA declara que não testou em outro sistema. Arquiteturas suportadas: Ampere, Hopper e Blackwell.
- O prompt precisa ser "aumentado" antes. Para qualidade decente, o texto curto tem que virar um JSON estruturado — e o exemplo oficial da própria NVIDIA faz isso chamando um LLM de fronteira por API. É um passo separado, com custo próprio, que nenhuma demonstração mostra.
Os nossos templates de 1 clique cobrem os modelos que testamos ponta a ponta. O Cosmos 3 não é um deles: as máquinas de bloco não aceitam template, e a instalação é manual — subir a máquina, baixar os pesos, rodar o contêiner.
Preferimos dizer isso do que vender um botão que não existe. Se você quer o caminho de 1 clique, ele existe para os modelos de linguagem, imagem e voz do catálogo — não para este.
O que a NVIDIA admite que não funciona
A seção de limitações da ficha técnica é honesta o bastante para merecer tradução direta. Os defeitos declarados: inconsistência temporal, movimento instável de câmera ou objeto, interação física imprecisa, sincronia áudio-vídeo errada e deriva de estado — especialmente em saída longa ou de alta resolução.
No modo de raciocínio: estado de objeto, relação causal, geometria espacial, ordem temporal e intenção do agente podem ser inferidos errado; contexto longo pode produzir entidade alucinada.
E a causa raiz, declarada: não há simulador de física no modelo. Geometria 3D, evolução no espaço-tempo, permanência de objeto, dinâmica de contato e leis físicas são apenas aproximadas.
Vale a pena?
Depende inteiramente de qual das três perguntas é a sua:
- "Quero gerar vídeo de marketing." Não. É caro demais e há modelos abertos menores muito melhores nessa relação custo-benefício.
- "Quero entender cena de vídeo com raciocínio espacial." Talvez — e comece pelo Nano de 16B, que cabe em uma placa.
- "Quero fabricar dado de treino para robô ou veículo, com controle de ação." Aí sim. É o único pacote aberto que faz isso com licença comercial hoje, e é o assunto da parte 3.
Testar sem contratar um bloco de oito placas
Dá para começar pelo checkpoint de 16B numa placa só, medir se a saída serve para o seu caso e só então dimensionar. Cobrança por hora de uso, em reais, sem contrato e sem compromisso mínimo.
Ver o catálogo →Continue: parte 1: o que é um world model · parte 4: dividir entre GPUs