A ByteDance lançou o Seedance 2.5 em 31 de julho de 2026 e abriu a API pública para desenvolvedores em 7 de agosto. O salto é grande: clipes de até 30 segundos em plano único, com áudio nativo, aceitando até 50 referências multimodais na mesma geração (30 imagens, 10 vídeos e 10 áudios) e suporte nativo a mais de 10 idiomas. Ele já é o modelo padrão nos aplicativos da própria empresa, com distribuição internacional em andamento.
Duas coisas ao mesmo tempo. Primeira: o Seedance 2.5 é fechado e controlado por acesso — dá para usar, não para hospedar, e cada geração passa pela infraestrutura de outra empresa. Segunda: os modelos abertos de vídeo amadureceram e já entregam boa parte do que essa geração anuncia. Para estúdio, agência e time de conteúdo no Brasil, a decisão real é onde cada tipo de trabalho roda — e a resposta quase sempre é híbrida.
O que o Seedance 2.5 trouxe
| Recurso | Detalhe |
|---|---|
| Duração | Até 30 segundos em plano único |
| Áudio | Gerado nativamente junto com a imagem |
| Referências | Até 50 entradas: 30 imagens, 10 vídeos, 10 áudios |
| Idiomas | Mais de 10, com legenda, locução e títulos na mesma cena |
| Disponibilidade | API pública desde 7/8/2026 — serviço fechado, sem pesos |
O detalhe das 50 referências é o mais subestimado. Ele muda o vídeo por IA de "sorteio bonito" para direção de arte controlada: você entrega o rosto do apresentador, o produto, a paleta, um clipe de movimento e a trilha, e pede a cena. É o que separa demonstração de produção.
O lado aberto: o que dá para rodar na sua própria GPU
Enquanto os fechados avançam, a leva aberta chegou perto o suficiente para trabalho real. Modelos como Wan 2.7, LTX-2 e Alice v1 já cobrem boa parte dos recursos anunciados na geração fechada — e, ao contrário dela, rodam dentro de uma máquina que é sua.
As três vantagens que importam quando você produz em escala:
- Custo por clipe previsível. Você paga a hora da GPU, não a geração. Quem itera 40 vezes num plano sabe a diferença que isso faz.
- Sem fila e sem política de conteúdo de terceiro. Campanha de marca, personagem próprio e material de cliente não dependem de moderação alheia.
- Pipeline seu. Dá para encadear geração, upscaling, interpolação e sincronia de áudio no mesmo fluxo, com seus LoRAs e seus modelos de voz.
A conta do custo por clipe
Aqui não vale chutar throughput: cada modelo, resolução e número de passos gera um tempo diferente. O que dá para entregar é a fórmula — meça o seu tempo por clipe uma vez e a tabela resolve o resto.
custo_por_clipe = (preco_hora / 60) * minutos_por_clipe
| GPU | Preço/hora | 2 min/clipe | 5 min/clipe | 10 min/clipe |
|---|---|---|---|---|
| RTX 4090 24 GB | R$ 2,78 | R$ 0,09 | R$ 0,23 | R$ 0,46 |
| RTX 6000 Ada 48 GB | R$ 6,01 | R$ 0,20 | R$ 0,50 | R$ 1,00 |
| RTX 5090 32 GB | R$ 4,77 | R$ 0,16 | R$ 0,40 | R$ 0,80 |
| RTX PRO 6000 96 GB | R$ 10,26 | R$ 0,34 | R$ 0,86 | R$ 1,71 |
Preços de catálogo em 15/08/2026. Repare no que a tabela ensina: a GPU mais cara só compensa se ela for proporcionalmente mais rápida. Se a PRO 6000 gera em 2 minutos o que a RTX 6000 Ada gera em 5, ela é mais barata por clipe. Meça antes de assumir.
Modelo de vídeo consome memória em função de resolução × quadros. Um clipe curto em 720p costuma caber em 24 GB; subir para 1080p, aumentar a duração ou rodar upscaling no mesmo fluxo empurra para 45–48 GB. Antes de reservar uma máquina grande, teste o seu fluxo na menor que couber — a diferença entre R$ 2,78 e R$ 10,26 por hora se acumula rápido em produção.
Como montar o estúdio na prática
1. Suba o ComfyUI em 1 clique
O template de ComfyUI entrega o ambiente pronto com CUDA e a interface de fluxo já servida — você entra pelo navegador e carrega os modelos e workflows que quiser, inclusive os de vídeo. É o ponto de partida padrão de quem monta pipeline visual.
2. Encadeie o áudio no mesmo pipeline
Locução e clonagem de voz em português têm templates próprios: XTTS-v2, F5-TTS e OpenVoice v2. Para sincronia labial de apresentador, o LivePortrait resolve o rosto sem regravar nada.
3. Desligue quando terminar
É o hábito que mais economiza em produção de vídeo: render é trabalho em rajada. Rodou o lote, desligou. Numa GPU comprada, a placa parada continua custando; alugada, a hora não rodada não é cobrada.
Quando usar o fechado e quando usar o aberto
| Situação | Melhor caminho | Por quê |
|---|---|---|
| Peça única, prazo curto, qualidade máxima | Serviço fechado de ponta | Você paga pela geração e acabou; não precisa montar nada |
| Volume alto, muitas iterações | Modelo aberto em GPU por hora | Custo por clipe cai conforme você ocupa a máquina |
| Personagem, marca ou estilo próprio | Aberto, com LoRA treinado | Consistência entre peças; só existe com pesos na sua mão |
| Material sensível ou sob contrato | Aberto, em instância dedicada | Você controla o que entra, o que fica em log e por quanto tempo |
| Legendas e locução em vários idiomas | Híbrido | Gere a cena onde for melhor; produza o áudio no seu pipeline |
Três produções que cabem no orçamento hoje
Catálogo de e-commerce em vídeo
Mil produtos, um clipe de 5 segundos cada, gerado a partir da foto do produto. A 2 minutos por clipe numa RTX 4090, são cerca de 33 horas de máquina — perto de R$ 92 em GPU. O gargalo passa a ser a curadoria, não o custo.
Variações de criativo para anúncio
Testar 30 versões de um anúncio é rotina de performance. Com modelo aberto rodando em lote, o custo por variação fica em centavos e a equipe pode errar à vontade — que é como se descobre o criativo vencedor.
Treinamento corporativo em escala
Apresentador sintético, roteiro em português, sincronia labial e legenda. Uma vez montado o fluxo, cada novo módulo custa tempo de GPU, não uma nova diária de estúdio.
Monte o seu estúdio de vídeo por IA por hora
ComfyUI em 1 clique, GPUs de 24 a 96 GB a partir de R$ 1,27/h, em reais e via Pix. Ligou, gerou, desligou.
Ver GPUs e templates →Perguntas frequentes
O que o Seedance 2.5 faz de novo?
Lançado em 31 de julho de 2026, com API pública desde 7 de agosto, ele gera clipes de até 30 segundos em plano único com áudio nativo, aceita até 50 referências multimodais na mesma geração, sendo 30 imagens, 10 vídeos e 10 áudios, e tem suporte nativo a mais de 10 idiomas. É um serviço fechado e controlado por acesso: não há pesos para hospedar.
Existe alternativa aberta para geração de vídeo?
Sim. Modelos abertos como Wan 2.7, LTX-2 e Alice v1 amadureceram e já cobrem boa parte dos recursos anunciados pelas gerações fechadas. Eles rodam numa GPU alugada por hora, o que dá custo por clipe previsível, ausência de fila e liberdade para treinar LoRAs do seu personagem, produto ou estilo.
Quanto custa gerar um clipe na GPU alugada?
O custo é o preço por hora dividido por 60 e multiplicado pelos minutos por clipe. Numa RTX 4090 a R$ 2,78 por hora, um clipe que leva 2 minutos sai por cerca de R$ 0,09; a 5 minutos, R$ 0,23. Numa RTX 6000 Ada de 48 GB a R$ 6,01 por hora, os mesmos tempos custam R$ 0,20 e R$ 0,50. A GPU mais cara só compensa se for proporcionalmente mais rápida.
Leia também: Vídeo por IA com áudio sincronizado · Modelos abertos de imagem em 2026 · Pipeline barato de clipe musical com IA