A ByteDance lançou o Seedance 2.5 em 31 de julho de 2026 e abriu a API pública para desenvolvedores em 7 de agosto. O salto é grande: clipes de até 30 segundos em plano único, com áudio nativo, aceitando até 50 referências multimodais na mesma geração (30 imagens, 10 vídeos e 10 áudios) e suporte nativo a mais de 10 idiomas. Ele já é o modelo padrão nos aplicativos da própria empresa, com distribuição internacional em andamento.

⚡ Resumo

Duas coisas ao mesmo tempo. Primeira: o Seedance 2.5 é fechado e controlado por acesso — dá para usar, não para hospedar, e cada geração passa pela infraestrutura de outra empresa. Segunda: os modelos abertos de vídeo amadureceram e já entregam boa parte do que essa geração anuncia. Para estúdio, agência e time de conteúdo no Brasil, a decisão real é onde cada tipo de trabalho roda — e a resposta quase sempre é híbrida.

O que o Seedance 2.5 trouxe

RecursoDetalhe
DuraçãoAté 30 segundos em plano único
ÁudioGerado nativamente junto com a imagem
ReferênciasAté 50 entradas: 30 imagens, 10 vídeos, 10 áudios
IdiomasMais de 10, com legenda, locução e títulos na mesma cena
DisponibilidadeAPI pública desde 7/8/2026 — serviço fechado, sem pesos

O detalhe das 50 referências é o mais subestimado. Ele muda o vídeo por IA de "sorteio bonito" para direção de arte controlada: você entrega o rosto do apresentador, o produto, a paleta, um clipe de movimento e a trilha, e pede a cena. É o que separa demonstração de produção.

O lado aberto: o que dá para rodar na sua própria GPU

Enquanto os fechados avançam, a leva aberta chegou perto o suficiente para trabalho real. Modelos como Wan 2.7, LTX-2 e Alice v1 já cobrem boa parte dos recursos anunciados na geração fechada — e, ao contrário dela, rodam dentro de uma máquina que é sua.

As três vantagens que importam quando você produz em escala:

A conta do custo por clipe

Aqui não vale chutar throughput: cada modelo, resolução e número de passos gera um tempo diferente. O que dá para entregar é a fórmula — meça o seu tempo por clipe uma vez e a tabela resolve o resto.

custo_por_clipe = (preco_hora / 60) * minutos_por_clipe
GPUPreço/hora2 min/clipe5 min/clipe10 min/clipe
RTX 4090 24 GBR$ 2,78R$ 0,09R$ 0,23R$ 0,46
RTX 6000 Ada 48 GBR$ 6,01R$ 0,20R$ 0,50R$ 1,00
RTX 5090 32 GBR$ 4,77R$ 0,16R$ 0,40R$ 0,80
RTX PRO 6000 96 GBR$ 10,26R$ 0,34R$ 0,86R$ 1,71

Preços de catálogo em 15/08/2026. Repare no que a tabela ensina: a GPU mais cara só compensa se ela for proporcionalmente mais rápida. Se a PRO 6000 gera em 2 minutos o que a RTX 6000 Ada gera em 5, ela é mais barata por clipe. Meça antes de assumir.

💡 VRAM é o que decide a resolução

Modelo de vídeo consome memória em função de resolução × quadros. Um clipe curto em 720p costuma caber em 24 GB; subir para 1080p, aumentar a duração ou rodar upscaling no mesmo fluxo empurra para 45–48 GB. Antes de reservar uma máquina grande, teste o seu fluxo na menor que couber — a diferença entre R$ 2,78 e R$ 10,26 por hora se acumula rápido em produção.

Como montar o estúdio na prática

1. Suba o ComfyUI em 1 clique

O template de ComfyUI entrega o ambiente pronto com CUDA e a interface de fluxo já servida — você entra pelo navegador e carrega os modelos e workflows que quiser, inclusive os de vídeo. É o ponto de partida padrão de quem monta pipeline visual.

2. Encadeie o áudio no mesmo pipeline

Locução e clonagem de voz em português têm templates próprios: XTTS-v2, F5-TTS e OpenVoice v2. Para sincronia labial de apresentador, o LivePortrait resolve o rosto sem regravar nada.

3. Desligue quando terminar

É o hábito que mais economiza em produção de vídeo: render é trabalho em rajada. Rodou o lote, desligou. Numa GPU comprada, a placa parada continua custando; alugada, a hora não rodada não é cobrada.

Quando usar o fechado e quando usar o aberto

SituaçãoMelhor caminhoPor quê
Peça única, prazo curto, qualidade máximaServiço fechado de pontaVocê paga pela geração e acabou; não precisa montar nada
Volume alto, muitas iteraçõesModelo aberto em GPU por horaCusto por clipe cai conforme você ocupa a máquina
Personagem, marca ou estilo próprioAberto, com LoRA treinadoConsistência entre peças; só existe com pesos na sua mão
Material sensível ou sob contratoAberto, em instância dedicadaVocê controla o que entra, o que fica em log e por quanto tempo
Legendas e locução em vários idiomasHíbridoGere a cena onde for melhor; produza o áudio no seu pipeline

Três produções que cabem no orçamento hoje

Catálogo de e-commerce em vídeo

Mil produtos, um clipe de 5 segundos cada, gerado a partir da foto do produto. A 2 minutos por clipe numa RTX 4090, são cerca de 33 horas de máquina — perto de R$ 92 em GPU. O gargalo passa a ser a curadoria, não o custo.

Variações de criativo para anúncio

Testar 30 versões de um anúncio é rotina de performance. Com modelo aberto rodando em lote, o custo por variação fica em centavos e a equipe pode errar à vontade — que é como se descobre o criativo vencedor.

Treinamento corporativo em escala

Apresentador sintético, roteiro em português, sincronia labial e legenda. Uma vez montado o fluxo, cada novo módulo custa tempo de GPU, não uma nova diária de estúdio.

Monte o seu estúdio de vídeo por IA por hora

ComfyUI em 1 clique, GPUs de 24 a 96 GB a partir de R$ 1,27/h, em reais e via Pix. Ligou, gerou, desligou.

Ver GPUs e templates →

Perguntas frequentes

O que o Seedance 2.5 faz de novo?

Lançado em 31 de julho de 2026, com API pública desde 7 de agosto, ele gera clipes de até 30 segundos em plano único com áudio nativo, aceita até 50 referências multimodais na mesma geração, sendo 30 imagens, 10 vídeos e 10 áudios, e tem suporte nativo a mais de 10 idiomas. É um serviço fechado e controlado por acesso: não há pesos para hospedar.

Existe alternativa aberta para geração de vídeo?

Sim. Modelos abertos como Wan 2.7, LTX-2 e Alice v1 amadureceram e já cobrem boa parte dos recursos anunciados pelas gerações fechadas. Eles rodam numa GPU alugada por hora, o que dá custo por clipe previsível, ausência de fila e liberdade para treinar LoRAs do seu personagem, produto ou estilo.

Quanto custa gerar um clipe na GPU alugada?

O custo é o preço por hora dividido por 60 e multiplicado pelos minutos por clipe. Numa RTX 4090 a R$ 2,78 por hora, um clipe que leva 2 minutos sai por cerca de R$ 0,09; a 5 minutos, R$ 0,23. Numa RTX 6000 Ada de 48 GB a R$ 6,01 por hora, os mesmos tempos custam R$ 0,20 e R$ 0,50. A GPU mais cara só compensa se for proporcionalmente mais rápida.

Leia também: Vídeo por IA com áudio sincronizado · Modelos abertos de imagem em 2026 · Pipeline barato de clipe musical com IA