Geração de imagem por IA parou de ser assunto de novidade e virou item de custo em agência, e-commerce e time de produto. A boa notícia de 2026 é que os modelos abertos alcançaram qualidade de produção — e rodam numa GPU alugada por hora, com custo por imagem na casa de frações de centavo. Este guia coloca lado a lado os três nomes que dominam a conversa hoje e mostra qual roda em qual placa, por quanto, e com qual licença.
FLUX.2 é a referência de qualidade em pesos abertos, com geração nativa em até 4 MP. Qwen-Image 2.0 é o mais leve dos três — um desenho de ~7 bilhões de parâmetros com saída nativa em 2K e licença Apache 2.0 em algumas versões, o que o torna o mais amigável para uso comercial. HunyuanImage 3.0, da Tencent, é multimodal e autorregressivo: junta tokens de texto e imagem no mesmo modelo, o que melhora aderência ao prompt e conhecimento de mundo. Nenhum deles exige data center: a maioria dos fluxos cabe entre 12 e 24 GB de VRAM.
Os três, lado a lado
| Modelo | Arquitetura | Destaque | Onde brilha |
|---|---|---|---|
| FLUX.2 | Diffusion Transformer | Geração nativa até 4 MP | Cenas complexas, composição, iluminação, arte conceitual |
| Qwen-Image 2.0 | Difusão, ~7 B parâmetros | Leve, saída nativa 2K | Volume alto, texto dentro da imagem, custo baixo |
| HunyuanImage 3.0 | Multimodal autorregressivo | Texto e imagem no mesmo espaço de tokens | Aderência ao prompt, cena realista, conhecimento de mundo |
Antes de escolher: leia a licença
É o erro mais caro dessa área. "Pesos abertos" não é sinônimo de uso comercial liberado: várias famílias publicam variantes com licenças diferentes — uma permissiva para uso livre e outra restrita a pesquisa. Antes de colocar uma imagem gerada num anúncio ou num catálogo de cliente, confira qual variante exata você baixou e o que a licença dela permite. Uma linha de leitura hoje evita um problema jurídico caro depois.
Qual GPU cada um pede
A regra prática: o consumo cresce com tamanho do modelo × resolução × quantidade de imagens no lote. Estas faixas cobrem a maioria dos fluxos:
| Perfil de uso | VRAM confortável | GPU sugerida | Preço/hora |
|---|---|---|---|
| Modelo leve (~7 B), 1K–2K, lote pequeno | 12–16 GB | RTX 3090 24 GB | R$ 1,27 |
| Modelo de ponta, alta resolução, LoRA | 24 GB | RTX 4090 24 GB | R$ 2,78 |
| Lote grande, upscaling no mesmo fluxo | 32–48 GB | RTX 6000 Ada 48 GB | R$ 6,01 |
| Multimodal grande ou treino de LoRA pesado | 48–96 GB | RTX 6000 Ada 48 GB / RTX PRO 6000 96 GB | R$ 6,01 / R$ 10,26 |
Preços de catálogo em 15/08/2026, por hora, em reais, sujeitos a disponibilidade.
Quanto custa cada imagem, de verdade
A conta é direta e não depende de tabela de ninguém:
custo_por_imagem = (preco_hora / 3600) * segundos_por_imagem
imagens_por_real = 3600 / (preco_hora * segundos_por_imagem) * 1
| GPU | Preço/hora | 5 s/imagem | 10 s/imagem | 1.000 imagens a 10 s |
|---|---|---|---|---|
| RTX 3090 24 GB | R$ 1,27 | R$ 0,0018 | R$ 0,0035 | R$ 3,53 |
| RTX 4090 24 GB | R$ 2,78 | R$ 0,0039 | R$ 0,0077 | R$ 7,72 |
| RTX 6000 Ada 48 GB | R$ 6,01 | R$ 0,0083 | R$ 0,0167 | R$ 16,69 |
Mil imagens por menos que um almoço, na placa certa. É esse número que muda a estratégia de conteúdo de um e-commerce: deixa de fazer sentido escolher quais produtos ganham foto de estilo — todos ganham.
Não é a GPU: é a máquina esquecida ligada. Um fluxo de imagem trabalha em rajada — você gera 300 peças em uma hora e some por três dias. Gere em lote, baixe o resultado, desligue. E lembre que a placa mais cara só vale se for proporcionalmente mais rápida: compare custo por imagem, nunca preço por hora.
Como subir em minutos
Três templates de 1 clique cobrem os perfis mais comuns:
- Fooocus — a porta de entrada. Interface simples, bom resultado sem ajustar nada. Ideal para quem não é técnico.
- InvokeAI — editor completo com camadas, inpainting e gestão de modelos. Bom para time de design.
- ComfyUI — fluxo em nós, para quem quer pipeline: geração, upscaling, ControlNet, LoRA e pós-processamento encadeados e repetíveis.
- rembg — remoção de fundo em lote, o passo que quase todo catálogo precisa depois.
Quatro usos que se pagam no primeiro mês
Catálogo de e-commerce
Foto de produto em fundo neutro vira cena de estilo de vida. Um catálogo de 5.000 itens sai por menos de R$ 40 em GPU, gerando dez segundos por imagem. O ganho de conversão de uma imagem contextualizada costuma pagar isso no primeiro dia.
Criativos para anúncio
Gerar 50 variações de um mesmo conceito e deixar o teste A/B decidir. Com custo por imagem em frações de centavo, a limitação passa a ser o tempo da equipe para revisar.
Identidade visual consistente com LoRA
Treinar um LoRA com o seu produto, sua mascote ou seu estilo é o que separa "imagem bonita" de "imagem da marca". Um treino leve cabe numa 4090; treinos maiores pedem 48 GB. Depois de pronto, todo mundo gera dentro do padrão.
Editorial e material de apoio
Blog, apresentação, sala de aula, material de treinamento. Substituir banco de imagens por geração própria elimina custo recorrente de licenciamento — e evita a foto genérica que todo mundo reconhece.
Mil imagens por menos de R$ 10 em GPU
Suba Fooocus, InvokeAI ou ComfyUI em 1 clique numa GPU por hora, em reais. Gere em lote e desligue.
Ver GPUs e templates →Perguntas frequentes
Quais são os melhores modelos abertos de imagem em 2026?
FLUX.2 é a referência de qualidade em pesos abertos, com geração nativa em até 4 MP. Qwen-Image 2.0 é o mais leve, com cerca de 7 bilhões de parâmetros e saída nativa em 2K, e algumas versões da família usam licença Apache 2.0, o que facilita o uso comercial. HunyuanImage 3.0, da Tencent, é multimodal autorregressivo e se destaca em aderência ao prompt e realismo.
Quanta VRAM é necessária para gerar imagens?
Modelos leves de cerca de 7 bilhões de parâmetros rodam confortáveis em 12 a 16 GB. Modelos de ponta em alta resolução, com LoRA, pedem 24 GB. Lote grande com upscaling no mesmo fluxo pede 32 a 48 GB. Multimodais grandes ou treino pesado de LoRA pedem de 48 a 96 GB.
Quanto custa gerar mil imagens?
A conta é o preço por hora dividido por 3.600 e multiplicado pelos segundos por imagem. A dez segundos por imagem, mil imagens saem por cerca de R$ 3,53 numa RTX 3090 a R$ 1,27 por hora, R$ 7,72 numa RTX 4090 a R$ 2,78 por hora, ou R$ 16,69 numa RTX 6000 Ada de 48 GB a R$ 6,01 por hora.
Leia também: InvokeAI em 1 clique · Fooocus: Stable Diffusion sem complicação · Vídeo por IA na sua própria GPU