Qwen3-235B em bloco de GPUs
O flagship MoE da Qwen para raciocínio e código
- Memória de vídeo
- 480 GB
- Instalação
- ~15 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
O Qwen3-235B é um modelo de mistura de especialistas: muitos parâmetros no total, poucos ativos por token. Isso dá qualidade de modelo grande com throughput melhor do que o tamanho sugere — desde que caiba na memória.
Qwen3-235B-A22B (MoE) servido via vLLM com API OpenAI-compatível — top em raciocínio e código entre os open-source. ATENÇÃO: exige múltiplas GPUs H100/H200 ou quantização. Para 1 GPU, use o template Qwen3 (8B).
Para que serve
- Qualidade de modelo grande com licença permissiva
- Bom desempenho em português entre os modelos de topo
- Uso intensivo com custo fixo por hora, sem contar token
- Avaliação interna antes de fechar contrato com API paga
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template Qwen3-235B-A22B e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 15 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Quanta memória de vídeo?
Cerca de 480 GB. Na prática, um bloco de placas de 80 a 141 GB.
Mistura de especialistas ajuda no custo?
Sim: como poucos especialistas são ativados por token, a velocidade por requisição é melhor do que a de um modelo denso do mesmo tamanho.
Dá para rodar quantizado em menos placas?
Dá, ao custo de alguma qualidade. Use o console para ver quais blocos estão disponíveis no momento.