Qwen3 com API própria
Qwen3-8B multilíngue (ótimo PT-BR) em 1 GPU
- Memória de vídeo
- 20 GB
- Instalação
- ~6 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
O Qwen3 é hoje uma das melhores famílias abertas em português e tem licença permissiva. Com o vLLM na frente, ele atende sua aplicação com a mesma API que você já usa.
Qwen3-8B da Alibaba — modelo multilíngue forte (excelente PT-BR) que roda numa RTX 4090. Servido via vLLM com API OpenAI-compatível. Para mais capacidade, troque por Qwen3-14B/32B (mais VRAM) ou veja o template Qwen3-235B.
Para que serve
- Atendimento e resumo em português sem mandar dado para fora
- Classificação e extração em lote, com custo fixo por hora
- Base para afinar no vocabulário da sua empresa
- Licença permissiva, sem trava para uso comercial
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template Qwen3 e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Qual tamanho escolher?
As versões de 8 a 14 bilhões cabem em 24 GB e já dão bom resultado em português. Acima disso, olhe placas de 80 GB.
Vai bem em português?
Sim, é um dos modelos abertos que menos escorrega em concordância e vocabulário do Brasil.
Posso usar comercialmente?
Sim, a licença é permissiva. Confira sempre a versão exata que você baixar.