InícioTemplates › Qwen3
🧠 LLM Self-hosted

Qwen3 com API própria

Qwen3-8B multilíngue (ótimo PT-BR) em 1 GPU

A partir de
carregando…
máquina mais barata que atende este template
Subir em 1 clique →
Memória de vídeo
20 GB
Instalação
~6 min
Acesso
porta 8000
Cobrança
por hora, em reais

O Qwen3 é hoje uma das melhores famílias abertas em português e tem licença permissiva. Com o vLLM na frente, ele atende sua aplicação com a mesma API que você já usa.

Qwen3-8B da Alibaba — modelo multilíngue forte (excelente PT-BR) que roda numa RTX 4090. Servido via vLLM com API OpenAI-compatível. Para mais capacidade, troque por Qwen3-14B/32B (mais VRAM) ou veja o template Qwen3-235B.

Para que serve

Como subir

  1. Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
  2. No console, escolha o template Qwen3 e a máquina — o próprio console esconde as que não atendem ao requisito.
  3. Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.

Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.

Perguntas frequentes

Qual tamanho escolher?

As versões de 8 a 14 bilhões cabem em 24 GB e já dão bom resultado em português. Acima disso, olhe placas de 80 GB.

Vai bem em português?

Sim, é um dos modelos abertos que menos escorrega em concordância e vocabulário do Brasil.

Posso usar comercialmente?

Sim, a licença é permissiva. Confira sempre a versão exata que você baixar.

Qwen3 rodando hoje
Você paga só as horas em que a máquina fica ligada.
Subir em 1 clique →

Templates relacionados

vLLM
API OpenAI-compatível pronta para Llama, Qwen, Mistral e mais
TGI (HuggingFace)
Text Generation Inference do HuggingFace — alternativa ao vLLM
LiteLLM Proxy
1 endpoint OpenAI roteando 100+ provedores (cloud + local)
Ollama
Rode DeepSeek, Qwen3, Llama e Mistral com 1 comando