TGI: inferência com quantização pronta
Text Generation Inference do HuggingFace — alternativa ao vLLM
- Memória de vídeo
- 12 GB
- Instalação
- ~6 min
- Acesso
- porta 8080
- Cobrança
- por hora, em reais
O TGI é o servidor de inferência da Hugging Face, com streaming de tokens e quantização de fábrica. É a escolha natural de quem já vive dentro do ecossistema deles e quer o mesmo comportamento em produção.
TGI é o servidor de produção do HuggingFace para LLMs. Excelente suporte a modelos quantizados (GPTQ, AWQ, EETQ), streaming nativo, métricas Prometheus. Roda Qwen2.5-3B por padrão.
Para que serve
- Servir modelo quantizado em placa menor, cortando custo
- Streaming de resposta para chat com sensação de tempo real
- Integração direta com modelos do Hub
- Métricas prontas para acompanhar carga e latência
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template TGI (HuggingFace) e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8080.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
TGI ou vLLM?
O vLLM costuma render mais em lote e tem API compatível com o padrão OpenAI; o TGI se integra melhor ao ecossistema Hugging Face e traz quantização pronta.
Preciso de token do Hub?
Só para modelos com acesso restrito. Modelos abertos baixam direto.
Qual GPU escolher?
12 GB rodam modelos quantizados de porte médio. Para modelos maiores sem quantização, vá para 40 GB ou mais.