DeepSeek-R1 Distill: raciocínio sem máquina gigante
Raciocínio forte do DeepSeek-R1 que cabe em 1 GPU
- Memória de vídeo
- 20 GB
- Instalação
- ~6 min
- Acesso
- porta 8000
- Cobrança
- por hora, em reais
As versões destiladas do R1 trazem a cadeia de raciocínio para um tamanho que cabe em placa comum. É o melhor ponto de partida para quem quer testar raciocínio passo a passo sem alugar um bloco de oito GPUs.
Versão destilada do DeepSeek-R1 (default: Llama-8B) — herda o raciocínio passo-a-passo do R1 num modelo pequeno que roda numa RTX 4090. Servido via vLLM com API OpenAI-compatível. Troque por distill 14B/32B (mais VRAM) editando o modelo.
Para que serve
- Resolver problema de matemática e lógica com passo a passo
- Revisar código apontando o porquê de cada correção
- Rodar avaliações internas sem custo por token
- Base para afinar o modelo no seu domínio
Como subir
- Crie sua conta e adicione saldo em reais (Pix ou cartão, sem mensalidade).
- No console, escolha o template DeepSeek-R1-Distill e a máquina — o próprio console esconde as que não atendem ao requisito.
- Em cerca de 6 minutos a instalação termina e o endereço de acesso aparece no painel, na porta 8000.
Terminou? Basta destruir a máquina: a cobrança para junto. Nada de contrato ou franquia mínima.
Perguntas frequentes
Qual placa usar?
A partir de 20 GB de memória de vídeo. Uma placa de 24 GB atende com folga.
A diferença para o R1 completo é grande?
O completo raciocina melhor em problema difícil, mas exige centenas de GB. O destilado entrega boa parte do resultado a uma fração do custo.
Ele mostra o raciocínio?
Sim, o texto de raciocínio vem separado da resposta final e você decide se exibe.