Assistente de código deixou de ser novidade e virou ferramenta de trabalho. O que ainda incomoda são duas coisas: a assinatura por cabeça, que cresce com o time, e o fato de que o seu código-fonte sai da empresa a cada tecla digitada.

Dá para resolver os dois. Este guia monta um copiloto para a equipe inteira em duas configurações — uma que você liga em 15 minutos e cobra por uso, outra que roda numa GPU sua com controle total — e mostra a conta de qual compensa no seu tamanho de time.

⚡ Resumo

O editor é o mesmo (VS Code, JetBrains, Neovim); o que muda é para onde ele aponta. Chat e refatoração funcionam bem por token, a centavos por desenvolvedor por dia. Autocompletar linha a linha pede modelo próprio numa GPU dedicada, por causa da latência.

Antes de tudo: são dois produtos, não um

Quase todo mundo trata "copiloto" como uma coisa só, e é aí que a montagem dá errado. São dois modos de uso com exigências opostas:

Autocompletar (inline)Chat / agente
GatilhoCada pausa na digitaçãoQuando o dev pede
Latência aceitávelAbaixo de 300 msAlguns segundos
VolumeCentenas de chamadas/horaDezenas por dia
Tipo de modeloPequeno, treinado em fill-in-the-middleModelo geral, quanto melhor melhor
Melhor arranjoGPU dedicada, na sua redeAPI por token

A recomendação honesta: comece pelo chat. Ele entrega a maior parte do valor (explicar código, escrever teste, refatorar, revisar diff), é o que menos custa e liga em minutos. Autocompletar é ótimo, mas é o modo caro e chato de operar — deixe para a segunda fase.

Configuração 1: chat e agente por token (15 minutos)

Vamos usar o Continue, que é aberto, roda em VS Code e JetBrains, e aceita qualquer endpoint compatível com a API da OpenAI — que é o caso da API da GPUBrasil.

Passo 1: a chave

No painel, em Chaves de API, gere uma chave. O ideal é uma chave por desenvolvedor: assim você vê o consumo individual no painel e revoga a de quem sai da empresa sem mexer no resto do time.

Passo 2: instalar e apontar

Instale a extensão Continue e edite ~/.continue/config.json:

{
  "models": [
    {
      "title": "Padrão (código e chat)",
      "provider": "openai",
      "model": "gpub-plus",
      "apiBase": "https://gpubrasil.com.br/v1",
      "apiKey": "gpub_live_suachaveaqui"
    },
    {
      "title": "Econômico (perguntas rápidas)",
      "provider": "openai",
      "model": "gpub-fast",
      "apiBase": "https://gpubrasil.com.br/v1",
      "apiKey": "gpub_live_suachaveaqui"
    },
    {
      "title": "Máximo (base inteira, refatoração grande)",
      "provider": "openai",
      "model": "gpub-max",
      "apiBase": "https://gpubrasil.com.br/v1",
      "apiKey": "gpub_live_suachaveaqui"
    }
  ],
  "allowAnonymousTelemetry": false
}

Pronto. Ctrl+L abre o chat com o arquivo aberto no contexto; Ctrl+I edita a seleção com instrução em linguagem natural.

💡 Por que três modelos e não um

"Explica esta função" e "refatora este módulo de 2 mil linhas" não são o mesmo problema. Deixe os três configurados e o dev escolhe no seletor: o gpub-fast custa R$ 0,49 por milhão de tokens de entrada, o gpub-max custa R$ 17,90. Usar o caro para tudo multiplica a conta por 36 sem melhorar as perguntas simples.

Passo 3: mesma coisa nos outros editores

pip install aider-chat

export OPENAI_API_BASE="https://gpubrasil.com.br/v1"
export OPENAI_API_KEY="gpub_live_suachaveaqui"

aider --model openai/gpub-plus src/servico.py
# "adicione tratamento de erro e um teste para o caso de timeout"

Quanto isso custa por desenvolvedor

Uso realista de chat: 40 interações por dia, cerca de 6 mil tokens de entrada (o arquivo mais o contexto) e 700 de saída por interação.

ModeloPor diaPor mês (22 dias)Time de 10
gpub-fastR$ 0,15R$ 3,26R$ 33
gpub-plusR$ 0,28R$ 6,10R$ 61
gpub-baseR$ 2,40R$ 52,74R$ 527
gpub-maxR$ 6,67R$ 146,80R$ 1.468

Para comparação, uma assinatura corporativa dos assistentes de mercado fica em torno de US$ 19 por desenvolvedor por mês — perto de R$ 115 com o dólar em R$ 6. Com o gpub-plus, o mesmo time de 10 gasta R$ 61 no total, e você paga só quem realmente usou.

A economia não é o argumento mais forte, no entanto. O mais forte é o próximo.

Configuração 2: modelo próprio numa GPU dedicada

Duas razões levam à segunda configuração, e nenhuma é preço:

Passo 1: subir o servidor de modelo

O template vLLM sobe em 1 clique e serve uma interface compatível com a da OpenAI. Para autocompletar, escolha um modelo de código pequeno com suporte a fill-in-the-middle — é o que permite completar no meio do arquivo, olhando o que vem antes e depois do cursor.

UsoTamanhoGPU sugeridaPreço/hMês 24×7
Autocompletar (time pequeno)1B–3BRTX A4000 16 GBR$ 1,07R$ 781
Autocompletar (time médio)7BRTX 4090 24 GBR$ 2,38R$ 1.737
Autocompletar + chat14B–32BRTX 5090 32 GBR$ 4,77R$ 3.482
Chat de alta qualidade70B+RTX PRO 6000 96 GBR$ 10,73R$ 7.833
⚠️ Faça esta conta antes de decidir

Uma GPU dedicada 24×7 para autocompletar custa a partir de R$ 781/mês. Isso só se paga contra assinaturas de mercado com 7 desenvolvedores ou mais. Abaixo disso, você está pagando por controle e latência — o que pode ser perfeitamente racional, mas não é economia. Não venda internamente como corte de custo se não for.

E desligue fora do horário: 10 h por dia útil derruba os R$ 781 para cerca de R$ 235.

Passo 2: apontar o Continue para as duas fontes

A configuração madura usa autocompletar local e chat por token. Você paga GPU só pelo que exige latência, e usa modelo grande no que exige qualidade:

{
  "models": [
    {
      "title": "Chat (por token)",
      "provider": "openai",
      "model": "gpub-plus",
      "apiBase": "https://gpubrasil.com.br/v1",
      "apiKey": "gpub_live_suachaveaqui"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Autocompletar (GPU dedicada)",
    "provider": "openai",
    "model": "modelo-de-codigo-servido",
    "apiBase": "http://SEU_IP:8000/v1",
    "apiKey": "chave-interna"
  },
  "tabAutocompleteOptions": {
    "debounceDelay": 250,
    "maxPromptTokens": 1024,
    "multilineCompletions": "auto"
  }
}

O debounceDelay é o parâmetro que decide o custo e o incômodo: baixo demais dispara uma chamada por tecla; alto demais e a sugestão chega quando o dev já digitou a linha. 250 ms é um bom ponto de partida.

Passo 3: não exponha o servidor na internet

Um endpoint de LLM aberto vira consumo de terceiros na sua conta em questão de horas. Duas formas de fechar:

ssh -N -L 8000:localhost:8000 gpu-copiloto
# agora, no config: "apiBase": "http://localhost:8000/v1"
🎯 O arranjo que costuma ser o certo

Um proxy no meio, chave por desenvolvedor, autocompletar indo para a GPU local e chat indo para a API por token. Você troca modelo, ajusta limite e vê consumo por pessoa sem tocar na máquina de ninguém — e o dev não precisa saber que existe roteamento.

Regras de uso que valem escrever

A parte que quase ninguém documenta e que separa adoção de bagunça:

Medindo se está valendo

Depois de um mês, olhe três números — e não confie na percepção, que é sempre otimista:

Copiloto para o time, cobrado em reais

API por token compatível com a da OpenAI a partir de R$ 0,49 por milhão, e GPUs dedicadas quando o time crescer. Sem assinatura por cabeça — você paga o uso.

Criar conta →

Problemas comuns

SintomaCausa
Chat funciona, autocompletar não sugere nadaModelo sem suporte a fill-in-the-middle — troque por um modelo de código
Sugestão chega tarde demaisdebounceDelay alto, ou modelo grande demais para autocompletar
Conta muito acima do previstoAutocompletar apontado para modelo caro por token
Respostas ignoram o projetoFalta indexar a base — ative o contexto de repositório no Continue
Erro 401Chave revogada, ou apiBase sem o /v1 no fim
Consumo de alguém que já saiu da empresaChave compartilhada — é exatamente o que uma chave por pessoa evita

Conclusão

Copiloto de código não precisa ser assinatura por cabeça nem projeto de infraestrutura. Comece pelo chat por token — 15 minutos de configuração, alguns reais por desenvolvedor por mês — e só monte a GPU dedicada quando aparecer uma razão concreta: autocompletar com latência baixa, ou uma exigência de governança que peça controle sobre modelo, pesos e logs.

Os dois arranjos convivem no mesmo editor. Essa é a vantagem de tudo falar o mesmo protocolo: a decisão deixa de ser arquitetural e vira uma linha de configuração que você muda quando a conta mandar.

Continue: GPU como máquina de desenvolvimento · LiteLLM Proxy · servir modelo com vLLM