
O Claude Code é distribuído com modelos da Anthropic, mas uma única variável de ambiente, ANTHROPIC_BASE_URL, permite-lhe encaminhar pedidos para praticamente qualquer fornecedor de LLM. Isto significa que pode substituir o Claude Opus, que custa 25 USD, pelo DeepSeek, a cerca de 0,27 USD por milhão de tokens de saída, ou executar modelos localmente através do Ollama gratuitamente. Este guia aborda todos os métodos para utilizar diferentes modelos no Claude Code, baseando-se na nossa comparação detalhada do Claude Code com configurações práticas para cada abordagem.
Todos os Métodos num Relance
Escolha o método que se adequa à sua situação e salte para a respetiva secção para obter o código de configuração.
| Método | Ideal Para | Custo | Configuração | Modelos |
|---|---|---|---|---|
| OpenRouter | Variedade de modelos, uma chave API | Pagamento por token (repasse) | Fácil | 300+ |
| Ollama | Privacidade, gratuito, offline | Gratuito (o seu hardware) | Fácil | 50+ open-source |
| LM Studio | Modelos locais com interface gráfica | Gratuito (o seu hardware) | Fácil | 50+ open-source |
| claude-code-router | Encaminhamento inteligente por tarefa | Varia conforme o fornecedor | Média | Depende da config. |
| claude-code-proxy | Backend Gemini/OpenAI | Preços do fornecedor | Média | OpenAI + Gemini |
| LiteLLM | Empresas, balanceamento de carga | Preços do fornecedor | Avançada | 100+ entre fornecedores |
Continue a ler para ver a configuração passo a passo de cada método, ou salte para o quadro de decisão se já souber o que precisa.
Como Funciona Realmente a Troca de Modelos no Claude Code?
Antes de configurar qualquer proxy, precisa de compreender porque é que a maioria dos tutoriais o deixa com uma configuração quebrada. O Claude Code utiliza internamente três slots de modelo, e não apenas um:
- Slot Haiku, para tarefas de fundo como resumos de ficheiros e conclusão de separadores
- Slot Sonnet, para codificação padrão, o modelo com o qual interage mais frequentemente
- Slot Opus, para raciocínio complexo, planeamento e tarefas agentivas multi-etapa
Quando altera o modelo com /model ou --model, está apenas a alterar o slot principal. O Claude Code continua a tentar chamar os outros dois slots utilizando a API da Anthropic. Se apontou o ANTHROPIC_BASE_URL para um proxy mas definiu apenas um modelo, esses outros slots falharão com um erro de "modelo não encontrado".
A solução: defina as três variáveis de ambiente para que todos os slots sejam encaminhados através do seu proxy.
# Cut Claude Code's Bill 90%: Run OpenRouter, Ollama or LiteLLM
export ANTHROPIC_DEFAULT_HAIKU_MODEL="your-haiku-equivalent"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-sonnet-equivalent"
export ANTHROPIC_DEFAULT_OPUS_MODEL="your-opus-equivalent"Troca Nativa de Modelos (Modelos Anthropic)
Se permanecer dentro da família de modelos da Anthropic, a troca é simples. Utilize o comando /model dentro do Claude Code, passe --model ao iniciar a partir do terminal ou adicione modelos ao array availableModels no seu ficheiro de definições. A Anthropic continua a adicionar opções aqui, e a nossa compilação das novas funcionalidades do Claude Code para 2026 acompanha o que foi lançado recentemente.
A Estratégia opusplan
opusplan é o encaminhamento multi-modelo integrado do Claude Code. Envia tarefas de fundo para o Haiku e canaliza o raciocínio complexo para o Opus, automaticamente. Não o configura manualmente; basta selecioná-lo como o seu modelo. É a própria resposta da Anthropic ao problema "porque estou a pagar preços do Opus por uma listagem de ficheiros?". Vale a pena experimentar antes de recorrer a um router de terceiros, juntamente com o modo rápido da Anthropic, se a velocidade bruta for a sua prioridade.
OpenRouter, Uma Chave API, 300+ Modelos
O OpenRouter atua como um agregador de APIs. Obtém uma única chave API e acesso a mais de 300 modelos da Anthropic, Google, Meta, Mistral, DeepSeek e outros. Os preços são de repasse para a maioria dos modelos, sem margem de lucro adicional.
Passos de Configuração
- Crie uma conta em openrouter.ai e gere uma chave API
- Execute
claude /logoutpara limpar qualquer sessão existente da Anthropic - Defina as suas variáveis de ambiente:
export ANTHROPIC_BASE_URL="https://openrouter.ai/api"
export ANTHROPIC_API_KEY="sk-or-v1-your-key-here"
# Map all three model slots
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek/deepseek-chat-v3"
export ANTHROPIC_DEFAULT_SONNET_MODEL="anthropic/claude-sonnet-4"
export ANTHROPIC_DEFAULT_OPUS_MODEL="anthropic/claude-opus-4"- Inicie o
claudee verifique a conexão
Note as três variáveis de slot; se as ignorar, encontrará o erro "modelo não encontrado" que abordámos acima. O guia oficial de integração do OpenRouter confirma esta configuração.
Modelos Recomendados via OpenRouter
Nem todos os modelos no OpenRouter lidam de forma fiável com a chamada de ferramentas do Claude Code. Eis o que realmente funciona bem:
| Tarefa | Modelo | Porquê |
|---|---|---|
| Tarefas de fundo económicas | DeepSeek V3.2 | 0,27/1,10 USD por MTok, chamada de ferramentas decente |
| Codificação padrão | Claude Sonnet 4 | Mesma qualidade que direto, faturação consolidada |
| Bases de código enormes (contexto 1M) | Gemini 2.5 Flash | 0,15/0,60 USD por MTok, janela de contexto massiva |
| Raciocínio complexo | Claude Opus 4 | Melhor qualidade de codificação agentiva |
Custo e Faturação
O OpenRouter cobra preços de repasse na maioria dos modelos. Paga exatamente o que o fornecedor subjacente cobra, mais uma pequena margem em alguns modelos de terceiros. Defina limites de gastos no seu painel do OpenRouter para evitar surpresas.
Veredito: O OpenRouter é a melhor opção para programadores que desejam máxima variedade de modelos com configuração mínima. Uma chave API, um painel de faturação, 300+ modelos. Difícil de superar em flexibilidade.
Ollama, Gratuito, Local e Privado
O Ollama executa modelos inteiramente na sua máquina. Desde a v0.14.0 (janeiro de 2026), suporta nativamente a API de Mensagens da Anthropic, o que significa que o Claude Code pode comunicar com ele sem qualquer camada de tradução. O seu código nunca sai da sua máquina.
Pré-requisitos e Hardware
Precisará de hardware decente para uma experiência utilizável:
- Modelos 7B (edições rápidas, tarefas simples): mínimo de 16 GB de RAM
- Modelos 14B (qualidade de codificação sólida): 32 GB de RAM, GPU recomendada
- Modelos 32B+ (qualidade próxima da cloud): 64 GB de RAM ou GPU dedicada com 24 GB+ de VRAM
Para explorar mais profundamente os requisitos de hardware e seleção de modelos, consulte o nosso guia para executar LLMs localmente.
Passos de Configuração
- Instale o Ollama a partir de ollama.com
- Obtenha um modelo focado em codificação
- Inicie com compatibilidade para Claude Code
- Defina as suas variáveis de ambiente
# Install and pull a coding model
ollama pull qwen2.5-coder:14b
# Launch with Claude Code compatibility
ollama launch claude
# Set env vars
export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="qwen2.5-coder:14b"
export ANTHROPIC_DEFAULT_SONNET_MODEL="qwen2.5-coder:14b"
export ANTHROPIC_DEFAULT_OPUS_MODEL="qwen2.5-coder:14b"A documentação de integração do Ollama recomenda modelos com janelas de contexto de 64k+ tokens para a melhor experiência com o Claude Code.
Melhores Modelos Locais para Codificação
| Modelo | Tamanho | Pontos Fortes | Notas |
|---|---|---|---|
| Qwen 2.5 Coder 14B | 14B | Melhor codificação local global | Chamada de ferramentas forte, bom manuseamento de contexto |
| devstral | 24B | Especialista em codificação da Mistral | Ótimo para refatorização e revisão de código |
| GLM 4.7 | 9B | Raciocínio geral | Bom equilíbrio entre velocidade e qualidade |
Seja honesto consigo mesmo quanto a uma coisa: os modelos locais produzem código de qualidade visivelmente inferior ao do Claude Sonnet para tarefas agentivas complexas e multi-etapa. A chamada de ferramentas é menos fiável e verá mais caminhos de ficheiros alucinados. São fantásticos para edições rápidas, geração simples e trabalho sensível à privacidade, mas não espere qualidade nativa do Claude numa refatorização de 50 ficheiros.
Veredito: O Ollama é a melhor escolha para trabalho sensível à privacidade e programadores que desejam utilização gratuita e ilimitada. Se tiver o hardware, é difícil argumentar contra "zero dólares para sempre".
Ollama Cloud vs OpenRouter: Preços e Quando Cada Um Vence
O Ollama e o OpenRouter resolvem o problema dos custos de extremos opostos. O Ollama executa modelos em hardware que controla, com custo zero por token, enquanto o OpenRouter cobra preços de repasse em mais de 300 modelos alojados, sem hardware para gerir. Este guia configura o Ollama localmente, e a mesma matemática de custo fixo versus por token aplica-se se executar a sua camada alojada em vez disso.
| Fator | Ollama | OpenRouter |
|---|---|---|
| Modelo de custo | Gratuito localmente, paga pelo hardware | Por token de repasse, sem margem na maioria dos modelos |
| Preço de exemplo | 0 USD por token | DeepSeek V3.2 a 0,27/1,10 USD, Gemini 2.5 Flash a 0,15/0,60 USD por MTok |
| Hardware | 16 GB RAM (7B) até 24 GB+ VRAM (32B+) | Nenhum, totalmente alojado |
| Acesso a modelos | 50+ modelos open-source | 300+ entre fornecedores |
| Privacidade | O código nunca sai da sua máquina | Os pedidos passam pelo OpenRouter |
Escolha o Ollama quando a privacidade, o uso offline ou edições rotineiras de alto volume forem importantes e já possuir o hardware. Escolha o OpenRouter quando desejar variedade de modelos, sem hardware inicial, e faturação apenas pelo que utiliza.
LM Studio, Modelos Locais Com Interface Gráfica
O LM Studio oferece a mesma execução de modelos locais que o Ollama, mas com uma interface visual. Navega pelos modelos numa GUI, escolhe níveis de quantização com um clique e testa o chat antes de apontar o Claude Code para ele. Os mesmos requisitos de hardware que o Ollama. Se estiver a comparar executadores, o nosso guia sobre as melhores ferramentas para executar LLMs localmente aborda as compensações.
Configuração
- Descarregue o LM Studio e instale-o
- Procure e descarregue um modelo de codificação (Qwen 2.5 Coder, devstral, etc.)
- Inicie o servidor local a partir da interface do LM Studio
- Aponte o Claude Code para ele:
# Point Claude Code to LM Studio's local server
export ANTHROPIC_BASE_URL="http://localhost:1234/v1"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-loaded-model-name"O blog do LM Studio tem um passo a passo com capturas de ecrã se preferir guias de configuração visuais.
Veredito: O LM Studio é ideal para programadores que preferem uma GUI em vez da CLI para gerir modelos locais. Se já se sente confortável com ollama pull e ficheiros de configuração, fique com o Ollama. Se quiser navegar visualmente pelos modelos e ajustar definições com controlos deslizantes, o LM Studio é a sua escolha.
claude-code-router, Encaminhamento Inteligente de Modelos
O claude-code-router é um pacote npm que executa um proxy local entre o Claude Code e os seus fornecedores configurados. O que o torna interessante é o encaminhamento consciente do contexto: pode enviar tarefas de fundo económicas para o DeepSeek, codificação padrão para o Sonnet e raciocínio complexo para o Opus, tudo automaticamente.
O projeto tem mais de 30 mil estrelas no GitHub e suporta OpenRouter, DeepSeek, Gemini, Ollama, Groq, Volcengine e SiliconFlow como fornecedores.
Instalação e Configuração
npm install -g claude-code-router
claude-code-router init
claude-code-router startO comando init cria um config.json onde define os seus fornecedores e mapeamentos de modelos:
{
"providers": {
"openrouter": {
"apiKey": "sk-or-v1-...",
"models": {
"haiku": "deepseek/deepseek-chat-v3",
"sonnet": "anthropic/claude-sonnet-4",
"opus": "anthropic/claude-opus-4"
}
}
}
}Configuração de Encaminhamento Consciente do Contexto
É aqui que o claude-code-router brilha. Pode encaminhar diferentes tipos de tarefas para diferentes modelos com base na complexidade. O resumo de fundo vai para um modelo barato, enquanto o planeamento e o trabalho de arquitetura vão para o seu melhor modelo. O router lida com todo o mapeamento de slots de forma transparente.
Também pode misturar fornecedores: use o Ollama para repositórios sensíveis à privacidade e o OpenRouter para todo o resto, alternando com o comando /model dentro do Claude Code.
Veredito: O claude-code-router é ideal para utilizadores avançados que desejam controlo granular sobre qual modelo lida com cada tipo de tarefa. É a opção mais configurável, mas essa flexibilidade vem com mais configuração do que uma simples troca de ANTHROPIC_BASE_URL.
claude-code-proxy e LiteLLM, Configurações Avançadas
Estes dois métodos servem necessidades diferentes, mas partilham uma característica: ambos são servidores proxy que traduzem entre formatos de API.
claude-code-proxy (Backend Gemini e OpenAI)
O claude-code-proxy é uma ferramenta Python (3,3 mil estrelas no GitHub) que aceita pedidos no formato Anthropic do Claude Code e traduz-os para o formato OpenAI ou Gemini através do LiteLLM nos bastidores. É a maneira mais simples de utilizar especificamente os modelos Gemini ou GPT com o Claude Code.
pip install claude-code-proxy
claude-code-proxy --port 8080
# Then point Claude Code at it
export ANTHROPIC_BASE_URL="http://localhost:8080"
export ANTHROPIC_API_KEY="your-gemini-or-openai-key"Se desejar especificamente a janela de contexto de 1 milhão de tokens do Gemini para grandes monorepos, este é o caminho mais direto.
LiteLLM (Proxy Universal Empresarial)
O LiteLLM é um proxy de nível empresarial que suporta mais de 100 fornecedores com balanceamento de carga, cadeias de fallback, limitação de taxa e registo de auditoria. É exagerado para um programador individual, mas essencial para equipas que necessitam de governança em torno do uso de modelos de IA.
A configuração utiliza um ficheiro YAML:
model_list:
- model_name: claude-sonnet-4-20250514
litellm_params:
model: gemini/gemini-2.5-flash
api_key: os.environ/GEMINI_API_KEY
- model_name: claude-haiku-3-5-20241022
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY# Start LiteLLM proxy
litellm --config config.yaml --port 4000
# Point Claude Code to LiteLLM
export ANTHROPIC_BASE_URL="http://localhost:4000"
export ANTHROPIC_API_KEY="sk-litellm"Uma nota importante da documentação oficial do Claude Code: "A Anthropic não endossa, mantém nem audita o LiteLLM." Utilize-o, mas saiba que é uma ferramenta da comunidade, não um produto da Anthropic. O tutorial do LiteLLM tem mais exemplos de configuração avançada.
Veredito: Use o claude-code-proxy se quiser especificamente modelos Gemini ou OpenAI. Use o LiteLLM se a sua equipa precisar de balanceamento de carga, fallback e registo de auditoria entre fornecedores.
Claude Code Router vs LiteLLM: Qual Deve Utilizar?
O Claude Code Router é a escolha mais simples para programadores individuais que desejam encaminhamento de modelos por tarefa, enquanto o LiteLLM foi construído para equipas que necessitam de balanceamento de carga, cadeias de fallback e registo de auditoria. O Router instala via npm e lê um config.json; o LiteLLM executa um proxy configurado por YAML empresarial em mais de 100 fornecedores.
| Fator | Claude Code Router | LiteLLM |
|---|---|---|
| Dificuldade de configuração | Média: npm install, editar config.json | Avançada: ficheiro de configuração YAML |
| Ideal para | Programadores individuais que querem encaminhamento por tarefa | Equipas que necessitam de governança |
| Formato de configuração | config.json | YAML model_list |
| Funcionalidade de destaque | Encaminhamento por tarefa consciente do contexto | Balanceamento de carga, fallback, registo de auditoria |
| Fornecedores | OpenRouter, DeepSeek, Gemini, Ollama, Groq, e mais | 100+ entre fornecedores |
| Maturidade | 30k+ estrelas no GitHub, construído para Claude Code | Proxy empresarial, ferramenta da comunidade (não endossada pela Anthropic) |
Escolha o claude-code-router se for um programador individual que deseja tarefas de fundo baratas no DeepSeek e raciocínio complexo no Opus sem muita configuração. Escolha o LiteLLM se a sua equipa precisar de balanceamento de carga, limitação de taxa e registos de auditoria entre fornecedores.
A pesar também outros proxies? A nossa compilação das melhores ferramentas de gateway LLM compara-os lado a lado.
Quanto Custa Realmente Cada Método?
Vamos colocar números reais nisto. Eis o que pagará por 1 milhão de tokens nas combinações de modelo/método mais comuns:
| Modelo / Método | Entrada (por 1M tokens) | Saída (por 1M tokens) | Estimativa Mensal (uso moderado) |
|---|---|---|---|
| Claude Opus 4.6 (direto) | 5,00 USD | 25,00 USD | ~50-150 USD |
| Claude Sonnet 4.6 (direto) | 3,00 USD | 15,00 USD | ~30-60 USD |
| Claude Sonnet via OpenRouter | 3,00 USD | 15,00 USD | Igual (repasse) |
| DeepSeek V3.2 (OpenRouter) | 0,27 USD | 1,10 USD | ~3-8 USD |
| Gemini 2.5 Flash (OpenRouter) | 0,15 USD | 0,60 USD | ~2-5 USD |
| Ollama (local) | Gratuito | Gratuito | 0 USD (custos de hardware) |
Dados de preços da página oficial de preços da Anthropic e do OpenRouter. Uso moderado assume ~5-10M tokens/mês para sessões diárias de codificação.
"Cost per 1M Output Tokens by Model"
Tabela de dados
| "Model" | "Output Cost" |
|---|---|
| "Opus 4.6" | 25 |
| "Sonnet 4.6" | 15 |
| "DeepSeek V3.2" | 1.1 |
| "Gemini 2.5 Flash" | 0.6 |
| "Ollama (local)" | 0 |
A diferença de custo é significativa, mas modelos mais baratos produzem código de menor qualidade, especialmente para tarefas agentivas complexas onde a fiabilidade da chamada de ferramentas importa. O DeepSeek a 1,10 USD/MTok de saída é ótimo para edições de rotina. Para uma refatorização multi-ficheiro onde o Claude Code precisa de ler, planear, editar e verificar em 20 ficheiros? Ainda quererá o Sonnet ou o Opus.
Veredito: Para poupança de custos com qualidade aceitável, OpenRouter + DeepSeek oferece a melhor proporção. Para custo zero, o Ollama é imbatível se tiver o hardware. Para qualidade máxima, a Anthropic direta continua a ser rei.
Qual Método Deve Utilizar?, Quadro de Decisão
Eis a secção que todos os outros tutoriais ignoram. Em vez de lhe dizer "use apenas o OpenRouter", vamos corresponder os métodos às necessidades reais:
| Se Precisar de... | Utilize Este Método | Porquê |
|---|---|---|
| Máxima variedade de modelos, uma chave API | OpenRouter | 300+ modelos, configuração fácil, pagamento por uso |
| Gratuito, ilimitado, código permanece local | Ollama | Custo zero, privacidade total, capaz offline |
| Modelos locais com interface visual | LM Studio | Navegador de modelos GUI, seleção fácil de quantização |
| Encaminhamento inteligente por tarefa | claude-code-router | Encaminhe raciocínio para Opus, edições rápidas para DeepSeek |
| Especificamente modelos Gemini ou OpenAI | claude-code-proxy | Traduz formato Anthropic para OpenAI/Gemini |
| Empresarial: balanceamento, auditoria | LiteLLM | Limitação de taxa, cadeias de fallback, controlos de equipa |
Deve Mesmo Alterar?
Opinião honesta: para a maioria dos programadores que fazem codificação agentiva complexa, refatorizações multi-ficheiro, planeamento de arquitetura, depuração de problemas complicados de concorrência, o Claude Sonnet via Anthropic direta continua a ser a melhor opção. O Claude nativo tem a chamada de ferramentas mais fiável, a melhor compreensão do seu próprio fluxo de trabalho agentivo e zero latência de proxy.
A troca de modelos é uma otimização para cenários específicos:
- Está a gastar muitos tokens em tarefas de fundo que não precisam da qualidade do Sonnet, ou continua a atingir os limites de uso 2x do Claude
- Precisa da janela de contexto de 1M do Gemini para um monorepo massivo
- O seu código não pode sair da sua máquina (governo, saúde, finanças)
- Tem um orçamento apertado e qualidade aceitável vence qualidade perfeita
Se nenhum destes se aplicar, o opusplan (encaminhamento integrado da Anthropic) pode ser tudo o que precisa.
A fiabilidade da chamada de ferramentas é a métrica de qualidade que mais importa aqui. A hierarquia é: Claude nativo >> OpenRouter Claude >> DeepSeek/Gemini >> modelos locais. Quanto mais descer, mais verá chamadas de ferramentas falhadas, caminhos de ficheiros alucinados e edições incompletas.
Resolução de Problemas Comuns
Erro "Modelo não encontrado"
Este é o problema mais comum. Ocorre quando define o ANTHROPIC_BASE_URL mas se esquece de mapear todos os três slots de modelo. O Claude Code tenta chamar o Haiku ou o Opus através do seu proxy, o proxy não reconhece o nome do modelo padrão da Anthropic e obtém o erro.
# Fix: set ALL three model slot variables
export ANTHROPIC_DEFAULT_HAIKU_MODEL="your-model"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-model"
export ANTHROPIC_DEFAULT_OPUS_MODEL="your-model"Conexão recusada / timeout
O seu proxy não está em execução, ou o Claude Code está a atingir a porta errada. Verifique se o processo do proxy está ativo e confirme a porta no ANTHROPIC_BASE_URL. Firewalls e VPNs também podem bloquear conexões localhost.
Falhas na chamada de ferramentas
O modelo não suporta adequadamente o formato de uso de ferramentas da Anthropic. Sintomas: o Claude Code fica pendurado, produz chamadas de ferramentas vazias ou edita os ficheiros errados. Mude para um modelo com suporte verificado para chamada de ferramentas; o Qwen 2.5 Coder e o devstral lidam melhor com isto entre os modelos locais.
Problemas de streaming
Alguns proxies não lidam corretamente com eventos enviados pelo servidor. As respostas aparecem todas de uma vez em vez de em streaming, ou truncam a meio da resposta. Certifique-se de que a versão do seu proxy está atualizada e verifique as issues do GitHub para bugs de streaming conhecidos.
Janela de contexto excedida
Os modelos locais muitas vezes têm por padrão janelas de contexto de 4K-8K. O Claude Code precisa de muito mais do que isso para sessões reais de codificação. Utilize modelos com contexto de 32K+, ou encaminhe tarefas de contexto longo para o Gemini (janela de 1M) através do OpenRouter.
Deve fazer logout primeiro para o OpenRouter
Se estiver a mudar da Anthropic direta para o OpenRouter, execute claude /logout primeiro. O Claude Code coloca a autenticação em cache e continuará a tentar usar a sua chave da Anthropic mesmo após alterar o URL base.
# Clear cached authentication before switching providers
claude /logoutFAQ
Pode usar o Claude Code com GPT-4 ou Gemini?
Sim. O claude-code-proxy traduz pedidos no formato Anthropic para o formato OpenAI ou Gemini. Também pode aceder a ambos através do OpenRouter com uma única chave API. A chamada de ferramentas pode ser menos fiável do que no Claude nativo, especialmente para tarefas complexas multi-etapa.
Como uso o Claude Code sem uma chave API da Anthropic?
Utilize o Ollama para utilização local totalmente gratuita, sem necessidade de chave API de qualquer fornecedor. Alternativamente, use o OpenRouter com o seu formato de chave API. Ainda define a variável de ambiente ANTHROPIC_API_KEY, mas esta aponta para a chave do seu proxy (ex.: sk-or-v1-... para OpenRouter, "ollama" para Ollama).
Como configuro o Claude Code com o Ollama?
Instale o Ollama, obtenha um modelo como qwen2.5-coder:14b, execute ollama launch claude e defina três variáveis de ambiente: ANTHROPIC_BASE_URL, ANTHROPIC_API_KEY e as três vars de slot de modelo. Consulte a secção Ollama acima para o código completo.
Quais modelos funcionam melhor com o Claude Code?
Para cloud: o Claude Sonnet 4 oferece a melhor qualidade de codificação, enquanto o DeepSeek V3.2 oferece o melhor valor. Para local: o Qwen 2.5 Coder 14B é atualmente o padrão ouro. O fator decisivo é a fiabilidade da chamada de ferramentas; o Claude Code depende muito dela para operações de ficheiros, e os modelos nativos da Claude lidam melhor com isto.
Como resolvo o erro "modelo não encontrado" no Claude Code?
Defina as três variáveis de ambiente de slot de modelo: ANTHROPIC_DEFAULT_HAIKU_MODEL, ANTHROPIC_DEFAULT_SONNET_MODEL e ANTHROPIC_DEFAULT_OPUS_MODEL. Este erro ocorre porque o Claude Code usa três slots de modelo internos, e um slot não mapeado tenta chamar um nome de modelo que o seu proxy não reconhece.
O Claude Code pode funcionar offline com modelos locais?
Sim. Tanto o Ollama como o LM Studio executam modelos inteiramente na sua máquina sem necessidade de conexão à Internet. O seu código nunca sai do seu hardware. Precisará de especificações adequadas -- mínimo de 16 GB de RAM para modelos 7B, 32 GB+ para anything maior.
Posso usar o LM Studio com o Claude Code?
Sim. O LM Studio executa um servidor local ao qual o Claude Code se conecta definindo ANTHROPIC_BASE_URL para http://localhost:1234/v1 e ANTHROPIC_API_KEY para lm-studio. Descarregue um modelo de codificação como o Qwen 2.5 Coder, inicie o servidor a partir da GUI do LM Studio e depois mapeie o seu slot de modelo. É a alternativa visual à CLI do Ollama.
O que é o ANTHROPIC_BASE_URL e como o uso?
É a variável de ambiente que diz ao Claude Code para onde enviar os pedidos de API. Por padrão, aponta para https://api.anthropic.com. Altere-o para qualquer endpoint compatível com Anthropic, OpenRouter (https://openrouter.ai/api), Ollama (http://localhost:11434), LiteLLM (http://localhost:4000), etc.
O claude-code-router é melhor que o LiteLLM?
Ferramentas diferentes para problemas diferentes. O claude-code-router é mais simples (npm install, editar config.json, feito) e desenhado especificamente para o Claude Code. O LiteLLM é de nível empresarial com balanceamento de carga, limitação de taxa, cadeias de fallback e registo de auditoria. Programador individual? Use o claude-code-router. Equipa com necessidades de governança? Use o LiteLLM.
Quanto posso poupar usando modelos não-Anthropic?
Mudar do Claude Opus 4.6 para o DeepSeek V3.2 reduz os custos de tokens de saída em cerca de 95% (25 USD vs 1,10 USD por milhão de tokens). O Ollama reduz isso para zero se tiver o hardware. Mas as compensações de qualidade são reais: espere menor precisão em tarefas agentivas complexas multi-etapa, chamada de ferramentas menos fiável e mais caminhos de ficheiros alucinados.
A chamada de ferramentas funciona com todos os métodos de proxy?
Não de forma fiável em toda a linha. O Claude nativo tem o melhor suporte para chamada de ferramentas. O OpenRouter com modelos Claude funciona quase tão bem. O DeepSeek e Gemini têm suporte parcial; chamadas de ferramentas simples funcionam, mas cadeias complexas podem falhar. Os modelos locais via Ollama têm a chamada de ferramentas menos fiável. Esta é a principal preocupação de qualidade ao mudar da Anthropic.
Fontes
- Configuração de Modelo, Docs Claude Code
- Configuração de Gateway LLM, Docs Claude Code
- Integração Claude Code, Docs OpenRouter
- Integração Claude Code, Docs Ollama
- Preços da API Claude, Anthropic
- claude-code-router, GitHub
- claude-code-proxy, GitHub
- Usar Claude Code com Modelos Não-Anthropic, Docs LiteLLM