guides

Claude Code-Rechnung um 90 % senken: OpenRouter, Ollama oder LiteLLM nutzen

Geschrieben von Mert Batur
Aktualisiert Jul 5, 2026
14 Lesezeit
Claude Code-Rechnung um 90 % senken: OpenRouter, Ollama oder LiteLLM nutzen

Claude Code wird mit Anthropic-Modellen ausgeliefert, aber eine einzige Umgebungsvariable -- ANTHROPIC_BASE_URL -- ermöglicht es, Anfragen an praktisch jeden LLM-Anbieter weiterzuleiten. Das bedeutet, Sie können auf DeepSeek umsteigen, das ungefähr 0,27 $ pro Million Output-Token kostet, anstatt Claude Opus für 25 $, oder Modelle lokal über Ollama kostenlos ausführen. Dieser Leitfaden behandelt alle Methoden zur Nutzung verschiedener Modelle in Claude Code und baut auf unserem detaillierten Claude Code-Vergleich mit praxisnahem Setup für jeden Ansatz auf.

Alle Methoden auf einen Blick

Wählen Sie die Methode, die zu Ihrer Situation passt, und springen Sie direkt zum entsprechenden Abschnitt für den Setup-Code.

MethodeAm besten fürKostenSetupModelle
OpenRouterModellvielfalt, ein API-SchlüsselPay-per-Token (Durchleitung)Einfach300+
OllamaDatenschutz, kostenlos, offlineKostenlos (eigene Hardware)Einfach50+ Open-Source
LM StudioLokale Modelle mit GUIKostenlos (eigene Hardware)Einfach50+ Open-Source
claude-code-routerIntelligentes aufgabenbasiertes RoutingJe nach AnbieterMittelKonfigurationsabhängig
claude-code-proxyGemini/OpenAI-BackendAnbieterpreiseMittelOpenAI + Gemini
LiteLLMEnterprise, LastverteilungAnbieterpreiseFortgeschritten100+ bei verschiedenen Anbietern

Lesen Sie weiter für die schrittweise Einrichtung jeder Methode, oder springen Sie direkt zum Entscheidungsrahmen, wenn Sie bereits wissen, was Sie benötigen.

Wie funktioniert der Claude Code-Modellwechsel tatsächlich?

Bevor Sie einen Proxy konfigurieren, müssen Sie verstehen, warum die meisten Anleitungen zu einem fehlerhaften Setup führen. Claude Code verwendet intern drei Modell-Slots -- nicht einen:

  • Haiku-Slot -- Hintergrundaufgaben wie Dateizusammenfassung und Tab-Vervollständigung
  • Sonnet-Slot -- Standard-Coding, das Modell, mit dem Sie am meisten interagieren
  • Opus-Slot -- komplexes Denken, Planung und mehrstufige agentische Aufgaben

Wenn Sie das Modell mit /model oder --model ändern, ändern Sie nur den primären Slot. Claude Code versucht weiterhin, die anderen beiden Slots über die Anthropic-API aufzurufen. Wenn Sie ANTHROPIC_BASE_URL auf einen Proxy gerichtet haben, aber nur ein Modell gesetzt haben, schlagen diese anderen Slots mit einem "model not found"-Fehler fehl.

Die Lösung: Setzen Sie alle drei Umgebungsvariablen, damit jeder Slot durch Ihren Proxy geleitet wird.

bash
# Alle drei Slots durch Ihren Proxy leiten
export ANTHROPIC_DEFAULT_HAIKU_MODEL="ihr-haiku-äquivalent"
export ANTHROPIC_DEFAULT_SONNET_MODEL="ihr-sonnet-äquivalent"
export ANTHROPIC_DEFAULT_OPUS_MODEL="ihr-opus-äquivalent"
<!-- IMAGE: Architecture diagram showing Claude Code request routing through ANTHROPIC_BASE_URL to multiple providers (OpenRouter, Ollama, LiteLLM, claude-code-router) -->

Nativer Modellwechsel (Anthropic-Modelle)

Wenn Sie innerhalb der Anthropic-Modellfamilie bleiben, ist der Wechsel unkompliziert. Verwenden Sie den Befehl /model innerhalb von Claude Code, übergeben Sie --model beim Start vom Terminal, oder fügen Sie Modelle dem availableModels-Array in Ihrer Einstellungsdatei hinzu. Anthropic fügt hier laufend neue Optionen hinzu, und unsere Übersicht der neuesten Claude Code-Funktionen für 2026 verfolgt, was zuletzt veröffentlicht wurde.

Die opusplan-Strategie

opusplan ist das integrierte Multi-Modell-Routing von Claude Code. Es sendet Hintergrundaufgaben an Haiku und leitet komplexes Denken an Opus weiter -- automatisch. Sie konfigurieren es nicht manuell; wählen Sie es einfach als Ihr Modell aus. Es ist Anthropics eigene Antwort auf das Problem "Warum zahle ich Opus-Preise für eine Dateiliste?". Es lohnt sich, es auszuprobieren, bevor Sie zu einem Drittanbieter-Router greifen, neben Anthropics Fast Mode, wenn reine Geschwindigkeit Ihre Priorität ist.

OpenRouter -- Ein API-Schlüssel, 300+ Modelle

OpenRouter fungiert als API-Aggregator. Sie erhalten einen einzigen API-Schlüssel und Zugang zu 300+ Modellen von Anthropic, Google, Meta, Mistral, DeepSeek und mehr. Die Preisgestaltung ist bei den meisten Modellen eine Durchleitung -- kein Aufschlag.

Setup-Schritte

  1. Erstellen Sie ein Konto auf openrouter.ai und generieren Sie einen API-Schlüssel
  2. Führen Sie claude /logout aus, um alle bestehenden Anthropic-Sitzungen zu löschen
  3. Setzen Sie Ihre Umgebungsvariablen:
bash
export ANTHROPIC_BASE_URL="https://openrouter.ai/api"
export ANTHROPIC_API_KEY="sk-or-v1-ihr-schlüssel-hier"

# Alle drei Modell-Slots zuordnen
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek/deepseek-chat-v3"
export ANTHROPIC_DEFAULT_SONNET_MODEL="anthropic/claude-sonnet-4"
export ANTHROPIC_DEFAULT_OPUS_MODEL="anthropic/claude-opus-4"
  1. Starten Sie claude und überprüfen Sie die Verbindung

Beachten Sie die drei Slot-Variablen -- lassen Sie diese weg, erhalten Sie den "model not found"-Fehler, den wir oben beschrieben haben. Der offizielle OpenRouter-Integrationsleitfaden bestätigt dieses Setup.

Empfohlene Modelle über OpenRouter

Nicht jedes Modell auf OpenRouter unterstützt Claude Codes Tool-Calling zuverlässig. Hier ist, was tatsächlich gut funktioniert:

AufgabeModellWarum
Günstige HintergrundaufgabenDeepSeek V3.20,27 $/1,10 $ pro MTok, ordentliches Tool-Calling
Standard-CodingClaude Sonnet 4Gleiche Qualität wie direkt, zentralisierte Abrechnung
Riesige Codebasen (1M Kontext)Gemini 2.5 Flash0,15 $/0,60 $ pro MTok, massives Kontextfenster
Komplexes DenkenClaude Opus 4Beste agentische Coding-Qualität

Kosten und Abrechnung

OpenRouter berechnet bei den meisten Modellen Durchleitungspreise. Sie zahlen genau das, was der zugrunde liegende Anbieter berechnet, zuzüglich einer kleinen Marge bei einigen Drittanbieter-Modellen. Legen Sie Ausgabenlimits in Ihrem OpenRouter-Dashboard fest, um Überraschungen zu vermeiden.

Fazit: OpenRouter ist die beste Option für Entwickler, die maximale Modellvielfalt mit minimalem Einrichtungsaufwand möchten. Ein API-Schlüssel, ein Abrechnungs-Dashboard, 300+ Modelle. Schwer zu übertreffen in puncto Flexibilität.

Ollama -- Kostenlos, lokal und privat

Ollama führt Modelle vollständig auf Ihrem Computer aus. Seit v0.14.0 (Januar 2026) unterstützt es die Anthropic Messages API nativ, was bedeutet, dass Claude Code ohne Übersetzungsschicht damit kommunizieren kann. Ihr Code verlässt niemals Ihren Computer.

Voraussetzungen und Hardware

Sie benötigen anständige Hardware für eine brauchbare Erfahrung:

  • 7B-Modelle (schnelle Bearbeitungen, einfache Aufgaben): mindestens 16 GB RAM
  • 14B-Modelle (solide Coding-Qualität): 32 GB RAM, GPU empfohlen
  • 32B+-Modelle (nahe Cloud-Qualität): 64 GB RAM oder dedizierte GPU mit 24 GB+ VRAM

Für einen tieferen Einblick in Hardwareanforderungen und Modellauswahl lesen Sie unseren Leitfaden zum lokalen Ausführen von LLMs.

Setup-Schritte

  1. Installieren Sie Ollama von ollama.com
  2. Laden Sie ein auf Coding ausgerichtetes Modell herunter
  3. Starten Sie mit Claude Code-Kompatibilität
  4. Setzen Sie Ihre Umgebungsvariablen
bash
# Installieren und ein Coding-Modell laden
ollama pull qwen2.5-coder:14b

# Mit Claude Code-Kompatibilität starten
ollama launch claude

# Umgebungsvariablen setzen
export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="qwen2.5-coder:14b"
export ANTHROPIC_DEFAULT_SONNET_MODEL="qwen2.5-coder:14b"
export ANTHROPIC_DEFAULT_OPUS_MODEL="qwen2.5-coder:14b"

Die Ollama-Integrationsdokumentation empfiehlt Modelle mit 64k+ Token-Kontextfenstern für die beste Claude Code-Erfahrung.

Beste lokale Modelle für Coding

ModellGrößeStärkeHinweise
Qwen 2.5 Coder 14B14BBestes lokales Coding insgesamtStarkes Tool-Calling, gutes Kontext-Handling
devstral24BMistrals Coding-SpezialistGroßartig für Refactoring und Code-Review
GLM 4.79BAllgemeines DenkenGute Balance aus Geschwindigkeit und Qualität

Seien Sie ehrlich mit sich selbst: Lokale Modelle produzieren bei komplexen, mehrstufigen agentischen Aufgaben merklich niedrigere Codequalität als Claude Sonnet. Tool-Calling ist weniger zuverlässig, und Sie werden mehr halluzinierte Dateipfade sehen. Sie sind fantastisch für schnelle Bearbeitungen, einfache Generierungen und datenschutzsensible Arbeit -- erwarten Sie jedoch keine native Claude-Qualität bei einem 50-Datei-Refactoring.

Fazit: Ollama ist die beste Wahl für datenschutzsensible Arbeit und Entwickler, die kostenloses, unbegrenztes Nutzung wünschen. Wenn Sie die Hardware haben, ist es schwer, gegen "null Euro für immer" zu argumentieren.

Ollama Cloud vs. OpenRouter: Preise und wann welches gewinnt

Ollama und OpenRouter lösen das Kostenproblem von entgegengesetzten Enden aus. Ollama betreibt Modelle auf Hardware, die Sie kontrollieren, zu null Kosten pro Token, während OpenRouter Durchleitungspreise über 300+ gehostete Modelle berechnet, ohne dass Sie Hardware verwalten müssen. Dieser Leitfaden richtet Ollama lokal ein, und dieselbe Rechnung aus Fixkosten gegen Kosten pro Token gilt, wenn Sie stattdessen dessen gehostete Stufe nutzen.

FaktorOllamaOpenRouter
KostenmodellKostenlos lokal, Sie zahlen für HardwareDurchleitung pro Token, keine Marge bei den meisten Modellen
Beispielpreis0 $ pro TokenDeepSeek V3.2 bei 0,27 $/1,10 $, Gemini 2.5 Flash bei 0,15 $/0,60 $ pro MTok
Hardware16 GB RAM (7B) bis zu 24 GB+ VRAM (32B+)Keine, vollständig gehostet
Modellzugang50+ Open-Source-Modelle300+ bei verschiedenen Anbietern
DatenschutzCode verlässt niemals Ihren ComputerAnfragen laufen über OpenRouter

Wählen Sie Ollama, wenn Datenschutz, Offline-Nutzung oder umfangreiche Routinebearbeitungen wichtig sind und Sie die Hardware bereits besitzen. Wählen Sie OpenRouter, wenn Sie Modellvielfalt, keine Vorab-Hardware und eine Nur-für-Nutzung-zahlen-Abrechnung möchten.

LM Studio -- Lokale Modelle mit GUI

LM Studio bietet die gleiche lokale Modellausführung wie Ollama, aber mit einer visuellen Oberfläche. Sie durchsuchen Modelle in einer GUI, wählen Quantisierungsstufen mit einem Klick und testen den Chat, bevor Sie Claude Code darauf ausrichten. Gleiche Hardwareanforderungen wie Ollama. Wenn Sie Runner vergleichen, behandelt unser Leitfaden zu den besten Tools zum lokalen Ausführen von LLMs die Kompromisse.

Setup

  1. Laden Sie LM Studio herunter und installieren Sie es
  2. Suchen Sie nach einem Coding-Modell und laden Sie es herunter (Qwen 2.5 Coder, devstral usw.)
  3. Starten Sie den lokalen Server über die LM Studio-Oberfläche
  4. Richten Sie Claude Code darauf aus:
bash
# Claude Code auf LM Studios lokalen Server ausrichten
export ANTHROPIC_BASE_URL="http://localhost:1234/v1"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_DEFAULT_SONNET_MODEL="ihr-geladenes-modell-name"

Der LM Studio-Blog enthält eine Schritt-für-Schritt-Anleitung mit Screenshots, wenn Sie visuelle Setup-Leitfäden bevorzugen.

Fazit: LM Studio ist am besten für Entwickler, die eine GUI gegenüber CLI für die Verwaltung lokaler Modelle bevorzugen. Wenn Sie bereits mit ollama pull und Konfigurationsdateien vertraut sind, bleiben Sie bei Ollama. Wenn Sie Modelle visuell durchsuchen und Einstellungen mit Schiebereglern anpassen möchten, ist LM Studio Ihre Wahl.

claude-code-router -- Intelligentes Modell-Routing

claude-code-router ist ein npm-Paket, das einen lokalen Proxy zwischen Claude Code und Ihren konfigurierten Anbietern betreibt. Was es interessant macht, ist kontextbewusstes Routing -- Sie können günstige Hintergrundaufgaben an DeepSeek senden, Standard-Coding an Sonnet und komplexes Denken an Opus, alles automatisch.

Das Projekt hat 30k+ GitHub-Sterne und unterstützt OpenRouter, DeepSeek, Gemini, Ollama, Groq, Volcengine und SiliconFlow als Anbieter.

Installation und Setup

bash
npm install -g claude-code-router
claude-code-router init
claude-code-router start

Der init-Befehl erstellt eine config.json, in der Sie Ihre Anbieter und Modell-Zuordnungen definieren:

json
{
  "providers": {
    "openrouter": {
      "apiKey": "sk-or-v1-...",
      "models": {
        "haiku": "deepseek/deepseek-chat-v3",
        "sonnet": "anthropic/claude-sonnet-4",
        "opus": "anthropic/claude-opus-4"
      }
    }
  }
}

Konfiguration für kontextbewusstes Routing

Hier glänzt claude-code-router. Sie können verschiedene Aufgabentypen basierend auf der Komplexität an verschiedene Modelle weiterleiten. Hintergrund-Zusammenfassungen gehen an ein günstiges Modell, während Planungs- und Architekturarbeiten an Ihr bestes Modell gehen. Der Router verwaltet alle Slot-Zuordnungen transparent.

Sie können auch Anbieter mischen -- verwenden Sie Ollama für datenschutzsensible Repositories und OpenRouter für alles andere, und wechseln Sie mit dem /model-Befehl innerhalb von Claude Code.

Fazit: claude-code-router ist am besten für Power-User, die detaillierte Kontrolle darüber haben möchten, welches Modell welchen Aufgabentyp übernimmt. Es ist die konfigurierbarste Option, aber diese Flexibilität erfordert mehr Setup als ein einfacher ANTHROPIC_BASE_URL-Austausch.

claude-code-proxy und LiteLLM -- Erweiterte Setups

Diese beiden Methoden dienen unterschiedlichen Zwecken, teilen aber eine Eigenschaft: Beide sind Proxy-Server, die zwischen API-Formaten übersetzen.

claude-code-proxy (Gemini und OpenAI-Backend)

claude-code-proxy ist ein Python-Tool (3.3k GitHub-Sterne), das Anthropic-Format-Anfragen von Claude Code akzeptiert und sie über LiteLLM unter der Haube in OpenAI- oder Gemini-Format übersetzt. Es ist der einfachste Weg, Gemini oder GPT-Modelle speziell mit Claude Code zu verwenden.

bash
pip install claude-code-proxy
claude-code-proxy --port 8080

# Dann Claude Code darauf ausrichten
export ANTHROPIC_BASE_URL="http://localhost:8080"
export ANTHROPIC_API_KEY="ihr-gemini-oder-openai-schlüssel"

Wenn Sie speziell Geminis 1M-Token-Kontext für große Monorepos möchten, ist dies der direkteste Weg.

LiteLLM (Enterprise Universal Proxy)

LiteLLM ist ein enterprise-tauglicher Proxy, der 100+ Anbieter mit Lastverteilung, Fallback-Ketten, Rate-Limiting und Audit-Logging unterstützt. Es ist überdimensioniert für einen einzelnen Entwickler, aber unerlässlich für Teams, die Governance um die KI-Modellnutzung benötigen.

Das Setup verwendet eine YAML-Konfiguration:

yaml
model_list:
  - model_name: claude-sonnet-4-20250514
    litellm_params:
      model: gemini/gemini-2.5-flash
      api_key: os.environ/GEMINI_API_KEY
  - model_name: claude-haiku-3-5-20241022
    litellm_params:
      model: deepseek/deepseek-chat
      api_key: os.environ/DEEPSEEK_API_KEY
bash
# LiteLLM-Proxy starten
litellm --config config.yaml --port 4000

# Claude Code auf LiteLLM ausrichten
export ANTHROPIC_BASE_URL="http://localhost:4000"
export ANTHROPIC_API_KEY="sk-litellm"

Ein wichtiger Hinweis aus der offiziellen Claude Code-Dokumentation: "Anthropic empfiehlt, wartet oder prüft LiteLLM nicht." Nutzen Sie es, aber wissen Sie, dass es ein Community-Tool ist, kein Anthropic-Produkt. Das LiteLLM-Tutorial enthält weitere erweiterte Konfigurationsbeispiele.

Fazit: Verwenden Sie claude-code-proxy, wenn Sie speziell Gemini- oder OpenAI-Modelle benötigen. Verwenden Sie LiteLLM, wenn Ihr Team Lastverteilung, Fallback und Audit-Logging über Anbieter hinweg benötigt.

Claude Code Router vs. LiteLLM: Welches sollten Sie verwenden?

Claude Code Router ist die einfachere Wahl für Einzelentwickler, die aufgabenbasiertes Modell-Routing möchten, während LiteLLM für Teams gebaut ist, die Lastverteilung, Fallback-Ketten und Audit-Logging benötigen. Router installiert sich über npm und liest eine config.json; LiteLLM betreibt einen enterprise-tauglichen, YAML-konfigurierten Proxy über 100+ Anbieter.

FaktorClaude Code RouterLiteLLM
EinrichtungsschwierigkeitMittel: npm install, config.json bearbeitenFortgeschritten: YAML-Konfigurationsdatei
Am besten fürEinzelentwickler, die aufgabenbasiertes Routing wollenTeams, die Governance benötigen
Konfigurationsformatconfig.jsonYAML model_list
Herausragendes FeatureKontextbewusstes aufgabenbasiertes RoutingLastverteilung, Fallback, Audit-Logging
AnbieterOpenRouter, DeepSeek, Gemini, Ollama, Groq und mehr100+ bei verschiedenen Anbietern
Reife30k+ GitHub-Sterne, gebaut für Claude CodeEnterprise-Proxy, Community-Tool (nicht von Anthropic unterstützt)

Wählen Sie claude-code-router, wenn Sie ein Einzelentwickler sind, der günstige Hintergrundaufgaben auf DeepSeek und komplexes Denken auf Opus möchte, ohne viel Einrichtungsaufwand. Wählen Sie LiteLLM, wenn Ihr Team Lastverteilung, Rate-Limiting und Audit-Logs über Anbieter hinweg benötigt.

Ziehen Sie auch andere Proxys in Betracht? Unsere Übersicht der besten LLM-Gateway-Tools vergleicht sie nebeneinander.

Was kostet jede Methode tatsächlich?

Lassen Sie uns echte Zahlen dazu nennen. Hier ist, was Sie pro 1 Million Token bei den gängigsten Modell-/Methoden-Kombinationen zahlen:

Modell / MethodeInput (pro 1M Token)Output (pro 1M Token)Monatliche Schätzung (mäßige Nutzung)
Claude Opus 4.6 (direkt)4,60 €23,00 €~46-138 €
Claude Sonnet 4.6 (direkt)2,75 €13,80 €~28-55 €
Claude Sonnet über OpenRouter2,75 €13,80 €Gleich (Durchleitung)
DeepSeek V3.2 (OpenRouter)0,25 €1,01 €~3-7 €
Gemini 2.5 Flash (OpenRouter)0,14 €0,55 €~2-5 €
Ollama (lokal)KostenlosKostenlos0 € (Hardwarekosten)

Preisdaten von Anthropics offizieller Preisseite und OpenRouter. Mäßige Nutzung setzt ~5-10M Token/Monat für tägliche Coding-Sitzungen voraus.

"Kosten pro 1M Output-Token nach Modell"

"Claude Opus 4.6 kostet 23 € pro 1M Output-Token vs. DeepSeek V3.2 bei 1,01 € -- ein 23-facher Kostenunterschied. Ollama läuft auf lokaler Hardware völlig kostenlos."
Datentabelle
"Kosten pro 1M Output-Token nach Modell"
"Modell""Output-Kosten"
"Opus 4.6"23
"Sonnet 4.6"13.8
"DeepSeek V3.2"1.01
"Gemini 2.5 Flash"0.55
"Ollama (lokal)"0

Die Kostenlücke ist erheblich, aber günstigere Modelle produzieren niedrigere Codequalität -- besonders bei komplexen agentischen Aufgaben, bei denen die Zuverlässigkeit des Tool-Callings wichtig ist. DeepSeek bei 1,01 €/MTok Output ist großartig für Routinebearbeitungen. Für ein Multi-Datei-Refactoring, bei dem Claude Code über 20 Dateien hinweg lesen, planen, bearbeiten und überprüfen muss? Sie werden immer noch Sonnet oder Opus wollen.

Fazit: Für Kosteneinsparungen bei akzeptabler Qualität bietet OpenRouter + DeepSeek das beste Verhältnis. Für null Kosten ist Ollama unschlagbar, wenn Sie die Hardware haben. Für maximale Qualität bleibt Anthropic direkt die erste Wahl.

Welche Methode sollten Sie verwenden? -- Entscheidungsrahmen

Hier ist der Abschnitt, den jedes andere Tutorial überspringt. Anstatt Ihnen einfach zu sagen "Verwenden Sie einfach OpenRouter", passen wir Methoden an tatsächliche Bedürfnisse an:

Wenn Sie brauchen...Verwenden Sie diese MethodeWarum
Maximale Modellvielfalt, ein API-SchlüsselOpenRouter300+ Modelle, einfaches Setup, Pay-per-Use
Kostenlos, unbegrenzt, Code bleibt lokalOllamaNull Kosten, volle Privatsphäre, offline-fähig
Lokale Modelle mit visueller OberflächeLM StudioGUI-Modell-Browser, einfache Quantisierungsauswahl
Intelligentes aufgabenbasiertes Routingclaude-code-routerDenken an Opus, schnelle Bearbeitungen an DeepSeek
Speziell Gemini oder OpenAI-Modelleclaude-code-proxyÜbersetzt Anthropic-Format zu OpenAI/Gemini
Enterprise: Lastverteilung, AuditLiteLLMRate-Limiting, Fallback-Ketten, Team-Kontrollen

Sollten Sie überhaupt wechseln?

Ehrliche Einschätzung: Für die meisten Entwickler, die komplexes agentisches Coding betreiben -- Multi-Datei-Refactorings, Architekturplanung, Debugging von kniffligen Nebenläufigkeitsproblemen -- bleibt Claude Sonnet über direktes Anthropic die beste Option. Natives Claude hat das zuverlässigste Tool-Calling, das beste Verständnis seines eigenen agentischen Workflows und null Proxy-Latenz.

Der Modellwechsel ist eine Optimierung für spezifische Szenarien:

  • Sie verbrennen Token bei Hintergrundaufgaben, die keine Sonnet-Qualität benötigen, oder Sie stoßen immer wieder an Claudes 2x-Nutzungslimits
  • Sie benötigen Geminis 1M-Kontextfenster für ein riesiges Monorepo
  • Ihr Code darf Ihren Computer nicht verlassen (Regierung, Gesundheitswesen, Finanzen)
  • Sie haben ein knappes Budget und akzeptable Qualität schlägt perfekte Qualität

Wenn keines davon zutrifft, könnte opusplan (Anthropics integriertes Routing) alles sein, was Sie brauchen.

Die Zuverlässigkeit des Tool-Callings ist hier die wichtigste Qualitätsmetrik. Die Hierarchie ist: natives Claude >> OpenRouter Claude >> DeepSeek/Gemini >> lokale Modelle. Je weiter unten Sie gehen, desto mehr fehlgeschlagene Tool-Calls, halluzinierte Dateipfade und unvollständige Bearbeitungen werden Sie sehen.

Häufige Probleme beheben

Fehler "model not found"

Das ist das häufigste Problem. Es tritt auf, wenn Sie ANTHROPIC_BASE_URL setzen, aber vergessen, alle drei Modell-Slots zuzuordnen. Claude Code versucht, Haiku oder Opus über Ihren Proxy aufzurufen, der Proxy erkennt den Standard-Anthropic-Modellnamen nicht, und Sie erhalten den Fehler.

bash
# Lösung: ALLE drei Modell-Slot-Variablen setzen
export ANTHROPIC_DEFAULT_HAIKU_MODEL="ihr-modell"
export ANTHROPIC_DEFAULT_SONNET_MODEL="ihr-modell"
export ANTHROPIC_DEFAULT_OPUS_MODEL="ihr-modell"

Verbindung abgelehnt / Timeout

Ihr Proxy läuft nicht, oder Claude Code trifft den falschen Port. Überprüfen Sie, ob der Proxy-Prozess aktiv ist und überprüfen Sie den Port in ANTHROPIC_BASE_URL. Firewalls und VPNs können auch localhost-Verbindungen blockieren.

Tool-Calling-Fehler

Das Modell unterstützt Anthropics Tool-Use-Format nicht korrekt. Symptome: Claude Code hängt, produziert leere Tool-Calls oder bearbeitet die falschen Dateien. Wechseln Sie zu einem Modell mit verifizierter Tool-Calling-Unterstützung -- Qwen 2.5 Coder und devstral verwalten dies am besten unter den lokalen Modellen.

Streaming-Probleme

Einige Proxys verarbeiten server-sent events nicht korrekt. Antworten erscheinen alle auf einmal anstatt gestreamt zu werden, oder sie werden mitten in der Antwort abgebrochen. Stellen Sie sicher, dass Ihre Proxy-Version aktuell ist und überprüfen Sie die GitHub-Issues auf bekannte Streaming-Bugs.

Kontextfenster überschritten

Lokale Modelle haben oft standardmäßig 4K-8K-Kontextfenster. Claude Code benötigt für echte Coding-Sitzungen viel mehr. Verwenden Sie Modelle mit 32K+ Kontext, oder leiten Sie Aufgaben mit langem Kontext über OpenRouter an Gemini (1M-Fenster) weiter.

Muss sich zuerst für OpenRouter abmelden

Wenn Sie von direktem Anthropic zu OpenRouter wechseln, führen Sie zuerst claude /logout aus. Claude Code speichert die Authentifizierung und wird weiterhin versuchen, Ihren Anthropic-Schlüssel zu verwenden, auch nachdem Sie die Basis-URL geändert haben.

bash
# Gespeicherte Authentifizierung vor dem Anbieterwechsel löschen
claude /logout

FAQ

Kann man Claude Code mit GPT-4 oder Gemini verwenden?

Ja. claude-code-proxy übersetzt Anthropic-Format-Anfragen in OpenAI- oder Gemini-Format. Sie können auch über OpenRouter auf beide mit einem einzigen API-Schlüssel zugreifen. Tool-Calling kann weniger zuverlässig als natives Claude sein, insbesondere für komplexe mehrstufige Aufgaben.

Wie verwende ich Claude Code ohne einen Anthropic-API-Schlüssel?

Verwenden Sie Ollama für vollständig kostenlose lokale Nutzung -- kein API-Schlüssel von irgendeinem Anbieter erforderlich. Alternativ verwenden Sie OpenRouter mit deren API-Schlüssel-Format. Sie setzen weiterhin die ANTHROPIC_API_KEY-Umgebungsvariable, aber sie zeigt auf den Schlüssel Ihres Proxys (z.B. sk-or-v1-... für OpenRouter, "ollama" für Ollama).

Wie richte ich Claude Code mit Ollama ein?

Installieren Sie Ollama, laden Sie ein Modell wie qwen2.5-coder:14b herunter, führen Sie ollama launch claude aus und setzen Sie drei Umgebungsvariablen: ANTHROPIC_BASE_URL, ANTHROPIC_API_KEY und die drei Modell-Slot-Variablen. Sehen Sie den Ollama-Abschnitt oben für den vollständigen Code.

Welche Modelle funktionieren am besten mit Claude Code?

Für die Cloud: Claude Sonnet 4 liefert die beste Coding-Qualität, während DeepSeek V3.2 den besten Gegenwert bietet. Für lokal: Qwen 2.5 Coder 14B ist der aktuelle Goldstandard. Der entscheidende Faktor ist die Zuverlässigkeit des Tool-Callings -- Claude Code ist stark darauf für Dateioperationen angewiesen, und native Claude-Modelle verwalten es am besten.

Wie behebe ich den "model not found"-Fehler in Claude Code?

Setzen Sie alle drei Modell-Slot-Umgebungsvariablen: ANTHROPIC_DEFAULT_HAIKU_MODEL, ANTHROPIC_DEFAULT_SONNET_MODEL und ANTHROPIC_DEFAULT_OPUS_MODEL. Dieser Fehler tritt auf, weil Claude Code drei interne Modell-Slots verwendet, und ein nicht zugeordneter Slot versucht, einen Modellnamen aufzurufen, den Ihr Proxy nicht erkennt.

Kann Claude Code offline mit lokalen Modellen arbeiten?

Ja. Sowohl Ollama als auch LM Studio führen Modelle vollständig auf Ihrem Computer ohne Internetverbindung aus. Ihr Code verlässt niemals Ihre Hardware. Sie benötigen ausreichende Spezifikationen -- mindestens 16 GB RAM für 7B-Modelle, 32 GB+ für alles Größere.

Kann ich LM Studio mit Claude Code verwenden?

Ja. LM Studio betreibt einen lokalen Server, mit dem sich Claude Code verbindet, indem Sie ANTHROPIC_BASE_URL auf http://localhost:1234/v1 und ANTHROPIC_API_KEY auf lm-studio setzen. Laden Sie ein Coding-Modell wie Qwen 2.5 Coder herunter, starten Sie den Server über die LM Studio-GUI, und ordnen Sie dann Ihren Modell-Slot zu. Es ist die visuelle Alternative zu Ollamas CLI.

Was ist ANTHROPIC_BASE_URL und wie verwende ich es?

Es ist die Umgebungsvariable, die Claude Code mitteilt, wohin API-Anfragen gesendet werden sollen. Standardmäßig zeigt sie auf https://api.anthropic.com. Ändern Sie sie zu einem beliebigen Anthropic-kompatiblen Endpunkt -- OpenRouter (https://openrouter.ai/api), Ollama (http://localhost:11434), LiteLLM (http://localhost:4000) usw.

Ist claude-code-router besser als LiteLLM?

Verschiedene Tools für verschiedene Probleme. claude-code-router ist einfacher (npm install, config.json bearbeiten, fertig) und speziell für Claude Code konzipiert. LiteLLM ist enterprise-tauglich mit Lastverteilung, Rate-Limiting, Fallback-Ketten und Audit-Logging. Einzelentwickler? Verwenden Sie claude-code-router. Team mit Governance-Anforderungen? Verwenden Sie LiteLLM.

Wie viel kann ich durch die Nutzung von Nicht-Anthropic-Modellen sparen?

Der Wechsel von Claude Opus 4.6 zu DeepSeek V3.2 reduziert die Output-Token-Kosten um etwa 95% (23 € vs. 1,01 € pro Million Token). Ollama bringt das auf null, wenn Sie die Hardware haben. Aber Qualitätskompromisse sind real -- erwarten Sie geringere Genauigkeit bei komplexen mehrstufigen agentischen Aufgaben, weniger zuverlässiges Tool-Calling und mehr halluzinierte Dateipfade.

Funktioniert Tool-Calling mit allen Proxy-Methoden?

Nicht zuverlässig über alle hinweg. Natives Claude hat die beste Tool-Calling-Unterstützung. OpenRouter mit Claude-Modellen funktioniert fast genauso gut. DeepSeek und Gemini haben partielle Unterstützung -- einfache Tool-Calls funktionieren, aber komplexe Ketten können fehlschlagen. Lokale Modelle über Ollama haben das unzuverlässigste Tool-Calling. Dies ist die wichtigste Qualitätssorge beim Wechsel von Anthropic.

Quellen

Tags

claude-codeopenrouterollamalitellmclaude-code-routerlokale-modelleki-coding-tools

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.