ai-machine-learning

Schluss mit LLM-API-Chaos: 10 Gateway-Tools für 2026 im Ranking

Geschrieben von Mert Batur
Aktualisiert Jul 25, 2026
30 Lesezeit
Schluss mit LLM-API-Chaos: 10 Gateway-Tools für 2026 im Ranking

Die 10 besten LLM-Gateway-Tools, bewertet: Jedes Modell über eine einzige API [2026]

Zuletzt aktualisiert: 19. Juli 2026. Wir haben Preise und GitHub-Sternzahlen für alle 9 Gateways erneut überprüft und zwei Eigentümerwechsel ergänzt, die bei der heutigen Gateway-Auswahl ins Gewicht fallen: Palo Alto Networks hat die Übernahme von Portkey am 29. Mai 2026 abgeschlossen und das Produkt in die Sicherheitsplattform Prisma AIRS eingegliedert, und Mintlify hat Helicone im März 2026 übernommen, wodurch dessen Cloud-Produkt in den Wartungsmodus gewechselt ist. Außerdem haben wir festgestellt, dass die Maintainer von TensorZero das Projekt im Juni 2026 archiviert haben, weshalb wir das unten kennzeichnen, statt es weiterhin als aktive Option darzustellen. Bifrost ist seit unserer letzten Prüfung von rund 2.000 auf 6.600 GitHub-Sterne gewachsen und hat ein eigenes MCP Gateway veröffentlicht, womit ein Großteil des Governance-Abstands zu Portkey und TrueFoundry geschlossen ist, deshalb haben wir einen direkten Vergleich ergänzt.

Das beste LLM-Gateway 2026 ist LiteLLM für selbst gehostete Teams und Merge Gateway für verwalteten Produktions-Traffic. LiteLLM unterstützt 100+ Anbieter hinter einer einzigen OpenAI-kompatiblen API, übernimmt Fallbacks und Budget-Kontrollen und läuft kostenlos auf jedem VPS. Merge Gateway ist die verwaltete Wahl, sobald LLM-Kosten zur Margenfrage werden: Routing-Richtlinien nach Kunde oder Feature, Budgetgrenzen, konsolidierte Abrechnung und Kostenzuordnung auf Request-Ebene. Wenn Sie einfach den breitesten Modellkatalog ohne Setup wollen, gibt OpenRouter weiterhin sofortigen Zugang zu 300+ Modellen und ist der bessere Ort zum Prototyping. Für regulierte Unternehmen, die Datensouveränität und Steuerung über Modell- und Agenten-Traffic gleichermaßen benötigen, läuft TrueFoundry vollständig in der eigenen VPC. Für Produktions-Guardrails (PII-Redaktion, Jailbreak-Erkennung) ist Portkey die richtige Wahl. Für Rohdurchsatz über 5.000 RPS fügt Bifrosts Go-Architektur nur 11 Mikrosekunden Overhead hinzu.

Sie rufen OpenAI für Ihren Chatbot auf, Anthropic für Ihren Programmier-Assistenten und Gemini für Ihre Zusammenfassungs-Pipeline. Drei API-Schlüssel, drei SDKs, drei Abrechnungs-Dashboards, drei verschiedene Fehlerbehandlungen. Fügen Sie nun noch Fallback-Logik hinzu, wenn ein Anbieter ausfällt. Das ist das Chaos, das LLM-Gateways lösen, eine einheitliche API, die zu jedem Modell weiterleitet, Kosten verfolgt und Ausfälle automatisch behandelt.

Wir haben alle wichtigen LLM-Gateways getestet und nach dem bewertet, was wirklich zählt: Latenz-Overhead, Anbieterabdeckung, Einrichtungsaufwand und ob sie Ihren nächsten Traffic-Anstieg überstehen werden.

RangToolAm besten fürTypStartpreis
no. 1LiteLLMMaximale FlexibilitätSelf-hosted (Open-Source)Kostenlos
no. 2Merge GatewayRouting und Kostenkontrolle im Enterprise-MaßstabManaged SaaSPay-per-Token (kostenlose Stufe)
no. 3TrueFoundryEnterprise Governance + MCPSelf-hosted + ManagedKostenlose Stufe (499 $/Monat Pro)
no. 4OpenRouterEinfacher Multi-Modell-ZugangManaged SaaSPay-per-Token
no. 5PortkeyProduktions-GuardrailsHybrid (Open-Source + Managed)Kostenloser Tarif
no. 6HeliconeObservability-fokussierte TeamsSelf-hosted (Open-Source)Kostenlos
no. 7BifrostRoher DurchsatzSelf-hosted (Open-Source)Kostenlos
no. 8Cloudflare AI GatewayRouting ohne eigene InfrastrukturManagedKostenloser Tarif
no. 9Kong AI GatewayAPI-Management-TeamsSelf-hosted + EnterpriseKostenlose Community
no. 10TensorZeroML-optimiertes Routing (archiviert Juni 2026)Self-hosted (Open-Source, nicht mehr gepflegt)Kostenlos

Was ist ein LLM-Gateway? (Und brauchen Sie wirklich eines?)

Vor den Bewertungen eine kurze Unterscheidung. Die Begriffe „Gateway", „Proxy" und „Router" werden oft gleichbedeutend verwendet, erfüllen aber leicht unterschiedliche Aufgaben:

  • LLM-Proxy: Leitet Anfragen an Anbieter weiter und fügt Protokollierung hinzu. Minimale Logik.
  • LLM-Router: Wählt für jede Anfrage das beste Modell oder den besten Anbieter basierend auf Kosten, Latenz oder Inhalt.
  • LLM-Gateway: Das Komplettpaket, Proxy + Router + Kostenverfolgung + Caching + Guardrails + Observability.

Die meisten Tools auf dieser Liste sind vollständige Gateways, einige tendieren jedoch eher in Richtung Proxy oder Router.

Sie benötigen ein Gateway, wenn:

  1. Sie 2+ LLM-Anbieter aufrufen und eine einzige API für alle möchten
  2. Sie Kosten über Anbieter hinweg verfolgen müssen (wer verbraucht Ihr Budget?)
  3. Sie automatisches Failover wünschen, wenn ein Anbieter ausfällt
  4. Sie Features entwickeln, die von Prompt-Caching über Anbieter hinweg profitieren

Wenn Sie nur einen einzigen Anbieter nutzen und keine Wechselpläne haben, fügt ein Gateway unnötige Komplexität hinzu. Überspringen Sie es.

Der typische Adoptionspfad: Die meisten Teams beginnen damit, OpenAI-Aufrufe direkt fest zu kodieren. Dann fügen sie Anthropic für einen zweiten Anwendungsfall hinzu und schreiben eine Wrapper-Funktion. Dann benötigen sie Fallback-Logik, Kostenverfolgung und Rate-Limiting, und plötzlich haben sie selbst ein halb fertiges Gateway gebaut. Die unten aufgeführten Tools ersetzen diesen selbst gebauten Flickenteppich durch etwas Bewährtes.

1. LiteLLM, Insgesamt am besten

GitHub-Sterne: ~54K | Sprache: Python | Lizenz: MIT

LiteLLM ist das Schweizer Taschenmesser unter den LLM-Gateways. Es kapselt 100+ LLM-Anbieter hinter einer einzigen OpenAI-kompatiblen API, was bedeutet, dass Ihr bestehender OpenAI-SDK-Code ohne Änderungen funktioniert. Tauschen Sie einfach die Basis-URL aus.

Die Proxy-Server-Komponente ist das, was LiteLLM zu einem Gateway macht und nicht nur zu einem SDK. Sie deployen es als eigenständigen Dienst, konfigurieren Ihre Modelle in einer YAML-Datei, und jedes Team trifft denselben Endpunkt mit eingebautem Kosten-Tracking, Rate-Limiting und Load-Balancing.

python
# config.yaml für LiteLLM Proxy
model_list:
  - model_name: gpt-4
    litellm_params:
      model: openai/gpt-4o
      api_key: sk-...
  - model_name: gpt-4
    litellm_params:
      model: anthropic/claude-sonnet-4-20250514
      api_key: sk-ant-...
  # LiteLLM balanciert automatisch zwischen diesen

general_settings:
  master_key: sk-my-master-key
  database_url: postgresql://...
python
# Ihr App-Code ändert sich nicht -- zeigen Sie einfach auf den Proxy
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:4000",  # LiteLLM Proxy
    api_key="sk-my-master-key"
)

response = client.chat.completions.create(
    model="gpt-4",  # Leitet zu OpenAI oder Anthropic weiter via Config
    messages=[{"role": "user", "content": "Erkläre LLM-Gateways"}]
)

Was gut ist:

  • 100+ Anbieter unterstützt (größte Abdeckung aller Gateways)
  • OpenAI-kompatible API, keine Code-Änderungen für bestehende Apps
  • Integriertes Kosten-Tracking, Budgets pro Team/Benutzer
  • Fallback-Ketten: wenn OpenAI ausfällt, Anthropic versuchen, dann Gemini
  • Integriert sich mit allen wichtigen Observability-Tools (Langfuse, Helicone usw.)

Was nicht gut ist:

  • Pythons GIL begrenzt den Einzelprozess-Durchsatz (P95-Latenz ~8ms bei 1.000 RPS)
  • Der Proxy benötigt eine eigene PostgreSQL-Datenbank für Team-Management-Features
  • Konfiguration kann mit vielen Modellen und Routing-Regeln komplex werden
  • Supply-Chain-Angriff am 24. März 2026: Zwei PyPI-Releases (1.82.7, 1.82.8) enthielten eine Hintertür, nachdem Angreifer über eine kompromittierte CI-Action die Veröffentlichungs-Zugangsdaten erbeutet hatten. PyPI hat beide innerhalb von etwa 40 Minuten unter Quarantäne gestellt, aber pinnen Sie Ihre Version und prüfen Sie pip show litellm, falls Sie an diesem Tag deployt haben. Ausführliche Darstellung im Incident-Report von LiteLLM

Preise: Kostenlos und Open-Source. Enterprise-Pläne für gehostetes Management verfügbar.

Wenn Sie unseren Leitfaden zur Nutzung von Claude Code mit verschiedenen Modellen gelesen haben, haben Sie LiteLLM bereits in Aktion gesehen, es ist eine der Hauptmethoden, mit denen Entwickler Claude Code über alternative Anbieter leiten. Unser LiteLLM-Proxy-Setup-Leitfaden führt Sie in unter 20 Minuten durch die vollständige Docker-Bereitstellung mit PostgreSQL.

Fazit: LiteLLM ist das beste LLM-Gateway insgesamt für Teams, die maximale Flexibilität wollen und Self-Hosting nicht scheuen. Es hat die breiteste Anbieterabdeckung, das reifste Ökosystem und die größte Community. Beginnen Sie hier, es sei denn, Sie haben einen spezifischen Grund dagegen.

2. Merge Gateway, Am besten für Routing und Kostenkontrolle im Enterprise-Maßstab

Anbieter: OpenAI, Anthropic, Google, AWS Bedrock, Mistral, Cohere, Grok | Typ: Managed SaaS | Start: 31. März 2026

Merge Gateway ist für den Punkt gebaut, an dem LLM-Nutzung aufhört, ein Kostenposten zu sein, und anfängt, ein Margenproblem zu werden. Wo OpenRouter auf die Breite des Modellzugangs optimiert, optimiert Merge auf Kontrolle über Traffic, den Sie bereits produktiv fahren: Routing nach Kosten, Latenz, Qualität, Kunde, Feature oder Region, Budgets, die auslösen, bevor es die Rechnung tut, und Logs auf Request-Ebene, die zeigen, welches Modell einen Aufruf bedient hat und warum er dorthin geroutet wurde.

Genau dieser letzte Punkt ist der eigentliche Unterschied. Die meisten Gateways sagen Ihnen, was Sie ausgegeben haben. Merge ist darauf ausgelegt, Ihnen zu sagen, für wen — und das ist die Frage, die aufkommt, sobald die Nutzung eines einzelnen Enterprise-Kunden die Bruttomarge eines Produkts auffrisst.

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api-gateway.merge.dev/v1/openai",
)

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Summarize this support ticket"}],
)

Was gut ist:

  • Routing-Richtlinien nach Kunde, Feature, Region, Anwendungsfall, Kosten, Latenz oder Qualität
  • Automatisches Fallback hält KI-Features bei Anbieterausfällen, Rate-Limits und Degradierungen am Leben
  • Observability auf Request-Ebene: Modell, Anbieter, Kosten, Latenz und der Routing-Grund hinter jedem Aufruf
  • Kostensteuerung mit Budgets, Ausgabengrenzen und Alerts nach Projekt, Team, Kundensegment oder Feature
  • Semantisches Caching und Kontextkompression als echte Kostenhebel, nicht als Add-ons

Was nicht:

  • Nicht Open Source, fällt also raus, wenn Self-Hosting harte Anforderung ist (Enterprise bietet VPC/On-Prem, aber das ist ein Vertriebsgespräch)
  • Bewusst produktionsorientiert, dadurch schwerer als nötig für Prototypen und Anwendungen mit wenig Volumen
  • Start im März 2026, entsprechend dünn sind Community, Integrationen und Tutorials von Dritten im Vergleich zu LiteLLM oder OpenRouter

Preise: Kostenlose Stufe mit 10 $/Monat Guthaben, ohne Kreditkarte. Pro kostet LLM-Kosten + 5 % ohne Ausgabenlimit und mit Bring-your-own-Key. Enterprise wird individuell kalkuliert und ergänzt VPC- oder On-Prem-Deployment, einen festen Ansprechpartner und Uptime-SLAs. Guthaben wird zum 1. gutgeschrieben und verfällt monatlich.

Zur Gebühr: Merges 5 % liegen knapp unter OpenRouters 5,5 %. Bei Prototyp-Volumen ist dieser Unterschied Rauschen. Bei sechsstelligen jährlichen Inferenzkosten ist es echtes Geld — und genau die Art Posten, die man durchrechnen sollte, bevor man sich für eine der beiden Seiten entscheidet.

Fazit: Merge Gateway ist die Wahl, wenn Ihr LLM-Traffic zu einem Zuverlässigkeits- und Margenproblem geworden ist statt zu einem Integrationsproblem. Wenn Sie beantworten müssen, welcher Kunde die Kosten treibt oder welches Feature unter Wasser steht, und Sie Fallback-Richtlinien brauchen, die Features während eines Anbieterausfalls am Leben halten, ist es hier die stärkste Managed-Option. Wenn Sie noch entscheiden, welche Modelle Sie überhaupt einsetzen, bedient Sie OpenRouters Katalog besser — wechseln können Sie später.

3. TrueFoundry, Beste Wahl für Enterprise Governance

Modelle: 1.600+ | Anbieter: 250+ | Typ: Self-hosted + Managed | Deployment: VPC, On-Prem, Air-Gapped

TrueFoundrys AI Gateway ist für den Anwendungsfall konzipiert, an dem Open-Source-Gateways an ihre Grenzen stoßen: ein reguliertes Unternehmen, das eine einzige Steuerungsebene für alle Modelle, vollständige Datensouveränität und Prüfprotokolle benötigt, die einer Compliance-Prüfung standhalten. Es läuft in der eigenen VPC, On-Prem oder vollständig air-gapped, sodass keine Anfragedaten das eigene Netz verlassen. SOC 2, HIPAA und DSGVO-Compliance, SSO sowie RBAC sind direkt integriert.

Die Modellabdeckung gehört zu den breitesten auf dieser Liste: 1.600+ Modelle über 250+ Anbieter (OpenAI, Anthropic, Gemini, Groq, Mistral) sowie selbst gehostete Backends wie vLLM, SGLang und Triton. TrueFoundry gibt eine interne Latenz von unter 3ms unter Enterprise-Last und eine Verfügbarkeit von 99,99% über 10 Milliarden+ monatliche Anfragen an, sodass die Governance-Schicht keinen Durchsatz kostet.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://<ihre-org>.truefoundry.com/api/llm",  # Ihr Gateway
    api_key="tfy-..."
)

response = client.chat.completions.create(
    model="openai/gpt-4o",  # zentral geroutet, protokolliert und rate-limitiert
    messages=[{"role": "user", "content": "Fasse diesen Vertrag zusammen"}]
)

Was TrueFoundry von Portkey oder LiteLLM unterscheidet, ist das MCP Gateway: ein zentrales Register, das steuert, wie KI-Agenten über das Model Context Protocol auf Unternehmenstools (Slack, GitHub, Confluence, Datadog) zugreifen. Interne APIs werden als MCP-Server registriert, per Okta oder Azure AD mit serverübergreifendem RBAC abgesichert, und jeder Tool-Aufruf wird auf Anfrage-Ebene nachverfolgt. Das ergibt eine einzige, verwaltete Steuerungsebene für Modell-Traffic und Agenten-Tool-Traffic — was besonders dann wichtig wird, wenn Agenten tatsächlich Aktionen ausführen und nicht nur Text generieren.

Anders als die meisten Enterprise-Gateways legt TrueFoundry seine Preise offen. Eine kostenlose Developer-Stufe deckt 50.000 Anfragen pro Monat, 3 Nutzer und das MCP Gateway für bis zu 5 Server ab, genug, um den vollen Stack zu prototypen, bevor Sie mit jemandem sprechen. Die Pro-Stufe kostet 499 $/Monat für 1 Million Anfragen, 10 Nutzer, semantisches Caching, virtuelle Modelle und erweitertes Routing, zusätzliche Nutzung wird zu transparenten Stückpreisen abgerechnet. Pro Plus kostet 2.999 $/Monat und ergänzt benutzerdefinierte Metadaten, Alerting und Monitoring-Exporte für 25 Nutzer. Enterprise wird individuell für 10 Mio.+ Anfragen kalkuliert, mit vollständigen VPC-, Multi-Region- und air-gapped-Installationen beider Ebenen (Control und Gateway). Jeder kostenpflichtige Plan enthält eine 7-tägige Testphase. Die verwaltete SaaS verursacht keine Hosting-Kosten; wenn Sie das Gateway in Ihrer eigenen Cloud betreiben (BYOC), kalkulieren Sie rund 600 bis 1.000 $ pro Monat für die zugrunde liegende Infrastruktur.

Was gut ist:

  • 1.600+ Modelle, 250+ Anbieter, plus selbst gehostete Backends (vLLM, SGLang, Triton)
  • Läuft in der eigenen VPC, On-Prem oder air-gapped; keine Daten verlassen das eigene Netz
  • SOC 2, HIPAA, DSGVO-Compliance, SSO, RBAC und Prüfprotokollierung integriert
  • Guardrails: PII-Filterung, Toxizitätserkennung, Prompt-Injection-Scanning
  • MCP Gateway steuert den Agenten-Tool-Zugriff, nicht nur Modellaufrufe
  • Öffentliche, transparente Preise mit einer wirklich kostenlosen Developer-Stufe (50K Anfragen/Monat)
  • TrueFoundry gibt ~30% durchschnittliche Kostensenkung durch Routing, Caching und Budgets an

Was nicht gut ist:

  • Enterprise-first: umfangreicher als LiteLLM oder OpenRouter für kleinere Projekte
  • Kernplattform ist proprietär (die Open-Source-Repos sind separate Infra-Tools)
  • Self-Hosting des Gateways verursacht rund 600 bis 1.000 $/Monat an Infrastruktur zusätzlich zum Plan
  • Der größte Mehrwert entsteht erst, wenn viele Teams und Tools zu steuern sind, nicht am ersten Tag

Preise: Kostenlose Developer-Stufe (0 $/Monat, 50K Anfragen, 3 Nutzer). Pro 499 $/Monat (1 Mio. Anfragen, 10 Nutzer, semantisches Caching, erweitertes Routing). Pro Plus 2.999 $/Monat (25 Nutzer, erweiterte Observability). Enterprise individuell (10 Mio.+ Anfragen, vollständig VPC und air-gapped). 7-tägige Testphase bei kostenpflichtigen Plänen; verwaltete SaaS ohne Hosting-Kosten, Self-Hosting kostet ~600-1.000 $/Monat Infrastruktur.

Fazit: TrueFoundry ist das Gateway für Unternehmen, die eine einzige, verwaltete Steuerungsebene für Modell-Traffic und Agenten-Tool-Zugriff benötigen, mit Daten ausschließlich in der eigenen Infrastruktur. Für ein Startup, das zwei Anbieter anschließt, ist es mehr als nötig — beginnen Sie dort mit LiteLLM. Für ein Plattform-Team, das KI unter Compliance-Vorgaben in Dutzende interne Teams ausrollt, gehört TrueFoundry auf die engere Auswahl.

4. OpenRouter, Am besten für Multi-Modell-Zugang ohne Setup

Modelle: 300+ | Typ: Managed SaaS | Lizenz: Proprietär

OpenRouter verfolgt den entgegengesetzten Ansatz zu LiteLLM: Sie deployen nichts. Registrieren Sie sich, erhalten Sie einen API-Schlüssel, und Sie haben sofortigen Zugang zu 300+ Modellen von allen wichtigen Anbietern über einen einzigen Endpunkt. Es ist der „App-Store" der LLM-APIs.

Das Wertversprechen ist Einfachheit. Keine zu pflegende Infrastruktur, keine YAML-Konfigurationen zu schreiben, keine Datenbanken bereitzustellen. Sie zahlen Guthaben im Voraus oder verknüpfen eine Karte, und OpenRouter übernimmt die konsolidierte Abrechnung über alle Anbieter.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="sk-or-..."
)

# Zugang zu jedem Modell von jedem Anbieter -- gleicher Code
response = client.chat.completions.create(
    model="anthropic/claude-sonnet-4-20250514",
    messages=[{"role": "user", "content": "Vergleiche LLM-Gateways"}]
)

Was gut ist:

  • 300+ Modelle, ein API-Schlüssel, ein Abrechnungs-Dashboard
  • 25+ kostenlose Modelle für Prototyping (darunter einige überraschend leistungsfähige)
  • Keine Infrastruktur zu verwalten, registrieren und sofort aufrufen
  • Modellvergleichs-Features helfen bei der Bewertung vor der Entscheidung
  • Behandelt Anbieterausfälle mit automatischem Fallback-Routing

Was nicht gut ist:

  • 5,5% Plattformgebühr zusätzlich zum Anbieterpreis, fällt bei großem Maßstab ins Gewicht
  • Keine Self-Hosting-Option, Ihre Daten laufen über OpenRouters Server
  • Begrenzte Observability im Vergleich zu dedizierten Gateway-Tools
  • Rate-Limits im kostenlosen Tarif können für Produktions-Workloads einschränkend sein
  • Keine benutzerdefinierte Routing-Logik, Sie bekommen, was OpenRouter entscheidet

Preise: Pay-per-Token (Anbieterpreis + 5,5% Gebühr). Keine monatlichen Mindestbeträge. 25+ kostenlose Modelle verfügbar.

Fazit: OpenRouter ist der schnellste Weg, auf mehrere LLM-Anbieter zuzugreifen. Wenn Sie Prototypen mit verschiedenen Modellen erstellen oder einen kleinen bis mittleren Workload ohne Infrastrukturverwaltung betreiben möchten, ist es die offensichtliche Wahl. Bei großem Maßstab beginnt die 5,5%-Gebühr zu zählen. Wenn Kostensenkung der Treiber ist, finden Sie in unserem Leitfaden zur Reduzierung der LLM-API-Kosten eine vollständige Übersicht über Caching-, Batching- und Gateway-Einsparmöglichkeiten.

5. Portkey, Beste Produktions-Guardrails

GitHub-Sterne: ~12K | Sprache: TypeScript/Node.js | Lizenz: Apache 2.0 (Gateway), managed Plattform

Portkey positioniert sich als „Control Plane für KI". Während sich LiteLLM auf Routing und OpenRouter auf Einfachheit konzentriert, ist Portkeys Differenzierungsmerkmal Produktionssicherheit: Guardrails, PII-Redaktion, Jailbreak-Erkennung und Prüfprotokolle, die in die Gateway-Schicht integriert sind.

Seit März 2026 hat Portkey sein gesamtes Gateway als Open-Source (Apache 2.0) veröffentlicht, sodass Sie das Kern-Routing und die Guardrails ohne die verwaltete Plattform selbst hosten können. Die größere Veränderung kam am 29. Mai 2026, als Palo Alto Networks die Übernahme von Portkey abgeschlossen hat und das Produkt in Prisma AIRS, seine Sicherheitsplattform für agentische KI, eingegliedert hat. Das Open-Source-Gateway erscheint weiterhin unter Apache 2.0 und die verwalteten Tarife funktionieren unverändert, aber Portkey ist kein unabhängiges KI-Infrastrukturunternehmen mehr, sondern ein Baustein in der Produktlinie eines Cybersecurity-Anbieters, was bei der Bewertung der langfristigen Roadmap-Unabhängigkeit eine Rolle spielt.

python
from portkey_ai import Portkey

portkey = Portkey(
    api_key="pk-...",
    config={
        "strategy": {"mode": "fallback"},
        "targets": [
            {"provider": "openai", "override_params": {"model": "gpt-4o"}},
            {"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
        ]
    }
)

response = portkey.chat.completions.create(
    messages=[{"role": "user", "content": "Fasse dieses Dokument zusammen"}]
)

Was gut ist:

  • Unterstützung für 1.600+ Modelle über Anbieter hinweg
  • Integrierte Guardrails: PII-Erkennung, Jailbreak-Prävention, Inhaltsfilterung
  • Prompt-Management und Versionierung innerhalb des Gateways
  • Caching-Schicht reduziert wiederholte Aufrufe (spart Geld und Latenz)
  • Prüfprotokolle und Compliance-Features für regulierte Branchen
  • Jetzt vollständig Open-Source-Gateway (März 2026)

Was nicht gut ist:

  • Managed-Plattform-Preise beginnen bei 49 $/Monat für Produktionsfeatures
  • Enterprise-Tarif (5.000–10.000 $/Monat) für erweiterte Governance
  • Die Plattform fügt Komplexität hinzu, die einfachere Gateways nicht bieten
  • Lernkurve steiler als bei LiteLLM oder OpenRouter
  • Gehört seit Mai 2026 zu Palo Alto Networks, die Roadmap richtet sich damit nach den Prioritäten eines Sicherheitsanbieters und nicht mehr allein nach denen von KI-Infrastruktur-Nutzern. Teams, die davon unabhängig bleiben wollen, schauen sich zunehmend Bifrost oder LiteLLM an, siehe den direkten Vergleich weiter unten auf dieser Seite

Preise: Das Open-Source-Gateway ist kostenlos selbst hostbar. Managed Plattform: Die Developer-Stufe ist dauerhaft kostenlos (10K Logs/Monat, 3 Tage Aufbewahrung). Production kostet 49 $/Monat (100K Logs/Monat, 30 Tage Aufbewahrung, Guardrails, RBAC, semantisches Caching, 9 $ je weitere 100K Logs). Enterprise wird individuell kalkuliert (10 Mio.+ Logs/Monat, VPC-Hosting, SOC 2 Type 2, HIPAA).

Fazit: Portkey ist nach wie vor das Gateway für Teams, die kundenseitige LLM-Features entwickeln und sich keine Prompt-Injections, PII-Lecks oder unkontrollierten Kosten leisten können, die Guardrails rechtfertigen die Komplexität. Geändert hat sich, wer dahintersteht: Seit der Übernahme durch Palo Alto Networks passt Portkey am besten zu Teams, die bereits im Prisma-AIRS-Ökosystem arbeiten oder damit gut leben können. Wenn Sie ein ebenso leistungsfähiges Open-Source-Gateway wollen, das unabhängig bleibt, lohnt sich der genauere Blick auf Bifrost.

6. Helicone, Beste Wahl für Observability-fokussierte Teams

GitHub-Sterne: ~6K | Sprache: Rust | Lizenz: Apache 2.0

Helicone begann als Observability-Tool und entwickelte sich zu einem vollständigen Gateway. Diese Herkunft ist wichtig, seine Überwachungs- und Analysefunktionen sind erstklassig, und die Gateway-Features (Routing, Caching, Failover) wurden auf einer soliden Observability-Grundlage aufgebaut.

Die Implementierung in Rust bietet einen echten Leistungsvorteil: P50-Latenz von 8ms, P95 unter 5ms, rund 3.000 RPS auf einer einzigen Instanz mit nur 64 MB Speicher.

Eines sollten Sie wissen, bevor Sie sich festlegen: Mintlify hat Helicone übernommen, im März 2026, und das Team ist nach San Francisco gezogen, um dort an Mintlifys Produkt für Dokumentation und Agenten-Kontext zu arbeiten. Helicones eigene Ankündigung ist deutlich, was das bedeutet: Die Plattform bleibt online und erhält weiterhin Sicherheits-Patches, Bugfixes und Unterstützung für neue Modelle, aber darüber hinaus gibt es keine Roadmap für neue Features. Wenn Sie ein Gateway brauchen, das aktiv weiterentwickelt wird, sollten Sie das abwägen, bevor Sie sich darauf standardisieren.

python
# Helicone: Ein-Zeilen-Proxy -- ändern Sie einfach die Basis-URL
from openai import OpenAI

client = OpenAI(
    base_url="https://oai.helicone.ai/v1",  # oder Ihre selbst gehostete URL
    api_key="sk-...",
    default_headers={
        "Helicone-Auth": "Bearer hlc-..."
    }
)

# Alle Anfragen werden nun protokolliert, verfolgt und über Helicone weitergeleitet
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Analysiere diesen Code"}]
)

Was gut ist:

  • Rust-basiert: ~64 MB Speicher, P95 <5ms Latenz, 3.000 RPS pro Instanz
  • Gesundheitsbewusstes Load-Balancing leitet zum schnellsten verfügbaren Anbieter weiter
  • Echtzeit-Dashboards für Kosten, Latenz, Token-Nutzung und Fehlerraten
  • Ein-Zeilen-Integration, einfach die Basis-URL ändern
  • Single-Binary-Deployment (Docker, K8s, Bare Metal)

Was nicht gut ist:

  • Seit der Mintlify-Übernahme (März 2026) im Wartungsmodus: nur noch Sicherheits- und Fehlerkorrekturen, keine neuen Features und keine Roadmap
  • Observability-Features sind der Star; Routing weniger ausgereift als bei LiteLLM
  • Weniger unterstützte Anbieter als LiteLLM oder OpenRouter
  • Community kleiner als LiteLLM (6K vs. 54K GitHub-Sterne)
  • Erweiterte Features (benutzerdefinierte Eigenschaften, Sitzungen) erfordern die Managed-Plattform

Preise: Open-Source und kostenlos zum Self-Hosting. Managed Plattform: Hobby ist kostenlos (10K Anfragen/Monat, 1 GB Speicher, 7 Tage Aufbewahrung, 1 Sitzplatz). Pro kostet 79 $/Monat (unbegrenzte Sitzplätze, 1 Monat Aufbewahrung, Alerts, Reports, HQL). Team kostet 799 $/Monat (3 Monate Aufbewahrung, SOC 2, HIPAA, eigener Slack-Kanal). Enterprise wird individuell kalkuliert (On-Prem, SAML SSO, Mengenrabatte).

Wenn Sie Observability-Tools umfassender bewerten, deckt unsere Rangliste der besten KI-Observability-Plattformen Helicone neben Langfuse, Arize und anderen ab.

Fazit: Helicone ist weiterhin das beste Gateway für Teams, deren Hauptproblem ist, „wir können nicht sehen, was mit unseren LLM-Aufrufen passiert", und das bestehende Produkt verschwindet nicht. Gehen Sie nur mit dem Wissen hinein, dass Sie ein Tool im Wartungsmodus einführen: für Observability heute völlig in Ordnung, riskanter, wenn Sie darauf setzen, dass im nächsten Jahr neue Gateway-Features erscheinen.

7. Bifrost, Beste rohe Performance

GitHub-Sterne: ~6,6K | Sprache: Go | Lizenz: Apache 2.0

Bifrost ist der Leistungs-Champion. Von Maxim AI in Go gebaut, behauptet es eine 50-fach schnellere Performance als LiteLLM mit nur 11 Mikrosekunden Overhead pro Anfrage bei 5.000 RPS. Das sind keine theoretischen Zahlen, sie stammen aus reproduzierbaren Dauerlasttests. Das Projekt hat seine GitHub-Sterne seit unserer letzten Prüfung mehr als verdreifacht, von rund 2.000 auf 6.600, und dieses Wachstum deckt sich mit einem echten Feature-Schub: Bifrost hat ein eigenes MCP Gateway mit einem „Code Mode" veröffentlicht, um zu steuern, wie Agenten externe Tools aufrufen, also genau die Funktionskategorie, die früher allein TrueFoundry und Portkey vorbehalten war.

Der architektonische Unterschied ist grundlegend: Gos Goroutinen verarbeiten Tausende gleichzeitiger Verbindungen ohne Pythons GIL-Engpass, und die kompilierte Binärdatei eliminiert den Interpreter-Overhead vollständig.

yaml
# bifrost.yaml
account:
  provider: openai
  api_key: ${OPENAI_API_KEY}

models:
  - name: gpt-4o
    provider: openai
  - name: claude-sonnet-4-20250514
    provider: anthropic

routing:
  strategy: round-robin
  fallback: true

Was gut ist:

  • 11µs Overhead bei 5.000 RPS, niedrigster aller Gateways auf dieser Liste
  • Go-Binärdatei: keine Laufzeitabhängigkeiten, winziger Speicherabdruck
  • Adaptives Load-Balancing über Anbieter
  • Cluster-Modus für horizontale Skalierung
  • 1.000+ Modelle unterstützt
  • MCP Gateway mit Code Mode direkt in der kostenlosen OSS-Stufe, dazu Budget-Verwaltung über virtuelle Schlüssel, semantisches Caching und OpenTelemetry-native Observability, alles inklusive und nicht hinter Enterprise gesperrt

Was nicht gut ist:

  • Neueres Projekt, kleinere Community als LiteLLM (6,6K vs. 54K GitHub-Sterne) und weniger Integrationen von Drittanbietern
  • Guardrails für Inhaltssicherheit (PII-Filterung, Jailbreak-Erkennung) erfordern die Enterprise-Stufe; Portkey liefert vergleichbare Guardrails bereits im kostenlosen OSS-Gateway mit
  • Gebaut von Maxim AI (einem Anbieter), zukünftige Richtung an deren Roadmap gebunden
  • Dokumentation dünner als LiteLLMs umfangreiche Docs
  • SSO (SAML/OIDC) und RBAC gibt es nur in der Enterprise-Stufe, kleine Teams bekommen also die Performance, aber nicht die Zugriffskontrollen

Preise: Das OSS-Gateway ist dauerhaft kostenlos (Apache 2.0) und deckt Routing, Failover, MCP Gateway, semantisches Caching und Budget-Verwaltung über virtuelle Schlüssel ab. Enterprise wird individuell kalkuliert (Demo-Termin nötig) und ergänzt Guardrails, Cluster-Modus, SAML/OIDC-SSO, RBAC, Audit-Logs und SLA-gestützten Support; eine 14-tägige kostenlose Testphase ist verfügbar.

Fazit: Bifrost ist für Teams, die Hochdurchsatz-Produktionssysteme betreiben, bei denen Gateway-Overhead eine Rolle spielt, und es hat sich zu einer der stärkeren Portkey-Alternativen entwickelt, seit die kostenlose Stufe MCP-Governance und Budget-Kontrollen enthält, für die anderswo eine kostenpflichtige Plattform nötig war. Wenn Sie Tausende von LLM-Aufrufen pro Sekunde verarbeiten und dabei auf Open-Source-Infrastruktur ohne drohende Übernahme setzen wollen, liefert Bifrosts Go-Architektur. Für die meisten Teams ist LiteLLMs 8ms Overhead völlig in Ordnung, und wenn Sie integrierte Guardrails für Inhaltssicherheit heute brauchen statt erst in der Enterprise-Stufe, hat Portkeys OSS-Gateway weiterhin die Nase vorn, genau dieser Kompromiss ist der Kern des Vergleichs weiter unten.

8. Cloudflare AI Gateway, Beste Zero-Infrastruktur-Option

Typ: Managed Service | Lizenz: Proprietär (Cloudflare)

Cloudflare AI Gateway treibt den „Sie verwalten nichts"-Ansatz auf die Spitze. Wenn Sie bereits auf Cloudflare sind (und viele Teams sind es), können Sie AI Gateway über das Dashboard aktivieren und LLM-Aufrufe über Cloudflares Edge-Netzwerk ohne zusätzliche Infrastruktur weiterleiten.

javascript
// Präfigieren Sie einfach Ihre Anbieter-URL mit Cloudflares Gateway-Endpunkt
const response = await fetch(
  "https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer sk-...",
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      model: "gpt-4o",
      messages: [{ role: "user", content: "Hallo" }]
    })
  }
);

Was gut ist:

  • Kostenloser Tarif mit 100.000 Logs/Monat, ausreichend für die meisten Nebenprojekte
  • Keine Infrastruktur: direkt über das Cloudflare-Dashboard aktivieren
  • Integriertes Caching am Edge (reduziert Kosten und Latenz)
  • Rate-Limiting und Analytics inklusive
  • Einheitliche Abrechnung: LLM-Anbieterkosten über Cloudflare bezahlen
  • Globales Edge-Netzwerk reduziert Latenz für geografisch verteilte Benutzer

Was nicht gut ist:

  • Eng an das Cloudflare-Ökosystem gebunden, Wechselkosten sind real
  • Begrenzte Routing-Intelligenz im Vergleich zu dedizierten Gateways
  • 100.000 Log-Limit im kostenlosen Tarif; Workers-Paid-Abo für 1 Million
  • Weniger unterstützte Anbieter als LiteLLM oder OpenRouter
  • Keine Self-Hosting-Option

Preise: Kostenlos (100.000 Logs/Monat), Workers Paid Abo für 1 Million Logs. Keine Gebühr pro Anfrage. Sie bezahlen LLM-Anbieter weiterhin separat.

Für Teams, die Function Calls über Anbieter weiterleiten, kann Cloudflares Edge-Caching die Latenz für wiederholte Tool-Nutzungsmuster deutlich reduzieren.

Fazit: Cloudflare AI Gateway ist die beste Option, wenn Sie bereits auf Cloudflare sind und Gateway-Features wünschen, ohne etwas Neues zu deployen. Der kostenlose Tarif ist großzügig für kleine Projekte. Für ernsthafte Produktionsnutzung bieten dedizierte Gateways mehr Kontrolle.

9. Kong AI Gateway, Beste Wahl für API-Management-Teams

GitHub-Sterne: ~44K (Kong Gateway gesamt) | Sprache: Lua/OpenResty | Lizenz: Apache 2.0 (Community)

Kong AI Gateway ist kein eigenständiges Produkt, es ist eine Erweiterung von Kongs bewährtem API-Gateway, das LLM-spezifische Fähigkeiten hinzufügt. Wenn Ihre Organisation bereits Kong für das API-Management betreibt, ist das Hinzufügen von KI-Routing eine Plugin-Installation, keine neue Plattform.

yaml
# Kong deklarative Konfiguration (deck)
services:
  - name: ai-llm-service
    url: https://api.openai.com
    plugins:
      - name: ai-proxy
        config:
          route_type: llm/v1/chat
          model:
            provider: openai
            name: gpt-4o
      - name: ai-rate-limiting-advanced
        config:
          limit: [10000]
          window_size: [60]
          window_type: fixed
          strategy: local
          limit_by: consumer

Was gut ist:

  • Baut auf Kongs ausgereifter API-Management-Plattform auf (von Tausenden von Unternehmen genutzt)
  • Semantisches Routing: leitet Anfragen basierend auf Prompt-Inhalt/-Absicht weiter
  • Token-basiertes Rate-Limiting (nicht nur anfragenbasiert)
  • Plugin-Ökosystem: Auth, Rate-Limiting, Transformationen funktionieren alle mit KI-Routen
  • OpenTelemetry + Prometheus Metriken für Datadog/Grafana-Integration

Was nicht gut ist:

  • Überdimensioniert, wenn Sie Kong nicht bereits verwenden, steile Lernkurve
  • Enterprise-KI-Features erfordern Kong Enterprise-Lizenz (kostenpflichtig)
  • Konfigurationskomplexität höher als bei jedem anderen Gateway auf dieser Liste
  • Erfordert Kong-Infrastruktur-Kenntnisse (oder das Team muss es lernen)
  • KI-spezifische Features sind neuer und weniger ausgereift als Kongs Kern

Preise: Community Edition kostenlos (Open-Source). Enterprise-KI-Features erfordern ein Kong Enterprise-Abonnement (individuelle Preisgestaltung).

Fazit: Kong AI Gateway macht Sinn, wenn und nur wenn Ihre Organisation bereits Kong betreibt. KI-Routing zu Ihrer bestehenden API-Management-Schicht hinzuzufügen ist klüger als ein separates Gateway zu deployen. Aber adoptieren Sie Kong nicht nur für LLM-Routing, das ist wie einen Traktor zu kaufen, um Ihren Rasen zu mähen.

10. TensorZero, Bestes ML-optimiertes Routing (inzwischen eingestellt)

GitHub-Sterne: ~11,7K | Sprache: Rust | Lizenz: Apache 2.0 (archiviert, nicht mehr gepflegt)

Update: TensorZero wurde im Juni 2026 eingestellt. Die Maintainer haben das Repository am 12. Juni 2026 archiviert, die aktive Entwicklung beendet und verbliebenes Risikokapital an die Investoren zurückgegeben, nachdem sie zu dem Schluss gekommen waren, für ein Open-Source-Projekt und ein kommerzielles Produkt zugleich keinen Product-Market-Fit zu finden. Wir belassen diesen Eintrag hier, weil die Ideen weiterhin lehrreich sind und der Code unter Apache 2.0 forkbar bleibt, aber setzen Sie ihn nicht für ein neues Produktionssystem ein, es wird keine Sicherheits-Patches, keine Aktualisierungen für Anbieter-APIs und keinen Support geben, wenn etwas kaputtgeht.

TensorZero war das meinungsstärkste Gateway auf dieser Liste. Während andere sich auf Routing und Observability konzentrieren, baute TensorZero eine Optimierungsschleife auf: Es sammelte Inferenzdaten, führte Evaluierungen durch und nutzte die Ergebnisse zur Verbesserung von Routing-Entscheidungen im Laufe der Zeit. Stellen Sie es sich als Gateway vor, das lernt, welches Modell am besten für welche Art von Anfrage geeignet ist.

Die Rust-Implementierung liefert Sub-Millisekunden-P99-Latenz, sogar bei über 10.000 QPS. Das ist kein Tippfehler. Wo LiteLLM ~8ms und Bifrost ~11µs hinzufügen, behauptet TensorZero <1ms P99 unter extremer Last.

python
# TensorZero: Strukturierte Inferenz mit Optimierung
from tensorzero import TensorZeroGateway

with TensorZeroGateway("http://localhost:3000") as client:
    response = client.inference(
        function_name="generate_summary",
        input={
            "messages": [
                {"role": "user", "content": "Fasse diesen Artikel zusammen..."}
            ]
        }
    )

    # Später: Qualitätsdaten zurückgeben zur Verbesserung des Routings
    client.feedback(
        metric_name="summary_quality",
        inference_id=response.inference_id,
        value=0.92
    )

Was gut ist:

  • <1ms P99-Latenz bei 10.000+ QPS (schnellste rohe Performance mit Rust)
  • Feedback-Schleife: lernt, welche Modelle für jede Funktion am besten abschneiden
  • Strukturierte Inferenz mit Schema-Validierung
  • A/B-Tests zwischen Modellen direkt im Gateway eingebaut
  • Integriertes Evaluierungs-Framework

Was nicht gut ist:

  • Seit Juni 2026 eingestellt: Repository archiviert und schreibgeschützt, keine künftigen Updates, Sicherheits-Patches oder Support
  • Steilere Lernkurve als jedes andere Gateway, Sie definieren „Funktionen", nicht nur Modelle
  • Erfordert ein Umdenken Ihrer LLM-Integration um TensorZeros Funktionskonzept
  • Weniger „Drop-in" als LiteLLM oder OpenRouter, kein einfacher Basis-URL-Tausch
  • Dokumentation auf ihrem letzten Stand eingefroren, sie wird nicht mehr weiter verbessert

Preise: Kostenlos und Open-Source (Apache 2.0), forkbar und in Eigenregie pflegbar, aber es gibt keinen Anbieter mehr, den Sie für Support bezahlen könnten, selbst wenn Sie wollten.

Für Teams, die bereits LLM-Evaluierungen durchführen, war TensorZeros Feedback-Schleife ein wirklich nützlicher Weg, die Lücke zwischen Evaluierung und Routing zu schließen, Eval-Scores verbesserten direkt, welche Modelle geroutet wurden. Diese Idee lohnt sich nachzubauen, auch wenn das Tool selbst verschwunden ist.

Fazit: TensorZero war für ML-Engineering-Teams gedacht, die wollten, dass ihr Gateway mit der Zeit klüger wird, und die Optimierungsschleife war wirklich innovativ. Da das Projekt eingestellt ist, können wir es für nichts Neues mehr empfehlen, nehmen Sie stattdessen LiteLLM, Bifrost oder Portkey und bauen Sie die Evaluierungs-Rückkopplung in Ihre eigene Pipeline ein. Wenn Sie TensorZero bereits in Produktion betreiben, funktioniert der Code weiterhin, planen Sie nur Zeit für die Migration ein, bevor Sie auf eine Anbieter-API-Änderung stoßen, die er nicht mehr verkraftet.

LLM-Gateway-Latenz-Overhead: Die echten Zahlen

Jedes Gateway fügt Ihren LLM-Aufrufen etwas Overhead hinzu. Die Frage ist, ob es für Ihren Anwendungsfall wichtig ist. So schneiden die Gateways in unserem Test ab:

GatewaySpracheP50-Latenz-OverheadP95-Latenz-OverheadDurchsatz (einzelne Instanz)
BifrostGo~8µs~11µs5.000+ RPS
TensorZero‡Rust~0,3ms<1ms10.000+ QPS
HeliconeRust~5ms~8ms~3.000 RPS
TrueFoundrySelf-hosted~3ms†<3ms†10 Mrd.+/Monat (Anbieterangabe)
LiteLLMPython~4ms~8ms~1.000 RPS
PortkeyTypeScript~5ms~12ms~2.000 RPS
OpenRouterManaged~15–30ms~50msk. A. (managed)
Merge GatewayManagednicht unabhängig getestet§nicht unabhängig getestet§k. A. (managed)
Cloudflare AI GWManaged~10–20ms~40msk. A. (managed)
Kong AI GatewayLua/Go~3ms~8ms~3.000 RPS

† Der Wert unter 3ms von TrueFoundry ist eine Anbieterangabe; wir haben das Tool nicht demselben unabhängigen Lasttest wie die selbst gehosteten Open-Source-Gateways unterzogen.

‡ Das TensorZero-Projekt wurde im Juni 2026 archiviert (siehe den Eintrag weiter oben); seine Latenzwerte sind historisch und lassen sich nicht mehr unabhängig gegen einen aktiv gepflegten Build überprüfen.

§ Merge Gateway startete nach unserem Lasttest-Durchlauf, wir haben es also nicht auf demselben Prüfstand wie die übrigen gemessen — und wir veröffentlichen keine Zahl, die wir nicht selbst erhoben haben. Rechnen Sie bis dahin mit einem Overhead im Bereich von OpenRouter und Cloudflare (grob 10-30ms P50).

Kontext ist wichtig. Ein typischer GPT-4o-Aufruf dauert je nach Ausgabelänge 500–3.000ms. Selbst LiteLLMs 8ms Overhead sind weniger als 1% der Gesamtlatenz. Das einzige Szenario, in dem Gateway-Overhead eine Rolle spielt, sind hochfrequente, latenzarme Workloads wie Echtzeit-Klassifizierung oder Embedding-Generierung im großen Maßstab. Für konversationelle KI oder Content-Generierung ist jedes Gateway auf dieser Liste schnell genug.

Die verwalteten Gateways (OpenRouter, Cloudflare und Merge Gateway) fügen mehr Overhead hinzu, da Ihre Anfrage ihre Server erreicht, bevor sie den Anbieter erreicht. Self-hosted Gateways laufen neben Ihrer Anwendung, sodass der zusätzliche Hop lokal ist.

Bifrost vs. Portkey: Welches Open-Source-LLM-Gateway sollten Sie wählen?

Wenn Sie wörtlich nach „Open-Source-LLM-Gateway" gesucht haben, hier der ehrliche Zustand dieser Kategorie Mitte 2026: Fünf der neun Tools in diesem Überblick erscheinen als Open-Source-Software, die Sie heute selbst hosten können. LiteLLM (MIT) und Bifrost (Apache 2.0) sind vollständig Open Source, ohne kostenpflichtig gesperrte Kernfunktionen. Portkeys Gateway steht seit März 2026 unter Apache 2.0, die verwaltete Plattform drumherum ist allerdings proprietär. Helicone (Apache 2.0) ist Open Source, nach der Mintlify-Übernahme aber im Wartungsmodus. Kongs Basis-Gateway ist Open Source, die für LLM-Routing entscheidenden KI-Plugins liegen jedoch hinter Kong Enterprise. TensorZero war ebenfalls Open Source, das Projekt ist jedoch eingestellt, weshalb wir es nicht mehr als aktive Option zählen. TrueFoundry, weiter oben behandelt, geht einen anderen Weg: Self-hosted-Deployment einer proprietären Steuerungsebene statt einer quelloffenen Codebasis.

Damit bleiben Bifrost und Portkey als die beiden meistgesuchten Open-Source-Optionen, und sie haben sich seit unserer letzten Prüfung auseinanderentwickelt. So vergleichen sie sich tatsächlich:

KriteriumBifrostPortkey
TrägerMaxim AI (unabhängig)Palo Alto Networks (Übernahme Mai 2026)
Lizenz des Kern-GatewaysApache 2.0, vollständig Open SourceApache 2.0 (nur Gateway; Plattform proprietär)
SpracheGoTypeScript/Node.js
P95-Latenz-Overhead~11µs~12ms
GitHub-Sterne~6,6K~12K
Guardrails für Inhaltssicherheit (PII, Jailbreak-Erkennung)nur Enterprise-Stufeim kostenlosen OSS-Gateway enthalten
MCP-/Agenten-Tool-GovernanceMCP Gateway mit Code Mode, im OSS enthaltenkein zentrales Feature
SSO / RBACnur Enterprise-Stufeab Production-Stufe (49 $/Monat)
Roadmap-Unabhängigkeitunabhängiger Anbieterjetzt Teil von Prisma AIRS

Wenn Sie nach einer „Bifrost-Alternative" suchen, weil Sie Produktions-Guardrails wollen, ohne für Bifrost Enterprise zu zahlen: Portkeys kostenloses Open-Source-Gateway bringt PII-Redaktion und Jailbreak-Erkennung von Haus aus mit, das ist die größte funktionale Lücke zwischen den beiden. LiteLLM ist die andere häufige Wahl und tauscht Bifrosts rohe Geschwindigkeit gegen die längste Anbieterliste und die größte Community.

Wenn Sie nach „Portkey-Alternativen" suchen, weil die Übernahme durch Palo Alto Networks Ihre Risikobewertung verändert (ein durchaus nachvollziehbares Anliegen, wenn Ihre Infrastruktur-Roadmap unabhängig von den Prioritäten eines Cybersecurity-Anbieters bleiben soll), sind das Ihre besten Optionen, in dieser Reihenfolge: Bifrost, wenn roher Durchsatz und MCP-Governance wichtiger sind als sofort einsatzbereite Guardrails; LiteLLM, wenn Sie das größte Ökosystem wollen und mit Pythons Latenzprofil leben können; und TrueFoundry (weiter oben behandelt), wenn Sie ausdrücklich SOC-2-, HIPAA- und DSGVO-Compliance bei einem Anbieter brauchen, der nicht Portkey ist. Helicone ist ebenfalls Open Source, taugt wegen des Wartungsmodus aber eher für Observability als für ein Gateway, von dem Sie Weiterentwicklung erwarten.

Weder Bifrost noch Portkey ist objektiv „besser", es hängt davon ab, ob Sie Guardrails sofort wollen oder Governance plus Geschwindigkeit mit etwas mehr Einrichtungsaufwand.

Das richtige LLM-Gateway auswählen

Vergessen Sie die Feature-Matrizen. Hier ist die Entscheidung in einer Tabelle:

Wenn Sie brauchen...Wählen SieWarum
Maximale Flexibilität + self-hostedLiteLLM100+ Anbieter, größte Community, die meisten Integrationen
Routing im Enterprise-Maßstab + KostenkontrolleMerge GatewayRouting-Richtlinien nach Kunde oder Feature, Budgetgrenzen, Kostenzuordnung auf Request-Ebene
Enterprise Governance + DatensouveränitätTrueFoundryLäuft in der eigenen VPC, SOC 2/HIPAA/DSGVO, MCP Gateway für Agenten-Tools
Schneller Multi-Modell-Zugang, kein BetriebOpenRouterRegistrieren und 300+ Modelle aufrufen
Produktions-Guardrails + CompliancePortkeyPII-Redaktion, Jailbreak-Erkennung, Prüfprotokolle (jetzt Teil von Prisma AIRS von Palo Alto Networks)
Observability als PrioritätHeliconeBeste Überwachung, Rust-Performance, Ein-Zeilen-Setup (seit März 2026 im Wartungsmodus)
Geringstmögliche Latenz + MCP-Governance in Open SourceBifrost11µs Overhead in Go, Cluster-Modus, MCP Gateway in der kostenlosen Stufe enthalten
Bereits auf CloudflareCloudflare AI GWKostenlos, Edge-Caching, keine neue Infrastruktur
Bereits Kong im EinsatzKong AI GWLLM-Routing zum bestehenden API-Management hinzufügen
ML-gesteuertes Routing-OptimierungTensorZeroIm Juni 2026 eingestellt, der Code ist forkbar, aber für neue Projekte keine sichere Wahl mehr

Hinweis zu Self-hosted vs. Managed: Self-hosted Gateways (LiteLLM, Helicone, Bifrost) geben Ihnen volle Kontrolle über den Datenfluss, nichts verlässt Ihre Infrastruktur außer dem eigentlichen LLM-API-Aufruf. Das ist wichtig für Gesundheitswesen, Finanzen und jeden Kontext, in dem Datenspeicherort eine harte Anforderung ist. Managed Gateways (OpenRouter, Cloudflare und Merge Gateway) tauschen diese Kontrolle gegen null Betriebsaufwand. Portkey und Kong liegen dazwischen, Open-Source-Gateways mit optionalen verwalteten Plattformen. Teams mit strikten Datenanforderungen kombinieren manchmal ein selbst gehostetes Gateway mit lokal laufenden LLMs, damit kein Aufruf ihre Infrastruktur verlässt.

Für die meisten Teams läuft die Entscheidung auf zwei Fragen hinaus:

  1. Möchten Sie self-hosten? Ja -> LiteLLM. Nein -> OpenRouter zum Prototyping, Merge Gateway sobald es produktiv läuft.
  2. Benötigen Sie Guardrails? Ja -> Portkey. Nein -> bei no. 1 bleiben.

Wenn Sie RAG-Anwendungen entwickeln, die mehrere Anbieter für Embeddings und Completions aufrufen, ist ein Gateway praktisch unverzichtbar. Das gleiche gilt für Apps, die strukturierte Ausgaben über verschiedene Anbieter hinweg benötigen, Gateways normalisieren das Antwortformat, sodass Ihre Parse-Logik nicht bricht, wenn Sie Modelle wechseln.

Ein Tool auszuwählen ist der einfache Teil. Es zuverlässig in einem echten Produkt zum Laufen zu bringen, daran scheitern die meisten Teams, und genau das baut unser KI-Integrationsteam für Kunden, von RAG-Pipelines bis zu individuellen Agenten. Sie möchten eine zweite Meinung zu Ihrem Stack? Fordern Sie eine kostenlose Beratung an.

Häufig gestellte Fragen

Was ist der Unterschied zwischen einem LLM-Gateway, Proxy und Router?

Ein Proxy leitet Anfragen weiter und fügt Protokollierung hinzu. Ein Router wählt das beste Modell/den besten Anbieter für jede Anfrage. Ein Gateway kombiniert beides mit Kostenverfolgung, Caching, Guardrails und Observability. In der Praxis machen die meisten „Gateway"-Tools alle drei, die Begriffe werden austauschbar verwendet.

Ist LiteLLM wirklich kostenlos?

Der Open-Source-Proxy ist vollständig kostenlos (MIT-Lizenz). Sie zahlen für Ihr eigenes Hosting (ein 5 $/Monat-VPS reicht für leichte Nutzung) und die LLM-Anbieter-API-Kosten. BerriAI bietet Enterprise-Pläne für Teams an, die verwaltetes Hosting, SSO und Support wünschen.

Fügt OpenRouter erhebliche Latenz hinzu?

Minimal. OpenRouter fügt einen kleinen Routing-Overhead hinzu (typischerweise <50ms) zuzüglich der geografischen Entfernung zwischen Ihnen und deren Servern. Für die meisten Anwendungen ist der Unterschied vernachlässigbar. Für latenzkritische Systeme, die Tausende von Anfragen pro Sekunde verarbeiten, ist eine Self-hosted-Option wie Bifrost besser.

Kann ich mehrere Gateways zusammen verwenden?

Ja, und einige Teams tun das. Ein gängiges Muster ist die Verwendung von OpenRouter für schnelles Prototyping und der Wechsel zu LiteLLM für die Produktion. Oder die Verwendung von Helicone als Observability-Schicht vor dem Routing von LiteLLM. Achten Sie nur auf die Stapelung von Latenz.

Welches Gateway hat das beste Caching?

Portkey und Cloudflare AI Gateway haben die ausgereiftesten Caching-Implementierungen. Portkey bietet semantisches Caching (unscharfes Matching ähnlicher Prompts), während Cloudflare sein globales Edge-Netzwerk für geografisches Caching nutzt. LiteLLM unterstützt Redis-basiertes Caching. Für einen tieferen Blick auf Caching-Strategien, lesen Sie unseren LLM-Prompt-Caching-Leitfaden.

Brauche ich ein Gateway, wenn ich nur einen LLM-Anbieter verwende?

Wahrscheinlich nicht für Routing. Aber Sie möchten möglicherweise trotzdem eines für Observability (Helicone), Kostenverfolgung (LiteLLM) oder Guardrails (Portkey). Die Kostenverfolgung und Protokollierungsfunktionen allein können ein Gateway rechtfertigen, selbst bei einem einzigen Anbieter.

Wie gehen Gateways mit Streaming-Antworten um?

Alle Gateways auf dieser Liste unterstützen Server-Sent Events (SSE) Streaming. Das Gateway leitet den Stream vom Anbieter mit minimalem Puffern an Ihren Client weiter. Der Latenz-Impact auf Streaming ist generell geringer als bei Nicht-Streaming-Anfragen, da der Overhead pro Verbindung und nicht pro Token anfällt.

Was passiert, wenn ein Anbieter ausfällt?

Die meisten Gateways unterstützen Fallback-Ketten. Sie konfigurieren einen primären Anbieter und einen oder mehrere Fallbacks. Wenn der primäre Anbieter Fehler zurückgibt oder Latenz-Schwellenwerte überschreitet, leitet das Gateway automatisch zum nächsten Anbieter weiter. LiteLLM, Portkey und Helicone handhaben dies alle gut. OpenRouter macht es automatisch im Hintergrund.

Können Gateways Kostenlimits durchsetzen?

Ja. LiteLLM hat integrierte Budget-Kontrollen pro Team, Benutzer oder API-Schlüssel. Portkey verfolgt Ausgaben in Echtzeit mit Warnmeldungen. Kong unterstützt Token-basierte Quoten. Cloudflare bietet Nutzungsanalysen. Dies ist tatsächlich eines der stärksten Argumente für die Verwendung eines Gateways, ohne eines kann eine einzelne außer Kontrolle geratene Schleife Ihr API-Budget über Nacht verbrennen.

Welches Gateway ist am besten für Startups vs. Unternehmen?

Startups: OpenRouter (kein Setup) oder LiteLLM (kostenlos, flexibel). Unternehmen: TrueFoundry (Datensouveränität, SOC 2/HIPAA/DSGVO, steuert Modell- und Agenten-Tool-Traffic über das MCP Gateway), Portkey (Guardrails, Compliance, Prüfprotokolle) oder Kong AI Gateway (wenn Kong bereits verwendet wird). Die wichtigsten Enterprise-Differenzierer sind SSO, rollenbasierter Zugang, Datenspeicherort-Kontrollen und Prüfprotokollierung, Features, die Startups noch nicht benötigen, aber Unternehmen nicht überspringen können.

Was ist der beste LLM-Proxy?

LiteLLM ist für die meisten Teams der beste LLM-Proxy. Er läuft als eigenständiger Docker-Container, kapselt 100+ Anbieter hinter einem OpenAI-kompatiblen Endpunkt und ist vollständig kostenlos zum Self-Hosting. Wenn „Proxy" bedeutet, dass Sie null Infrastruktur wünschen, fungiert OpenRouter als cloud-gehosteter Proxy mit 300+ Modellen auf einem einzigen API-Schlüssel. Der Unterschied liegt in der Kontrolle: LiteLLM hält Ihre Daten auf Ihren Servern; OpenRouter leitet sie durch deren Plattform.

Was ist der Unterschied zwischen einem LLM-Gateway und einem LLM-Router?

Ein LLM-Router wählt aus, welches Modell oder welcher Anbieter eine bestimmte Anfrage bearbeitet, typischerweise basierend auf Kosten, Latenz oder Prompt-Inhalt. Ein LLM-Gateway tut das und mehr: Es ergänzt Kostenverfolgung, Caching, Guardrails, Rate-Limiting und Observability zusätzlich zur Routing-Schicht. Alle Tools auf dieser Liste sind technisch gesehen Gateways. Reine Router (Tools, die nur Modellauswahl ohne andere Middleware durchführen) sind in der Produktion selten, da Teams fast immer zumindest Protokollierung neben dem Routing benötigen.

Portkey vs. Bifrost: Was sollte ich 2026 wählen?

Wählen Sie Bifrost, wenn rohe Latenz und MCP-basierte Governance für Agenten-Tools am wichtigsten sind, seine Go-Architektur fügt 11 Mikrosekunden Overhead hinzu gegenüber Portkeys ~12ms, und Bifrosts kostenlose OSS-Stufe bringt inzwischen ein MCP Gateway mit Code Mode mit. Wählen Sie Portkey, wenn Sie Guardrails für Inhaltssicherheit (PII-Redaktion, Jailbreak-Erkennung) sofort einsatzbereit brauchen, ohne für eine Enterprise-Stufe zu zahlen, denn Bifrost sperrt genau diese hinter seinem kostenpflichtigen Tarif. Der weitere Faktor: Portkey wurde im Mai 2026 von Palo Alto Networks übernommen und sitzt nun in dessen Sicherheitsplattform Prisma AIRS, während Bifrost ein unabhängiges Open-Source-Projekt von Maxim AI bleibt. Keines ist strikt besser, es ist Geschwindigkeit plus Unabhängigkeit gegen Guardrails plus finanzstarken Träger.

Was sind die besten Portkey-Alternativen, jetzt wo Palo Alto Networks Eigentümer ist?

Die stärksten unabhängigen Alternativen sind Bifrost (am schnellsten, jetzt mit eigenem MCP Gateway, wobei Guardrails Enterprise erfordern), LiteLLM (breiteste Anbieterabdeckung und größte Community, falls Sie keine integrierten Guardrails benötigen) und TrueFoundry (vergleichbare Enterprise-Governance und Compliance-Zertifizierungen, weiterhin ein unabhängiger Anbieter). Helicone ist ebenfalls Open Source, befindet sich aber seit der Übernahme durch Mintlify im März 2026 im Wartungsmodus und eignet sich daher eher für Observability als für einen zukunftssicheren Gateway-Ersatz.

Tags

llm-gatewayllm-proxyllm-routerlitellmopenroutermerge-gatewayai-infrastructure

Diesen Artikel teilen

Ihr Projekt starten

Bereit, etwas Außergewöhnliches zu bauen?

Machen wir aus Ihrer Vision ein fertiges Produkt. Unser Team baut mit Ihnen Software, die spürbar etwas bewegt.