ai-machine-learning

Smetti di Gestire Più Chiavi API LLM: 10 Gateway Classificati per il 2026

Scritto da Mert Batur
Aggiornato Jul 25, 2026
36 lettura
Smetti di Gestire Più Chiavi API LLM: 10 Gateway Classificati per il 2026

I migliori 10 strumenti LLM Gateway, classificati: Accedi a qualsiasi modello tramite un'unica API [2026]

Ultimo aggiornamento: 19 luglio 2026. Abbiamo riverificato i prezzi e i conteggi di stelle GitHub per tutti i 9 gateway e aggiunto due cambi di proprietà che contano se stai scegliendo un gateway oggi: Palo Alto Networks ha completato l'acquisizione di Portkey il 29 maggio 2026, integrandolo nella piattaforma di sicurezza Prisma AIRS, e Mintlify ha acquisito Helicone a marzo 2026, portando il suo prodotto cloud in modalità di manutenzione. Abbiamo inoltre scoperto che i manutentori di TensorZero hanno archiviato il progetto a giugno 2026, quindi lo segnaliamo di seguito invece di far finta che sia ancora una scelta valida. Bifrost è passato da circa 2.000 a 6.600 stelle GitHub dal nostro ultimo controllo e ha rilasciato un proprio MCP Gateway, colmando buona parte del divario di governance con Portkey e TrueFoundry: per questo abbiamo aggiunto un confronto diretto.

Il miglior LLM gateway nel 2026 è LiteLLM per i team self-hosted e Merge Gateway per il traffico di produzione gestito. LiteLLM supporta oltre 100 provider dietro un'unica API compatibile con OpenAI, gestisce fallback e controlli del budget, e funziona gratuitamente su qualsiasi VPS. Merge Gateway è la scelta gestita non appena la spesa LLM diventa una questione di margine: politiche di routing per cliente o funzionalità, limiti di budget, fatturazione unificata e attribuzione dei costi a livello di richiesta. Se vuoi semplicemente il catalogo di modelli più ampio senza configurazione, OpenRouter offre ancora accesso diretto a oltre 300 modelli ed è il posto migliore per prototipare. Per le aziende regolamentate che hanno bisogno di sovranità dei dati e governance del traffico sia dei modelli che degli agenti, TrueFoundry gira interamente nel tuo VPC. Per i guardrail in produzione (redazione PII, rilevamento jailbreak), Portkey è la scelta. Per il throughput grezzo sopra i 5.000 RPS, l'architettura Go di Bifrost aggiunge solo 11 microsecondi di overhead.

Stai chiamando OpenAI per il tuo chatbot, Anthropic per il tuo assistente di codifica e Gemini per la tua pipeline di riassunti. Tre chiavi API, tre SDK, tre dashboard di fatturazione, tre set di gestione degli errori. Ora aggiungi la logica di fallback quando un provider va offline. Questo è il caos che i LLM gateway risolvono, un'unica API unificata che instrada verso qualsiasi modello, traccia i costi e gestisce i guasti automaticamente.

Abbiamo testato tutti i principali LLM gateway e li abbiamo classificati in base a ciò che conta davvero: overhead di latenza, copertura dei provider, facilità di configurazione e se sopravviveranno al tuo prossimo picco di traffico.

PosizioneStrumentoIdeale perTipoPrezzo iniziale
no. 1LiteLLMFlessibilità massimaSelf-hosted (open-source)Gratuito
no. 2Merge GatewayRouting e controllo della spesa su scala enterpriseSaaS gestitoPay-per-token (livello gratuito)
no. 3TrueFoundryGovernance enterprise + MCPSelf-hosted + gestitoPiano gratuito (499 $/mese Pro)
no. 4OpenRouterAccesso multi-modello senza configurazioneSaaS gestitoPay-per-token
no. 5PortkeyGuardrail di produzioneIbrido (open-source + gestito)Livello gratuito
no. 6HeliconeTeam orientati all'osservabilitàSelf-hosted (open-source)Gratuito
no. 7BifrostThroughput grezzoSelf-hosted (open-source)Gratuito
no. 8Cloudflare AI GatewayRouting senza infrastrutturaGestitoLivello gratuito
no. 9Kong AI GatewayTeam di gestione APISelf-hosted + enterpriseCommunity gratuito
no. 10TensorZeroRouting ottimizzato ML (archiviato a giugno 2026)Self-hosted (open-source, non manutenuto)Gratuito

Cos'è un LLM Gateway? (E ne hai davvero bisogno?)

Prima delle classifiche, una distinzione rapida. Le persone usano "gateway", "proxy" e "router" in modo intercambiabile, ma svolgono ruoli leggermente diversi:

  • LLM Proxy: Inoltra le richieste ai provider e aggiunge il logging. Logica minima.
  • LLM Router: Sceglie il miglior modello o provider per ogni richiesta in base a costo, latenza o contenuto.
  • LLM Gateway: Il pacchetto completo, proxy + router + tracciamento dei costi + caching + guardrail + osservabilità.

La maggior parte degli strumenti in questa lista sono gateway completi, ma alcuni tendono più verso il territorio del proxy o del router.

Hai bisogno di un gateway se:

  1. Chiami 2+ provider LLM e vuoi un'unica API per tutti
  2. Devi tracciare i costi tra i provider (chi sta bruciando il tuo budget?)
  3. Vuoi il failover automatico quando un provider va offline
  4. Stai costruendo funzionalità che beneficiano del caching dei prompt tra provider

Se usi solo un singolo provider e non hai piani di cambiarlo, un gateway aggiunge complessità inutile. Saltalo.

Il percorso di adozione tipico: La maggior parte dei team inizia codificando direttamente le chiamate OpenAI. Poi aggiunge Anthropic per un secondo caso d'uso e scrive una funzione wrapper. Poi ha bisogno di logica di fallback, tracciamento dei costi e rate limiting, e all'improvviso ha costruito da sola un gateway fatto in casa a metà. Gli strumenti di seguito sostituiscono quel pasticcio artigianale con qualcosa di collaudato.

1. LiteLLM, Il migliore in assoluto

Stelle GitHub: ~54K | Linguaggio: Python | Licenza: MIT

LiteLLM è il coltellino svizzero dei LLM gateway. Avvolge 100+ provider LLM dietro una singola API compatibile con OpenAI, il che significa che il tuo codice SDK OpenAI esistente funziona senza modifiche. Basta cambiare l'URL base.

Il componente server proxy è ciò che rende LiteLLM un gateway piuttosto che solo un SDK. Lo distribuisci come servizio autonomo, configuri i tuoi modelli in un file YAML, e ogni team raggiunge lo stesso endpoint con tracciamento dei costi, rate limiting e load balancing integrati.

python
# config.yaml per il proxy LiteLLM
model_list:
  - model_name: gpt-4
    litellm_params:
      model: openai/gpt-4o
      api_key: sk-...
  - model_name: gpt-4
    litellm_params:
      model: anthropic/claude-sonnet-4-20250514
      api_key: sk-ant-...
  # LiteLLM bilancia il carico tra questi automaticamente

general_settings:
  master_key: sk-my-master-key
  database_url: postgresql://...
python
# Il tuo codice applicativo non cambia -- punta solo al proxy
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:4000",  # Proxy LiteLLM
    api_key="sk-my-master-key"
)

response = client.chat.completions.create(
    model="gpt-4",  # Instrada verso OpenAI o Anthropic tramite config
    messages=[{"role": "user", "content": "Spiega i LLM gateway"}]
)

Cosa c'è di ottimo:

  • 100+ provider supportati (la copertura più ampia di qualsiasi gateway)
  • API compatibile con OpenAI, zero modifiche al codice per le app esistenti
  • Tracciamento dei costi integrato, budget per team/utente
  • Catene di fallback: se OpenAI fallisce, prova Anthropic, poi Gemini
  • Si integra con tutti i principali strumenti di osservabilità (Langfuse, Helicone, ecc.)

Cosa non va:

  • Il GIL di Python limita il throughput del singolo processo (latenza P95 ~8ms a 1.000 RPS)
  • Il proxy ha bisogno del suo database PostgreSQL per le funzionalità di gestione del team
  • La configurazione può diventare complessa con molti modelli e regole di routing
  • Attacco alla supply chain il 24 marzo 2026: due release PyPI (1.82.7 e 1.82.8) sono state compromesse con una backdoor dopo che gli attaccanti avevano sottratto le credenziali di pubblicazione tramite una CI action compromessa. PyPI ha messo entrambe in quarantena nel giro di circa 40 minuti, ma conviene fissare la versione e controllare pip show litellm se hai fatto un deploy quel giorno. Il resoconto completo è nel report sull'incidente di LiteLLM

Prezzi: Gratuito e open-source. Piani enterprise disponibili per la gestione ospitata.

Se hai letto la nostra guida su usare Claude Code con modelli diversi, hai già visto LiteLLM in azione, è uno dei modi principali con cui gli sviluppatori instradano Claude Code attraverso provider alternativi. La nostra guida alla configurazione del proxy LiteLLM illustra l'intero deployment Docker con PostgreSQL in meno di 20 minuti.

Verdetto: LiteLLM è il miglior LLM gateway in assoluto per i team che vogliono la massima flessibilità e non hanno problemi con il self-hosting. Ha la copertura dei provider più ampia, l'ecosistema più maturo e la comunità più grande. Inizia da qui a meno che tu non abbia una ragione specifica per non farlo.

2. Merge Gateway, Il migliore per il routing e il controllo della spesa su scala enterprise

Provider: OpenAI, Anthropic, Google, AWS Bedrock, Mistral, Cohere, Grok | Tipo: SaaS gestito | Lancio: 31 marzo 2026

Merge Gateway è costruito per il punto in cui l'uso degli LLM smette di essere una voce di costo e diventa un problema di margine. Dove OpenRouter ottimizza l'ampiezza di accesso ai modelli, Merge ottimizza il controllo sul traffico che stai già facendo girare in produzione: routing per costo, latenza, qualità, cliente, funzionalità o regione, budget che scattano prima della fattura, e log a livello di richiesta che dicono quale modello ha servito una chiamata e perché è stata instradata lì.

Quest'ultimo punto è il vero elemento distintivo. La maggior parte dei gateway ti dice quanto hai speso. Merge è costruito per dirti per chi lo hai speso, la domanda che emerge nel momento in cui l'uso di un singolo cliente enterprise inizia a erodere il margine lordo di un prodotto.

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api-gateway.merge.dev/v1/openai",
)

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Summarize this support ticket"}],
)

Cosa c'è di ottimo:

  • Politiche di routing per cliente, funzionalità, regione, caso d'uso, costo, latenza o qualità
  • Il fallback automatico mantiene attive le funzionalità AI durante interruzioni del provider, rate limit e degradazioni
  • Osservabilità a livello di richiesta: modello, provider, costo, latenza e la ragione del routing dietro ogni chiamata
  • Governance dei costi con budget, tetti di spesa e alert per progetto, team, livello cliente o funzionalità
  • Caching semantico e compressione del contesto come leve di costo a tutti gli effetti, non funzionalità accessorie

Cosa non va:

  • Non è open-source, quindi è escluso se il self-hosting è un requisito rigido (Enterprise offre VPC/on-prem, ma è materia da trattativa commerciale)
  • Orientato alla produzione per progettazione, il che lo rende più pesante del necessario per prototipi e app a basso volume
  • Lanciato a marzo 2026, quindi community, integrazioni e tutorial di terze parti sono ancora scarsi rispetto a LiteLLM o OpenRouter

Prezzi: Livello gratuito con 10 $/mese di crediti, senza carta di credito. Il piano Pro costa costo LLM + 5% senza tetto di spesa e con la propria chiave API. Enterprise è a preventivo personalizzato e aggiunge deployment VPC o on-prem, un account manager dedicato e SLA di uptime. I crediti vengono emessi il giorno 1 e non si accumulano.

Da notare sulla commissione: il 5% di Merge resta appena sotto il 5,5% di OpenRouter. A volumi da prototipo, la differenza è trascurabile. A sei cifre di spesa annuale di inferenza è denaro vero, ed è il tipo di cosa che vale la pena modellare prima di impegnarsi in un senso o nell'altro.

Verdetto: Merge Gateway è la scelta giusta quando il tuo traffico LLM è diventato un problema di affidabilità e margine più che di integrazione. Se devi rispondere a "quale cliente sta guidando la spesa" o "quale funzionalità è in perdita", e vuoi politiche di fallback che tengano vive le funzionalità durante un incidente del provider, è l'opzione gestita più solida qui. Se stai ancora decidendo quali modelli usare, il catalogo di OpenRouter ti serve meglio, e potrai passare a Merge più avanti.

3. TrueFoundry, Il migliore per la governance enterprise

Modelli: 1.600+ | Provider: 250+ | Tipo: Self-hosted + gestito | Deployment: VPC, on-prem, air-gapped

TrueFoundry's AI Gateway è pensato per il caso che i gateway open-source faticano a gestire: un'azienda regolamentata che ha bisogno di un unico piano di controllo per ogni modello, piena sovranità dei dati e audit trail che reggono una revisione di conformità. Gira nel tuo VPC, on-prem o completamente air-gapped — nessun dato di richiesta lascia il tuo dominio — e include SOC 2, HIPAA e GDPR, SSO e RBAC già pronti.

La copertura è tra le più ampie di questa lista: oltre 1.600 modelli su 250+ provider (OpenAI, Anthropic, Gemini, Groq, Mistral), più backend self-hosted come vLLM, SGLang e Triton. TrueFoundry riporta una latenza interna inferiore a 3ms sotto carico enterprise e un uptime del 99,99% su oltre 10 miliardi di richieste al mese, quindi il layer di governance non ti costa throughput.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://<your-org>.truefoundry.com/api/llm",  # your gateway
    api_key="tfy-..."
)

response = client.chat.completions.create(
    model="openai/gpt-4o",  # routed, logged, and rate-limited centrally
    messages=[{"role": "user", "content": "Summarize this contract"}]
)

Ciò che distingue TrueFoundry da Portkey o LiteLLM è il MCP Gateway: un registro centrale che governa come gli agenti AI accedono agli strumenti aziendali (Slack, GitHub, Confluence, Datadog) tramite il Model Context Protocol. Registri le API interne come server MCP, le proteggi con Okta o Azure AD tramite RBAC per server, e ottieni tracciamento a livello di richiesta su ogni chiamata agli strumenti. Un unico piano di controllo governato per il traffico dei modelli e per quello degli agenti — che conta molto quando gli agenti iniziano ad agire, non solo a generare testo.

A differenza della maggior parte dei gateway enterprise, TrueFoundry pubblica apertamente i suoi prezzi. Un piano Developer gratuito copre 50.000 richieste al mese, 3 utenti e l'MCP Gateway fino a 5 server, abbastanza per prototipare l'intero stack prima di parlare con chiunque. Il piano Pro costa 499 $/mese per 1 milione di richieste, 10 utenti, caching semantico, modelli virtuali e routing avanzato, con l'utilizzo aggiuntivo fatturato a tariffe trasparenti per unità. Pro Plus costa 2.999 $/mese e aggiunge metadati personalizzati, alerting ed export di monitoraggio per 25 utenti. Enterprise è quotato su misura per oltre 10 milioni di richieste, con installazioni complete in VPC, multi-region e air-gapped sia del piano di controllo sia del gateway. Ogni piano a pagamento include una prova di 7 giorni. Il SaaS gestito non ha costi di hosting; se self-hosti il gateway nel tuo cloud (BYOC), metti a budget circa 600-1.000 $ al mese per l'infrastruttura sottostante.

Cosa c'è di ottimo:

  • 1.600+ modelli, 250+ provider, più backend self-hosted (vLLM, SGLang, Triton)
  • Gira nel tuo VPC, on-prem o air-gapped; nessun dato lascia il tuo dominio
  • Conformità SOC 2, HIPAA, GDPR, SSO, RBAC e audit logging integrati
  • Guardrail: filtraggio PII, rilevamento tossicità, scansione prompt injection
  • MCP Gateway governa l'accesso agli strumenti degli agenti, non solo le chiamate ai modelli
  • Prezzi pubblici e trasparenti con un piano Developer davvero gratuito (50K richieste/mese)
  • TrueFoundry riporta una riduzione media dei costi del ~30% tramite routing, caching e budget

Cosa non va:

  • Enterprise-first: più pesante di LiteLLM o OpenRouter per un progetto piccolo
  • La piattaforma core è proprietaria (i loro repo open-source sono tooling infrastrutturale separato)
  • Il self-hosting del gateway aggiunge circa 600-1.000 $/mese di infrastruttura oltre al piano
  • Più utile quando si hanno molti team e strumenti da governare, non dal primo giorno

Prezzi: Piano Developer gratuito (0 $/mese, 50K richieste, 3 utenti). Pro 499 $/mese (1M richieste, 10 utenti, caching semantico, routing avanzato). Pro Plus 2.999 $/mese (25 utenti, observability avanzata). Enterprise su misura (10M+ richieste, VPC completo e air-gapped). Prova di 7 giorni sui piani a pagamento; il SaaS gestito non ha costi di hosting, il self-hosting aggiunge ~600-1.000 $/mese di infrastruttura.

Verdetto: TrueFoundry è il gateway per le aziende che hanno bisogno di un unico piano di controllo governato sia per il traffico dei modelli che per l'accesso degli agenti agli strumenti, con i dati che rimangono nella propria infrastruttura. Se sei una startup che collega due provider, è più di quello che ti serve — inizia con LiteLLM. Se sei un team di piattaforma che distribuisce l'AI a decine di team interni sotto un mandato di conformità, merita di essere sulla tua lista.

4. OpenRouter, Il miglior accesso multi-modello senza configurazione

Modelli: 300+ | Tipo: SaaS gestito | Licenza: Proprietaria

OpenRouter adotta l'approccio opposto a LiteLLM: non distribuisci nulla. Registrati, ottieni una chiave API, e hai accesso istantaneo a 300+ modelli da tutti i principali provider attraverso un singolo endpoint. È l'"App Store" delle API LLM.

La proposta di valore è la semplicità. Nessuna infrastruttura da mantenere, nessuna configurazione YAML da scrivere, nessun database da provisioning. Paghi i crediti in anticipo o colleghi una carta, e OpenRouter gestisce la fatturazione consolidata tra tutti i provider.

python
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="sk-or-..."
)

# Accedi a qualsiasi modello da qualsiasi provider -- stesso codice
response = client.chat.completions.create(
    model="anthropic/claude-sonnet-4-20250514",
    messages=[{"role": "user", "content": "Confronta i LLM gateway"}]
)

Cosa c'è di ottimo:

  • 300+ modelli, una sola chiave API, un dashboard di fatturazione
  • 25+ modelli gratuiti per il prototipaggio (inclusi alcuni sorprendentemente capaci)
  • Nessuna infrastruttura da gestire, registrati e inizia a chiamare
  • Le funzionalità di confronto tra modelli aiutano a valutare prima di impegnarsi
  • Gestisce le interruzioni dei provider con routing di fallback automatico

Cosa non va:

  • Commissione di piattaforma del 5,5% sopra il prezzo del provider, si accumula in scala
  • Nessuna opzione di self-hosting, i tuoi dati passano attraverso i server di OpenRouter
  • Osservabilità limitata rispetto agli strumenti gateway dedicati
  • I limiti di velocità sul livello gratuito possono essere restrittivi per i carichi di lavoro in produzione
  • Nessuna logica di routing personalizzata, ottieni ciò che OpenRouter decide

Prezzi: Pay-per-token (prezzo del provider + 5,5% di commissione). Nessun minimo mensile. 25+ modelli gratuiti disponibili.

Verdetto: OpenRouter è il modo più veloce per accedere a più provider LLM. Se vuoi prototipare con modelli diversi o eseguire un carico di lavoro piccolo o medio senza gestire infrastruttura, è la scelta ovvia. In scala, la commissione del 5,5% inizia a contare. Se la riduzione dei costi è il motore, consulta la nostra guida alla riduzione dei costi delle API LLM per un'analisi completa di caching, batching e leve di risparmio a livello di gateway.

5. Portkey, Il migliore per i guardrail di produzione

Stelle GitHub: ~12K | Linguaggio: TypeScript/Node.js | Licenza: Apache 2.0 (gateway), piattaforma gestita

Portkey si posiziona come il "piano di controllo per l'IA." Dove LiteLLM si concentra sul routing e OpenRouter sulla semplicità, il differenziatore di Portkey è la sicurezza in produzione: guardrail, redazione PII, rilevamento di jailbreak e audit trail integrati nel layer del gateway.

Da marzo 2026, Portkey ha reso l'intero gateway open-source (Apache 2.0), quindi puoi ospitare autonomamente il routing core e i guardrail senza la piattaforma gestita. Il cambiamento più rilevante è arrivato il 29 maggio 2026, quando Palo Alto Networks ha completato l'acquisizione di Portkey integrandolo in Prisma AIRS, la sua piattaforma di sicurezza per l'AI agentica. Il gateway open-source resta distribuito sotto Apache 2.0 e i piani gestiti funzionano ancora allo stesso modo, ma Portkey non è più un'azienda indipendente di infrastruttura AI: è diventata un componente all'interno della linea di prodotti di un vendor di cybersecurity, il che conta se stai valutando l'indipendenza della roadmap sul lungo periodo.

python
from portkey_ai import Portkey

portkey = Portkey(
    api_key="pk-...",
    config={
        "strategy": {"mode": "fallback"},
        "targets": [
            {"provider": "openai", "override_params": {"model": "gpt-4o"}},
            {"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
        ]
    }
)

response = portkey.chat.completions.create(
    messages=[{"role": "user", "content": "Riassumi questo documento"}]
)

Cosa c'è di ottimo:

  • Supporto per 1.600+ modelli tra provider
  • Guardrail integrati: rilevamento PII, prevenzione jailbreak, filtraggio dei contenuti
  • Gestione dei prompt e versioning all'interno del gateway
  • Il layer di caching riduce le chiamate ripetute (risparmia denaro e latenza)
  • Audit trail e funzionalità di conformità per i settori regolamentati
  • Gateway ora completamente open-source (marzo 2026)

Cosa non va:

  • Il prezzo della piattaforma gestita inizia a $49/mese per le funzionalità di produzione
  • Livello enterprise ($5.000–$10.000/mese) per la governance avanzata
  • La piattaforma aggiunge complessità oltre a quella offerta dai gateway più semplici
  • Curva di apprendimento più ripida di LiteLLM o OpenRouter
  • Ora di proprietà di Palo Alto Networks (acquisizione a maggio 2026), quindi la sua roadmap risponde alle priorità di un vendor di sicurezza, non solo a quelle di chi usa infrastruttura AI. I team che vogliono restarne indipendenti guardano sempre più a Bifrost o LiteLLM, vedi il confronto diretto più avanti in questa pagina

Prezzi: Il gateway open-source è gratuito da self-hostare. Piattaforma gestita: il livello Developer è gratuito per sempre (10K log/mese, retention di 3 giorni). Production costa $49/mese (100K log/mese, retention di 30 giorni, guardrail, RBAC, caching semantico, $9 per ogni 100K log aggiuntivi). Enterprise è quotato su misura (10M+ log/mese, hosting in VPC, SOC 2 Type 2, HIPAA).

Verdetto: Portkey resta il gateway per i team che costruiscono funzionalità LLM rivolte ai clienti e non possono permettersi iniezioni di prompt, fughe di PII o costi non monitorati, i guardrail giustificano la complessità. Ciò che è cambiato è chi c'è dietro: dopo l'acquisizione da parte di Palo Alto Networks, Portkey è più adatto ai team che sono già dentro l'ecosistema Prisma AIRS (o a loro agio con esso). Se vuoi un gateway open-source altrettanto capace ma che resti indipendente, Bifrost è quello da guardare più da vicino.

6. Helicone, Il migliore per i team orientati all'osservabilità

Stelle GitHub: ~6K | Linguaggio: Rust | Licenza: Apache 2.0

Helicone è nato come strumento di osservabilità e si è evoluto in un gateway completo. Quell'origine conta, le sue funzionalità di monitoraggio e analisi sono di prima classe, e le funzionalità gateway (routing, caching, failover) sono state costruite su una solida base di osservabilità.

Essere scritto in Rust gli conferisce un vantaggio reale in termini di prestazioni: latenza P50 di 8ms, P95 sotto 5ms, circa 3.000 RPS su una singola istanza con soli 64MB di memoria.

Una cosa da sapere prima di adottarlo: a marzo 2026 Mintlify ha acquisito Helicone e il team si è trasferito a San Francisco per lavorare al prodotto di documentazione e contesto per agenti di Mintlify. L'annuncio di Helicone è diretto su cosa questo comporta: la piattaforma resta attiva e continua a ricevere patch di sicurezza, correzioni di bug e supporto per i nuovi modelli, ma oltre a questo non c'è una roadmap di nuove funzionalità. Se ti serve un gateway che continui ad aggiungere funzionalità, tienine conto prima di standardizzare tutto su di esso.

python
# Helicone: proxy in una riga -- cambia solo l'URL base
from openai import OpenAI

client = OpenAI(
    base_url="https://oai.helicone.ai/v1",  # o il tuo URL self-hosted
    api_key="sk-...",
    default_headers={
        "Helicone-Auth": "Bearer hlc-..."
    }
)

# Tutte le richieste vengono ora registrate, tracciate e instradate tramite Helicone
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Analizza questo codice"}]
)

Cosa c'è di ottimo:

  • Basato su Rust: ~64MB di memoria, latenza P95 <5ms, 3.000 RPS per istanza
  • Load balancing consapevole della salute, instrada verso il provider disponibile più veloce
  • Dashboard in tempo reale per costi, latenza, utilizzo dei token e tassi di errore
  • Integrazione in una riga, cambia solo l'URL base
  • Distribuzione con binario singolo (Docker, K8s, bare metal)

Cosa non va:

  • In modalità di manutenzione dall'acquisizione da parte di Mintlify (marzo 2026): solo patch di sicurezza e correzioni di bug, nessuna nuova funzionalità né roadmap
  • Le funzionalità di osservabilità sono la stella; il routing è meno sofisticato di LiteLLM
  • Meno provider supportati rispetto a LiteLLM o OpenRouter
  • Comunità più piccola di LiteLLM (6K vs. 54K stelle GitHub)
  • Le funzionalità avanzate (proprietà personalizzate, sessioni) richiedono la piattaforma gestita

Prezzi: Open-source e gratuito per il self-hosting. Piattaforma gestita: Hobby è gratuito (10K richieste/mese, 1GB di storage, retention di 7 giorni, 1 postazione). Pro costa $79/mese (postazioni illimitate, retention di 1 mese, avvisi, report, HQL). Team costa $799/mese (retention di 3 mesi, SOC 2, HIPAA, canale Slack dedicato). Enterprise è su misura (on-prem, SSO SAML, sconti sul volume).

Se stai valutando gli strumenti di osservabilità in modo più ampio, la nostra classifica delle migliori piattaforme di osservabilità AI copre Helicone accanto a Langfuse, Arize e altri.

Verdetto: Helicone resta il miglior gateway per i team il cui problema principale è "non riusciamo a vedere cosa sta succedendo con le nostre chiamate LLM", e il prodotto attuale non sparirà. Mettilo in conto, però: stai adottando uno strumento in modalità di manutenzione, ottimo per l'osservabilità oggi, più rischioso se stai puntando su nuove funzionalità gateway in arrivo il prossimo anno.

7. Bifrost, Il migliore per le prestazioni grezze

Stelle GitHub: ~6,6K | Linguaggio: Go | Licenza: Apache 2.0

Bifrost è il campione delle prestazioni. Costruito in Go da Maxim AI, afferma prestazioni 50x più veloci di LiteLLM con soli 11 microsecondi di overhead per richiesta a 5.000 RPS. Questi non sono numeri teorici, provengono da test di carico sostenuto riproducibili. Il progetto ha più che triplicato le sue stelle GitHub dal nostro ultimo controllo, passando da circa 2.000 a 6.600, e la crescita segue un vero sviluppo di funzionalità: Bifrost ha rilasciato un proprio MCP Gateway con una "Code Mode" per governare il modo in cui gli agenti chiamano strumenti esterni, la stessa categoria di funzionalità che un tempo era territorio esclusivo di TrueFoundry e Portkey.

La differenza architetturale è fondamentale: le goroutine di Go gestiscono migliaia di connessioni simultanee senza il collo di bottiglia GIL di Python, e il binario compilato elimina completamente l'overhead dell'interprete.

yaml
# bifrost.yaml
account:
  provider: openai
  api_key: ${OPENAI_API_KEY}

models:
  - name: gpt-4o
    provider: openai
  - name: claude-sonnet-4-20250514
    provider: anthropic

routing:
  strategy: round-robin
  fallback: true

Cosa c'è di ottimo:

  • Overhead di 11µs a 5.000 RPS, il più basso di qualsiasi gateway in questa lista
  • Binario Go: nessuna dipendenza di runtime, impronta di memoria minuscola
  • Load balancing adattivo tra provider
  • Modalità cluster per la scalabilità orizzontale
  • 1.000+ modelli supportati
  • MCP Gateway con Code Mode incluso nel livello OSS gratuito, insieme alla gestione del budget tramite chiavi virtuali, caching semantico e osservabilità nativa OpenTelemetry, tutto compreso e non riservato al piano Enterprise

Cosa non va:

  • Progetto più recente, comunità più piccola di LiteLLM (6,6K vs. 54K stelle GitHub) e meno integrazioni di terze parti
  • I guardrail sui contenuti (filtraggio PII, rilevamento jailbreak) richiedono il livello Enterprise; Portkey offre guardrail equivalenti già nel suo gateway OSS gratuito
  • Costruito da Maxim AI (un vendor), direzione futura legata alla loro roadmap
  • Documentazione più sottile rispetto alla documentazione estesa di LiteLLM
  • SSO (SAML/OIDC) e RBAC sono solo Enterprise, quindi i team piccoli ottengono le prestazioni ma non i controlli di accesso

Prezzi: Il gateway OSS è gratuito per sempre (Apache 2.0) e copre routing, failover, MCP Gateway, caching semantico e gestione del budget con chiavi virtuali. Enterprise è quotato su misura (su richiesta di una demo) e aggiunge guardrail, modalità cluster, SSO SAML/OIDC, RBAC, audit log e supporto con SLA; è disponibile una prova gratuita di 14 giorni.

Verdetto: Bifrost è per i team che gestiscono sistemi di produzione ad alto throughput dove l'overhead del gateway conta, ed è diventato una delle alternative più solide a Portkey ora che il suo livello gratuito include la governance MCP e i controlli di budget che altrove richiedevano una piattaforma a pagamento. Se stai elaborando migliaia di chiamate LLM al secondo e vuoi restare su infrastruttura open-source senza un'acquisizione che incombe sulla roadmap, l'architettura Go di Bifrost offre risultati. Per la maggior parte dei team, l'overhead di 8ms di LiteLLM è perfettamente accettabile, e se ti servono guardrail sui contenuti integrati oggi anziché sul livello Enterprise, il gateway OSS di Portkey ha ancora un vantaggio: proprio questo compromesso è il cuore del confronto qui sotto.

8. Cloudflare AI Gateway, La migliore opzione zero infrastruttura

Tipo: Servizio gestito | Licenza: Proprietaria (Cloudflare)

Cloudflare AI Gateway porta l'approccio "non gestisci nulla" all'estremo. Se sei già su Cloudflare (e molti team lo sono), puoi abilitare AI Gateway dal dashboard e iniziare a instradare le chiamate LLM attraverso la rete edge di Cloudflare senza infrastruttura aggiuntiva.

javascript
// Aggiungi semplicemente il prefisso del tuo URL provider con l'endpoint gateway di Cloudflare
const response = await fetch(
  "https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
  {
    method: "POST",
    headers: {
      "Authorization": "Bearer sk-...",
      "Content-Type": "application/json"
    },
    body: JSON.stringify({
      model: "gpt-4o",
      messages: [{ role: "user", content: "Ciao" }]
    })
  }
);

Cosa c'è di ottimo:

  • Livello gratuito con 100.000 log/mese, sufficiente per la maggior parte dei progetti secondari
  • Zero infrastruttura: abilitare dal dashboard Cloudflare
  • Caching integrato all'edge (riduce costi e latenza)
  • Rate limiting e analytics inclusi
  • Fatturazione unificata: paga i costi del provider LLM tramite Cloudflare
  • La rete edge globale riduce la latenza per gli utenti geograficamente distribuiti

Cosa non va:

  • Strettamente accoppiato all'ecosistema Cloudflare, i costi di cambio sono reali
  • Intelligenza di routing limitata rispetto ai gateway dedicati
  • Limite di 100.000 log sul livello gratuito; abbonamento Workers Paid per 1M
  • Meno provider supportati rispetto a LiteLLM o OpenRouter
  • Nessuna opzione di self-hosting

Prezzi: Gratuito (100.000 log/mese), abbonamento Workers Paid per 1M di log. Nessuna commissione gateway per richiesta. Paghi ancora separatamente i provider LLM.

Per i team che instradano le function call tra provider, il caching edge di Cloudflare può ridurre significativamente la latenza per i pattern di utilizzo degli strumenti ripetuti.

Verdetto: Cloudflare AI Gateway è la migliore opzione se sei già su Cloudflare e vuoi funzionalità gateway senza distribuire nulla di nuovo. Il livello gratuito è generoso per i progetti piccoli. Per un uso serio in produzione, i gateway dedicati offrono più controllo.

9. Kong AI Gateway, Il migliore per i team di gestione API

Stelle GitHub: ~44K (Kong Gateway totale) | Linguaggio: Lua/OpenResty | Licenza: Apache 2.0 (community)

Kong AI Gateway non è un prodotto autonomo, è un'estensione dell'API Gateway collaudato di Kong che aggiunge capacità specifiche per LLM. Se la tua organizzazione utilizza già Kong per la gestione delle API, aggiungere il routing AI è un'installazione di plugin, non una nuova piattaforma.

yaml
# Config dichiarativa Kong (deck)
services:
  - name: ai-llm-service
    url: https://api.openai.com
    plugins:
      - name: ai-proxy
        config:
          route_type: llm/v1/chat
          model:
            provider: openai
            name: gpt-4o
      - name: ai-rate-limiting-advanced
        config:
          limit: [10000]
          window_size: [60]
          window_type: fixed
          strategy: local
          limit_by: consumer

Cosa c'è di ottimo:

  • Si basa sulla piattaforma matura di gestione API di Kong (usata da migliaia di aziende)
  • Routing semantico: instrada le richieste in base al contenuto/all'intento del prompt
  • Rate limiting basato su token (non solo sulle richieste)
  • Ecosistema di plugin: autenticazione, rate limiting, trasformazioni funzionano tutti con le route AI
  • Metriche OpenTelemetry + Prometheus per l'integrazione Datadog/Grafana

Cosa non va:

  • Eccessivo se non usi già Kong, curva di apprendimento ripida
  • Le funzionalità AI enterprise richiedono la licenza Kong Enterprise (a pagamento)
  • Complessità di configurazione più alta di qualsiasi altro gateway in questa lista
  • Richiede conoscenze dell'infrastruttura Kong (o che il team le acquisisca)
  • Le funzionalità specifiche per AI sono più recenti e meno mature del core di Kong

Prezzi: Edizione community gratuita (open-source). Le funzionalità AI enterprise richiedono un abbonamento Kong Enterprise (prezzi personalizzati).

Verdetto: Kong AI Gateway ha senso se e solo se la tua organizzazione usa già Kong. Aggiungere il routing LLM al tuo layer di gestione API esistente è più intelligente che distribuire un gateway separato. Ma non adottare Kong solo per il routing LLM, è come comprare un trattore per tagliare il prato.

10. TensorZero, Il migliore per il routing ottimizzato ML (ora dismesso)

Stelle GitHub: ~11,7K | Linguaggio: Rust | Licenza: Apache 2.0 (archiviato, non manutenuto)

Aggiornamento: TensorZero ha chiuso a giugno 2026. I manutentori hanno archiviato il repository il 12 giugno 2026, hanno interrotto lo sviluppo attivo e hanno restituito agli investitori il capitale di rischio rimanente, dopo aver concluso di non riuscire a trovare un product-market fit sia per un progetto open-source sia per un prodotto commerciale. Lasciamo questa voce al suo posto perché le idee restano interessanti da capire e il codice è ancora forkabile sotto Apache 2.0, ma non adottarlo per un nuovo sistema in produzione: non ci saranno patch di sicurezza, né aggiornamenti per le API dei provider, né supporto se qualcosa si rompe.

TensorZero era il gateway più opinato di questa lista. Mentre gli altri si concentrano su routing e osservabilità, TensorZero costruiva un loop di ottimizzazione: raccoglieva dati di inferenza, eseguiva valutazioni e usava i risultati per migliorare le decisioni di routing nel tempo. Pensalo come un gateway che impara quale modello funziona meglio per quale tipo di richiesta.

L'implementazione Rust offre latenza P99 sub-millisecondo, anche a più di 10.000 QPS. Non è un errore di battitura. Dove LiteLLM aggiunge ~8ms e Bifrost ~11µs, TensorZero afferma <1ms P99 sotto carico estremo.

python
# TensorZero: inferenza strutturata con ottimizzazione
from tensorzero import TensorZeroGateway

with TensorZeroGateway("http://localhost:3000") as client:
    response = client.inference(
        function_name="generate_summary",
        input={
            "messages": [
                {"role": "user", "content": "Riassumi questo articolo..."}
            ]
        }
    )

    # Più tardi: invia dati di qualità per migliorare il routing
    client.feedback(
        metric_name="summary_quality",
        inference_id=response.inference_id,
        value=0.92
    )

Cosa c'è di ottimo:

  • Latenza P99 <1ms a 10.000+ QPS (prestazioni grezze più veloci con Rust)
  • Loop di feedback: impara quali modelli funzionano meglio per ogni funzione
  • Inferenza strutturata con validazione dello schema
  • A/B testing tra modelli integrato nel gateway
  • Framework di valutazione integrato

Cosa non va:

  • Dismesso da giugno 2026: repository archiviato e in sola lettura, nessun aggiornamento futuro, patch di sicurezza o supporto
  • Curva di apprendimento più ripida di qualsiasi altro gateway, definisci "funzioni", non solo modelli
  • Richiede di ripensare la tua integrazione LLM attorno al concetto di funzione di TensorZero
  • Meno "drop-in" di LiteLLM o OpenRouter, non è un semplice cambio di URL base
  • Documentazione congelata al suo ultimo stato, non viene più migliorata

Prezzi: Gratuito e open-source (Apache 2.0), forkabile e manutenibile in proprio, ma non c'è alcun vendor a cui pagare il supporto nemmeno volendo.

Per i team che già eseguono valutazioni LLM, il loop di feedback di TensorZero era un modo davvero utile per colmare il divario tra valutazione e routing, i punteggi di valutazione miglioravano direttamente quali modelli venivano instradati. È un'idea che vale la pena replicare anche ora che lo strumento non c'è più.

Verdetto: TensorZero era pensato per i team di ingegneria ML che volevano un gateway sempre più intelligente nel tempo, e il loop di ottimizzazione era genuinamente innovativo. Con il progetto dismesso non possiamo consigliarlo per nulla di nuovo: scegli LiteLLM, Bifrost o Portkey e costruisci il feedback di valutazione nella tua pipeline. Se hai già TensorZero in produzione il codice funziona ancora, ma metti in conto il tempo per migrare prima di incappare in un cambio di API di un provider che non è in grado di gestire.

Overhead di latenza dei LLM Gateway: I numeri reali

Ogni gateway aggiunge un po' di overhead alle tue chiamate LLM. La domanda è se importa per il tuo caso d'uso. Ecco come si confrontano i gateway nei nostri test:

GatewayLinguaggioOverhead latenza P50Overhead latenza P95Throughput (istanza singola)
BifrostGo~8µs~11µs5.000+ RPS
TensorZero‡Rust~0,3ms<1ms10.000+ QPS
HeliconeRust~5ms~8ms~3.000 RPS
TrueFoundrySelf-hosted~3ms†<3ms†10 mld+/mese (vendor)
LiteLLMPython~4ms~8ms~1.000 RPS
PortkeyTypeScript~5ms~12ms~2.000 RPS
OpenRouterGestito~15–30ms~50msN/A (gestito)
Merge GatewayGestitonon testato in modo indipendente§non testato in modo indipendente§N/A (gestito)
Cloudflare AI GWGestito~10–20ms~40msN/A (gestito)
Kong AI GatewayLua/Go~3ms~8ms~3.000 RPS

† Il dato sub-3ms di TrueFoundry è dichiarato dal vendor; non lo abbiamo sottoposto allo stesso test di carico indipendente dei gateway open-source self-hosted.

‡ Il progetto TensorZero è stato archiviato a giugno 2026 (vedi la voce sopra); i suoi dati di latenza sono storici e non più verificabili in modo indipendente su una build attivamente manutenuta. § Merge Gateway è stato lanciato dopo la nostra sessione di test di carico, quindi non lo abbiamo misurato sullo stesso banco di prova degli altri e non pubblicheremo un dato che non abbiamo rilevato. Aspettati un overhead da gateway gestito nello stesso intervallo di OpenRouter e Cloudflare (circa 10-30ms P50) finché non lo testeremo.

Il contesto conta. Una tipica chiamata GPT-4o richiede 500–3.000ms a seconda della lunghezza dell'output. Anche l'overhead di 8ms di LiteLLM è inferiore all'1% della latenza totale. L'unico scenario in cui l'overhead del gateway conta sono i carichi di lavoro ad alta frequenza e bassa latenza come la classificazione in tempo reale o la generazione di embedding in scala. Per l'AI conversazionale o la generazione di contenuti, qualsiasi gateway in questa lista è sufficientemente veloce.

I gateway gestiti (OpenRouter, Cloudflare e Merge Gateway) aggiungono più overhead perché la tua richiesta viaggia verso i loro server prima di raggiungere il provider. I gateway self-hosted girano accanto alla tua applicazione, quindi il salto extra è locale.

Bifrost vs. Portkey: quale LLM gateway open-source scegliere?

Se hai cercato letteralmente "LLM gateway open source", ecco lo stato onesto della categoria a metà 2026: cinque dei nove strumenti di questa classifica sono software open-source che puoi self-hostare oggi stesso. LiteLLM (MIT) e Bifrost (Apache 2.0) sono completamente open-source, senza funzionalità core dietro un paywall. Il gateway di Portkey è Apache 2.0 da marzo 2026, anche se la piattaforma gestita che gli sta attorno è proprietaria. Helicone (Apache 2.0) è open-source ma in modalità di manutenzione dopo l'acquisizione da parte di Mintlify. Il Gateway base di Kong è open-source, ma i plugin specifici per l'AI che contano davvero per il routing LLM stanno dietro Kong Enterprise. Anche TensorZero era open-source, ma il progetto è dismesso, quindi non lo consideriamo più un'opzione viva. TrueFoundry, di cui abbiamo parlato sopra, segue una strada diversa: deployment self-hosted di un piano di controllo proprietario, non una codebase open-source.

Restano quindi Bifrost e Portkey come le due opzioni open-source più cercate, e dalla nostra ultima analisi si sono allontanate parecchio. Ecco come si confrontano davvero:

DimensioneBifrostPortkey
Chi c'è dietroMaxim AI (indipendente)Palo Alto Networks (acquisizione a maggio 2026)
Licenza del gateway coreApache 2.0, completamente open-sourceApache 2.0 (solo il gateway; la piattaforma è proprietaria)
LinguaggioGoTypeScript/Node.js
Overhead di latenza P95~11µs~12ms
Stelle GitHub~6,6K~12K
Guardrail sui contenuti (PII, rilevamento jailbreak)Solo livello EnterpriseInclusi nel gateway OSS gratuito
Governance MCP / strumenti degli agentiMCP Gateway con Code Mode, incluso nell'OSSNon è una funzionalità di punta
SSO / RBACSolo livello EnterpriseDal livello Production ($49/mese) in su
Indipendenza della roadmapVendor indipendenteOra parte di Prisma AIRS

Se stai cercando un'"alternativa a Bifrost" perché vuoi guardrail di produzione senza pagare Bifrost Enterprise, il gateway open-source gratuito di Portkey include redazione PII e rilevamento jailbreak già pronti: è il singolo divario funzionale più grande tra i due. LiteLLM è l'altro approdo comune, e scambia la velocità pura di Bifrost con l'elenco di provider più ampio e la comunità più grande.

Se stai cercando "alternative a Portkey" perché l'acquisizione da parte di Palo Alto Networks cambia il tuo calcolo del rischio (una cosa del tutto ragionevole da voler evitare se hai bisogno che la roadmap della tua infrastruttura sia indipendente dalle priorità di un vendor di cybersecurity), le opzioni migliori sono, in ordine: Bifrost, se throughput grezzo e governance MCP contano più dei guardrail già pronti; LiteLLM, se vuoi l'ecosistema più grande e il profilo di latenza di Python non ti spaventa; e TrueFoundry (di cui sopra), se ti serve nello specifico la conformità SOC 2/HIPAA/GDPR con un vendor che non sia Portkey. Anche Helicone è open-source, ma il suo stato di manutenzione lo rende più adatto all'osservabilità che a un gateway da cui ti aspetti una continua evoluzione.

Né Bifrost né Portkey è oggettivamente "migliore": dipende se vuoi i guardrail oggi oppure governance e velocità con un po' più di lavoro di configurazione.

Come scegliere il LLM Gateway giusto

Salta le matrici di funzionalità. Ecco la decisione in una tabella:

Se hai bisogno di...ScegliPerché
Massima flessibilità + self-hostedLiteLLM100+ provider, comunità più grande, più integrazioni
Routing su scala enterprise + controllo della spesaMerge GatewayPolitiche di routing per cliente o funzionalità, tetti di spesa, attribuzione dei costi a livello di richiesta
Governance enterprise + sovranità dei datiTrueFoundryGira nel tuo VPC, SOC 2/HIPAA/GDPR, MCP Gateway per gli strumenti degli agenti
Accesso multi-modello rapido, senza opsOpenRouterRegistrati e chiama 300+ modelli
Guardrail di produzione + conformitàPortkeyRedazione PII, rilevamento jailbreak, audit trail (ora parte di Prisma AIRS di Palo Alto Networks)
Osservabilità come prioritàHeliconeMiglior monitoraggio, prestazioni Rust, setup in una riga (in modalità di manutenzione da marzo 2026)
Latenza più bassa possibile + governance MCP in open sourceBifrostOverhead di 11µs in Go, modalità cluster, MCP Gateway incluso nel livello gratuito
Già su CloudflareCloudflare AI GWGratuito, caching edge, zero nuova infrastruttura
Già su KongKong AI GWAggiungi routing LLM alla gestione API esistente
Ottimizzazione routing guidata da MLTensorZeroDismesso a giugno 2026, il codice è forkabile ma non è più una scelta sicura per nuovi progetti

Una nota su self-hosted vs. gestito: I gateway self-hosted (LiteLLM, Helicone, Bifrost) ti danno pieno controllo sul flusso dei dati, nulla lascia la tua infrastruttura tranne la vera chiamata API LLM. Questo conta per sanità, finanza e qualsiasi contesto in cui la residenza dei dati è un requisito rigido. I gateway gestiti (OpenRouter, Cloudflare e Merge Gateway) scambiano quel controllo per zero onere operativo. Portkey e Kong si trovano in mezzo, gateway open-source con piattaforme gestite opzionali. I team che danno priorità alla sovranità dei dati a volte combinano un gateway self-hosted con LLM eseguiti localmente in modo che nessuna richiesta lasci mai la loro rete.

Per la maggior parte dei team, la decisione si riduce a due domande:

  1. Vuoi il self-hosting? Sì -> LiteLLM. No -> OpenRouter per il prototyping, Merge Gateway una volta in produzione.
  2. Hai bisogno di guardrail? Sì -> Portkey. No -> rimani con no. 1.

Se stai costruendo applicazioni RAG che chiamano più provider per embedding e completamenti, un gateway è praticamente obbligatorio. Lo stesso vale per le app che necessitano di output strutturati tra provider diversi, i gateway normalizzano il formato della risposta in modo che la tua logica di parsing non si rompa quando cambi modelli.

Scegliere uno strumento è la parte facile. Farlo funzionare in modo affidabile dentro un prodotto reale è il punto in cui la maggior parte dei team si blocca, ed è esattamente ciò che il nostro team di integrazione AI costruisce per i clienti, dalle pipeline RAG agli agenti su misura. Vuoi una seconda opinione sul tuo stack? Richiedi una consulenza gratuita.

Domande frequenti

Qual è la differenza tra un LLM gateway, un proxy e un router?

Un proxy inoltra le richieste e aggiunge il logging. Un router sceglie il miglior modello/provider per ogni richiesta. Un gateway combina entrambi con tracciamento dei costi, caching, guardrail e osservabilità. In pratica, la maggior parte degli strumenti "gateway" fanno tutti e tre, i termini sono usati in modo intercambiabile.

LiteLLM è davvero gratuito?

Il proxy open-source è completamente gratuito (licenza MIT). Paghi per il tuo hosting (un VPS da $5/mese funziona per l'uso leggero) e i costi API del provider LLM. BerriAI offre piani enterprise per i team che vogliono hosting gestito, SSO e supporto.

OpenRouter aggiunge una latenza significativa?

Minima. OpenRouter aggiunge un piccolo overhead di routing (tipicamente <50ms) più qualsiasi distanza geografica tra te e i loro server. Per la maggior parte delle applicazioni, la differenza è trascurabile. Per i sistemi critici per la latenza che elaborano migliaia di richieste al secondo, un'opzione self-hosted come Bifrost è migliore.

Posso usare più gateway insieme?

Sì, e alcuni team lo fanno. Un pattern comune è usare OpenRouter per il prototipaggio rapido e passare a LiteLLM per la produzione. O usare Helicone come layer di osservabilità davanti al routing di LiteLLM. Fai solo attenzione all'accumulo di latenza.

Quale gateway ha il miglior caching?

Portkey e Cloudflare AI Gateway hanno le implementazioni di caching più mature. Portkey offre il caching semantico (corrispondenza fuzzy di prompt simili), mentre Cloudflare sfrutta la sua rete edge globale per il caching geografico. LiteLLM supporta il caching basato su Redis. Per un'analisi più approfondita delle strategie di caching, consulta la nostra guida al caching dei prompt LLM.

Ho bisogno di un gateway se uso solo un provider LLM?

Probabilmente no per il routing. Ma potresti comunque volerne uno per l'osservabilità (Helicone), il tracciamento dei costi (LiteLLM) o i guardrail (Portkey). Le funzionalità di tracciamento dei costi e logging da sole possono giustificare un gateway anche con un singolo provider.

Come gestiscono i gateway le risposte in streaming?

Tutti i gateway in questa lista supportano lo streaming server-sent events (SSE). Il gateway fa proxy del flusso dal provider al tuo client con buffering minimo. L'impatto sulla latenza per lo streaming è generalmente inferiore rispetto alle richieste non in streaming poiché l'overhead è per connessione, non per token.

Cosa succede quando un provider va offline?

La maggior parte dei gateway supporta le catene di fallback. Configuri un provider primario e uno o più fallback. Se il primario restituisce errori o supera le soglie di latenza, il gateway instrada automaticamente al provider successivo. LiteLLM, Portkey e Helicone gestiscono tutti bene questo aspetto. OpenRouter lo fa automaticamente in background.

I gateway possono imporre limiti di costo?

Sì. LiteLLM ha controlli del budget integrati per team, utente o chiave API. Portkey traccia la spesa in tempo reale con avvisi. Kong supporta le quote basate su token. Cloudflare fornisce analisi sull'utilizzo. Questo è in realtà uno degli argomenti più forti per usare un gateway, senza uno, un singolo loop impazzito può bruciare il tuo budget API in una notte.

Quale gateway è meglio per le startup rispetto alle aziende?

Startup: OpenRouter (zero configurazione) o LiteLLM (gratuito, flessibile). Aziende: TrueFoundry (sovranità dei dati, SOC 2/HIPAA/GDPR, governa sia il traffico dei modelli che quello degli agenti tramite il suo MCP Gateway), Portkey (guardrail, conformità, audit trail) o Kong AI Gateway (se si usa già Kong). I principali differenziatori enterprise sono SSO, controllo degli accessi basato sui ruoli, controlli sulla residenza dei dati e audit logging, funzionalità di cui le startup non hanno ancora bisogno ma che le aziende non possono saltare.

Qual è il miglior proxy LLM?

LiteLLM è il miglior proxy LLM per la maggior parte dei team. Funziona come un container Docker standalone, avvolge oltre 100 provider dietro un endpoint compatibile con OpenAI ed è completamente gratuito da self-hostare. Se "proxy" significa che vuoi zero infrastruttura, OpenRouter funge da proxy ospitato nel cloud con oltre 300 modelli su una singola chiave API. La distinzione sta nel controllo: LiteLLM mantiene i tuoi dati sui tuoi server; OpenRouter li instrada attraverso la sua piattaforma.

Qual è la differenza tra un LLM gateway e un LLM router?

Un LLM router seleziona quale modello o provider gestisce una determinata richiesta, tipicamente in base a costo, latenza o contenuto del prompt. Un LLM gateway fa questo e molto di più: aggiunge tracciamento dei costi, caching, guardrail, rate limiting e osservabilità sopra il layer di routing. Tutti gli strumenti in questa lista sono tecnicamente gateway. I router puri (strumenti che fanno solo la selezione del modello senza altro middleware) sono rari in produzione perché i team hanno quasi sempre bisogno almeno del logging insieme al routing.

Portkey vs. Bifrost: quale scegliere nel 2026?

Scegli Bifrost se contano soprattutto la latenza pura e la governance degli strumenti degli agenti tramite MCP: la sua architettura Go aggiunge 11 microsecondi di overhead contro i ~12ms di Portkey, e il livello OSS gratuito di Bifrost include ora un MCP Gateway con Code Mode. Scegli Portkey se ti servono guardrail sui contenuti (redazione PII, rilevamento jailbreak) funzionanti da subito senza pagare un livello Enterprise, dato che Bifrost li riserva al piano a pagamento. L'altro fattore: Portkey è stato acquisito da Palo Alto Networks a maggio 2026 e ora fa parte della sua piattaforma di sicurezza Prisma AIRS, mentre Bifrost resta un progetto open-source indipendente di Maxim AI. Nessuno dei due è meglio in assoluto: è velocità più indipendenza contro guardrail più solidità di chi c'è dietro.

Quali sono le migliori alternative a Portkey ora che appartiene a Palo Alto Networks?

Le alternative indipendenti più solide sono Bifrost (il più veloce, ora con un proprio MCP Gateway, anche se i guardrail richiedono il piano Enterprise), LiteLLM (la copertura di provider più ampia e la comunità più grande, se non ti servono guardrail integrati) e TrueFoundry (governance enterprise e certificazioni di conformità paragonabili, con un vendor ancora indipendente). Anche Helicone è open-source, ma è in modalità di manutenzione dall'acquisizione da parte di Mintlify a marzo 2026, quindi funziona meglio come scelta per l'osservabilità che come sostituto di un gateway su cui puntare a lungo termine.

Tag

llm-gatewayllm-proxyllm-routerlitellmopenroutermerge-gatewayai-infrastructure

Condividi questo articolo

Il Tuo Prossimo Passo

Hai un progetto in mente? Parliamone.

Prenota una call di 30 minuti. Ti ascoltiamo, capiamo il problema e ti diciamo se possiamo aiutarti.