
Đừng xoay sở với hàng tá API LLM nữa: 9 công cụ Gateway được xếp hạng cho năm 2026
Cập nhật lần cuối: 24 tháng 6, 2026. Chúng tôi đã xác minh lại giá, số sao GitHub, và danh sách nhà cung cấp được hỗ trợ cho cả 9 gateway, đồng thời bổ sung TrueFoundry, một mặt phẳng kiểm soát doanh nghiệp cũng quản trị quyền truy cập công cụ của agent thông qua MCP Gateway. Bản phát hành mã nguồn mở hoàn toàn của Portkey (tháng 3 năm 2026) và các con số benchmark cập nhật của Bifrost được phản ánh bên dưới.
LLM gateway tốt nhất năm 2026 là LiteLLM cho các đội tự lưu trữ và OpenRouter cho truy cập được quản lý, không cần vận hành. LiteLLM hỗ trợ hơn 100 nhà cung cấp sau một API tương thích OpenAI duy nhất, xử lý fallback và kiểm soát ngân sách, đồng thời chạy miễn phí trên bất kỳ VPS nào. OpenRouter cho phép truy cập tức thì vào hơn 300 mô hình mà không cần hạ tầng. Với các doanh nghiệp bị quản lý chặt cần chủ quyền dữ liệu cộng với khả năng quản trị trên cả lưu lượng mô hình lẫn agent, TrueFoundry chạy hoàn toàn trong VPC riêng của bạn. Với các guardrails production (che giấu PII, phát hiện jailbreak), Portkey là lựa chọn phù hợp. Với thông lượng thô trên 5.000 RPS, kiến trúc Go của Bifrost chỉ thêm 11 micro giây chi phí phụ trội.
Bạn đang gọi OpenAI cho chatbot, Anthropic cho trợ lý lập trình, và Gemini cho pipeline tóm tắt. Ba khóa API, ba SDK, ba bảng điều khiển thanh toán, ba bộ xử lý lỗi. Giờ hãy thêm logic fallback khi một nhà cung cấp gặp sự cố. Đó chính là mớ hỗn độn mà các LLM gateway giải quyết, một API thống nhất định tuyến đến bất kỳ mô hình nào, theo dõi chi phí, và tự động xử lý lỗi.
Chúng tôi đã kiểm thử mọi LLM gateway lớn và xếp hạng chúng theo những gì thực sự quan trọng: chi phí phụ trội về độ trễ, phạm vi nhà cung cấp, mức độ dễ thiết lập, và liệu chúng có đứng vững trước đợt tăng lưu lượng tiếp theo của bạn hay không.
| Xếp hạng | Công cụ | Phù hợp nhất cho | Loại | Giá khởi điểm |
|---|---|---|---|---|
| số 1 | LiteLLM | Linh hoạt tổng thể | Tự lưu trữ (mã nguồn mở) | Miễn phí |
| số 2 | OpenRouter | Truy cập đa mô hình không cần thiết lập | SaaS được quản lý | Trả theo token |
| số 3 | TrueFoundry | Quản trị doanh nghiệp + MCP | Tự lưu trữ + được quản lý | Gói miễn phí (Pro $499/tháng) |
| số 4 | Portkey | Guardrails production | Lai (mã nguồn mở + được quản lý) | Gói miễn phí |
| số 5 | Helicone | Đội ưu tiên observability | Tự lưu trữ (mã nguồn mở) | Miễn phí |
| số 6 | Bifrost | Hiệu năng thông lượng thô | Tự lưu trữ (mã nguồn mở) | Miễn phí |
| số 7 | Cloudflare AI Gateway | Định tuyến không cần hạ tầng | Được quản lý | Gói miễn phí |
| số 8 | Kong AI Gateway | Đội quản lý API | Tự lưu trữ + doanh nghiệp | Cộng đồng miễn phí |
| số 9 | TensorZero | Định tuyến tối ưu bằng ML | Tự lưu trữ (mã nguồn mở) | Miễn phí |
LLM Gateway là gì? (Và bạn có thực sự cần nó không?)
Trước khi vào xếp hạng, một sự phân biệt nhanh. Mọi người dùng "gateway," "proxy," và "router" thay thế cho nhau, nhưng chúng đảm nhận những vai trò hơi khác nhau:
- LLM Proxy: Chuyển tiếp yêu cầu đến nhà cung cấp, thêm ghi log. Logic tối thiểu.
- LLM Router: Chọn mô hình hoặc nhà cung cấp tốt nhất cho mỗi yêu cầu dựa trên chi phí, độ trễ, hoặc nội dung.
- LLM Gateway: Gói đầy đủ, proxy + router + theo dõi chi phí + caching + guardrails + observability.
Hầu hết công cụ trong danh sách này là gateway đầy đủ, nhưng một số nghiêng nhiều hơn về phía proxy hoặc router.
Bạn cần gateway nếu:
- Bạn gọi từ 2 nhà cung cấp LLM trở lên và muốn một API cho tất cả
- Bạn cần theo dõi chi phí trên nhiều nhà cung cấp (ai đang đốt ngân sách của bạn?)
- Bạn muốn tự động failover khi một nhà cung cấp gặp sự cố
- Bạn đang xây dựng các tính năng hưởng lợi từ prompt caching trên nhiều nhà cung cấp
Nếu bạn chỉ dùng một nhà cung cấp duy nhất và không có kế hoạch chuyển đổi, gateway sẽ thêm độ phức tạp không cần thiết. Hãy bỏ qua nó.
Lộ trình áp dụng điển hình: Hầu hết các đội bắt đầu bằng cách hardcode các lời gọi OpenAI trực tiếp. Sau đó họ thêm Anthropic cho một trường hợp sử dụng thứ hai và viết một hàm wrapper. Rồi họ cần logic fallback, theo dõi chi phí, và giới hạn tốc độ, và đột nhiên họ đã tự xây dựng một gateway chắp vá. Các công cụ dưới đây thay thế mớ hỗn độn tự chế đó bằng những thứ đã được kiểm chứng trong thực chiến.
1. LiteLLM, Tốt nhất tổng thể
Số sao GitHub: ~40K | Ngôn ngữ: Python | Giấy phép: MIT
LiteLLM là con dao đa năng Thụy Sĩ của các LLM gateway. Nó gói gọn hơn 100 nhà cung cấp LLM sau một API tương thích OpenAI duy nhất, nghĩa là mã SDK OpenAI hiện có của bạn hoạt động mà không cần thay đổi. Chỉ cần đổi base URL.
Thành phần proxy server là thứ biến LiteLLM thành một gateway thay vì chỉ là một SDK. Bạn triển khai nó như một dịch vụ độc lập, cấu hình mô hình trong tệp YAML, và mọi nhóm đều truy cập cùng một endpoint với tính năng theo dõi chi phí, giới hạn tốc độ, và cân bằng tải được tích hợp sẵn.
# config.yaml for LiteLLM proxy
model_list:
- model_name: gpt-4
litellm_params:
model: openai/gpt-4o
api_key: sk-...
- model_name: gpt-4
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: sk-ant-...
# LiteLLM load-balances between these automatically
general_settings:
master_key: sk-my-master-key
database_url: postgresql://...# Your app code doesn't change -- just point to the proxy
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:4000", # LiteLLM proxy
api_key="sk-my-master-key"
)
response = client.chat.completions.create(
model="gpt-4", # Routes to OpenAI or Anthropic via config
messages=[{"role": "user", "content": "Explain LLM gateways"}]
)Điểm mạnh:
- Hỗ trợ hơn 100 nhà cung cấp (phạm vi rộng nhất trong số các gateway)
- API tương thích OpenAI, không cần sửa code cho ứng dụng hiện có
- Theo dõi chi phí tích hợp, ngân sách theo nhóm/người dùng
- Chuỗi fallback: nếu OpenAI lỗi, thử Anthropic, rồi Gemini
- Tích hợp với mọi công cụ observability lớn (Langfuse, Helicone, v.v.)
Điểm chưa mạnh:
- GIL của Python giới hạn thông lượng đơn tiến trình (độ trễ P95 ~8ms ở 1K RPS)
- Proxy cần cơ sở dữ liệu PostgreSQL riêng cho các tính năng quản lý nhóm
- Cấu hình có thể trở nên phức tạp khi có nhiều mô hình và quy tắc định tuyến
- Sự cố bảo mật chuỗi cung ứng gần đây (gói PyPI độc hại, được phát hiện nhanh chóng)
Giá: Miễn phí và mã nguồn mở. Có các gói doanh nghiệp cho quản lý lưu trữ.
Nếu bạn đã đọc hướng dẫn của chúng tôi về sử dụng Claude Code với các mô hình khác nhau, bạn đã thấy LiteLLM hoạt động, nó là một trong những cách chính để lập trình viên định tuyến Claude Code qua các nhà cung cấp thay thế.
Đánh giá: LiteLLM là LLM gateway tổng thể tốt nhất cho các đội muốn linh hoạt tối đa và không ngại tự lưu trữ. Nó có phạm vi nhà cung cấp rộng nhất, hệ sinh thái trưởng thành nhất, và cộng đồng lớn nhất. Hãy bắt đầu ở đây trừ khi bạn có lý do cụ thể để không làm vậy. Hướng dẫn thiết lập proxy LiteLLM của chúng tôi hướng dẫn triển khai Docker đầy đủ với PostgreSQL trong chưa đầy 20 phút.
2. OpenRouter, Gateway được quản lý tốt nhất
Số mô hình: 300+ | Loại: SaaS được quản lý | Giấy phép: Độc quyền
OpenRouter đi theo hướng ngược lại với LiteLLM: bạn không cần triển khai bất kỳ thứ gì. Đăng ký, nhận khóa API, và bạn có quyền truy cập tức thì vào hơn 300 mô hình từ mọi nhà cung cấp lớn qua một endpoint duy nhất. Đây là "kho ứng dụng" của các API LLM.
Giá trị cốt lõi là sự đơn giản. Không có hạ tầng nào để duy trì, không cần viết cấu hình YAML, không cần provision cơ sở dữ liệu. Bạn trả trước credit hoặc liên kết thẻ, và OpenRouter xử lý việc hợp nhất thanh toán trên tất cả nhà cung cấp.
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key="sk-or-..."
)
# Access any model from any provider -- same code
response = client.chat.completions.create(
model="anthropic/claude-sonnet-4-20250514",
messages=[{"role": "user", "content": "Compare LLM gateways"}]
)Điểm mạnh:
- Hơn 300 mô hình, một khóa API duy nhất, một bảng điều khiển thanh toán
- Hơn 25 mô hình miễn phí để prototype (bao gồm một số mô hình mạnh đến bất ngờ)
- Không có hạ tầng để quản lý, đăng ký và bắt đầu gọi
- Tính năng so sánh mô hình giúp bạn đánh giá trước khi cam kết
- Xử lý sự cố nhà cung cấp bằng định tuyến fallback tự động
Điểm chưa mạnh:
- Phí nền tảng 5,5% cộng thêm vào giá nhà cung cấp, tích lũy đáng kể ở quy mô lớn
- Không có tùy chọn tự lưu trữ, dữ liệu của bạn đi qua máy chủ của OpenRouter
- Observability hạn chế so với các công cụ gateway chuyên dụng
- Giới hạn tốc độ ở gói miễn phí có thể hạn chế với khối lượng công việc production
- Không có logic định tuyến tùy chỉnh, bạn nhận được những gì OpenRouter quyết định
Giá: Trả theo token (giá nhà cung cấp + phí 5,5%). Không có mức tối thiểu hàng tháng. Có sẵn hơn 25 mô hình miễn phí.
Đánh giá: OpenRouter là cách nhanh nhất để truy cập nhiều nhà cung cấp LLM. Nếu bạn muốn prototype với các mô hình khác nhau hoặc chạy khối lượng công việc vừa và nhỏ mà không cần quản lý hạ tầng, đây là lựa chọn hiển nhiên. Ở quy mô lớn, mức phí 5,5% bắt đầu đáng kể. Nếu giảm chi phí là động lực, hãy xem hướng dẫn giảm chi phí API LLM của chúng tôi để có phân tích đầy đủ về caching, batching, và các đòn bẩy tiết kiệm ở cấp gateway.
3. TrueFoundry, Tốt nhất cho quản trị doanh nghiệp
Số mô hình: 1.600+ | Nhà cung cấp: 250+ | Loại: Tự lưu trữ + được quản lý | Triển khai: VPC, on-prem, cách ly mạng (air-gapped)
AI Gateway của TrueFoundry được xây dựng cho trường hợp mà các gateway mã nguồn mở gặp khó: một doanh nghiệp bị quản lý chặt cần một mặt phẳng kiểm soát duy nhất cho mọi mô hình, chủ quyền dữ liệu đầy đủ, và nhật ký kiểm toán có thể vượt qua các cuộc rà soát tuân thủ. Nó chạy trong VPC riêng của bạn, on-prem, hoặc hoàn toàn cách ly mạng, nên không có dữ liệu yêu cầu nào rời khỏi miền của bạn, và nó đi kèm với tuân thủ SOC 2, HIPAA, và GDPR, SSO, cùng RBAC ngay từ đầu.
Phạm vi thuộc hàng rộng nhất trong danh sách này: hơn 1.600 mô hình trên 250+ nhà cung cấp (OpenAI, Anthropic, Gemini, Groq, Mistral), cộng với các backend tự lưu trữ như vLLM, SGLang, và Triton. TrueFoundry báo cáo độ trễ nội bộ dưới 3ms ở tải doanh nghiệp và thời gian hoạt động 99,99% trên hơn 10 tỷ yêu cầu mỗi tháng, nên lớp quản trị không khiến bạn phải đánh đổi thông lượng.
from openai import OpenAI
client = OpenAI(
base_url="https://<your-org>.truefoundry.com/api/llm", # your gateway
api_key="tfy-..."
)
response = client.chat.completions.create(
model="openai/gpt-4o", # routed, logged, and rate-limited centrally
messages=[{"role": "user", "content": "Summarize this contract"}]
)Điều phân biệt TrueFoundry với Portkey hay LiteLLM là MCP Gateway: một registry trung tâm quản trị cách các agent AI tiếp cận công cụ doanh nghiệp (Slack, GitHub, Confluence, Datadog) qua Model Context Protocol. Bạn đăng ký các API nội bộ làm máy chủ MCP, bảo vệ chúng sau Okta hoặc Azure AD với RBAC theo từng máy chủ, và có chức năng truy vết ở cấp yêu cầu cho mọi lời gọi công cụ. Điều đó mang lại cho bạn một mặt phẳng kiểm soát được quản trị duy nhất cho cả lưu lượng mô hình và lưu lượng công cụ của agent, điều này trở nên quan trọng khi các agent bắt đầu thực hiện hành động, chứ không chỉ tạo văn bản.
Không như hầu hết gateway doanh nghiệp, TrueFoundry công khai bảng giá ngay từ đầu. Gói Developer miễn phí bao gồm 50.000 yêu cầu mỗi tháng, 3 người dùng, và MCP Gateway cho tối đa 5 máy chủ, đủ để prototype toàn bộ stack trước khi bạn nói chuyện với bất kỳ ai. Gói Pro có giá $499/tháng cho 1 triệu yêu cầu, 10 người dùng, semantic caching, mô hình ảo, và định tuyến nâng cao, với lưu lượng phát sinh được tính theo đơn giá cố định trên mỗi đơn vị. Gói Pro Plus có giá $2.999/tháng và bổ sung metadata tùy chỉnh, cảnh báo, và xuất giám sát cho 25 người dùng. Gói Enterprise được báo giá tùy chỉnh cho hơn 10 triệu yêu cầu với VPC đầy đủ, đa vùng, và cài đặt cách ly mạng cho cả mặt phẳng kiểm soát và gateway. Mọi gói trả phí đều bao gồm bản dùng thử 7 ngày. SaaS được quản lý không có chi phí lưu trữ; nếu bạn tự lưu trữ gateway trong cloud riêng của mình (BYOC), hãy dự trù khoảng $600 đến $1.000 mỗi tháng cho hạ tầng cơ sở.
Điểm mạnh:
- Hơn 1.600 mô hình, 250+ nhà cung cấp, cộng với backend tự lưu trữ (vLLM, SGLang, Triton)
- Chạy trong VPC, on-prem, hoặc cách ly mạng; không có dữ liệu nào rời khỏi miền của bạn
- Tuân thủ SOC 2, HIPAA, GDPR, SSO, RBAC, và ghi log kiểm toán được tích hợp sẵn
- Guardrails: lọc PII, phát hiện độc hại, quét prompt-injection
- MCP Gateway quản trị quyền truy cập công cụ của agent, không chỉ lời gọi mô hình
- Bảng giá công khai, minh bạch với gói Developer thực sự miễn phí (50K yêu cầu/tháng)
- TrueFoundry báo cáo giảm trung bình ~30% chi phí nhờ định tuyến, caching, và ngân sách
Điểm chưa mạnh:
- Ưu tiên doanh nghiệp: nặng hơn LiteLLM hoặc OpenRouter cho một dự án nhỏ
- Nền tảng cốt lõi là độc quyền (các kho mã nguồn mở của họ là công cụ hạ tầng riêng biệt)
- Tự lưu trữ gateway tăng thêm khoảng $600 đến $1.000/tháng cho hạ tầng ngoài gói của bạn
- Có giá trị nhất khi bạn có nhiều nhóm và công cụ cần quản trị, không phải ngay từ ngày đầu
Giá: Gói Developer miễn phí ($0/tháng, 50K yêu cầu, 3 người dùng). Pro $499/tháng (1 triệu yêu cầu, 10 người dùng, semantic caching, định tuyến nâng cao). Pro Plus $2.999/tháng (25 người dùng, observability nâng cao). Enterprise tùy chỉnh (hơn 10 triệu yêu cầu, VPC đầy đủ và cách ly mạng). Bản dùng thử 7 ngày cho các gói trả phí; SaaS được quản lý không có chi phí lưu trữ, tự lưu trữ tăng thêm ~$600-$1.000/tháng cho hạ tầng.
Đánh giá: TrueFoundry là gateway dành cho doanh nghiệp cần một mặt phẳng kiểm soát được quản trị cho cả lưu lượng mô hình và truy cập công cụ của agent, với dữ liệu ở lại trong hạ tầng riêng của họ. Nếu bạn là startup đang kết nối hai nhà cung cấp, nó vượt quá nhu cầu của bạn, hãy bắt đầu với LiteLLM. Nếu bạn là nhóm nền tảng đang triển khai AI cho hàng chục nhóm nội bộ dưới yêu cầu tuân thủ, nó xứng đáng có trong danh sách rút gọn của bạn.
4. Portkey, Tốt nhất cho guardrails production
Số sao GitHub: ~7K | Ngôn ngữ: TypeScript/Node.js | Giấy phép: Apache 2.0 (gateway), nền tảng được quản lý
Portkey tự định vị là "mặt phẳng kiểm soát cho AI." Trong khi LiteLLM tập trung vào định tuyến và OpenRouter vào sự đơn giản, điểm khác biệt của Portkey là an toàn production: guardrails, che giấu PII, phát hiện jailbreak, và nhật ký kiểm toán được tích hợp vào lớp gateway.
Tính đến tháng 3 năm 2026, Portkey đã mã nguồn mở toàn bộ gateway của họ (Apache 2.0), nên bạn có thể tự lưu trữ phần định tuyến cốt lõi và guardrails mà không cần nền tảng được quản lý.
from portkey_ai import Portkey
portkey = Portkey(
api_key="pk-...",
config={
"strategy": {"mode": "fallback"},
"targets": [
{"provider": "openai", "override_params": {"model": "gpt-4o"}},
{"provider": "anthropic", "override_params": {"model": "claude-sonnet-4-20250514"}}
]
}
)
response = portkey.chat.completions.create(
messages=[{"role": "user", "content": "Summarize this document"}]
)Điểm mạnh:
- Hỗ trợ hơn 1.600 mô hình trên nhiều nhà cung cấp
- Guardrails tích hợp: phát hiện PII, ngăn chặn jailbreak, lọc nội dung
- Quản lý và phiên bản hóa prompt ngay trong gateway
- Lớp caching giảm các lời gọi lặp lại (tiết kiệm tiền và độ trễ)
- Nhật ký kiểm toán và tính năng tuân thủ cho các ngành bị quản lý
- Giờ đây gateway đã mã nguồn mở hoàn toàn (tháng 3 năm 2026)
Điểm chưa mạnh:
- Giá nền tảng được quản lý khởi điểm $49/tháng cho các tính năng production
- Gói doanh nghiệp ($5K-$10K/tháng) cho quản trị nâng cao
- Nền tảng thêm độ phức tạp vượt quá những gì các gateway đơn giản hơn cung cấp
- Đường cong học tập dốc hơn LiteLLM hoặc OpenRouter
Giá: Gateway mã nguồn mở miễn phí. Nền tảng được quản lý: Gói miễn phí (prototype), $49/tháng (production), doanh nghiệp tùy chỉnh.
Đánh giá: Portkey là gateway dành cho các đội đang xây dựng tính năng LLM hướng đến khách hàng, những người không thể chấp nhận rủi ro từ prompt injection, rò rỉ PII, hoặc chi phí không được giám sát. Các guardrails biện minh cho độ phức tạp. Nếu bạn đang xây dựng công cụ nội bộ, có những lựa chọn đơn giản hơn.
5. Helicone, Tốt nhất cho đội ưu tiên observability
Số sao GitHub: ~3K | Ngôn ngữ: Rust | Giấy phép: Apache 2.0
Helicone bắt đầu như một công cụ observability và phát triển thành một gateway đầy đủ. Nguồn gốc đó rất quan trọng, khả năng giám sát và phân tích của nó thuộc hàng tốt nhất, và các tính năng gateway (định tuyến, caching, failover) được xây dựng trên một nền tảng observability vững như bàn thạch.
Việc được viết bằng Rust mang lại cho nó lợi thế hiệu năng thực sự: độ trễ P50 là 8ms, P95 dưới 5ms, khoảng 3.000 RPS trên một instance duy nhất với chỉ 64MB bộ nhớ.
# Helicone: one-line proxy -- just change the base URL
from openai import OpenAI
client = OpenAI(
base_url="https://oai.helicone.ai/v1", # or your self-hosted URL
api_key="sk-...",
default_headers={
"Helicone-Auth": "Bearer hlc-..."
}
)
# All requests are now logged, tracked, and routed through Helicone
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Analyze this code"}]
)Điểm mạnh:
- Nền tảng Rust: ~64MB bộ nhớ, độ trễ P95 <5ms, 3K RPS mỗi instance
- Cân bằng tải nhận biết tình trạng sức khỏe định tuyến đến nhà cung cấp nhanh nhất hiện có
- Dashboard thời gian thực cho chi phí, độ trễ, mức sử dụng token, và tỷ lệ lỗi
- Tích hợp một dòng, đúng nghĩa chỉ cần đổi base URL
- Triển khai binary duy nhất (Docker, K8s, máy chủ vật lý)
Điểm chưa mạnh:
- Tính năng observability là ngôi sao; định tuyến kém tinh vi hơn LiteLLM
- Ít nhà cung cấp được hỗ trợ hơn LiteLLM hoặc OpenRouter
- Cộng đồng nhỏ hơn LiteLLM (3K so với 40K sao GitHub)
- Tính năng nâng cao (thuộc tính tùy chỉnh, phiên) yêu cầu nền tảng được quản lý
Giá: Mã nguồn mở và miễn phí khi tự lưu trữ. Giá nền tảng được quản lý thay đổi.
Nếu bạn đang đánh giá các công cụ observability một cách rộng hơn, bảng xếp hạng nền tảng observability AI tốt nhất của chúng tôi đề cập đến Helicone cùng với Langfuse, Arize, và những nền tảng khác.
Đánh giá: Helicone là gateway tốt nhất cho các đội mà nỗi đau chính là "chúng tôi không thể nhìn thấy điều gì đang xảy ra với các lời gọi LLM của mình." Nếu observability là mối quan tâm số 1 của bạn và định tuyến gateway là thứ yếu, Helicone mang lại cho bạn cả hai mà không phải đánh đổi.
6. Bifrost, Tốt nhất cho hiệu năng thô
Số sao GitHub: ~2K | Ngôn ngữ: Go | Giấy phép: MIT
Bifrost là nhà vô địch về hiệu năng. Được xây dựng bằng Go bởi nhóm Maxim, nó tuyên bố hiệu năng nhanh hơn 50 lần so với LiteLLM với chỉ 11 micro giây chi phí phụ trội cho mỗi yêu cầu ở 5.000 RPS. Đó không phải những con số lý thuyết, chúng đến từ các bài kiểm tra tải kéo dài có thể tái tạo.
Sự khác biệt về kiến trúc mang tính nền tảng: goroutine của Go xử lý hàng nghìn kết nối đồng thời mà không gặp nút thắt GIL của Python, và binary được biên dịch loại bỏ hoàn toàn chi phí trình thông dịch.
# bifrost.yaml
account:
provider: openai
api_key: ${OPENAI_API_KEY}
models:
- name: gpt-4o
provider: openai
- name: claude-sonnet-4-20250514
provider: anthropic
routing:
strategy: round-robin
fallback: trueĐiểm mạnh:
- Chi phí phụ trội 11us ở 5.000 RPS, thấp nhất trong số các gateway trong danh sách này
- Binary Go: không có phụ thuộc runtime, dung lượng bộ nhớ nhỏ
- Cân bằng tải thích ứng trên các nhà cung cấp
- Chế độ cluster để mở rộng theo chiều ngang
- Hỗ trợ hơn 1.000 mô hình
Điểm chưa mạnh:
- Dự án mới hơn, cộng đồng nhỏ hơn và ít tích hợp hơn
- Tính năng observability kém trưởng thành hơn Helicone hoặc Portkey
- Được xây dựng bởi Maxim (một nhà cung cấp), hướng đi tương lai gắn với lộ trình của họ
- Tài liệu mỏng hơn so với tài liệu phong phú của LiteLLM
- Không có quản lý nhóm hoặc kiểm soát ngân sách tích hợp
Giá: Miễn phí và mã nguồn mở (giấy phép MIT).
Đánh giá: Bifrost dành cho các đội đang vận hành hệ thống production có thông lượng cao nơi chi phí gateway quan trọng. Nếu bạn đang xử lý hàng nghìn lời gọi LLM mỗi giây và mỗi micro giây độ trễ đều đáng kể, kiến trúc Go của Bifrost sẽ đáp ứng. Với hầu hết các đội, chi phí phụ trội 8ms của LiteLLM là hoàn toàn ổn.
7. Cloudflare AI Gateway, Lựa chọn không cần hạ tầng tốt nhất
Loại: Dịch vụ được quản lý | Giấy phép: Độc quyền (Cloudflare)
Cloudflare AI Gateway đưa cách tiếp cận "bạn không quản lý gì" đến cực đoan. Nếu bạn đã ở trên Cloudflare (và nhiều đội đang như vậy), bạn có thể kích hoạt AI Gateway từ bảng điều khiển và bắt đầu định tuyến lời gọi LLM qua mạng edge của Cloudflare mà không cần thêm bất kỳ hạ tầng nào.
// Just prefix your provider URL with Cloudflare's gateway endpoint
const response = await fetch(
"https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_name}/openai/chat/completions",
{
method: "POST",
headers: {
"Authorization": "Bearer sk-...",
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "gpt-4o",
messages: [{ role: "user", content: "Hello" }]
})
}
);Điểm mạnh:
- Gói miễn phí với 100K log/tháng, đủ cho hầu hết dự án phụ
- Không cần hạ tầng: kích hoạt từ bảng điều khiển Cloudflare
- Caching tích hợp tại edge (giảm chi phí và độ trễ)
- Bao gồm giới hạn tốc độ và phân tích
- Thanh toán thống nhất: trả chi phí nhà cung cấp LLM qua Cloudflare
- Mạng edge toàn cầu giảm độ trễ cho người dùng phân tán về mặt địa lý
Điểm chưa mạnh:
- Gắn chặt với hệ sinh thái Cloudflare, chi phí chuyển đổi là có thực
- Trí thông minh định tuyến hạn chế so với các gateway chuyên dụng
- Giới hạn 100K log ở gói miễn phí; gói trả phí (Workers Paid) cho 1M
- Ít nhà cung cấp được hỗ trợ hơn LiteLLM hoặc OpenRouter
- Không có tùy chọn tự lưu trữ
Giá: Miễn phí (100K log/tháng), gói đăng ký Workers Paid cho 1M log. Không có phí gateway trên mỗi yêu cầu. Bạn vẫn trả tiền cho nhà cung cấp LLM riêng.
Với các đội định tuyến function call trên nhiều nhà cung cấp, caching edge của Cloudflare có thể giảm đáng kể độ trễ cho các mẫu sử dụng công cụ lặp đi lặp lại.
Đánh giá: Cloudflare AI Gateway là lựa chọn tốt nhất nếu bạn đã ở trên Cloudflare và muốn các tính năng gateway mà không cần triển khai bất kỳ thứ gì mới. Gói miễn phí hào phóng cho các dự án nhỏ. Với việc sử dụng production nghiêm túc, các gateway chuyên dụng cung cấp nhiều quyền kiểm soát hơn.
8. Kong AI Gateway, Tốt nhất cho đội quản lý API
Số sao GitHub: ~40K (tổng số của Kong Gateway) | Ngôn ngữ: Lua/OpenResty | Giấy phép: Apache 2.0 (cộng đồng)
Kong AI Gateway không phải sản phẩm độc lập, nó là phần mở rộng của Kong API Gateway đã được kiểm chứng trong thực chiến, bổ sung các khả năng dành riêng cho LLM. Nếu tổ chức của bạn đã chạy Kong cho quản lý API, việc thêm định tuyến AI chỉ là cài đặt plugin, không phải một nền tảng mới.
# Kong declarative config (deck)
services:
- name: ai-llm-service
url: https://api.openai.com
plugins:
- name: ai-proxy
config:
route_type: llm/v1/chat
model:
provider: openai
name: gpt-4o
- name: ai-rate-limiting-advanced
config:
limit: [10000]
window_size: [60]
window_type: fixed
strategy: local
limit_by: consumerĐiểm mạnh:
- Xây dựng trên nền tảng quản lý API trưởng thành của Kong (được hàng nghìn doanh nghiệp sử dụng)
- Định tuyến ngữ nghĩa: định tuyến yêu cầu dựa trên nội dung/ý định của prompt
- Giới hạn tốc độ dựa trên token (không chỉ dựa trên yêu cầu)
- Hệ sinh thái plugin: xác thực, giới hạn tốc độ, biến đổi đều hoạt động với các tuyến AI
- Số liệu OpenTelemetry + Prometheus để tích hợp Datadog/Grafana
Điểm chưa mạnh:
- Quá mức cần thiết nếu bạn chưa dùng Kong, đường cong học tập dốc
- Tính năng AI doanh nghiệp yêu cầu giấy phép Kong Enterprise (trả phí)
- Độ phức tạp cấu hình cao hơn bất kỳ gateway nào khác trong danh sách này
- Yêu cầu kiến thức về hạ tầng Kong (hoặc nhóm phải học nó)
- Tính năng dành riêng cho AI mới hơn và kém trưởng thành hơn so với phần lõi của Kong
Giá: Phiên bản cộng đồng miễn phí (mã nguồn mở). Tính năng AI doanh nghiệp yêu cầu đăng ký Kong Enterprise (giá tùy chỉnh).
Đánh giá: Kong AI Gateway chỉ hợp lý khi và chỉ khi tổ chức của bạn đã chạy Kong. Thêm định tuyến LLM vào lớp quản lý API hiện có của bạn thông minh hơn là triển khai một gateway riêng. Nhưng đừng áp dụng Kong chỉ vì định tuyến LLM, điều đó giống như mua máy kéo để cắt cỏ vậy.
9. TensorZero, Tốt nhất cho định tuyến tối ưu bằng ML
Số sao GitHub: ~5,5K | Ngôn ngữ: Rust | Giấy phép: Apache 2.0
TensorZero là gateway có quan điểm rõ ràng nhất trong danh sách này. Trong khi những gateway khác tập trung vào định tuyến và observability, TensorZero xây dựng một vòng lặp tối ưu hóa: nó thu thập dữ liệu suy luận, chạy đánh giá, và sử dụng kết quả để cải thiện quyết định định tuyến theo thời gian. Hãy nghĩ về nó như một gateway học được mô hình nào hoạt động tốt nhất cho loại yêu cầu nào.
Triển khai Rust mang lại độ trễ P99 dưới mili giây, ngay cả ở hơn 10.000 QPS. Đó không phải lỗi đánh máy. Trong khi LiteLLM thêm ~8ms và Bifrost thêm ~11us, TensorZero tuyên bố P99 <1ms dưới tải cực lớn.
# TensorZero: structured inference with optimization
from tensorzero import TensorZeroGateway
with TensorZeroGateway("http://localhost:3000") as client:
response = client.inference(
function_name="generate_summary",
input={
"messages": [
{"role": "user", "content": "Summarize this article..."}
]
}
)
# Later: feed back quality data to improve routing
client.feedback(
metric_name="summary_quality",
inference_id=response.inference_id,
value=0.92
)Điểm mạnh:
- Độ trễ P99 <1ms ở hơn 10K QPS (hiệu năng thô nhanh nhất với Rust)
- Vòng lặp phản hồi: học mô hình nào hoạt động tốt nhất cho từng function
- Suy luận có cấu trúc với xác thực schema
- Kiểm thử A/B giữa các mô hình được tích hợp vào gateway
- Framework đánh giá tích hợp
Điểm chưa mạnh:
- Đường cong học tập dốc hơn bất kỳ gateway nào khác, bạn định nghĩa "function," không chỉ mô hình
- Hệ sinh thái mới hơn, cộng đồng nhỏ hơn
- Yêu cầu suy nghĩ lại về tích hợp LLM của bạn xung quanh khái niệm function của TensorZero
- Ít "cắm và chạy" hơn LiteLLM hoặc OpenRouter, không phải chỉ đổi base URL đơn giản
- Tài liệu đang cải thiện nhưng vẫn đang trưởng thành
Giá: Miễn phí và mã nguồn mở (Apache 2.0).
Với các đội đã chạy đánh giá LLM, vòng lặp phản hồi của TensorZero thu hẹp khoảng cách giữa đánh giá và định tuyến, điểm đánh giá của bạn trực tiếp cải thiện việc mô hình nào được định tuyến đến.
Đánh giá: TensorZero dành cho các đội kỹ thuật ML muốn gateway của họ trở nên thông minh hơn theo thời gian. Vòng lặp tối ưu hóa thực sự sáng tạo. Nhưng đường cong học tập rất dốc, và hầu hết các đội không cần định tuyến tối ưu bằng ML, họ cần định tuyến đáng tin cậy với observability tốt.
Chi phí phụ trội độ trễ của LLM Gateway: Những con số thực
Mọi gateway đều thêm một số chi phí phụ trội vào các lời gọi LLM của bạn. Câu hỏi là liệu nó có quan trọng với trường hợp sử dụng của bạn không. Đây là cách các gateway thể hiện trong kiểm thử của chúng tôi:
| Gateway | Ngôn ngữ | Chi phí phụ trội độ trễ P50 | Chi phí phụ trội độ trễ P95 | Thông lượng (instance đơn) |
|---|---|---|---|---|
| Bifrost | Go | ~8us | ~11us | 5.000+ RPS |
| TensorZero | Rust | ~0,3ms | <1ms | 10.000+ QPS |
| Helicone | Rust | ~5ms | ~8ms | ~3.000 RPS |
| TrueFoundry | Tự lưu trữ | ~3ms† | <3ms† | 10 tỷ+/tháng (nhà cung cấp) |
| LiteLLM | Python | ~4ms | ~8ms | ~1.000 RPS |
| Portkey | TypeScript | ~5ms | ~12ms | ~2.000 RPS |
| OpenRouter | Được quản lý | ~15-30ms | ~50ms | N/A (được quản lý) |
| Cloudflare AI GW | Được quản lý | ~10-20ms | ~40ms | N/A (được quản lý) |
| Kong AI Gateway | Lua/Go | ~3ms | ~8ms | ~3.000 RPS |
† Con số dưới 3ms của TrueFoundry là do nhà cung cấp báo cáo; chúng tôi đã không chạy nó qua cùng một bài kiểm tra tải độc lập như các gateway mã nguồn mở tự lưu trữ.
Ngữ cảnh rất quan trọng. Một lời gọi GPT-4o điển hình mất 500-3.000ms tùy thuộc vào độ dài đầu ra. Ngay cả chi phí phụ trội 8ms của LiteLLM cũng chưa đến 1% tổng độ trễ. Kịch bản duy nhất mà chi phí gateway quan trọng là khối lượng công việc tần suất cao, độ trễ thấp như phân loại thời gian thực hoặc tạo embedding ở quy mô lớn. Với AI hội thoại hoặc tạo nội dung, bất kỳ gateway nào trong danh sách này đều đủ nhanh.
Các gateway được quản lý (OpenRouter, Cloudflare) thêm nhiều chi phí phụ trội hơn vì yêu cầu của bạn đi đến máy chủ của họ trước khi đến nhà cung cấp. Gateway tự lưu trữ chạy song song với ứng dụng của bạn, nên chặng bổ sung là cục bộ.
Cách chọn đúng LLM Gateway
Bỏ qua các bảng tính năng. Đây là quyết định trong một bảng duy nhất:
| Nếu bạn cần... | Chọn | Lý do |
|---|---|---|
| Linh hoạt tối đa + tự lưu trữ | LiteLLM | Hơn 100 nhà cung cấp, cộng đồng lớn nhất, nhiều tích hợp nhất |
| Truy cập đa mô hình nhanh, không cần vận hành | OpenRouter | Đăng ký và bắt đầu gọi hơn 300 mô hình |
| Quản trị doanh nghiệp + chủ quyền dữ liệu | TrueFoundry | Chạy trong VPC của bạn, SOC 2/HIPAA/GDPR, MCP Gateway cho công cụ agent |
| Guardrails production + tuân thủ | Portkey | Che giấu PII, phát hiện jailbreak, nhật ký kiểm toán |
| Observability là ưu tiên | Helicone | Giám sát tốt nhất, hiệu năng Rust, thiết lập một dòng |
| Chi phí phụ trội độ trễ thấp nhất có thể | Bifrost | Chi phí phụ trội 11us bằng Go, chế độ cluster |
| Đã ở trên Cloudflare | Cloudflare AI GW | Miễn phí, caching edge, không cần hạ tầng mới |
| Đã chạy Kong | Kong AI GW | Thêm định tuyến LLM vào quản lý API hiện có |
| Tối ưu hóa định tuyến hướng ML | TensorZero | Vòng lặp phản hồi, kiểm thử A/B, gateway Rust <1ms |
Một lưu ý về tự lưu trữ so với được quản lý: Gateway tự lưu trữ (LiteLLM, Helicone, Bifrost, TensorZero) cho bạn toàn quyền kiểm soát luồng dữ liệu, không có gì rời khỏi hạ tầng của bạn ngoài lời gọi API LLM thực tế. Điều đó quan trọng với y tế, tài chính, và bất kỳ ngữ cảnh nào mà cư trú dữ liệu là yêu cầu bắt buộc. Gateway được quản lý (OpenRouter, Cloudflare) đánh đổi quyền kiểm soát đó để lấy gánh nặng vận hành bằng không. Portkey và Kong nằm ở giữa, gateway mã nguồn mở với nền tảng được quản lý tùy chọn. Các đội ưu tiên chủ quyền dữ liệu đôi khi kết hợp gateway tự lưu trữ với LLM chạy cục bộ để không yêu cầu nào rời khỏi mạng của họ.
Với hầu hết các đội, quyết định thu gọn lại thành hai câu hỏi:
- Bạn có muốn tự lưu trữ không? Có -> LiteLLM. Không -> OpenRouter.
- Bạn có cần guardrails không? Có -> Portkey. Không -> giữ nguyên lựa chọn số 1.
Nếu bạn đang xây dựng ứng dụng RAG gọi nhiều nhà cung cấp cho embedding và completion, gateway gần như là bắt buộc. Điều tương tự cũng áp dụng cho các ứng dụng cần đầu ra có cấu trúc trên các nhà cung cấp khác nhau, gateway chuẩn hóa định dạng phản hồi để logic phân tích cú pháp của bạn không bị vỡ khi chuyển đổi mô hình.
Chọn công cụ là nửa dễ dàng. Làm cho nó chạy đáng tin cậy bên trong một sản phẩm thực tế là nơi hầu hết các đội bị đình trệ, và đó chính xác là những gì đội tích hợp AI của chúng tôi xây dựng cho khách hàng, từ pipeline RAG đến agent tùy chỉnh. Muốn có ý kiến thứ hai về stack của bạn? Nhận tư vấn miễn phí.
Câu hỏi thường gặp
Sự khác biệt giữa LLM gateway, proxy, và router là gì?
Proxy chuyển tiếp yêu cầu và thêm ghi log. Router chọn mô hình/nhà cung cấp tốt nhất cho mỗi yêu cầu. Gateway kết hợp cả hai với theo dõi chi phí, caching, guardrails, và observability. Trong thực tế, hầu hết công cụ "gateway" đều làm cả ba, các thuật ngữ này được sử dụng thay thế cho nhau.
LiteLLM có thực sự miễn phí không?
Proxy mã nguồn mở hoàn toàn miễn phí (giấy phép MIT). Bạn trả tiền cho lưu trữ riêng của mình (một VPS $5/tháng là đủ cho mức sử dụng nhẹ) và chi phí API của nhà cung cấp LLM. BerriAI cung cấp các gói doanh nghiệp cho các đội muốn lưu trữ được quản lý, SSO, và hỗ trợ.
OpenRouter có thêm độ trễ đáng kể không?
Tối thiểu. OpenRouter thêm một chi phí định tuyến nhỏ (thường <50ms) cộng với khoảng cách địa lý giữa bạn và máy chủ của họ. Với hầu hết ứng dụng, sự khác biệt là không đáng kể. Với các hệ thống nhạy cảm về độ trễ xử lý hàng nghìn yêu cầu mỗi giây, các tùy chọn tự lưu trữ như Bifrost hoặc TensorZero sẽ tốt hơn.
Tôi có thể sử dụng nhiều gateway cùng nhau không?
Có, và một số đội làm vậy. Một mẫu phổ biến là dùng OpenRouter cho prototype nhanh và chuyển sang LiteLLM cho production. Hoặc dùng Helicone làm lớp observability phía trước định tuyến của LiteLLM. Chỉ cần lưu ý về độ trễ chồng chất.
Gateway nào có caching tốt nhất?
Portkey và Cloudflare AI Gateway có các triển khai caching trưởng thành nhất. Portkey cung cấp semantic caching (khớp mờ các prompt tương tự), trong khi Cloudflare sử dụng mạng edge toàn cầu để caching theo vị trí địa lý. LiteLLM hỗ trợ caching dựa trên Redis. Để tìm hiểu sâu hơn về chiến lược caching, hãy xem hướng dẫn prompt caching LLM của chúng tôi.
Tôi có cần gateway nếu chỉ dùng một nhà cung cấp LLM không?
Có lẽ không cần cho định tuyến. Nhưng bạn vẫn có thể muốn có nó cho observability (Helicone), theo dõi chi phí (LiteLLM), hoặc guardrails (Portkey). Chỉ riêng các tính năng theo dõi chi phí và ghi log cũng có thể biện minh cho một gateway ngay cả với một nhà cung cấp duy nhất.
Gateway xử lý phản hồi streaming như thế nào?
Tất cả gateway trong danh sách này đều hỗ trợ streaming qua server-sent events (SSE). Gateway proxy luồng từ nhà cung cấp đến client của bạn với bộ đệm tối thiểu. Tác động độ trễ trên streaming thường thấp hơn so với yêu cầu không streaming vì chi phí phụ trội là trên mỗi kết nối, không phải mỗi token.
Điều gì xảy ra khi một nhà cung cấp gặp sự cố?
Hầu hết gateway hỗ trợ chuỗi fallback. Bạn cấu hình một nhà cung cấp chính và một hoặc nhiều nhà cung cấp dự phòng. Nếu nhà cung cấp chính trả về lỗi hoặc vượt quá ngưỡng độ trễ, gateway tự động định tuyến đến nhà cung cấp tiếp theo. LiteLLM, Portkey, và Helicone đều xử lý việc này tốt. OpenRouter làm điều đó tự động ở hậu trường.
Gateway có thể thực thi giới hạn chi phí không?
Có. LiteLLM có kiểm soát ngân sách tích hợp cho mỗi nhóm, người dùng, hoặc khóa API. Portkey theo dõi chi tiêu theo thời gian thực với cảnh báo. Kong hỗ trợ hạn ngạch dựa trên token. Cloudflare cung cấp phân tích mức sử dụng. Đây thực sự là một trong những lập luận mạnh nhất cho việc sử dụng gateway, nếu không có nó, một vòng lặp ngoài tầm kiểm soát duy nhất có thể đốt cháy ngân sách API của bạn qua đêm.
Gateway nào tốt nhất cho startup so với doanh nghiệp?
Startup: OpenRouter (không cần thiết lập) hoặc LiteLLM (miễn phí, linh hoạt). Doanh nghiệp: TrueFoundry (chủ quyền dữ liệu, SOC 2/HIPAA/GDPR, quản trị cả lưu lượng mô hình và công cụ agent qua MCP Gateway), Portkey (guardrails, tuân thủ, nhật ký kiểm toán), hoặc Kong AI Gateway (nếu đã dùng Kong). Các điểm khác biệt chính cho doanh nghiệp là SSO, truy cập dựa trên vai trò, kiểm soát cư trú dữ liệu, và ghi log kiểm toán, những tính năng mà startup chưa cần nhưng doanh nghiệp không thể bỏ qua.
LLM proxy tốt nhất là gì?
LiteLLM là LLM proxy tốt nhất cho hầu hết các đội. Nó chạy như một container Docker độc lập, gói gọn hơn 100 nhà cung cấp sau một endpoint tương thích OpenAI, và hoàn toàn miễn phí để tự lưu trữ. Nếu "proxy" có nghĩa là bạn muốn không có hạ tầng, OpenRouter hoạt động như một proxy được lưu trữ trên cloud với hơn 300 mô hình trên một khóa API duy nhất. Sự khác biệt là quyền kiểm soát: LiteLLM giữ dữ liệu trên máy chủ của bạn; OpenRouter định tuyến nó qua nền tảng của họ.
Sự khác biệt giữa LLM gateway và LLM router là gì?
LLM router chọn mô hình hoặc nhà cung cấp nào xử lý một yêu cầu nhất định, thường dựa trên chi phí, độ trễ, hoặc nội dung prompt. LLM gateway làm điều đó và hơn thế nữa: nó thêm theo dõi chi phí, caching, guardrails, giới hạn tốc độ, và observability trên lớp định tuyến. Tất cả công cụ trong danh sách này về mặt kỹ thuật đều là gateway. Các router thuần túy (công cụ chỉ chọn mô hình mà không có middleware nào khác) rất hiếm trong production vì các đội gần như luôn cần ít nhất ghi log cùng với định tuyến.