
LiteLLM Proxy: 1 API cho 100+ LLM (Cài đặt Docker trong 15 phút)
Nhóm của bạn đang chia sẻ các khóa API OpenAI qua tin nhắn riêng trên Slack. Không ai biết ai đã tiêu tốn 400 đô la vào thứ Ba tuần trước. Không có giới hạn tốc độ, không có cơ chế dự phòng khi nhà cung cấp gặp sự cố, và việc chuyển từ GPT-4o sang Claude đồng nghĩa với việc phải thay đổi mã nguồn ở mười hai nơi khác nhau. Nghe quen thuộc chứ? Một cổng LLM tự lưu trữ (self-hosted) sẽ giải quyết tất cả những vấn đề này, và proxy LiteLLM là tùy chọn mã nguồn mở phổ biến nhất, cung cấp một điểm cuối tương thích OpenAI duy nhất để định tuyến yêu cầu đến hơn 100 nhà cung cấp LLM.
Hướng dẫn này bao gồm toàn bộ quy trình thiết lập proxy litellm: Docker Compose với PostgreSQL, khóa ảo theo nhóm với ngân sách, theo dõi chi phí, giới hạn tốc độ và kết nối các AI IDE như Claude Code và Cursor. Nếu bạn đang đánh giá các công cụ cổng LLM, đây là hướng dẫn thực hành đưa bạn từ con số 0 đến môi trường production.
Một lưu ý quan trọng trước khi bắt đầu: SDK của LiteLLM (thư viện Python) và Proxy Server là hai thứ khác nhau. SDK dành cho một lập trình viên đơn lẻ gọi nhiều API LLM từ Python. Proxy dành cho các nhóm, nó hoạt động như một máy chủ trung gian giữa ứng dụng của bạn và các nhà cung cấp LLM. Nếu bạn là một dev độc lập viết script, SDK là đủ. Nếu bạn đang quản lý khóa, ngân sách và quyền truy cập cho một nhóm, bạn cần proxy. Đó chính xác là những gì chúng ta sẽ thiết lập ở đây.
Tổng quan về LiteLLM Proxy
| Thuộc tính | Chi tiết |
|---|---|
| Là gì | Máy chủ proxy tương thích OpenAI cho hơn 100 nhà cung cấp LLM |
| Dành cho ai | Các nhóm quản lý nhiều khóa API LLM, ngân sách và quyền truy cập |
| Giấy phép | MIT (mã nguồn mở) |
| Sao GitHub | 20.000+ |
| Nhà cung cấp hỗ trợ | OpenAI, Anthropic, Azure, AWS Bedrock, Google Vertex, Ollama và 100+ nữa |
| Tính năng chính | Khóa ảo, theo dõi chi phí, giới hạn tốc độ, dự phòng mô hình, cân bằng tải |
| Phương pháp cài đặt | Docker, Docker Compose, pip, Kubernetes/Helm |
| Phiên bản ổn định mới nhất | v1.83+ (tránh 1.82.7 và 1.82.8 -- xem phần Xử lý sự cố) |
| Định dạng cấu hình | config.yaml |
| Bảng điều khiển | Giao diện người dùng tích hợp sẵn để giám sát chi phí và mức sử dụng |
Dưới đây là so sánh các phương pháp triển khai:
| Phương pháp | Độ phức tạp | Phù hợp nhất cho | Thời gian cài đặt |
|---|---|---|---|
docker run | Thấp | Kiểm tra nhanh, dev độc lập | 60 giây |
| Docker Compose + Postgres | Trung bình | Nhóm (2-50 người) | 10-15 phút |
| Kubernetes / Helm | Cao | Doanh nghiệp, tự động mở rộng quy mô | 30-60 phút |
| pip install | Thấp | Chỉ phát triển cục bộ | 5 phút |
Đối với hầu hết các nhóm, Docker Compose với PostgreSQL là lựa chọn tối ưu nhất. Đó là mục tiêu chúng ta sẽ hướng tới, nhưng trước hết, hãy cùng khởi chạy một proxy trong 60 giây.
Điều kiện tiên quyết và Thiết lập Môi trường
Trước khi bắt đầu, hãy đảm bảo bạn có:
- Đã cài đặt Docker và Docker Compose (Docker Desktop bao gồm cả hai)
- Ít nhất một khóa API LLM (OpenAI, Anthropic hoặc một instance Ollama cục bộ)
- Kiến thức cơ bản về terminal / CLI
Xác minh Docker đã sẵn sàng và xuất các khóa API của bạn:
# Check Docker is installed
docker --version
docker compose version
# Export your LLM API keys (add to your shell profile for persistence)
export OPENAI_API_KEY="sk-..."
export ANTHROPIC_API_KEY="sk-ant-..."
# Optional: set a master key for your proxy (you'll need this later)
export LITELLM_MASTER_KEY="sk-master-your-secret-key"Chỉ vậy thôi. Không cần phiên bản Python đặc biệt, không cần công cụ cụ thể cho từng hệ điều hành. Nếu Docker chạy được trên máy của bạn, bạn đã sẵn sàng.
Bắt đầu nhanh, Proxy LiteLLM đầu tiên của bạn trong 60 giây
Một lệnh duy nhất để khởi chạy proxy với GPT-4o:
docker run -d \
--name litellm-proxy \
-p 4000:4000 \
-e OPENAI_API_KEY=$OPENAI_API_KEY \
-e LITELLM_MASTER_KEY=$LITELLM_MASTER_KEY \
ghcr.io/berriai/litellm:main-stable \
--model openai/gpt-4oKiểm tra bằng curl:
curl http://localhost:4000/v1/chat/completions \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o",
"messages": [{"role": "user", "content": "Say hello from LiteLLM"}]
}'Hoặc kiểm tra từ Python:
from openai import OpenAI
# Point the standard OpenAI SDK at your proxy
client = OpenAI(
api_key="sk-master-your-secret-key",
base_url="http://localhost:4000/v1"
)
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{"role": "user", "content": "Say hello from LiteLLM"}]
)
print(response.choices[0].message.content)Chuyện gì vừa xảy ra? Mã của bạn giao tiếp với localhost:4000 sử dụng định dạng SDK OpenAI tiêu chuẩn. Proxy nhận yêu cầu, chuyển tiếp nó đến API của OpenAI bằng khóa thật và trả về phản hồi. Mã ứng dụng của bạn không bao giờ chạm vào khóa API thực tế.
Đó là ý tưởng cốt lõi. Bây giờ hãy cùng xây dựng một thiết lập cho môi trường production.
Thiết lập Docker Compose Production với PostgreSQL
Lệnh docker run đơn lẻ hoạt động tốt cho việc kiểm tra, nhưng các nhóm production cần theo dõi chi phí liên tục, khóa ảo và lưu trữ cơ sở dữ liệu đúng chuẩn. Điều đó có nghĩa là sử dụng Docker Compose với PostgreSQL.
Tệp Docker Compose
# docker-compose.yml
version: "3.9"
services:
litellm:
image: ghcr.io/berriai/litellm:main-stable
container_name: litellm-proxy
ports:
- "4000:4000" # Proxy API port
volumes:
- ./config.yaml:/app/config.yaml # Mount your config file
environment:
- LITELLM_MASTER_KEY=${LITELLM_MASTER_KEY}
- OPENAI_API_KEY=${OPENAI_API_KEY}
- ANTHROPIC_API_KEY=${ANTHROPIC_API_KEY}
- DATABASE_URL=postgresql://litellm:litellm_password@postgres:5432/litellm
- LITELLM_SALT_KEY=${LITELLM_SALT_KEY:-sk-salt-random-string}
command: --config /app/config.yaml --detailed_debug
depends_on:
postgres:
condition: service_healthy
restart: unless-stopped
postgres:
image: postgres:16-alpine
container_name: litellm-db
environment:
POSTGRES_DB: litellm
POSTGRES_USER: litellm
POSTGRES_PASSWORD: litellm_password
volumes:
- litellm_pgdata:/var/lib/postgresql/data
healthcheck:
test: ["CMD-SHELL", "pg_isready -U litellm"]
interval: 5s
timeout: 5s
retries: 5
restart: unless-stopped
volumes:
litellm_pgdata:LITELLM_SALT_KEY mã hóa dữ liệu khóa ảo trong cơ sở dữ liệu. Tài liệu best practices production của LiteLLM khuyến nghị setting này cho bất kỳ triển khai nhóm nào.
Khởi chạy Stack
# Create a .env file with your keys (don't commit this to git)
echo "LITELLM_MASTER_KEY=sk-master-your-secret" > .env
echo "OPENAI_API_KEY=sk-..." >> .env
echo "ANTHROPIC_API_KEY=sk-ant-..." >> .env
echo "LITELLM_SALT_KEY=sk-salt-$(openssl rand -hex 16)" >> .env
# Start everything
docker compose up -d
# Check logs
docker compose logs -f litellmXác minh mọi thứ hoạt động
# Health check
curl http://localhost:4000/health
# Test a request
curl http://localhost:4000/v1/chat/completions \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-4o", "messages": [{"role": "user", "content": "ping"}]}'Nếu bạn thấy phản hồi thành công, stack production của bạn đang chạy. PostgreSQL lưu trữ tất cả dữ liệu chi phí, khóa ảo và số liệu sử dụng một cách bền vững qua các lần khởi động lại container.
Kết luận: Docker Compose + PostgreSQL là thiết lập production được khuyến nghị. Nó cung cấp cho bạn lưu trữ bền vững, theo dõi chi phí và khóa ảo chỉ với khoảng 10 phút làm việc. Tài liệu triển khai Docker bao gồm Kubernetes và Helm nếu bạn cần tự động mở rộng quy mô sau này.
Hướng dẫn config.yaml, Thiết lập đa nhà cung cấp thực tế
Hầu hết các hướng dẫn đều hiển thị một config.yaml với một mô hình duy nhất. Dưới đây là cách cấu hình thực tế của một nhóm với ba nhà cung cấp, cơ chế dự phòng và cân bằng tải.
Tệp Cấu hình
# config.yaml -- Real multi-provider setup
model_list:
# Primary: OpenAI GPT-4o
- model_name: gpt-4o # The name YOUR code uses
litellm_params:
model: openai/gpt-4o # The actual provider/model
api_key: os.environ/OPENAI_API_KEY
# Secondary: Anthropic Claude
- model_name: claude-sonnet
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: os.environ/ANTHROPIC_API_KEY
# Local: Ollama for development / cost-free testing
- model_name: local-llama
litellm_params:
model: ollama/llama3.1
api_base: http://host.docker.internal:11434
# Fallback: route "gpt-4o" to Claude if OpenAI is down
- model_name: gpt-4o
litellm_params:
model: anthropic/claude-sonnet-4-20250514
api_key: os.environ/ANTHROPIC_API_KEY
router_settings:
routing_strategy: least-busy # Load balance across same-name models
num_retries: 3
retry_after: 5 # Seconds between retries
fallbacks: [{"gpt-4o": ["claude-sonnet"]}]
general_settings:
master_key: os.environ/LITELLM_MASTER_KEY
database_url: os.environ/DATABASE_URLBí danh Mô hình và Định tuyến
Lưu ý rằng gpt-4o xuất hiện hai lần trong cấu hình, một lần trỏ đến OpenAI, một lần đến Anthropic. Khi mã của bạn yêu cầu gpt-4o, LiteLLM sẽ thử OpenAI trước. Nếu thất bại, setting fallbacks sẽ tự động định tuyến đến Claude. Mã ứng dụng của bạn không hề thay đổi.
Nếu bạn đang sử dụng các backend suy luận production như vLLM hoặc SGLang, bạn có thể thêm chúng theo cách tương tự, chỉ cần đặt api_base thành máy chủ suy luận của bạn.
Tham khảo nhanh Nhà cung cấp
| Nhà cung cấp | Ví dụ model_name | Biến Env | Điểm cuối (Endpoint) |
|---|---|---|---|
| OpenAI | openai/gpt-4o | OPENAI_API_KEY | Mặc định (api.openai.com) |
| Anthropic | anthropic/claude-sonnet-4-20250514 | ANTHROPIC_API_KEY | Mặc định |
| Ollama | ollama/llama3.1 | Không cần | http://localhost:11434 |
| Azure OpenAI | azure/gpt-4o | AZURE_API_KEY | Endpoint Azure của bạn |
| AWS Bedrock | bedrock/anthropic.claude-v2 | Thông tin xác thực AWS | Khu vực của bạn |
Setting routing_strategy: least-busy phân phối các yêu cầu trên các mô hình có cùng model_name. Nếu bạn có hai khóa OpenAI (có thể từ các tổ chức khác nhau với các giới hạn tốc độ khác nhau), hãy liệt kê cả hai dưới gpt-4o và LiteLLM sẽ cân bằng tải.
Khóa ảo, Khóa API theo nhóm với Ngân sách và Giới hạn Tốc độ
Đây là lúc LiteLLM ngừng trở thành "chỉ là một proxy" và trở thành một công cụ quản lý nhóm. Khóa ảo cho phép bạn cấp cho mỗi thành viên nhóm hoặc dịch vụ một khóa API riêng với giới hạn chi tiêu và giới hạn tốc độ, tất cả đều được định tuyến thông qua bộ khóa API nhà cung cấp duy nhất của bạn.
Tạo Khóa Nhóm với Ngân sách
# Create a virtual key with a $50/month budget
curl http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"team_id": "frontend-team",
"max_budget": 50.0,
"budget_duration": "1mo",
"models": ["gpt-4o", "claude-sonnet"],
"metadata": {"purpose": "frontend AI features"}
}'Phản hồi sẽ cung cấp cho bạn một khóa mới dạng sk-team-abc123.... Hãy cung cấp khóa này cho nhóm frontend. Họ có thể sử dụng nó giống hệt như một khóa OpenAI, nhưng nó bị giới hạn ở 50 đô la/tháng và chỉ có quyền truy cập vào các mô hình bạn đã chỉ định.
Đặt Giới hạn Tốc độ
# Create a key with rate limits: 100 requests/minute, 50K tokens/minute
curl http://localhost:4000/key/generate \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{
"team_id": "backend-team",
"max_budget": 200.0,
"budget_duration": "1mo",
"rpm_limit": 100,
"tpm_limit": 50000,
"models": ["gpt-4o", "claude-sonnet", "local-llama"]
}'Tài liệu về khóa ảo bao gồm mọi tham số. Bạn cũng có thể đặt ngân sách và giới hạn tốc độ cho từng người dùng để kiểm soát chi tiết hơn.
Giám sát Mức sử dụng Khóa
import requests
# Check a key's current spend and limits
response = requests.get(
"http://localhost:4000/key/info",
headers={"Authorization": f"Bearer {MASTER_KEY}"},
params={"key": "sk-team-abc123..."}
)
info = response.json()
print(f"Spent: ${info['spend']:.2f} / ${info['max_budget']:.2f}")
print(f"RPM used: {info['rpm_limit_used']} / {info['rpm_limit']}")Cần thu hồi một khóa bị xâm phạm? Chỉ cần một lệnh gọi API:
curl -X POST http://localhost:4000/key/delete \
-H "Authorization: Bearer $LITELLM_MASTER_KEY" \
-H "Content-Type: application/json" \
-d '{"keys": ["sk-team-abc123..."]}'Kết luận: Khóa ảo là yếu tố biến LiteLLM thành một công cụ cho nhóm, chứ không chỉ là proxy cá nhân. Nếu không có chúng, bạn chỉ đang thêm một bước trung gian giữa mã của bạn và LLM. Với chúng, bạn có kiểm soát truy cập, thực thi ngân sách và phân bổ mức sử dụng, những thứ giúp CFO của bạn không phải hoảng sợ.
Theo dõi Chi phí và Bảng điều khiển LiteLLM
Khi PostgreSQL được kết nối, LiteLLM tự động theo dõi chi phí của mọi yêu cầu. Bạn không cần cấu hình gì thêm, nó biết giá mỗi token cho mọi mô hình được hỗ trợ.
Bảng điều khiển (Dashboard)
Truy cập giao diện người dùng tích hợp sẵn tại http://localhost:4000/ui (đăng nhập bằng khóa master của bạn). Bạn sẽ thấy:
- Tổng chi tiêu trên tất cả các nhóm và khóa
- Chi tiết theo mô hình, những mô hình nào đang ngốn ngân sách của bạn
- Chi tiêu theo nhóm, ai đang sử dụng cái gì
- Khối lượng yêu cầu theo thời gian
Đối với các nhóm nghiêm túc về việc giảm chi phí API LLM, riêng bảng điều khiển này đã đủ lý do để chạy proxy. Bạn cũng có thể kết nối LiteLLM với các nền tảng quan sát AI bên ngoài như Langfuse hoặc Helicone để phân tích sâu hơn.
So sánh Chi phí theo Nhà cung cấp
Dưới đây là chi phí của các mô hình lớn trên mỗi triệu token (tính đến tháng 4 năm 2026):
| Nhà cung cấp | Mô hình | Input $/1M tokens | Output $/1M tokens |
|---|---|---|---|
| OpenAI | GPT-4o | $2.50 | $10.00 |
| OpenAI | GPT-4o mini | $0.15 | $0.60 |
| Anthropic | Claude Sonnet 4 | $3.00 | $15.00 |
| Anthropic | Claude Haiku 3.5 | $0.80 | $4.00 |
| Gemini 2.0 Flash | $0.10 | $0.40 | |
| Ollama | Llama 3.1 (cục bộ) | $0.00 | $0.00 |
Khi bạn thấy những con số này trong bảng điều khiển được phân tích theo nhóm, các cuộc thảo luận về "chúng ta có nên sử dụng mô hình rẻ hơn cho trường hợp sử dụng này không?" trở nên rất cụ thể.
Kết luận: Riêng việc theo dõi chi phí đã biện minh cho việc sử dụng proxy đối với bất kỳ nhóm nào chi tiêu >100 đô la/tháng cho API LLM. Bạn không thể tối ưu hóa những gì bạn không thể đo lường.
Kết nối AI IDE, Claude Code, Cursor và Continue
Đây là điều mà hầu hết các hướng dẫn LiteLLM bỏ qua hoàn toàn: bạn cũng có thể trỏ các công cụ coding AI của mình vào proxy. Một proxy duy nhất, tất cả các công cụ IDE, hóa đơn thống nhất.
Claude Code
# Set Claude Code to use your LiteLLM proxy
export ANTHROPIC_BASE_URL=http://localhost:4000/v1
export ANTHROPIC_API_KEY=sk-team-your-virtual-keyChỉ vậy thôi. Claude Code gửi yêu cầu đến proxy của bạn, proxy sẽ định tuyến chúng đến Anthropic (hoặc bất cứ nơi nào cấu hình của bạn chỉ định) trong khi theo dõi chi phí dưới khóa ảo của bạn.
Cursor
Trong cài đặt của Cursor, hãy thêm một điểm cuối tùy chỉnh tương thích OpenAI:
{
"openai.apiBaseUrl": "http://localhost:4000/v1",
"openai.apiKey": "sk-team-your-virtual-key"
}Continue (VS Code)
Trong config.json của Continue:
{
"models": [
{
"title": "GPT-4o via LiteLLM",
"provider": "openai",
"model": "gpt-4o",
"apiBase": "http://localhost:4000/v1",
"apiKey": "sk-team-your-virtual-key"
}
]
}Tại sao phải bận tâm? Bởi vì bây giờ mọi hoạt động sử dụng IDE của developer đều đi qua proxy. Bạn có được theo dõi chi phí theo từng người cho các trợ lý coding AI, giới hạn tốc độ để không ai vô tình đốt cháy 500 đô la trong một session coding, và một nơi duy nhất để chuyển đổi mô hình nếu bạn tìm thấy một tùy chọn tốt hơn.
Xử lý sự cố Các vấn đề Thường gặp
"Không tìm thấy tệp cấu hình"
Điều này thường có nghĩa là đường dẫn mount volume trong Docker bị sai. Đảm bảo config.yaml của bạn nằm trong thư mục bạn đang mount từ đó:
# Check the file exists where you think it does
ls -la ./config.yaml
# The volume mount in docker-compose.yml should match
# volumes:
# - ./config.yaml:/app/config.yaml"Kết nối bị từ chối" đến PostgreSQL
Mạng Docker luôn gây khó khăn cho mọi người ít nhất một lần. Nếu LiteLLM không thể kết nối với Postgres, hãy kiểm tra xem:
- Tên dịch vụ trong
DATABASE_URLkhớp với tên dịch vụ Docker Compose (postgres, không phảilocalhost) depends_onvớicondition: service_healthyđã được đặt (để LiteLLM đợi Postgres sẵn sàng)- Cả hai dịch vụ đều nằm trên cùng một mạng Docker (mặc định là như vậy trong Compose)
"Định dạng khóa API không hợp lệ"
Sự nhầm lẫn phổ biến nhất: LITELLM_MASTER_KEY của bạn dành cho các thao tác quản trị (tạo khóa ảo, truy cập bảng điều khiển). Khóa ảo (sk-team-...) là những gì ứng dụng của bạn sử dụng. Đừng nhầm lẫn chúng.
"Không tìm thấy mô hình"
Trường model trong yêu cầu của bạn phải khớp với model_name trong config.yaml. Nếu cấu hình của bạn định nghĩa gpt-4o nhưng mã của bạn yêu cầu openai/gpt-4o, nó sẽ không khớp. Hãy kiểm tra chính tả kỹ lưỡng.
Proxy khởi động nhưng yêu cầu bị treo
Thường là vấn đề về tường lửa hoặc ràng buộc cổng. Xác minh cổng 4000 đã được expose và không bị chặn:
# Check if the port is listening
docker port litellm-proxy
# Should show: 4000/tcp -> 0.0.0.0:4000Bảo mật: Tránh các Phiên bản 1.82.7 và 1.82.8
Vào tháng 3 năm 2026, một sự cố chuỗi cung ứng đã ảnh hưởng đến các phiên bản LiteLLM 1.82.7 và 1.82.8. Các phiên bản bị xâm phạm đã bị thu hồi và một bản phát hành sạch đã được phát hành ở phiên bản 1.83.0. Luôn ghim hình ảnh Docker của bạn vào một phiên bản cụ thể và kiểm tra cập nhật bảo mật chính thức trước khi nâng cấp. Nếu bạn đang dùng 1.82.7 hoặc 1.82.8, hãy cập nhật ngay lập tức.
Bạn Nên Chọn Phương pháp Thiết lập LiteLLM Nào?
| Nếu Bạn Cần... | Chọn | Tại sao |
|---|---|---|
| Kiểm tra nhanh, dev độc lập thử nghiệm | Lệnh đơn docker run | Không cần cấu hình, chạy trong 60 giây |
| Nhóm 2-10 người với theo dõi chi phí | Docker Compose + PostgreSQL | Dữ liệu bền vững, khóa ảo, giới hạn ngân sách |
| Nhóm 10-50 người với nhiều môi trường | Docker Compose + bộ nhớ đệm Redis | Thêm bộ nhớ đệm cho các prompt lặp lại, thông lượng tốt hơn |
| Doanh nghiệp với tuân thủ / tự động mở rộng quy mô | Kubernetes + biểu đồ Helm | Tự động mở rộng quy mô, cập nhật rolling, tích hợp RBAC |
| Phát triển cục bộ không dùng Docker | pip install litellm + CLI | Nhanh nhất cho dev Python kiểm tra cục bộ |
Nếu bạn đọc hướng dẫn này lần đầu tiên, hãy bắt đầu với Docker Compose + PostgreSQL. Bạn luôn có thể di chuyển sang Kubernetes sau này, config.yaml vẫn giữ nguyên.
Câu hỏi Thường gặp (FAQ)
LiteLLM proxy là gì và nó hoạt động như thế nào?
LiteLLM proxy là một máy chủ cổng AI mã nguồn mở nằm giữa các ứng dụng của bạn và các nhà cung cấp LLM như OpenAI và Anthropic. Nó phơi bày một điểm cuối duy nhất tương thích OpenAI, vì vậy mã của bạn giao tiếp với một URL duy nhất trong khi proxy xử lý định tuyến, quản lý khóa, theo dõi chi phí và dự phòng ở hậu trường.
Làm thế nào để thiết lập LiteLLM proxy với Docker Compose?
Tạo một tệp docker-compose.yml với hình ảnh proxy LiteLLM và cơ sở dữ liệu PostgreSQL, mount config.yaml của bạn, đặt các khóa API của bạn làm biến môi trường và chạy docker compose up -d. Phần Docker Compose Production ở trên có một tệp hoàn chỉnh, sẵn sàng để sao chép-dán.
Làm thế nào để quản lý khóa API nhóm với LiteLLM?
Sử dụng khóa ảo. Gọi điểm cuối /key/generate bằng khóa master của bạn để tạo khóa cho từng nhóm hoặc từng người dùng. Mỗi khóa ảo có thể có ngân sách hàng tháng, giới hạn tốc độ (RPM và TPM) và hạn chế truy cập mô hình riêng. Phần Khóa ảo bao gồm toàn bộ quy trình làm việc.
Làm thế nào để thêm theo dõi chi phí và giới hạn tốc độ vào API LLM của tôi?
Kết nối PostgreSQL với proxy (thông qua DATABASE_URL), và việc theo dõi chi phí sẽ diễn ra tự động. Đối với giới hạn tốc độ, hãy đặt rpm_limit và tpm_limit khi tạo khóa ảo. Bảng điều khiển tích hợp sẵn tại /ui hiển thị chi tiêu theo nhóm và theo mô hình.
LiteLLM proxy có an toàn để sử dụng trong production không?
Có, với một lưu ý: tránh các phiên bản 1.82.7 và 1.82.8, vốn bị ảnh hưởng bởi sự cố chuỗi cung ứng vào tháng 3 năm 2026. Sử dụng phiên bản 1.83.0 trở lên. Ghim phiên bản hình ảnh Docker của bạn, đặt LITELLM_SALT_KEY để mã hóa và tuân theo các best practices production chính thức.
Sự khác biệt giữa LiteLLM SDK và LiteLLM proxy là gì?
SDK là một thư viện Python để gọi nhiều API LLM từ mã của bạn. Proxy là một máy chủ độc lập mà toàn bộ nhóm của bạn kết nối đến. Sử dụng SDK khi bạn là một dev độc lập viết script. Sử dụng proxy khi bạn cần kiểm soát truy cập chia sẻ, theo dõi chi phí và giới hạn tốc độ trên toàn nhóm.
Tôi có thể sử dụng LiteLLM proxy với Ollama và các mô hình cục bộ không?
Chắc chắn rồi. Thêm một mục vào config.yaml của bạn với model: ollama/llama3.1 và api_base: http://host.docker.internal:11434 (hoặc host Ollama của bạn). Nhóm của bạn sau đó có thể truy cập các mô hình cục bộ thông qua cùng một điểm cuối proxy, rất tuyệt vời cho phát triển và kiểm tra miễn phí chi phí.
LiteLLM proxy có giá bao nhiêu?
LiteLLM proxy miễn phí và mã nguồn mở (giấy phép MIT). Bạn tự lưu trữ nó trên cơ sở hạ tầng của riêng mình. Chi phí duy nhất là máy chủ của bạn (một VPS nhỏ là đủ cho hầu hết các nhóm) và chi phí API LLM mà bạn đang trả. BerriAI cũng cung cấp một phiên bản đám mây được quản lý nếu bạn không muốn tự lưu trữ.
LiteLLM hỗ trợ những nhà cung cấp nào?
Hơn 100, bao gồm OpenAI, Anthropic, Azure OpenAI, AWS Bedrock, Google Vertex AI, Ollama, Hugging Face, Cohere, Replicate và nhiều hơn nữa. Danh sách đầy đủ có trên kho lưu trữ GitHub của LiteLLM.
Làm thế nào để cập nhật LiteLLM proxy một cách an toàn?
Luôn ghim một phiên bản cụ thể trong thẻ hình ảnh Docker của bạn (ví dụ: ghcr.io/berriai/litellm:v1.83.2-stable). Trước khi nâng cấp, hãy kiểm tra changelog để xem có thay đổi phá vỡ nào không. Không bao giờ sử dụng latest trong production. Và luôn xác minh phiên bản mới không nằm trong danh sách cảnh báo bảo mật, sự cố tháng 3 năm 2026 đã chứng minh rằng ngay cả các gói đáng tin cậy cũng có thể bị xâm phạm.
Kết luận Cuối cùng và Các Bước Tiếp theo
| Danh mục | Khuyến nghị | Ghi chú |
|---|---|---|
| Bắt đầu nhanh | Lệnh đơn docker run | Hoàn hảo để kiểm tra lần đầu |
| Thiết lập Nhóm | Docker Compose + PostgreSQL | Mặc định cho 90% các nhóm |
| Cấu hình | Đa nhà cung cấp với dự phòng | Đừng dựa vào một nhà cung cấp duy nhất |
| Quản lý Khóa | Khóa ảo theo nhóm | Ngân sách + giới hạn tốc độ cho mỗi khóa |
| Hiển thị Chi phí | Bảng điều khiển tích hợp + Postgres | Giám sát trước khi tối ưu hóa |
| Tích hợp IDE | Trỏ Claude Code / Cursor vào proxy | Hóa đơn thống nhất trên tất cả các công cụ |
| Bảo mật | Ghim phiên bản, đặt salt key | Tránh 1.82.7 và 1.82.8 |
Nếu nhóm của bạn chi tiêu tiền cho API LLM và bạn chưa có proxy, hãy bắt đầu với Docker Compose + Postgres ngay hôm nay. Việc thiết lập mất 15 phút và bạn sẽ có khả năng hiển thị chi phí cũng như kiểm soát truy cập khi kết thúc.
Khi đã chạy, hãy khám phá việc thêm các rào chắn (guardrails) vào pipeline LLM của bạn để lọc nội dung và kiểm tra an toàn. Proxy là nền tảng, mọi thứ khác được xây dựng dựa trên nó.