Techsy
Liên hệ
Bắt đầu
Quay lại Blog
guides

LiteLLM Proxy: 1 API cho 100+ LLM (Cài đặt Docker trong 15 phút)

Viết bởi Mert Batur Gürbüz
Cập nhật lần cuối May 12, 2026
15 phút đọc
Mục lục
LiteLLM Proxy: 1 API cho 100+ LLM (Cài đặt Docker trong 15 phút)

LiteLLM Proxy: 1 API cho 100+ LLM (Cài đặt Docker trong 15 phút)

Nhóm của bạn đang chia sẻ các khóa API OpenAI qua tin nhắn riêng trên Slack. Không ai biết ai đã tiêu tốn 400 đô la vào thứ Ba tuần trước. Không có giới hạn tốc độ, không có cơ chế dự phòng khi nhà cung cấp gặp sự cố, và việc chuyển từ GPT-4o sang Claude đồng nghĩa với việc phải thay đổi mã nguồn ở mười hai nơi khác nhau. Nghe quen thuộc chứ? Một cổng LLM tự lưu trữ (self-hosted) sẽ giải quyết tất cả những vấn đề này, và proxy LiteLLM là tùy chọn mã nguồn mở phổ biến nhất, cung cấp một điểm cuối tương thích OpenAI duy nhất để định tuyến yêu cầu đến hơn 100 nhà cung cấp LLM.

Hướng dẫn này bao gồm toàn bộ quy trình thiết lập proxy litellm: Docker Compose với PostgreSQL, khóa ảo theo nhóm với ngân sách, theo dõi chi phí, giới hạn tốc độ và kết nối các AI IDE như Claude Code và Cursor. Nếu bạn đang đánh giá các công cụ cổng LLM, đây là hướng dẫn thực hành đưa bạn từ con số 0 đến môi trường production.

Một lưu ý quan trọng trước khi bắt đầu: SDK của LiteLLM (thư viện Python) và Proxy Server là hai thứ khác nhau. SDK dành cho một lập trình viên đơn lẻ gọi nhiều API LLM từ Python. Proxy dành cho các nhóm, nó hoạt động như một máy chủ trung gian giữa ứng dụng của bạn và các nhà cung cấp LLM. Nếu bạn là một dev độc lập viết script, SDK là đủ. Nếu bạn đang quản lý khóa, ngân sách và quyền truy cập cho một nhóm, bạn cần proxy. Đó chính xác là những gì chúng ta sẽ thiết lập ở đây.

Tổng quan về LiteLLM Proxy

Thuộc tínhChi tiết
Là gìMáy chủ proxy tương thích OpenAI cho hơn 100 nhà cung cấp LLM
Dành cho aiCác nhóm quản lý nhiều khóa API LLM, ngân sách và quyền truy cập
Giấy phépMIT (mã nguồn mở)
Sao GitHub20.000+
Nhà cung cấp hỗ trợOpenAI, Anthropic, Azure, AWS Bedrock, Google Vertex, Ollama và 100+ nữa
Tính năng chínhKhóa ảo, theo dõi chi phí, giới hạn tốc độ, dự phòng mô hình, cân bằng tải
Phương pháp cài đặtDocker, Docker Compose, pip, Kubernetes/Helm
Phiên bản ổn định mới nhấtv1.83+ (tránh 1.82.7 và 1.82.8 -- xem phần Xử lý sự cố)
Định dạng cấu hìnhconfig.yaml
Bảng điều khiểnGiao diện người dùng tích hợp sẵn để giám sát chi phí và mức sử dụng

Dưới đây là so sánh các phương pháp triển khai:

Phương phápĐộ phức tạpPhù hợp nhất choThời gian cài đặt
docker runThấpKiểm tra nhanh, dev độc lập60 giây
Docker Compose + PostgresTrung bìnhNhóm (2-50 người)10-15 phút
Kubernetes / HelmCaoDoanh nghiệp, tự động mở rộng quy mô30-60 phút
pip installThấpChỉ phát triển cục bộ5 phút

Đối với hầu hết các nhóm, Docker Compose với PostgreSQL là lựa chọn tối ưu nhất. Đó là mục tiêu chúng ta sẽ hướng tới, nhưng trước hết, hãy cùng khởi chạy một proxy trong 60 giây.

Điều kiện tiên quyết và Thiết lập Môi trường

Trước khi bắt đầu, hãy đảm bảo bạn có:

  • Đã cài đặt Docker và Docker Compose (Docker Desktop bao gồm cả hai)
  • Ít nhất một khóa API LLM (OpenAI, Anthropic hoặc một instance Ollama cục bộ)
  • Kiến thức cơ bản về terminal / CLI

Xác minh Docker đã sẵn sàng và xuất các khóa API của bạn:

bash
# Check Docker is installed
docker --version
docker compose version

# Export your LLM API keys (add to your shell profile for persistence)
export OPENAI_API_KEY="sk-..."
export ANTHROPIC_API_KEY="sk-ant-..."

# Optional: set a master key for your proxy (you'll need this later)
export LITELLM_MASTER_KEY="sk-master-your-secret-key"

Chỉ vậy thôi. Không cần phiên bản Python đặc biệt, không cần công cụ cụ thể cho từng hệ điều hành. Nếu Docker chạy được trên máy của bạn, bạn đã sẵn sàng.

Bắt đầu nhanh, Proxy LiteLLM đầu tiên của bạn trong 60 giây

Một lệnh duy nhất để khởi chạy proxy với GPT-4o:

bash
docker run -d \
  --name litellm-proxy \
  -p 4000:4000 \
  -e OPENAI_API_KEY=$OPENAI_API_KEY \
  -e LITELLM_MASTER_KEY=$LITELLM_MASTER_KEY \
  ghcr.io/berriai/litellm:main-stable \
  --model openai/gpt-4o

Kiểm tra bằng curl:

bash
curl http://localhost:4000/v1/chat/completions \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-4o",
    "messages": [{"role": "user", "content": "Say hello from LiteLLM"}]
  }'

Hoặc kiểm tra từ Python:

python
from openai import OpenAI

# Point the standard OpenAI SDK at your proxy
client = OpenAI(
    api_key="sk-master-your-secret-key",
    base_url="http://localhost:4000/v1"
)

response = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[{"role": "user", "content": "Say hello from LiteLLM"}]
)
print(response.choices[0].message.content)

Chuyện gì vừa xảy ra? Mã của bạn giao tiếp với localhost:4000 sử dụng định dạng SDK OpenAI tiêu chuẩn. Proxy nhận yêu cầu, chuyển tiếp nó đến API của OpenAI bằng khóa thật và trả về phản hồi. Mã ứng dụng của bạn không bao giờ chạm vào khóa API thực tế.

Đó là ý tưởng cốt lõi. Bây giờ hãy cùng xây dựng một thiết lập cho môi trường production.

Thiết lập Docker Compose Production với PostgreSQL

Lệnh docker run đơn lẻ hoạt động tốt cho việc kiểm tra, nhưng các nhóm production cần theo dõi chi phí liên tục, khóa ảo và lưu trữ cơ sở dữ liệu đúng chuẩn. Điều đó có nghĩa là sử dụng Docker Compose với PostgreSQL.

Tệp Docker Compose

yaml
# docker-compose.yml
version: "3.9"

services:
  litellm:
    image: ghcr.io/berriai/litellm:main-stable
    container_name: litellm-proxy
    ports:
      - "4000:4000"         # Proxy API port
    volumes:
      - ./config.yaml:/app/config.yaml   # Mount your config file
    environment:
      - LITELLM_MASTER_KEY=${LITELLM_MASTER_KEY}
      - OPENAI_API_KEY=${OPENAI_API_KEY}
      - ANTHROPIC_API_KEY=${ANTHROPIC_API_KEY}
      - DATABASE_URL=postgresql://litellm:litellm_password@postgres:5432/litellm
      - LITELLM_SALT_KEY=${LITELLM_SALT_KEY:-sk-salt-random-string}
    command: --config /app/config.yaml --detailed_debug
    depends_on:
      postgres:
        condition: service_healthy
    restart: unless-stopped

  postgres:
    image: postgres:16-alpine
    container_name: litellm-db
    environment:
      POSTGRES_DB: litellm
      POSTGRES_USER: litellm
      POSTGRES_PASSWORD: litellm_password
    volumes:
      - litellm_pgdata:/var/lib/postgresql/data
    healthcheck:
      test: ["CMD-SHELL", "pg_isready -U litellm"]
      interval: 5s
      timeout: 5s
      retries: 5
    restart: unless-stopped

volumes:
  litellm_pgdata:

LITELLM_SALT_KEY mã hóa dữ liệu khóa ảo trong cơ sở dữ liệu. Tài liệu best practices production của LiteLLM khuyến nghị setting này cho bất kỳ triển khai nhóm nào.

Khởi chạy Stack

bash
# Create a .env file with your keys (don't commit this to git)
echo "LITELLM_MASTER_KEY=sk-master-your-secret" > .env
echo "OPENAI_API_KEY=sk-..." >> .env
echo "ANTHROPIC_API_KEY=sk-ant-..." >> .env
echo "LITELLM_SALT_KEY=sk-salt-$(openssl rand -hex 16)" >> .env

# Start everything
docker compose up -d

# Check logs
docker compose logs -f litellm

Xác minh mọi thứ hoạt động

bash
# Health check
curl http://localhost:4000/health

# Test a request
curl http://localhost:4000/v1/chat/completions \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "gpt-4o", "messages": [{"role": "user", "content": "ping"}]}'

Nếu bạn thấy phản hồi thành công, stack production của bạn đang chạy. PostgreSQL lưu trữ tất cả dữ liệu chi phí, khóa ảo và số liệu sử dụng một cách bền vững qua các lần khởi động lại container.

Kết luận: Docker Compose + PostgreSQL là thiết lập production được khuyến nghị. Nó cung cấp cho bạn lưu trữ bền vững, theo dõi chi phí và khóa ảo chỉ với khoảng 10 phút làm việc. Tài liệu triển khai Docker bao gồm Kubernetes và Helm nếu bạn cần tự động mở rộng quy mô sau này.

Hướng dẫn config.yaml, Thiết lập đa nhà cung cấp thực tế

Hầu hết các hướng dẫn đều hiển thị một config.yaml với một mô hình duy nhất. Dưới đây là cách cấu hình thực tế của một nhóm với ba nhà cung cấp, cơ chế dự phòng và cân bằng tải.

Tệp Cấu hình

yaml
# config.yaml -- Real multi-provider setup
model_list:
  # Primary: OpenAI GPT-4o
  - model_name: gpt-4o          # The name YOUR code uses
    litellm_params:
      model: openai/gpt-4o      # The actual provider/model
      api_key: os.environ/OPENAI_API_KEY

  # Secondary: Anthropic Claude
  - model_name: claude-sonnet
    litellm_params:
      model: anthropic/claude-sonnet-4-20250514
      api_key: os.environ/ANTHROPIC_API_KEY

  # Local: Ollama for development / cost-free testing
  - model_name: local-llama
    litellm_params:
      model: ollama/llama3.1
      api_base: http://host.docker.internal:11434

  # Fallback: route "gpt-4o" to Claude if OpenAI is down
  - model_name: gpt-4o
    litellm_params:
      model: anthropic/claude-sonnet-4-20250514
      api_key: os.environ/ANTHROPIC_API_KEY

router_settings:
  routing_strategy: least-busy    # Load balance across same-name models
  num_retries: 3
  retry_after: 5                  # Seconds between retries
  fallbacks: [{"gpt-4o": ["claude-sonnet"]}]

general_settings:
  master_key: os.environ/LITELLM_MASTER_KEY
  database_url: os.environ/DATABASE_URL

Bí danh Mô hình và Định tuyến

Lưu ý rằng gpt-4o xuất hiện hai lần trong cấu hình, một lần trỏ đến OpenAI, một lần đến Anthropic. Khi mã của bạn yêu cầu gpt-4o, LiteLLM sẽ thử OpenAI trước. Nếu thất bại, setting fallbacks sẽ tự động định tuyến đến Claude. Mã ứng dụng của bạn không hề thay đổi.

Nếu bạn đang sử dụng các backend suy luận production như vLLM hoặc SGLang, bạn có thể thêm chúng theo cách tương tự, chỉ cần đặt api_base thành máy chủ suy luận của bạn.

Tham khảo nhanh Nhà cung cấp

Nhà cung cấpVí dụ model_nameBiến EnvĐiểm cuối (Endpoint)
OpenAIopenai/gpt-4oOPENAI_API_KEYMặc định (api.openai.com)
Anthropicanthropic/claude-sonnet-4-20250514ANTHROPIC_API_KEYMặc định
Ollamaollama/llama3.1Không cầnhttp://localhost:11434
Azure OpenAIazure/gpt-4oAZURE_API_KEYEndpoint Azure của bạn
AWS Bedrockbedrock/anthropic.claude-v2Thông tin xác thực AWSKhu vực của bạn

Setting routing_strategy: least-busy phân phối các yêu cầu trên các mô hình có cùng model_name. Nếu bạn có hai khóa OpenAI (có thể từ các tổ chức khác nhau với các giới hạn tốc độ khác nhau), hãy liệt kê cả hai dưới gpt-4o và LiteLLM sẽ cân bằng tải.

Khóa ảo, Khóa API theo nhóm với Ngân sách và Giới hạn Tốc độ

Đây là lúc LiteLLM ngừng trở thành "chỉ là một proxy" và trở thành một công cụ quản lý nhóm. Khóa ảo cho phép bạn cấp cho mỗi thành viên nhóm hoặc dịch vụ một khóa API riêng với giới hạn chi tiêu và giới hạn tốc độ, tất cả đều được định tuyến thông qua bộ khóa API nhà cung cấp duy nhất của bạn.

Tạo Khóa Nhóm với Ngân sách

bash
# Create a virtual key with a $50/month budget
curl http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "team_id": "frontend-team",
    "max_budget": 50.0,
    "budget_duration": "1mo",
    "models": ["gpt-4o", "claude-sonnet"],
    "metadata": {"purpose": "frontend AI features"}
  }'

Phản hồi sẽ cung cấp cho bạn một khóa mới dạng sk-team-abc123.... Hãy cung cấp khóa này cho nhóm frontend. Họ có thể sử dụng nó giống hệt như một khóa OpenAI, nhưng nó bị giới hạn ở 50 đô la/tháng và chỉ có quyền truy cập vào các mô hình bạn đã chỉ định.

Đặt Giới hạn Tốc độ

bash
# Create a key with rate limits: 100 requests/minute, 50K tokens/minute
curl http://localhost:4000/key/generate \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "team_id": "backend-team",
    "max_budget": 200.0,
    "budget_duration": "1mo",
    "rpm_limit": 100,
    "tpm_limit": 50000,
    "models": ["gpt-4o", "claude-sonnet", "local-llama"]
  }'

Tài liệu về khóa ảo bao gồm mọi tham số. Bạn cũng có thể đặt ngân sách và giới hạn tốc độ cho từng người dùng để kiểm soát chi tiết hơn.

Giám sát Mức sử dụng Khóa

python
import requests

# Check a key's current spend and limits
response = requests.get(
    "http://localhost:4000/key/info",
    headers={"Authorization": f"Bearer {MASTER_KEY}"},
    params={"key": "sk-team-abc123..."}
)
info = response.json()
print(f"Spent: ${info['spend']:.2f} / ${info['max_budget']:.2f}")
print(f"RPM used: {info['rpm_limit_used']} / {info['rpm_limit']}")

Cần thu hồi một khóa bị xâm phạm? Chỉ cần một lệnh gọi API:

bash
curl -X POST http://localhost:4000/key/delete \
  -H "Authorization: Bearer $LITELLM_MASTER_KEY" \
  -H "Content-Type: application/json" \
  -d '{"keys": ["sk-team-abc123..."]}'

Kết luận: Khóa ảo là yếu tố biến LiteLLM thành một công cụ cho nhóm, chứ không chỉ là proxy cá nhân. Nếu không có chúng, bạn chỉ đang thêm một bước trung gian giữa mã của bạn và LLM. Với chúng, bạn có kiểm soát truy cập, thực thi ngân sách và phân bổ mức sử dụng, những thứ giúp CFO của bạn không phải hoảng sợ.

Theo dõi Chi phí và Bảng điều khiển LiteLLM

Khi PostgreSQL được kết nối, LiteLLM tự động theo dõi chi phí của mọi yêu cầu. Bạn không cần cấu hình gì thêm, nó biết giá mỗi token cho mọi mô hình được hỗ trợ.

Bảng điều khiển (Dashboard)

Truy cập giao diện người dùng tích hợp sẵn tại http://localhost:4000/ui (đăng nhập bằng khóa master của bạn). Bạn sẽ thấy:

  • Tổng chi tiêu trên tất cả các nhóm và khóa
  • Chi tiết theo mô hình, những mô hình nào đang ngốn ngân sách của bạn
  • Chi tiêu theo nhóm, ai đang sử dụng cái gì
  • Khối lượng yêu cầu theo thời gian
<!-- IMAGE: LiteLLM dashboard showing per-team cost tracking -->

Đối với các nhóm nghiêm túc về việc giảm chi phí API LLM, riêng bảng điều khiển này đã đủ lý do để chạy proxy. Bạn cũng có thể kết nối LiteLLM với các nền tảng quan sát AI bên ngoài như Langfuse hoặc Helicone để phân tích sâu hơn.

So sánh Chi phí theo Nhà cung cấp

Dưới đây là chi phí của các mô hình lớn trên mỗi triệu token (tính đến tháng 4 năm 2026):

Nhà cung cấpMô hìnhInput $/1M tokensOutput $/1M tokens
OpenAIGPT-4o$2.50$10.00
OpenAIGPT-4o mini$0.15$0.60
AnthropicClaude Sonnet 4$3.00$15.00
AnthropicClaude Haiku 3.5$0.80$4.00
GoogleGemini 2.0 Flash$0.10$0.40
OllamaLlama 3.1 (cục bộ)$0.00$0.00

Khi bạn thấy những con số này trong bảng điều khiển được phân tích theo nhóm, các cuộc thảo luận về "chúng ta có nên sử dụng mô hình rẻ hơn cho trường hợp sử dụng này không?" trở nên rất cụ thể.

Kết luận: Riêng việc theo dõi chi phí đã biện minh cho việc sử dụng proxy đối với bất kỳ nhóm nào chi tiêu >100 đô la/tháng cho API LLM. Bạn không thể tối ưu hóa những gì bạn không thể đo lường.

Kết nối AI IDE, Claude Code, Cursor và Continue

Đây là điều mà hầu hết các hướng dẫn LiteLLM bỏ qua hoàn toàn: bạn cũng có thể trỏ các công cụ coding AI của mình vào proxy. Một proxy duy nhất, tất cả các công cụ IDE, hóa đơn thống nhất.

Claude Code

bash
# Set Claude Code to use your LiteLLM proxy
export ANTHROPIC_BASE_URL=http://localhost:4000/v1
export ANTHROPIC_API_KEY=sk-team-your-virtual-key

Chỉ vậy thôi. Claude Code gửi yêu cầu đến proxy của bạn, proxy sẽ định tuyến chúng đến Anthropic (hoặc bất cứ nơi nào cấu hình của bạn chỉ định) trong khi theo dõi chi phí dưới khóa ảo của bạn.

Cursor

Trong cài đặt của Cursor, hãy thêm một điểm cuối tùy chỉnh tương thích OpenAI:

json
{
  "openai.apiBaseUrl": "http://localhost:4000/v1",
  "openai.apiKey": "sk-team-your-virtual-key"
}

Continue (VS Code)

Trong config.json của Continue:

json
{
  "models": [
    {
      "title": "GPT-4o via LiteLLM",
      "provider": "openai",
      "model": "gpt-4o",
      "apiBase": "http://localhost:4000/v1",
      "apiKey": "sk-team-your-virtual-key"
    }
  ]
}

Tại sao phải bận tâm? Bởi vì bây giờ mọi hoạt động sử dụng IDE của developer đều đi qua proxy. Bạn có được theo dõi chi phí theo từng người cho các trợ lý coding AI, giới hạn tốc độ để không ai vô tình đốt cháy 500 đô la trong một session coding, và một nơi duy nhất để chuyển đổi mô hình nếu bạn tìm thấy một tùy chọn tốt hơn.

Xử lý sự cố Các vấn đề Thường gặp

"Không tìm thấy tệp cấu hình"

Điều này thường có nghĩa là đường dẫn mount volume trong Docker bị sai. Đảm bảo config.yaml của bạn nằm trong thư mục bạn đang mount từ đó:

bash
# Check the file exists where you think it does
ls -la ./config.yaml

# The volume mount in docker-compose.yml should match
# volumes:
#   - ./config.yaml:/app/config.yaml

"Kết nối bị từ chối" đến PostgreSQL

Mạng Docker luôn gây khó khăn cho mọi người ít nhất một lần. Nếu LiteLLM không thể kết nối với Postgres, hãy kiểm tra xem:

  • Tên dịch vụ trong DATABASE_URL khớp với tên dịch vụ Docker Compose (postgres, không phải localhost)
  • depends_on với condition: service_healthy đã được đặt (để LiteLLM đợi Postgres sẵn sàng)
  • Cả hai dịch vụ đều nằm trên cùng một mạng Docker (mặc định là như vậy trong Compose)

"Định dạng khóa API không hợp lệ"

Sự nhầm lẫn phổ biến nhất: LITELLM_MASTER_KEY của bạn dành cho các thao tác quản trị (tạo khóa ảo, truy cập bảng điều khiển). Khóa ảo (sk-team-...) là những gì ứng dụng của bạn sử dụng. Đừng nhầm lẫn chúng.

"Không tìm thấy mô hình"

Trường model trong yêu cầu của bạn phải khớp với model_name trong config.yaml. Nếu cấu hình của bạn định nghĩa gpt-4o nhưng mã của bạn yêu cầu openai/gpt-4o, nó sẽ không khớp. Hãy kiểm tra chính tả kỹ lưỡng.

Proxy khởi động nhưng yêu cầu bị treo

Thường là vấn đề về tường lửa hoặc ràng buộc cổng. Xác minh cổng 4000 đã được expose và không bị chặn:

bash
# Check if the port is listening
docker port litellm-proxy
# Should show: 4000/tcp -> 0.0.0.0:4000

Bảo mật: Tránh các Phiên bản 1.82.7 và 1.82.8

Vào tháng 3 năm 2026, một sự cố chuỗi cung ứng đã ảnh hưởng đến các phiên bản LiteLLM 1.82.7 và 1.82.8. Các phiên bản bị xâm phạm đã bị thu hồi và một bản phát hành sạch đã được phát hành ở phiên bản 1.83.0. Luôn ghim hình ảnh Docker của bạn vào một phiên bản cụ thể và kiểm tra cập nhật bảo mật chính thức trước khi nâng cấp. Nếu bạn đang dùng 1.82.7 hoặc 1.82.8, hãy cập nhật ngay lập tức.

Bạn Nên Chọn Phương pháp Thiết lập LiteLLM Nào?

Nếu Bạn Cần...ChọnTại sao
Kiểm tra nhanh, dev độc lập thử nghiệmLệnh đơn docker runKhông cần cấu hình, chạy trong 60 giây
Nhóm 2-10 người với theo dõi chi phíDocker Compose + PostgreSQLDữ liệu bền vững, khóa ảo, giới hạn ngân sách
Nhóm 10-50 người với nhiều môi trườngDocker Compose + bộ nhớ đệm RedisThêm bộ nhớ đệm cho các prompt lặp lại, thông lượng tốt hơn
Doanh nghiệp với tuân thủ / tự động mở rộng quy môKubernetes + biểu đồ HelmTự động mở rộng quy mô, cập nhật rolling, tích hợp RBAC
Phát triển cục bộ không dùng Dockerpip install litellm + CLINhanh nhất cho dev Python kiểm tra cục bộ

Nếu bạn đọc hướng dẫn này lần đầu tiên, hãy bắt đầu với Docker Compose + PostgreSQL. Bạn luôn có thể di chuyển sang Kubernetes sau này, config.yaml vẫn giữ nguyên.

Câu hỏi Thường gặp (FAQ)

LiteLLM proxy là gì và nó hoạt động như thế nào?

LiteLLM proxy là một máy chủ cổng AI mã nguồn mở nằm giữa các ứng dụng của bạn và các nhà cung cấp LLM như OpenAI và Anthropic. Nó phơi bày một điểm cuối duy nhất tương thích OpenAI, vì vậy mã của bạn giao tiếp với một URL duy nhất trong khi proxy xử lý định tuyến, quản lý khóa, theo dõi chi phí và dự phòng ở hậu trường.

Làm thế nào để thiết lập LiteLLM proxy với Docker Compose?

Tạo một tệp docker-compose.yml với hình ảnh proxy LiteLLM và cơ sở dữ liệu PostgreSQL, mount config.yaml của bạn, đặt các khóa API của bạn làm biến môi trường và chạy docker compose up -d. Phần Docker Compose Production ở trên có một tệp hoàn chỉnh, sẵn sàng để sao chép-dán.

Làm thế nào để quản lý khóa API nhóm với LiteLLM?

Sử dụng khóa ảo. Gọi điểm cuối /key/generate bằng khóa master của bạn để tạo khóa cho từng nhóm hoặc từng người dùng. Mỗi khóa ảo có thể có ngân sách hàng tháng, giới hạn tốc độ (RPM và TPM) và hạn chế truy cập mô hình riêng. Phần Khóa ảo bao gồm toàn bộ quy trình làm việc.

Làm thế nào để thêm theo dõi chi phí và giới hạn tốc độ vào API LLM của tôi?

Kết nối PostgreSQL với proxy (thông qua DATABASE_URL), và việc theo dõi chi phí sẽ diễn ra tự động. Đối với giới hạn tốc độ, hãy đặt rpm_limit và tpm_limit khi tạo khóa ảo. Bảng điều khiển tích hợp sẵn tại /ui hiển thị chi tiêu theo nhóm và theo mô hình.

LiteLLM proxy có an toàn để sử dụng trong production không?

Có, với một lưu ý: tránh các phiên bản 1.82.7 và 1.82.8, vốn bị ảnh hưởng bởi sự cố chuỗi cung ứng vào tháng 3 năm 2026. Sử dụng phiên bản 1.83.0 trở lên. Ghim phiên bản hình ảnh Docker của bạn, đặt LITELLM_SALT_KEY để mã hóa và tuân theo các best practices production chính thức.

Sự khác biệt giữa LiteLLM SDK và LiteLLM proxy là gì?

SDK là một thư viện Python để gọi nhiều API LLM từ mã của bạn. Proxy là một máy chủ độc lập mà toàn bộ nhóm của bạn kết nối đến. Sử dụng SDK khi bạn là một dev độc lập viết script. Sử dụng proxy khi bạn cần kiểm soát truy cập chia sẻ, theo dõi chi phí và giới hạn tốc độ trên toàn nhóm.

Tôi có thể sử dụng LiteLLM proxy với Ollama và các mô hình cục bộ không?

Chắc chắn rồi. Thêm một mục vào config.yaml của bạn với model: ollama/llama3.1 và api_base: http://host.docker.internal:11434 (hoặc host Ollama của bạn). Nhóm của bạn sau đó có thể truy cập các mô hình cục bộ thông qua cùng một điểm cuối proxy, rất tuyệt vời cho phát triển và kiểm tra miễn phí chi phí.

LiteLLM proxy có giá bao nhiêu?

LiteLLM proxy miễn phí và mã nguồn mở (giấy phép MIT). Bạn tự lưu trữ nó trên cơ sở hạ tầng của riêng mình. Chi phí duy nhất là máy chủ của bạn (một VPS nhỏ là đủ cho hầu hết các nhóm) và chi phí API LLM mà bạn đang trả. BerriAI cũng cung cấp một phiên bản đám mây được quản lý nếu bạn không muốn tự lưu trữ.

LiteLLM hỗ trợ những nhà cung cấp nào?

Hơn 100, bao gồm OpenAI, Anthropic, Azure OpenAI, AWS Bedrock, Google Vertex AI, Ollama, Hugging Face, Cohere, Replicate và nhiều hơn nữa. Danh sách đầy đủ có trên kho lưu trữ GitHub của LiteLLM.

Làm thế nào để cập nhật LiteLLM proxy một cách an toàn?

Luôn ghim một phiên bản cụ thể trong thẻ hình ảnh Docker của bạn (ví dụ: ghcr.io/berriai/litellm:v1.83.2-stable). Trước khi nâng cấp, hãy kiểm tra changelog để xem có thay đổi phá vỡ nào không. Không bao giờ sử dụng latest trong production. Và luôn xác minh phiên bản mới không nằm trong danh sách cảnh báo bảo mật, sự cố tháng 3 năm 2026 đã chứng minh rằng ngay cả các gói đáng tin cậy cũng có thể bị xâm phạm.

Kết luận Cuối cùng và Các Bước Tiếp theo

Danh mụcKhuyến nghịGhi chú
Bắt đầu nhanhLệnh đơn docker runHoàn hảo để kiểm tra lần đầu
Thiết lập NhómDocker Compose + PostgreSQLMặc định cho 90% các nhóm
Cấu hìnhĐa nhà cung cấp với dự phòngĐừng dựa vào một nhà cung cấp duy nhất
Quản lý KhóaKhóa ảo theo nhómNgân sách + giới hạn tốc độ cho mỗi khóa
Hiển thị Chi phíBảng điều khiển tích hợp + PostgresGiám sát trước khi tối ưu hóa
Tích hợp IDETrỏ Claude Code / Cursor vào proxyHóa đơn thống nhất trên tất cả các công cụ
Bảo mậtGhim phiên bản, đặt salt keyTránh 1.82.7 và 1.82.8

Nếu nhóm của bạn chi tiêu tiền cho API LLM và bạn chưa có proxy, hãy bắt đầu với Docker Compose + Postgres ngay hôm nay. Việc thiết lập mất 15 phút và bạn sẽ có khả năng hiển thị chi phí cũng như kiểm soát truy cập khi kết thúc.

Khi đã chạy, hãy khám phá việc thêm các rào chắn (guardrails) vào pipeline LLM của bạn để lọc nội dung và kiểm tra an toàn. Proxy là nền tảng, mọi thứ khác được xây dựng dựa trên nó.

Nguồn

  • Bắt đầu nhanh LiteLLM Proxy, Tài liệu Chính thức
  • Hướng dẫn Triển khai Docker LiteLLM
  • Tài liệu Khóa ảo LiteLLM
  • Best Practices Production LiteLLM
  • Cập nhật Bảo mật LiteLLM, Tháng 3 năm 2026
  • BerriAI/litellm, Kho lưu trữ GitHub

Thẻ

thiết lập litellm proxyllm gatewaydocker composekhóa ảotheo dõi chi phígiới hạn tốc độphát triển ai

Chia sẻ bài viết này

Bài viết liên quan

Thêm từ chuyên mục guides

guides
Jul 18, 2026

So sánh giá LLM API 2026: Định giá mọi mô hình lớn

Bảng so sánh giá LLM API đầy đủ cho năm 2026 — Claude, GPT-5.6, Gemini, DeepSeek, Qwen, GLM và Mistral được định giá song song theo mỗi triệu token, lấy trực tiếp từ các trang giá chính thức.

12 min read phút đọc
Đọc
guides
Apr 12, 2026

Hướng dẫn Surfer SEO 2026: Trình soạn thảo nội dung, Chấm điểm NLP và Tìm kiếm AI

Hướng dẫn thực hành về Surfer SEO bao gồm quy trình làm việc với Trình soạn thảo nội dung, hệ thống chấm điểm NLP, AI Tracker để tối ưu hóa GEO và tự động hóa API. Dựa trên quá trình thử nghiệm hơn 50 bài viết.

14 min read phút đọc
Đọc
guides
Apr 12, 2026

Hướng dẫn Semrush 2026: Giải thích mọi công cụ (Kèm ví dụ)

Hướng dẫn thực tế về Semrush bao gồm nghiên cứu từ khóa, kiểm tra trang web, phân tích đối thủ, theo dõi khả năng hiển thị AI và thiết lập máy chủ MCP. Bao gồm các ví dụ mã và quy trình làm việc từ hệ thống SEO thực tế.

14 min read phút đọc
Đọc
Xem tất cả bài viết
Khởi động dự án của bạn

Sẵn sàng tạo nên điều gì đó đột phá?

Hãy biến tầm nhìn của bạn thành hiện thực. Đội ngũ của chúng tôi sẵn sàng đồng hành cùng bạn tạo ra phần mềm tạo nên sự khác biệt.

Đặt lịch gọi ý tưởng 30 phútXem dự án của chúng tôi

Công cụ hot trong kho

Claude Skills

Xem tất cả
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tự động hoá AI

Xem tất cả
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Công cụ hot trong kho

Claude Skills

Xem tất cả
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Tự động hoá AI

Xem tất cả
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Dịch vụ

  • Giải pháp doanh nghiệp
  • Ứng dụng di động
  • Ứng dụng web

Giải pháp

  • Hệ thống CRM
  • Tích hợp AI
  • Giải pháp ERP
  • Voice Agent
  • Tự động hóa quy trình
  • Bảo mật thông tin

Thư viện

  • Blog
  • Dự án

Cộng đồng

  • Tự động hoá AI
  • Claude Skills

Công cụ

  • Tính phí làm ứng dụng mobile
  • Tính phí dùng OpenAI / LLM API
  • Tính phí làm MVP
  • Tính phí làm Voice AI Agent

Công ty

  • Giới thiệu
  • Cộng sự
  • Liên hệ

Pháp lý

  • Chính sách quyền riêng tư
  • Điều khoản dịch vụ
  • Chính sách cookie

Dịch vụ

  • Giải pháp doanh nghiệp
  • Ứng dụng di động
  • Ứng dụng web

Giải pháp

  • Hệ thống CRM
  • Tích hợp AI
  • Giải pháp ERP
  • Voice Agent
  • Tự động hóa quy trình
  • Bảo mật thông tin

Thư viện

  • Blog
  • Dự án

Cộng đồng

  • Tự động hoá AI
  • Claude Skills

Công cụ

  • Tính phí làm ứng dụng mobile
  • Tính phí dùng OpenAI / LLM API
  • Tính phí làm MVP
  • Tính phí làm Voice AI Agent

Công ty

  • Giới thiệu
  • Cộng sự
  • Liên hệ
Pháp lýChính sách quyền riêng tưĐiều khoản dịch vụChính sách cookie
TECHSY
© 2026 Techsy. Bảo lưu mọi quyền.