
Claude Code đi kèm với các mô hình của Anthropic, nhưng chỉ với một biến môi trường duy nhất, ANTHROPIC_BASE_URL, bạn có thể định tuyến yêu cầu đến hầu hết mọi nhà cung cấp LLM. Điều đó có nghĩa là bạn có thể thay thế bằng DeepSeek với mức giá khoảng $0.27 cho mỗi triệu token đầu ra thay vì Claude Opus ở mức $25, hoặc chạy các mô hình cục bộ thông qua Ollama hoàn toàn miễn phí. Hướng dẫn này bao gồm mọi phương pháp để sử dụng các mô hình khác nhau trong Claude Code, dựa trên bài so sánh chi tiết về Claude Code của chúng tôi với hướng dẫn thiết lập thực tế cho từng cách tiếp cận.
Tổng quan nhanh các phương pháp
Chọn phương pháp phù hợp với tình huống của bạn, sau đó nhảy đến phần tương ứng để xem mã thiết lập.
| Phương pháp | Phù hợp nhất cho | Chi phí | Thiết lập | Mô hình |
|---|---|---|---|---|
| OpenRouter | Đa dạng mô hình, một khóa API | Trả theo token (giá gốc) | Dễ dàng | 300+ |
| Ollama | Quyền riêng tư, miễn phí, ngoại tuyến | Miễn phí (phần cứng của bạn) | Dễ dàng | 50+ mã nguồn mở |
| LM Studio | Mô hình cục bộ với giao diện đồ họa | Miễn phí (phần cứng của bạn) | Dễ dàng | 50+ mã nguồn mở |
| claude-code-router | Định tuyến thông minh theo tác vụ | Thay đổi tùy nhà cung cấp | Trung bình | Phụ thuộc cấu hình |
| claude-code-proxy | Backend Gemini/OpenAI | Giá nhà cung cấp | Trung bình | OpenAI + Gemini |
| LiteLLM | Doanh nghiệp, cân bằng tải | Giá nhà cung cấp | Nâng cao | 100+ across providers |
Đọc tiếp để xem hướng dẫn thiết lập từng bước cho mỗi phương pháp, hoặc nhảy đến khung quyết định nếu bạn đã biết mình cần gì.
Cơ chế chuyển đổi mô hình trong Claude Code hoạt động như thế nào?
Trước khi cấu hình bất kỳ proxy nào, bạn cần hiểu tại sao hầu hết các hướng dẫn đều khiến bạn gặp phải thiết lập bị lỗi. Claude Code nội bộ sử dụng ba khe mô hình (model slots), chứ không phải một:
- Khe Haiku, cho các tác vụ nền như tóm tắt tệp và hoàn thành tab
- Khe Sonnet, mặc định cho lập trình, là mô hình bạn tương tác nhiều nhất
- Khe Opus, cho suy luận phức tạp, lập kế hoạch và các tác vụ agent đa bước
Khi bạn thay đổi mô hình bằng lệnh /model hoặc --model, bạn chỉ đang thay đổi khe chính. Claude Code vẫn cố gắng gọi hai khe còn lại bằng API của Anthropic. Nếu bạn đã trỏ ANTHROPIC_BASE_URL vào một proxy nhưng chỉ đặt một mô hình, các khe khác sẽ thất bại với lỗi "model not found" (không tìm thấy mô hình).
Cách khắc phục: đặt cả ba biến môi trường để mọi khe đều được định tuyến qua proxy của bạn.
# Cut Claude Code's Bill 90%: Run OpenRouter, Ollama or LiteLLM
export ANTHROPIC_DEFAULT_HAIKU_MODEL="your-haiku-equivalent"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-sonnet-equivalent"
export ANTHROPIC_DEFAULT_OPUS_MODEL="your-opus-equivalent"Chuyển đổi mô hình gốc (Các mô hình Anthropic)
Nếu bạn vẫn nằm trong họ mô hình của Anthropic, việc chuyển đổi rất đơn giản. Sử dụng lệnh /model bên trong Claude Code, truyền tham số --model khi khởi chạy từ terminal, hoặc thêm các mô hình vào mảng availableModels trong tệp cài đặt của bạn. Anthropic liên tục bổ sung các tùy chọn tại đây, và bài tổng hợp của chúng tôi về các tính năng Claude Code mới nhất cho năm 2026 sẽ theo dõi những gì đã được phát hành gần đây.
Chiến lược opusplan
opusplan là cơ chế định tuyến đa mô hình tích hợp sẵn của Claude Code. Nó tự động gửi các tác vụ nền đến Haiku và chuyển hướng các suy luận phức tạp đến Opus. Bạn không cần cấu hình thủ công; chỉ cần chọn nó làm mô hình của bạn. Đây là câu trả lời của chính Anthropic cho vấn đề "tại sao tôi phải trả giá Opus cho việc liệt kê tệp?". Đáng để thử trước khi bạn tìm đến bộ định tuyến bên thứ ba, cùng với chế độ nhanh của Anthropic nếu tốc độ thô là ưu tiên hàng đầu của bạn.
OpenRouter, Một Khóa API, 300+ Mô hình
OpenRouter hoạt động như một bộ tổng hợp API. Bạn nhận được một khóa API duy nhất và quyền truy cập vào hơn 300 mô hình từ Anthropic, Google, Meta, Mistral, DeepSeek và nhiều hơn nữa. Giá cả là giá gốc cho hầu hết các mô hình, không có phí chênh lệch.
Các bước thiết lập
- Tạo tài khoản tại openrouter.ai và tạo khóa API
- Chạy
claude /logoutđể xóa bất kỳ phiên Anthropic hiện có nào - Đặt các biến môi trường của bạn:
export ANTHROPIC_BASE_URL="https://openrouter.ai/api"
export ANTHROPIC_API_KEY="sk-or-v1-your-key-here"
# Map all three model slots
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek/deepseek-chat-v3"
export ANTHROPIC_DEFAULT_SONNET_MODEL="anthropic/claude-sonnet-4"
export ANTHROPIC_DEFAULT_OPUS_MODEL="anthropic/claude-opus-4"- Khởi chạy
claudevà xác minh kết nối
Lưu ý ba biến khe (slot), nếu bỏ qua chúng, bạn sẽ gặp lỗi "model not found" mà chúng tôi đã đề cập ở trên. Hướng dẫn tích hợp OpenRouter chính thức xác nhận thiết lập này.
Các mô hình khuyến nghị qua OpenRouter
Không phải mọi mô hình trên OpenRouter đều xử lý việc gọi công cụ (tool calling) của Claude Code một cách đáng tin cậy. Dưới đây là những mô hình hoạt động tốt:
| Tác vụ | Mô hình | Lý do |
|---|---|---|
| Tác vụ nền giá rẻ | DeepSeek V3.2 | $0.27/$1.10 mỗi MTok, gọi công cụ khá tốt |
| Lập trình mặc định | Claude Sonnet 4 | Chất lượng tương đương trực tiếp, thanh toán gộp |
| Codebase khổng lồ (ngữ cảnh 1M) | Gemini 2.5 Flash | $0.15/$0.60 mỗi MTok, cửa sổ ngữ cảnh cực lớn |
| Suy luận phức tạp | Claude Opus 4 | Chất lượng lập trình agent tốt nhất |
Chi phí và Thanh toán
OpenRouter tính giá gốc cho hầu hết các mô hình. Bạn trả đúng số tiền mà nhà cung cấp gốc tính, cộng với một khoản biên lợi nhỏ cho một số mô hình bên thứ ba. Đặt giới hạn chi tiêu trong bảng điều khiển OpenRouter của bạn để tránh bất ngờ.
Kết luận: OpenRouter là lựa chọn tốt nhất cho các nhà phát triển muốn sự đa dạng mô hình tối đa với thiết lập tối thiểu. Một khóa API, một bảng điều khiển thanh toán, hơn 300 mô hình. Khó có đối thủ về mặt linh hoạt.
Ollama, Miễn phí, Cục bộ và Riêng tư
Ollama chạy các mô hình hoàn toàn trên máy của bạn. Kể từ v0.14.0 (tháng 1 năm 2026), nó hỗ trợ native Anthropic Messages API, điều đó có nghĩa là Claude Code có thể giao tiếp với nó mà không cần bất kỳ lớp chuyển đổi nào. Mã nguồn của bạn không bao giờ rời khỏi máy của bạn.
Yêu cầu tiên quyết và Phần cứng
Bạn sẽ cần phần cứng đủ mạnh để có trải nghiệm sử dụng được:
- Mô hình 7B (chỉnh sửa nhanh, tác vụ đơn giản): Tối thiểu 16GB RAM
- Mô hình 14B (chất lượng lập trình vững chắc): 32GB RAM, khuyến nghị có GPU
- Mô hình 32B+ (chất lượng gần bằng đám mây): 64GB RAM hoặc GPU chuyên dụng với 24GB+ VRAM
Để tìm hiểu sâu hơn về yêu cầu phần cứng và lựa chọn mô hình, hãy xem hướng dẫn chạy LLM cục bộ của chúng tôi.
Các bước thiết lập
- Cài đặt Ollama từ ollama.com
- Tải xuống một mô hình tập trung vào lập trình
- Khởi chạy với khả năng tương thích Claude Code
- Đặt các biến môi trường của bạn
# Install and pull a coding model
ollama pull qwen2.5-coder:14b
# Launch with Claude Code compatibility
ollama launch claude
# Set env vars
export ANTHROPIC_BASE_URL="http://localhost:11434"
export ANTHROPIC_API_KEY="ollama"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="qwen2.5-coder:14b"
export ANTHROPIC_DEFAULT_SONNET_MODEL="qwen2.5-coder:14b"
export ANTHROPIC_DEFAULT_OPUS_MODEL="qwen2.5-coder:14b"Tài liệu tích hợp Ollama khuyến nghị các mô hình có cửa sổ ngữ cảnh 64k+ token để có trải nghiệm Claude Code tốt nhất.
Các mô hình cục bộ tốt nhất cho lập trình
| Mô hình | Kích thước | Điểm mạnh | Ghi chú |
|---|---|---|---|
| Qwen 2.5 Coder 14B | 14B | Tốt nhất tổng thể cho lập trình cục bộ | Gọi công cụ mạnh, xử lý ngữ cảnh tốt |
| devstral | 24B | Chuyên gia lập trình của Mistral | Tuyệt vời cho tái cấu trúc và rà soát mã |
| GLM 4.7 | 9B | Suy luận chung | Cân bằng tốt giữa tốc độ và chất lượng |
Hãy thành thật với bản thân về một điều: các mô hình cục bộ tạo ra mã có chất lượng thấp hơn đáng kể so với Claude Sonnet cho các tác vụ agent phức tạp, đa bước. Việc gọi công cụ kém tin cậy hơn và bạn sẽ thấy nhiều đường dẫn tệp bị ảo giác hơn. Chúng tuyệt vời cho các chỉnh sửa nhanh, tạo sinh đơn giản và công việc nhạy cảm về quyền riêng tư, nhưng đừng mong đợi chất lượng native của Claude khi tái cấu trúc 50 tệp.
Kết luận: Ollama là lựa chọn tốt nhất cho công việc nhạy cảm về quyền riêng tư và các nhà phát triển muốn sử dụng miễn phí, không giới hạn. Nếu bạn có phần cứng, khó mà tranh cãi với cụm từ "không mất phí mãi mãi".
Ollama Cloud so với OpenRouter: Định giá và Khi nào mỗi bên thắng thế
Ollama và OpenRouter giải quyết vấn đề chi phí từ hai phía đối ngược. Ollama chạy các mô hình trên phần cứng bạn kiểm soát với chi phí mỗi token bằng 0, trong khi OpenRouter tính giá gốc trên hơn 300 mô hình được lưu trữ mà không cần quản lý phần cứng. Hướng dẫn này thiết lập Ollama cục bộ, và phép toán chi phí cố định so với mỗi token tương tự cũng áp dụng nếu bạn chạy tầng lưu trữ của nó.
| Yếu tố | Ollama | OpenRouter |
|---|---|---|
| Mô hình chi phí | Miễn phí cục bộ, bạn trả cho phần cứng | Mỗi token giá gốc, không phí chênh lệch cho hầu hết mô hình |
| Ví dụ về giá | $0 mỗi token | DeepSeek V3.2 ở mức $0.27/$1.10, Gemini 2.5 Flash ở mức $0.15/$0.60 mỗi MTok |
| Phần cứng | 16GB RAM (7B) đến 24GB+ VRAM (32B+) | Không có, hoàn toàn được lưu trữ |
| Truy cập mô hình | 50+ mô hình mã nguồn mở | 300+ across providers |
| Quyền riêng tư | Mã không bao giờ rời khỏi máy của bạn | Yêu cầu đi qua OpenRouter |
Chọn Ollama khi quyền riêng tư, sử dụng ngoại tuyến hoặc khối lượng lớn các chỉnh sửa thường xuyên là quan trọng và bạn đã sở hữu phần cứng. Chọn OpenRouter khi bạn muốn sự đa dạng mô hình, không cần phần cứng trả trước và thanh toán theo mức sử thực tế.
LM Studio, Mô hình Cục bộ Với Giao diện Đồ họa
LM Studio cung cấp khả năng thực thi mô hình cục bộ giống như Ollama, nhưng với giao diện trực quan. Bạn duyệt các mô hình trong giao diện đồ họa, chọn mức độ lượng tử hóa chỉ bằng một cú nhấp chuột và kiểm tra chat trước khi trỏ Claude Code vào đó. Yêu cầu phần cứng giống hệt Ollama. Nếu bạn đang so sánh các trình chạy, hướng dẫn của chúng tôi về các công cụ tốt nhất để chạy LLM cục bộ sẽ phân tích các đánh đổi.
Thiết lập
- Tải xuống LM Studio và cài đặt
- Tìm kiếm và tải xuống một mô hình lập trình (Qwen 2.5 Coder, devstral, v.v.)
- Khởi động máy chủ cục bộ từ giao diện LM Studio
- Trỏ Claude Code vào đó:
# Point Claude Code to LM Studio's local server
export ANTHROPIC_BASE_URL="http://localhost:1234/v1"
export ANTHROPIC_API_KEY="lm-studio"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-loaded-model-name"Blog của LM Studio có hướng dẫn kèm ảnh chụp màn hình nếu bạn thích các hướng dẫn thiết lập trực quan.
Kết luận: LM Studio phù hợp nhất cho các nhà phát triển thích giao diện đồ họa hơn CLI để quản lý mô hình cục bộ. Nếu bạn đã quen thuộc với ollama pull và các tệp cấu hình, hãy gắn bó với Ollama. Nếu bạn muốn duyệt mô hình trực quan và điều chỉnh cài đặt bằng thanh trượt, LM Studio là lựa chọn của bạn.
claude-code-router, Định tuyến Mô hình Thông minh
claude-code-router là một gói npm chạy một proxy cục bộ giữa Claude Code và các nhà cung cấp đã cấu hình của bạn. Điều thú vị là định tuyến nhận biết ngữ cảnh, bạn có thể gửi các tác vụ nền giá rẻ đến DeepSeek, lập trình mặc định đến Sonnet và suy luận phức tạp đến Opus, tất cả đều tự động.
Dự án này có hơn 30k sao trên GitHub và hỗ trợ OpenRouter, DeepSeek, Gemini, Ollama, Groq, Volcengine và SiliconFlow làm nhà cung cấp.
Cài đặt và Thiết lập
npm install -g claude-code-router
claude-code-router init
claude-code-router startLệnh init tạo ra một config.json nơi bạn định nghĩa các nhà cung cấp và ánh xạ mô hình của mình:
{
"providers": {
"openrouter": {
"apiKey": "sk-or-v1-...",
"models": {
"haiku": "deepseek/deepseek-chat-v3",
"sonnet": "anthropic/claude-sonnet-4",
"opus": "anthropic/claude-opus-4"
}
}
}
}Cấu hình Định tuyến Nhận biết Ngữ cảnh
Đây là điểm mạnh của claude-code-router. Bạn có thể định tuyến các loại tác vụ khác nhau đến các mô hình khác nhau dựa trên độ phức tạp. Tóm tắt nền sẽ đi đến một mô hình giá rẻ, trong khi công việc lập kế hoạch và kiến trúc sẽ đi đến mô hình tốt nhất của bạn. Bộ định tuyến xử lý tất cả việc ánh xạ khe một cách minh bạch.
Bạn cũng có thể trộn lẫn các nhà cung cấp, sử dụng Ollama cho các kho lưu trữ nhạy cảm về quyền riêng tư và OpenRouter cho mọi thứ khác, chuyển đổi bằng lệnh /model bên trong Claude Code.
Kết luận: claude-code-router phù hợp nhất cho người dùng nâng cao muốn kiểm soát chi tiết mô hình nào xử lý từng loại tác vụ. Đây là tùy chọn có thể cấu hình nhiều nhất, nhưng sự linh hoạt đó đi kèm với nhiều bước thiết lập hơn so với việc hoán đổi ANTHROPIC_BASE_URL đơn giản.
claude-code-proxy và LiteLLM, Các Thiết lập Nâng cao
Hai phương pháp này phục vụ các nhu cầu khác nhau nhưng chia sẻ một đặc điểm: chúng đều là các máy chủ proxy dịch giữa các định dạng API.
claude-code-proxy (Backend Gemini và OpenAI)
claude-code-proxy là một công cụ Python (3.3k sao trên GitHub) chấp nhận các yêu cầu định dạng Anthropic từ Claude Code và dịch chúng sang định dạng OpenAI hoặc Gemini thông qua LiteLLM bên dưới. Đây là cách đơn giản nhất để sử dụng cụ thể các mô hình Gemini hoặc GPT với Claude Code.
pip install claude-code-proxy
claude-code-proxy --port 8080
# Then point Claude Code at it
export ANTHROPIC_BASE_URL="http://localhost:8080"
export ANTHROPIC_API_KEY="your-gemini-or-openai-key"Nếu bạn đặc biệt muốn cửa sổ ngữ cảnh 1 triệu token của Gemini cho các monorepo lớn, đây là con đường trực tiếp nhất.
LiteLLM (Proxy Universal Cấp Doanh nghiệp)
LiteLLM là một proxy cấp doanh nghiệp hỗ trợ hơn 100 nhà cung cấp với cân bằng tải, chuỗi dự phòng, giới hạn tốc độ và ghi nhật ký kiểm toán. Nó là quá mức cần thiết cho một nhà phát triển đơn lẻ nhưng rất cần thiết cho các nhóm cần quản trị xung quanh việc sử dụng mô hình AI.
Thiết lập sử dụng cấu hình YAML:
model_list:
- model_name: claude-sonnet-4-20250514
litellm_params:
model: gemini/gemini-2.5-flash
api_key: os.environ/GEMINI_API_KEY
- model_name: claude-haiku-3-5-20241022
litellm_params:
model: deepseek/deepseek-chat
api_key: os.environ/DEEPSEEK_API_KEY# Start LiteLLM proxy
litellm --config config.yaml --port 4000
# Point Claude Code to LiteLLM
export ANTHROPIC_BASE_URL="http://localhost:4000"
export ANTHROPIC_API_KEY="sk-litellm"Một lưu ý quan trọng từ tài liệu chính thức của Claude Code: "Anthropic không bảo chứng, duy trì hoặc kiểm toán LiteLLM." Hãy sử dụng nó, nhưng biết rằng đây là một công cụ cộng đồng, không phải sản phẩm của Anthropic. Hướng dẫn LiteLLM có thêm các ví dụ cấu hình nâng cao.
Kết luận: Sử dụng claude-code-proxy nếu bạn muốn cụ thể các mô hình Gemini hoặc OpenAI. Sử dụng LiteLLM nếu nhóm của bạn cần cân bằng tải, dự phòng và ghi nhật ký kiểm toán across providers.
Claude Code Router so với LiteLLM: Bạn nên dùng cái nào?
Claude Code Router là lựa chọn đơn giản hơn cho các nhà phát triển đơn lẻ muốn định tuyến mô hình theo từng tác vụ, trong khi LiteLLM được xây dựng cho các nhóm cần cân bằng tải, chuỗi dự phòng và ghi nhật ký kiểm toán. Router cài đặt qua npm và đọc config.json; LiteLLM chạy một proxy được cấu hình YAML cấp doanh nghiệp trên hơn 100 nhà cung cấp.
| Yếu tố | Claude Code Router | LiteLLM |
|---|---|---|
| Độ khó thiết lập | Trung bình: npm install, chỉnh sửa config.json | Nâng cao: Tệp cấu hình YAML |
| Phù hợp nhất cho | Dev đơn lẻ muốn định tuyến theo tác vụ | Các nhóm cần quản trị |
| Định dạng cấu hình | config.json | YAML model_list |
| Tính năng nổi bật | Định tuyến theo tác vụ nhận biết ngữ cảnh | Cân bằng tải, dự phòng, ghi nhật ký kiểm toán |
| Nhà cung cấp | OpenRouter, DeepSeek, Gemini, Ollama, Groq, và nhiều hơn nữa | 100+ across providers |
| Mức độ trưởng thành | 30k+ sao GitHub, xây dựng cho Claude Code | Proxy doanh nghiệp, công cụ cộng đồng (không được Anthropic bảo chứng) |
Chọn claude-code-router nếu bạn là nhà phát triển đơn lẻ muốn các tác vụ nền giá rẻ trên DeepSeek và suy luận phức tạp trên Opus mà không cần nhiều thiết lập. Chọn LiteLLM nếu nhóm của bạn cần cân bằng tải, giới hạn tốc độ và nhật ký kiểm toán across providers.
Đang cân nhắc các proxy khác? Bài tổng hợp của chúng tôi về các công cụ cổng LLM tốt nhất so sánh chúng cạnh nhau.
Mỗi phương pháp thực sự tốn bao nhiêu?
Hãy đặt con số thực tế vào đây. Dưới đây là những gì bạn sẽ trả cho mỗi 1 triệu token across các tổ hợp mô hình/phương pháp phổ biến nhất:
| Mô hình / Phương pháp | Đầu vào (mỗi 1M token) | Đầu ra (mỗi 1M token) | Ước tính hàng tháng (sử dụng vừa phải) |
|---|---|---|---|
| Claude Opus 4.6 (trực tiếp) | $5.00 | $25.00 | ~$50-150 |
| Claude Sonnet 4.6 (trực tiếp) | $3.00 | $15.00 | ~$30-60 |
| Claude Sonnet qua OpenRouter | $3.00 | $15.00 | Như nhau (giá gốc) |
| DeepSeek V3.2 (OpenRouter) | $0.27 | $1.10 | ~$3-8 |
| Gemini 2.5 Flash (OpenRouter) | $0.15 | $0.60 | ~$2-5 |
| Ollama (cục bộ) | Miễn phí | Miễn phí | $0 (chi phí phần cứng) |
Dữ liệu giá từ trang giá chính thức của Anthropic và OpenRouter. Sử dụng vừa phải giả định ~5-10M token/tháng cho các phiên lập trình hàng ngày.
"Cost per 1M Output Tokens by Model"
Bảng dữ liệu
| "Model" | "Output Cost" |
|---|---|
| "Opus 4.6" | 25 |
| "Sonnet 4.6" | 15 |
| "DeepSeek V3.2" | 1.1 |
| "Gemini 2.5 Flash" | 0.6 |
| "Ollama (local)" | 0 |
Khoảng cách chi phí là đáng kể, nhưng các mô hình rẻ hơn tạo ra mã có chất lượng thấp hơn, đặc biệt là cho các tác vụ agent phức tạp nơi độ tin cậy của việc gọi công cụ là quan trọng. DeepSeek ở mức $1.10/MTok đầu ra rất tuyệt vời cho các chỉnh sửa thường xuyên. Đối với việc tái cấu trúc nhiều tệp nơi Claude Code cần đọc, lập kế hoạch, chỉnh sửa và xác minh across 20 tệp? Bạn vẫn sẽ muốn Sonnet hoặc Opus.
Kết luận: Để tiết kiệm chi phí với chất lượng chấp nhận được, OpenRouter + DeepSeek cung cấp tỷ lệ tốt nhất. Để chi phí bằng 0, Ollama là vô đối nếu bạn có phần cứng. Để có chất lượng tối đa, Anthropic trực tiếp vẫn là vua.
Bạn nên sử dụng phương pháp nào?, Khung quyết định
Đây là phần mà mọi hướng dẫn khác đều bỏ qua. Thay vì nói với bạn "chỉ cần sử dụng OpenRouter", hãy khớp các phương pháp với nhu cầu thực tế:
| Nếu bạn cần... | Sử dụng phương pháp này | Tại sao |
|---|---|---|
| Sự đa dạng mô hình tối đa, một khóa API | OpenRouter | 300+ mô hình, thiết lập dễ dàng, trả theo sử dụng |
| Miễn phí, không giới hạn, mã giữ lại cục bộ | Ollama | Chi phí bằng 0, quyền riêng tư đầy đủ, khả năng ngoại tuyến |
| Mô hình cục bộ với giao diện trực quan | LM Studio | Trình duyệt mô hình GUI, dễ dàng chọn lượng tử hóa |
| Định tuyến thông minh theo tác vụ | claude-code-router | Định tuyến suy luận đến Opus, chỉnh sửa nhanh đến DeepSeek |
| Cụ thể các mô hình Gemini hoặc OpenAI | claude-code-proxy | Dịch định dạng Anthropic sang OpenAI/Gemini |
| Doanh nghiệp: cân bằng tải, kiểm toán | LiteLLM | Giới hạn tốc độ, chuỗi dự phòng, kiểm soát nhóm |
Bạn có thực sự nên chuyển đổi không?
Quan điểm trung thực: đối với hầu hết các nhà phát triển thực hiện lập trình agent phức tạp, tái cấu trúc nhiều tệp, lập kế hoạch kiến trúc, gỡ lỗi các vấn đề đồng thời khó khăn, Claude Sonnet qua Anthropic trực tiếp vẫn là lựa chọn tốt nhất. Native Claude có việc gọi công cụ đáng tin cậy nhất, hiểu biết tốt nhất về quy trình làm việc agent của chính nó và không có độ trễ proxy.
Chuyển đổi mô hình là một tối ưu hóa cho các kịch bản cụ thể:
- Bạn đang đốt token cho các tác vụ nền không cần chất lượng Sonnet, hoặc bạn liên tục chạm vào giới hạn sử dụng 2x của Claude
- Bạn cần cửa sổ ngữ cảnh 1M của Gemini cho một monorepo khổng lồ
- Mã của bạn không thể rời khỏi máy của bạn (chính phủ, chăm sóc sức khỏe, tài chính)
- Bạn có ngân sách hạn chế và chất lượng chấp nhận được quan trọng hơn chất lượng hoàn hảo
Nếu không có điều nào trong số đó áp dụng, opusplan (định tuyến tích hợp sẵn của Anthropic) có thể là tất cả những gì bạn cần.
Độ tin cậy của việc gọi công cụ là chỉ số chất lượng quan trọng nhất ở đây. Hệ thống phân cấp là: native Claude >> OpenRouter Claude >> DeepSeek/Gemini >> mô hình cục bộ. Càng đi xuống, bạn càng thấy nhiều lần gọi công cụ thất bại, đường dẫn tệp bị ảo giác và các chỉnh sửa không đầy đủ.
Khắc phục sự cố thường gặp
Lỗi "Model not found"
Đây là vấn đề phổ biến nhất. Nó xảy ra khi bạn đặt ANTHROPIC_BASE_URL nhưng quên ánh xạ cả ba khe mô hình. Claude Code cố gắng gọi Haiku hoặc Opus thông qua proxy của bạn, proxy không nhận ra tên mô hình Anthropic mặc định và bạn nhận được lỗi.
# Fix: set ALL three model slot variables
export ANTHROPIC_DEFAULT_HAIKU_MODEL="your-model"
export ANTHROPIC_DEFAULT_SONNET_MODEL="your-model"
export ANTHROPIC_DEFAULT_OPUS_MODEL="your-model"Kết nối bị từ chối / hết thời gian
Proxy của bạn không chạy, hoặc Claude Code đang hit sai cổng. Xác minh quy trình proxy đang hoạt động và kiểm tra kỹ cổng trong ANTHROPIC_BASE_URL. Tường lửa và VPN cũng có thể chặn các kết nối localhost.
Lỗi gọi công cụ
Mô hình không hỗ trợ đúng định dạng sử dụng công cụ của Anthropic. Triệu chứng: Claude Code bị treo, tạo ra các lệnh gọi công cụ trống hoặc chỉnh sửa sai tệp. Chuyển sang một mô hình có hỗ trợ gọi công cụ đã được xác minh, Qwen 2.5 Coder và devstral xử lý tốt nhất trong số các mô hình cục bộ.
Vấn đề streaming
Một số proxy không xử lý đúng các sự kiện do máy chủ gửi. Phản hồi xuất hiện cùng lúc thay vì streaming, hoặc chúng bị cắt ngắn giữa chừng. Đảm bảo phiên bản proxy của bạn là mới nhất và kiểm tra các vấn đề GitHub của nó để biết các lỗi streaming đã biết.
Vượt quá cửa sổ ngữ cảnh
Các mô hình cục bộ thường mặc định là cửa sổ ngữ cảnh 4K-8K. Claude Code cần nhiều hơn thế cho các phiên lập trình thực tế. Sử dụng các mô hình có ngữ cảnh 32K+, hoặc định tuyến các tác vụ ngữ cảnh dài đến Gemini (cửa sổ 1M) thông qua OpenRouter.
Phải đăng xuất trước cho OpenRouter
Nếu bạn đang chuyển từ Anthropic trực tiếp sang OpenRouter, hãy chạy claude /logout trước. Claude Code lưu trữ xác thực và sẽ tiếp tục cố gắng sử dụng khóa Anthropic của bạn ngay cả sau khi bạn thay đổi URL cơ sở.
# Clear cached authentication before switching providers
claude /logoutFAQ
Bạn có thể sử dụng Claude Code với GPT-4 hoặc Gemini không?
Có. claude-code-proxy dịch các yêu cầu định dạng Anthropic sang định dạng OpenAI hoặc Gemini. Bạn cũng có thể truy cập cả hai thông qua OpenRouter với một khóa API duy nhất. Việc gọi công cụ có thể kém tin cậy hơn so với native Claude, đặc biệt là cho các tác vụ đa bước phức tạp.
Làm thế nào để sử dụng Claude Code mà không cần khóa API Anthropic?
Sử dụng Ollama để sử dụng cục bộ hoàn toàn miễn phí, không cần khóa API từ bất kỳ nhà cung cấp nào. Ngoài ra, sử dụng OpenRouter với định dạng khóa API của họ. Bạn vẫn đặt biến môi trường ANTHROPIC_API_KEY, nhưng nó trỏ đến khóa của proxy của bạn (ví dụ: sk-or-v1-... cho OpenRouter, "ollama" cho Ollama).
Làm thế nào để thiết lập Claude Code với Ollama?
Cài đặt Ollama, tải xuống một mô hình như qwen2.5-coder:14b, chạy ollama launch claude và đặt ba biến môi trường: ANTHROPIC_BASE_URL, ANTHROPIC_API_KEY và ba biến khe mô hình. Xem phần Ollama ở trên để biết mã đầy đủ.
Những mô hình nào hoạt động tốt nhất với Claude Code?
Cho đám mây: Claude Sonnet 4 mang lại chất lượng lập trình tốt nhất, trong khi DeepSeek V3.2 cung cấp giá trị tốt nhất. Cho cục bộ: Qwen 2.5 Coder 14B là tiêu chuẩn vàng hiện tại. Yếu tố quyết định là độ tin cậy của việc gọi công cụ, Claude Code phụ thuộc rất nhiều vào nó cho các thao tác tệp và các mô hình native của Claude xử lý tốt nhất.
Làm thế nào để sửa lỗi "model not found" trong Claude Code?
Đặt tất cả ba biến môi trường khe mô hình: ANTHROPIC_DEFAULT_HAIKU_MODEL, ANTHROPIC_DEFAULT_SONNET_MODEL và ANTHROPIC_DEFAULT_OPUS_MODEL. Lỗi này xảy ra vì Claude Code sử dụng ba khe mô hình nội bộ và một khe chưa được ánh xạ cố gắng gọi một tên mô hình mà proxy của bạn không nhận ra.
Claude Code có thể hoạt động ngoại tuyến với các mô hình cục bộ không?
Có. Cả Ollama và LM Studio đều chạy các mô hình hoàn toàn trên máy của bạn mà không cần kết nối internet. Mã của bạn không bao giờ rời khỏi phần cứng của bạn. Bạn sẽ cần thông số kỹ thuật đầy đủ -- tối thiểu 16GB RAM cho các mô hình 7B, 32GB+ cho bất kỳ thứ gì lớn hơn.
Tôi có thể sử dụng LM Studio với Claude Code không?
Có. LM Studio chạy một máy chủ cục bộ mà Claude Code kết nối đến bằng cách đặt ANTHROPIC_BASE_URL thành http://localhost:1234/v1 và ANTHROPIC_API_KEY thành lm-studio. Tải xuống một mô hình lập trình như Qwen 2.5 Coder, khởi động máy chủ từ giao diện GUI của LM Studio, sau đó ánh xạ khe mô hình của bạn. Đó là sự thay thế trực quan cho CLI của Ollama.
ANTHROPIC_BASE_URL là gì và làm thế nào để sử dụng nó?
Đó là biến môi trường告诉 Claude Code nơi gửi các yêu cầu API. Theo mặc định, nó trỏ đến https://api.anthropic.com. Thay đổi nó thành bất kỳ điểm cuối tương thích Anthropic nào, OpenRouter (https://openrouter.ai/api), Ollama (http://localhost:11434), LiteLLM (http://localhost:4000), v.v.
claude-code-router có tốt hơn LiteLLM không?
Các công cụ khác nhau cho các vấn đề khác nhau. claude-code-router đơn giản hơn (npm install, chỉnh sửa config.json, xong) và được thiết kế đặc biệt cho Claude Code. LiteLLM là cấp doanh nghiệp với cân bằng tải, giới hạn tốc độ, chuỗi dự phòng và ghi nhật ký kiểm toán. Nhà phát triển đơn lẻ? Sử dụng claude-code-router. Nhóm có nhu cầu quản trị? Sử dụng LiteLLM.
Tôi có thể tiết kiệm bao nhiêu khi sử dụng các mô hình không phải của Anthropic?
Chuyển từ Claude Opus 4.6 sang DeepSeek V3.2 cắt giảm chi phí token đầu ra khoảng 95% ($25 so với $1.10 mỗi triệu token). Ollama đưa con số đó về 0 nếu bạn có phần cứng. Nhưng sự đánh đổi về chất lượng là có thật, hãy mong đợi độ chính xác thấp hơn trên các tác vụ agent đa bước phức tạp, việc gọi công cụ kém tin cậy hơn và nhiều đường dẫn tệp bị ảo giác hơn.
Việc gọi công cụ có hoạt động với tất cả các phương pháp proxy không?
Không đáng tin cậy trên toàn bộ. Native Claude có hỗ trợ gọi công cụ tốt nhất. OpenRouter với các mô hình Claude hoạt động gần như tương tự. DeepSeek và Gemini có hỗ trợ một phần, các lệnh gọi công cụ đơn giản hoạt động, nhưng các chuỗi phức tạp có thể thất bại. Các mô hình cục bộ qua Ollama có việc gọi công cụ kém tin cậy nhất. Đây là mối quan tâm về chất lượng số một khi chuyển đổi away from Anthropic.
Nguồn
- Cấu hình Mô hình, Tài liệu Claude Code
- Cấu hình Cổng LLM, Tài liệu Claude Code
- Tích hợp Claude Code, Tài liệu OpenRouter
- Tích hợp Claude Code, Tài liệu Ollama
- Giá API Claude, Anthropic
- claude-code-router, GitHub
- claude-code-proxy, GitHub
- Sử dụng Claude Code với Các mô hình Không phải Anthropic, Tài liệu LiteLLM