
9 Mô Hình Embedding Tốt Nhất Cho RAG Năm 2026 (Tôi Đã Benchmark Retrieval, Độ Trễ & Chi Phí)
Voyage-4 ra mắt ngày 15 tháng 1 năm 2026. Sau đó voyage-context-4 xuất hiện vào ngày 29 tháng 6. Nếu pipeline RAG của bạn vẫn đang index bằng ada-002 của OpenAI, bạn đang bỏ lỡ Recall@10 có thể đo lường được và còn phải trả tiền cho đặc quyền đó. Chọn mô hình embedding tốt nhất cho RAG năm 2026 không phải là vớ lấy mô hình nào đứng đầu bảng xếp hạng MTEB tuần đó. Chúng tôi đã embed 10.000 tài liệu của chính mình để tìm ra mô hình nào thực sự retrieve tốt, và mỗi mô hình tốn bao nhiêu cho mỗi triệu token. Bên dưới: bảng xếp hạng, giá, và một thủ thuật truncation giúp chúng tôi giảm 3 lần dung lượng vector. Embedding chỉ là một lớp trong toàn bộ stack RAG, nhưng làm sai lớp này thì mọi thứ phía sau đều chịu ảnh hưởng.
Điểm Chính
- Chất lượng retrieval tốt nhất (API): Voyage-4-large, với MoE, Matryoshka dims, và ~$0.12/M token.
- API toàn diện nhất: Gemini Embedding 001, dẫn đầu MTEB tiếng Anh, 3072-dim, ~$0.15/M.
- Mã nguồn mở / tự host tốt nhất: Qwen3-Embedding-8B, dẫn đầu MTEB đa ngôn ngữ và code.
- Tối ưu chi phí nhất: OpenAI text-embedding-3-large cắt 3072→1024, ~$0.13/M, vector nhỏ hơn 3 lần.
Mô Hình Embedding Thay Đổi Gì Trong Năm 2026?
Bước chuyển lớn nhất năm 2026 là dòng Voyage-4 (mixture-of-experts, không gian embedding chung giữa nano/lite/standard/large, kèm Matryoshka truncation và lượng tử hóa int8/binary), và voyage-context-4, mã hóa mỗi chunk cùng với ngữ cảnh xung quanh nó. Trong khi đó Gemini Embedding 001 đứng đầu bảng xếp hạng MTEB tiếng Anh và Qwen3-Embedding dẫn đầu retrieval mã nguồn mở đa ngôn ngữ.
Hai lần ra mắt của Voyage đã định hình lại cuộc chơi. Voyage-4 (15 tháng 1, 2026) giới thiệu không gian embedding chung, cho phép bạn trộn mô hình nhỏ để index hàng loạt giá rẻ và mô hình lớn cho truy vấn giá trị cao mà không cần re-index toàn bộ. Chỉ riêng điều này đã tiết kiệm được hóa đơn re-embedding mà hầu hết các team đều ngại.
Sau đó voyage-context-4 (29 tháng 6, 2026) giải quyết trực tiếp vấn đề chunking: thay vì embed một đoạn văn cô lập, nó mã hóa chunk kèm theo ngữ cảnh tài liệu. Thực tế, điều này có nghĩa là bạn không cần phải tinh chỉnh thủ công ranh giới chunk để tránh mất nghĩa ở các mép.
Một câu duy nhất cần nhớ: contextual chunk embedding biến chunking từ một bài toán tinh chỉnh mong manh thành một mặc định bạn có thể tin tưởng. Muốn xem so sánh chi tiết các API hosted? Bài phân tích Voyage vs OpenAI vs Cohere đầy đủ của chúng tôi là hướng dẫn đồng hành cho việc đó.
Xếp Hạng 9 Mô Hình Embedding Tốt Nhất Cho RAG
Với hầu hết các team năm 2026, ba lựa chọn bao phủ 90% trường hợp: Voyage-4-large cho chất lượng retrieval cao nhất trên API hosted, Gemini Embedding 001 là mô hình toàn diện có điểm cao nhất, và Qwen3-Embedding-8B nếu bạn tự host. Bảng xếp hạng đầy đủ và bảng tổng hợp nằm ngay bên dưới, sắp xếp theo mức độ phù hợp cho RAG retrieval, mô hình API trước, rồi đến mã nguồn mở.
| Mô hình | Nhà cung cấp | MTEB (retrieval, kèm ngày) | Dimensions (Matryoshka?) | Context window | Giá /1M token | Đa ngôn ngữ | Mở vs API/tự host |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Đánh giá nhà cung cấp, không có trên MTEB công khai (tháng 1/2026) | 2048/1024/512/256 (có, MRL) | ~32K token | ~$0.12 | Mạnh | API |
| Gemini Embedding 001 | ~67.7 retrieval / 68.3 tổng (MTEB, tháng 4/2026) | 3072 (có, MRL) | ~2K token | ~$0.15 | Mạnh | API | |
| text-embedding-3-large | OpenAI | Xem MTEB trực tiếp (không phải nhà cung cấp đăng), 2026 | 3072→1024→256 (có, MRL) | ~8K token | ~$0.13 | Tốt | API |
| Cohere Embed v4 | Cohere | Đánh giá nhà cung cấp, đa phương thức (2026) | 1536 (cấu hình được) | ~128K token | ~$0.12 | Mạnh | API |
| Voyage-context-4 | Voyage AI | Đánh giá theo ngữ cảnh (tháng 6/2026) | 2048/1024/512/256 (có, MRL) | ~32K token | ~$0.12 | Mạnh | API |
| Qwen3-Embedding-8B | Alibaba | ~70.6 đa ngôn ngữ / ~80.7 code (MTEB, 2026) | 32–4096 (linh hoạt) | ~32K token | Weights miễn phí (chi phí GPU) | Dẫn đầu | Tự host |
| BGE-M3 | BAAI | Đa ngôn ngữ mạnh (bảng xếp hạng HF, 2026) | 1024 (dense+sparse+multi) | ~8K token | Weights miễn phí (chi phí GPU) | Mạnh | Tự host |
| NV-Embed-v2 | NVIDIA | ~72.3 trung bình tiếng Anh (HF MTEB, cần xác minh, 2026) | 4096 | ~32K token | Weights miễn phí (chi phí GPU) | Tập trung tiếng Anh | Tự host |
| nomic-embed-text | Nomic AI | Khiêm tốn, cấp laptop (2026) | 768 | ~8K token | Miễn phí (cục bộ) | Hạn chế | Tự host |
Lưu các vector này vào cơ sở dữ liệu vector có kích thước phù hợp với số chiều của bạn, vì index 3072-dim tốn kém hơn nhiều so với 1024-dim ở quy mô lớn.
1. Voyage-4-large
Chất lượng retrieval thuần tốt nhất trong các API. Đây là mô hình mixture-of-experts với không gian embedding chung (trộn nano/lite/large không cần re-index) và Matryoshka dims 2048/1024/512/256, kèm lượng tử hóa fp32/int8/binary để lưu trữ rẻ hơn. Với khoảng $0.12/M token, giá như mô hình tầm trung nhưng retrieve như mô hình cao cấp. Chọn mô hình này nếu chất lượng retrieval là nút thắt cổ chai của bạn và bạn có thể trả ~$0.12/M.
2. Gemini Embedding 001
API toàn diện nhất. Mô hình của Google dẫn đầu bảng xếp hạng MTEB tiếng Anh (~68.3 tổng, 67.7 retrieval theo bản chụp tháng 4/2026), có 3072 dims với MRL truncation, và chia sẻ không gian đa phương thức. Với **$0.15/M**, đây là mô hình đắt nhất trong các lựa chọn hàng đầu của chúng tôi. Chọn nếu bạn muốn mô hình tổng quát có điểm cao nhất và Gemini/Vertex đã là stack của bạn.
3. OpenAI text-embedding-3-large
Mặc định tốt nhất ở quy mô lớn và dễ tích hợp nhất. 3072 dims, MRL truncation xuống 256, và phạm vi SDK cùng hướng dẫn rộng nhất trong mọi embedder. Với ~$0.13/M, đây là lựa chọn an toàn, và text-embedding-3-small (~$0.02/M) là phiên bản tiết kiệm cho ngữ liệu tiếng Anh. ada-002 cũ vẫn hoạt động nhưng bạn đang trả tiền cho recall kém hơn. Chọn nếu bạn muốn không có bất ngờ và hỗ trợ hệ sinh thái rộng.
4. Cohere Embed v4
Lựa chọn tốt nhất cho đa phương tiện và đa ngôn ngữ doanh nghiệp. Embed v4 xử lý văn bản, hình ảnh, và tài liệu xen kẽ trong một mô hình, với context window lớn và retrieval xuyên ngôn ngữ mạnh, ở mức ~$0.12/M. Chọn nếu ngữ liệu của bạn trộn PDF, ảnh chụp màn hình, và văn bản, hoặc bạn cần phủ đa ngôn ngữ nghiêm túc dưới một API.
5. Voyage-context-4
Lựa chọn mới nhất cho RAG tài liệu dài. Ra mắt ngày 29 tháng 6 năm 2026, nó embed mỗi chunk cùng ngữ cảnh xung quanh, giảm các lỗi "mất ở ranh giới chunk" thường gặp khi chia naive. Cùng khoảng ~$0.12/M như dòng Voyage-4. Chọn nếu tài liệu của bạn dài và chunking đã là cơn đau đầu của bạn.
6. Qwen3-Embedding-8B
Mô hình mã nguồn mở tốt nhất tổng thể, và lựa chọn tốt nhất cho retrieval code. Qwen3-Embedding của Alibaba dẫn đầu MTEB đa ngôn ngữ mã nguồn mở (~70.6) và đứng đầu MTEB-Code (~80.7) theo tài liệu Qwen3-Embedding, với dims linh hoạt từ 32 đến 4096 và lượng tử hóa Q4. Chọn nếu bạn tự host, index code, hoặc cần retrieval đa ngôn ngữ mạnh mà không phải trả phí theo token.
7. BGE-M3
Mô hình mở toàn diện nhất. BGE-M3 của BAAI cho bạn retrieval dense, sparse, và multi-vector trong một mô hình duy nhất, xử lý hơn 100 ngôn ngữ, và vẫn là một trong những embedder được tải nhiều nhất trên Hugging Face. Chọn nếu bạn muốn retrieval hybrid dense kèm sparse từ một mô hình tự host.
8. NV-Embed-v2
Weights mở tốt nhất cho độ chính xác chỉ tiếng Anh. Mô hình của NVIDIA báo cáo ~72.3 trung bình tiếng Anh trên bảng xếp hạng HF MTEB (số liệu khác nhau theo bản chụp, nên kiểm tra bảng trực tiếp), với 4096 dims. Nặng hơn hầu hết khi chạy. Chọn nếu độ chính xác tiếng Anh là ưu tiên hàng đầu và bạn có đủ GPU.
9. nomic-embed-text
Lựa chọn cục bộ và laptop tốt nhất. Mô hình của Nomic chạy native trên Ollama, nhỏ gọn, và rẻ để tự host, đánh đổi recall cao nhất lấy tốc độ trên phần cứng khiêm tốn. Các lựa chọn thay thế cùng phân khúc: mxbai-embed-large và all-MiniLM kỳ cựu. Chọn nếu bạn muốn embedding hoàn toàn cục bộ không tốn phí API và chấp nhận recall thấp hơn.
Một điều mà thử nghiệm của chúng tôi liên tục xác nhận: mô hình #1 MTEB hiếm khi là mô hình tốt nhất cho ngữ liệu của bạn. Đó chính xác là những gì phần tiếp theo đo lường.
Cách Chúng Tôi Kiểm Tra: Embed 10.000 Tài Liệu Và Đo Những Gì Quan Trọng
Chúng tôi đã embed ~10.000 tài liệu thực từ ngữ liệu tài liệu sản phẩm nội bộ và ticket hỗ trợ, sau đó chấm điểm retrieval so với tập ~120 truy vấn được gán nhãn thủ công. Phát hiện nổi bật: cắt text-embedding-3-large của OpenAI từ 3072 xuống 1024 dims chỉ mất khoảng 0.03 Recall@10 trong khi giảm dung lượng vector ~3 lần. Mất chất lượng nhỏ, lợi lưu trữ lớn.
Chúng tôi đã kiểm tra một tập con (không phải tất cả chín mô hình một cách toàn diện): Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (đầy đủ và đã cắt), Qwen3-Embedding-8B tự host, BGE-M3, và nomic-embed-text. Chúng tôi đo Recall@10 và nDCG@10 so với tập truy vấn có nhãn, độ trễ embedding p95, và chi phí mỗi 1M token cho API hoặc GPU-giây cho tự host. Với chỉ ~120 truy vấn, hãy xem đây là kết quả định hướng, không phải bảng xếp hạng.
| Mô hình (dims) | Recall@10 | nDCG@10 | Độ trễ p95 | Chi phí |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0.89 | 0.81 | ~180 ms (API) | ~$0.12/M |
| Gemini Embedding 001 (3072) | 0.88 | 0.80 | ~210 ms (API) | ~$0.15/M |
| Qwen3-Embedding-8B (tự host) | 0.87 | 0.79 | ~430 ms (GPU nguội) | GPU-giây |
| text-embedding-3-large (3072) | 0.86 | 0.78 | ~160 ms (API) | ~$0.13/M |
| text-embedding-3-large (1024) | 0.83 | 0.75 | ~150 ms (API) | ~$0.13/M |
| BGE-M3 (1024) | 0.82 | 0.74 | ~300 ms (tự host) | GPU-giây |
| nomic-embed-text (768) | 0.76 | 0.69 | ~90 ms (cục bộ) | Miễn phí |
Hai bài học đọng lại. Thứ nhất, Qwen3-8B tự host ngang ngửa API hàng đầu trên tập tiếng Anh của chúng tôi, nhưng độ trễ p95 gần như tăng gấp đôi khi không có GPU ấm, nên hãy tính toán chi phí giữ một instance chạy liên tục. Thứ hai, mô hình #1 bảng xếp hạng không phải là người chiến thắng trên ngữ liệu của chúng tôi khi tính đến chi phí. Nếu bạn muốn đánh giá chất lượng retrieval end-to-end trên dữ liệu của chính mình, đó là cách chọn trung thực. Và nếu bạn tò mò tại sao điểm MTEB trên bảng xếp hạng có thể gây hiểu lầm, chúng tôi đã viết bài giải thích chi tiết về cách điểm MTEB hoạt động cho RAG.

Mô Hình Embedding Tốn Bao Nhiêu?
API embedding hosted có giá khoảng $0.02 đến $0.15 mỗi 1M token vào tháng 7 năm 2026. Mô hình mã nguồn mở có weights "miễn phí", nhưng bạn trả bằng thời gian GPU và VRAM. Các lựa chọn API rẻ nhất đủ tốt là text-embedding-3-small và voyage-4-lite ở mức ~$0.02/M; con đường tự host rẻ nhất là nomic-embed-text, gần như miễn phí ở cấp token.
Đây là bảng giá xác minh (tính đến tháng 7/2026, và giá embedding đã thay đổi hai lần trong nửa đầu 2026, nên kiểm tra lại trang nhà cung cấp trước khi cam kết):
| Mô hình | Giá /1M token (tháng 7/2026) | Ghi chú |
|---|---|---|
| voyage-4-lite | ~$0.02 | Tier rẻ nhất của Voyage |
| voyage-4 | ~$0.06 | Tier tiêu chuẩn |
| voyage-4-large | ~$0.12 | Chất lượng retrieval tốt nhất |
| voyage-context-4 | ~$0.12 | Chunk theo ngữ cảnh |
| OpenAI 3-small | ~$0.02 | Lựa chọn tiếng Anh tiết kiệm |
| OpenAI 3-large | ~$0.13 | Mặc định ở quy mô lớn |
| Cohere Embed v4 | ~$0.12 | Đa phương thức |
| Gemini Embedding 001 | ~$0.15 | Điểm cao nhất |
| Mã nguồn mở (Qwen3, BGE-M3, nomic) | Chi phí GPU/VRAM | Không phí theo token |
Ở 100M token được index, khoảng cách giữa $0.02/M và $0.15/M là $2 so với $15. Nhỏ. Nhưng re-embed ngữ liệu đó hàng tháng, thêm embedding lúc truy vấn, và hệ số nhân tăng nhanh. Đó là lý do chi phí của API tầng retrieval xứng đáng có một dòng thực sự trong ngân sách của bạn, không phải một sai số làm tròn. Tự host đảo ngược phép tính: không phí theo token, nhưng bạn đang thuê GPU dù nó bận hay nhàn.
Chi Phí vs Chất Lượng: Mô Hình Embedding Nào Tối Ưu Nhất?
Quy tắc tối ưu chi phí rất đơn giản: chọn mô hình rẻ nhất đạt Recall@10 ≥ 0.80 trên ngữ liệu của bạn. Trong thử nghiệm của chúng tôi, đó là OpenAI text-embedding-3-large cắt xuống 1024 dims: Recall@10 0.83 ở mức ~$0.13/M, với vector nhỏ hơn 3 lần so với phiên bản 3072-dim. Nó nằm ngay giữa góc phần tư tối ưu, recall đủ cao, lưu trữ đủ thấp.
Hãy hình dung biểu đồ phân tán ở đầu bài: chi phí mỗi 1M token trên trục X, chất lượng retrieval trên trục Y. Các API cao cấp (Voyage-4-large, Gemini 001) nằm ở góc trên bên phải, recall tuyệt vời, giá cao hơn. Tier tiết kiệm (3-small, voyage-4-lite) nằm ở góc dưới bên trái, rẻ nhưng recall thấp hơn trên truy vấn khó. Góc phần tư tối ưu chi phí là góc mà hầu hết các team bỏ qua: giá tầm trung, recall cao, vector nhỏ.
Nhận định thẳng thắn của tôi sau khi chạy số: hầu hết các team mua thừa chất lượng embedding và đầu tư thiếu vào chunking và reranking. Nếu bạn đạt recall 0.80 ở 1024 dims, chi thêm 3 lần cho lưu trữ để tăng 0.03 recall hiếm khi đáng.
Quy tắc quyết định trong ba dòng:
- Nếu chất lượng retrieval là nút thắt và ngân sách thoải mái, chọn Voyage-4-large hoặc Gemini 001.
- Nếu bị giới hạn chi phí, chọn text-embedding-3-large cắt xuống 1024, hoặc 3-small cho ngữ liệu dễ.
- Nếu tự host, Qwen3-Embedding-8B là vua tối ưu chi phí khi GPU của bạn đã chạy sẵn.
Mô Hình Embedding Mã Nguồn Mở / Cục Bộ Nào Tốt Nhất Cho RAG?
Tự host tốt nhất tổng thể là Qwen3-Embedding-8B (cần GPU thực, khoảng 16GB+ VRAM ở Q4). Lựa chọn laptop/cục bộ tốt nhất là nomic-embed-text trên Ollama, chạy trên phần cứng khiêm tốn không tốn phí API. Tự host thắng khi bạn cần cư trú dữ liệu, khối lượng cao, hoặc muốn loại bỏ phí theo token; API thắng khi bạn không muốn trông GPU.
Chạy embedder cục bộ chỉ cần hai lệnh. Kéo mô hình, rồi embed và truy vấn. Đây là đường dẫn cục bộ với Ollama và đường dẫn API với OpenAI SDK, đặt cạnh nhau:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingNhững gì người dùng thực tế báo cáo trên Reddit khớp với thử nghiệm của chúng tôi: người tự host liên tục gặp độ trễ p95 tăng vọt khi GPU nguội giữa các request. Cách sửa là giữ một instance ấm, điều này âm thầm biến tự host "miễn phí" thành hóa đơn GPU cố định hàng tháng. Đáng để tính giá trước khi bạn rời khỏi API. Nếu bạn đang xây vòng lặp eval, việc quản lý prompt xung quanh retrieval ở một nơi cũng giúp ích. Để xem hướng dẫn đầy đủ, hãy đọc bài chạy mô hình embedding cục bộ với Ollama của chúng tôi.
Dimension Cao Hơn Có Nghĩa Là Retrieval Tốt Hơn Không?
Không, không tuyến tính. Qua một ngưỡng nhất định, thêm dimensions chỉ tăng chi phí lưu trữ và độ trễ mà không tăng recall tương xứng. Matryoshka Representation Learning (MRL) cho phép bạn cắt vector (ví dụ 3072→1024→512) và giữ phần lớn recall trong khi giảm mỗi vector 3–6 lần. Đó là cắt trực tiếp hóa đơn cơ sở dữ liệu vector của bạn.
Số liệu của chúng tôi nói rõ. Giảm text-embedding-3-large từ 3072 xuống 1024 dims mất ~0.03 Recall@10 nhưng giảm lưu trữ khoảng 3 lần. Xuống 512 và mức giảm recall dốc hơn, đặc biệt trên truy vấn mơ hồ. Điểm tối ưu cho hầu hết ngữ liệu tiếng Anh nằm quanh 1024.
Một câu tóm tắt: dimensions là thuế lưu trữ và độ trễ bạn trả trên mỗi vector, nên cắt chúng xuống kích thước nhỏ nhất vẫn đạt ngưỡng recall của bạn. Ở 10M+ vector, quyết định đó quyết định vector store nào bạn có thể chi trả, nên kiểm tra vector DB nào xử lý được số chiều của bạn và chi phí lưu trữ trước khi chốt dimension.
Làm Thế Nào Để Chọn Mô Hình Embedding Cho RAG?
Chọn mô hình embedding cho RAG quy về bốn bước kiểm tra, theo thứ tự. Chạy chúng trên dữ liệu của chính bạn, không phải bảng xếp hạng công khai, và danh sách rút gọn sẽ ngắn rất nhanh.
- Recall@10 ≥ 0.80 trên ngữ liệu của BẠN. Kiểm tra một tập con với tập truy vấn gán nhãn thủ công. Thứ hạng trên bảng xếp hạng là gợi ý, không phải câu trả lời.
- Chi phí dưới ngưỡng $/1M của bạn. Tính cả re-embedding và embedding lúc truy vấn, không chỉ index ban đầu.
- Context window ≥ kích thước chunk của bạn. Nếu chunk của bạn 1.000 token, mô hình 512-token sẽ cắt và mất nghĩa.
- Bảo trì tích cực và đa ngôn ngữ nếu cần. Mô hình cập nhật năm 2026 tốt hơn checkpoint cũ từ 2024; kiểm tra trực tiếp ngôn ngữ mục tiêu của bạn.
Chấm điểm hai hoặc ba mô hình trên cả bốn tiêu chí và người chiến thắng thường tự lộ diện. Từ đó, vấn đề là tích hợp vào pipeline RAG đầy đủ: chunk, embed, lưu, retrieve, rerank.
Về Tác Giả
Mert Batur Gurbuz là Đồng sáng lập Techsy.io, nơi team xây dựng AI agent, hệ thống tự động hóa, và pipeline voice/SDR cho khách hàng B2B. Anh học tại University of Birmingham và viết về stack công cụ LLM mà team Techsy thực sự dùng trong production. Kết nối trên LinkedIn.
Chọn công cụ là nửa dễ. Làm cho nó chạy ổn định bên trong một sản phẩm thực là nơi hầu hết các team bị kẹt, và đó chính xác là những gì team tích hợp AI của chúng tôi xây cho khách hàng, từ pipeline RAG đến agent tùy chỉnh.
Câu Hỏi Thường Gặp
Điểm MTEB có đủ để chọn mô hình embedding tốt nhất cho RAG không?
Không. MTEB chủ yếu là retrieval văn bản đơn miền trên dataset công khai, nên nó không phản ánh ngữ liệu, kích thước chunk, hỗn hợp ngôn ngữ, hay ngưỡng chi phí của bạn. Trong benchmark 10.000 tài liệu của chúng tôi, mô hình #1 bảng xếp hạng không phải tốt nhất trên ngữ liệu của chúng tôi khi tính giá. Luôn chạy eval miền nhỏ.
Mô hình embedding tốt nhất cho RAG năm 2026 là gì?
Voyage-4-large cho chất lượng retrieval thuần, Gemini Embedding 001 là API toàn diện tốt nhất, và Qwen3-Embedding-8B nếu bạn tự host. "Tốt nhất" phụ thuộc vào ngưỡng chi phí và nhu cầu ngôn ngữ của bạn, nên rút gọn hai mô hình và kiểm tra trên dữ liệu của chính bạn trước khi cam kết.
Mô hình embedding mã nguồn mở tốt nhất cho RAG là gì?
Qwen3-Embedding-8B là mô hình mã nguồn mở dẫn đầu tổng thể (điểm MTEB đa ngôn ngữ và code cao nhất), BGE-M3 là mô hình hybrid linh hoạt toàn diện, và nomic-embed-text là lựa chọn laptop qua Ollama. Weights miễn phí, nhưng bạn trả cho GPU và VRAM để chạy chúng.
Mã nguồn mở vs API embedding, cái nào tốt hơn cho RAG?
API thắng ở không cần vận hành và chất lượng mới nhất; tự host thắng ở cư trú dữ liệu, khối lượng cao, và không phí theo token. Điểm hòa vốn thường được quyết định bởi khối lượng và tuân thủ, không phải chất lượng thuần. Dưới vài trăm triệu token mỗi tháng, API gần như luôn rẻ hơn trong thực tế.
Mô hình embedding cục bộ tốt nhất để chạy trên Ollama là gì?
nomic-embed-text là lựa chọn hàng đầu (ollama pull nomic-embed-text): nhẹ, nhanh trên phần cứng khiêm tốn, và miễn phí ở cấp token. Nếu bạn có VRAM GPU dư, biến thể Qwen3-Embedding nhỏ hơn retrieve tốt hơn. Cả hai index cục bộ không tốn phí API hay dữ liệu rời khỏi máy của bạn.
Dimension embedding cao hơn có nghĩa là retrieval tốt hơn không?
Không tuyến tính. Qua một ngưỡng, thêm dimensions tăng lưu trữ và độ trễ mà không tăng recall tương xứng. Mô hình Matryoshka cho phép bạn cắt (ví dụ 3072→1024) và giữ phần lớn recall trong khi giảm mỗi vector khoảng 3 lần, cắt trực tiếp chi phí cơ sở dữ liệu vector.
Mô hình embedding rẻ nhất vẫn tốt cho RAG là gì?
text-embedding-3-small ($0.02/M) hoặc voyage-4-lite ($0.02/M) đạt Recall@10 vững cho hầu hết ngữ liệu tiếng Anh. Nếu bạn chạy được GPU, nomic-embed-text gần như miễn phí ở cấp token. Kiểm tra trên dữ liệu của bạn trước; mô hình rẻ giảm chất lượng trên truy vấn mơ hồ.
Mô hình embedding đa ngôn ngữ tốt nhất cho RAG là gì?
Qwen3-Embedding-8B và BGE-M3 dẫn đầu retrieval đa ngôn ngữ mã nguồn mở, trong khi Cohere Embed v4 và Gemini Embedding 001 là lựa chọn hosted mạnh. Luôn kiểm tra trên ngôn ngữ mục tiêu của bạn, vì thứ hạng MTEB-multilingual cao không đảm bảo hiệu suất tốt nhất cho cặp ngôn ngữ cụ thể của bạn.
Tôi có vẫn cần reranker khi đã có mô hình embedding tốt không?
Thường có, cho RAG độ chính xác cao. Embedder mạnh đưa ứng viên vào top-50; reranker sắp xếp lại top-k cho độ chính xác cuối cùng. Embedder rẻ hơn kèm reranker thường đánh bại embedder đắt tiền đơn lẻ, và tổng chi phí thấp hơn.
Kết Luận
Retrieval tổng thể tốt nhất trên API thuộc về Voyage-4-large; Gemini Embedding 001 là mô hình toàn diện có điểm cao nhất; Qwen3-Embedding-8B dẫn đầu mã nguồn mở và retrieval code; và nomic-embed-text là lựa chọn laptop cục bộ. Nhưng người chiến thắng về tối ưu chi phí cho hầu hết các team là text-embedding-3-large cắt ở 1024 dims: Recall@10 0.83, ~$0.13/M, và vector nhỏ hơn 3 lần. Bài học thực sự từ 10.000 tài liệu là mô hình #1 MTEB hiếm khi là mô hình tốt nhất cho ngữ liệu của bạn, nên hãy kiểm tra trên dữ liệu của chính mình. Đang xây RAG production và muốn có người xem giúp? Nhận tư vấn miễn phí.