
2026 年 RAG 最佳 9 大嵌入模型(我實測了檢索、延遲與成本)
Voyage-4 於 2026 年 1 月 15 日發布,接著 voyage-context-4 在 6 月 29 日登場。如果你的 RAG 管線還在用 OpenAI 的 ada-002 做索引,你正在白白損失可衡量的 Recall@10——而且還為此付了錢。2026 年挑選 RAG 最佳嵌入模型,不是看當週 MTEB 排行榜上誰第一就選誰。我們用自己的 10,000 份文件做了嵌入,找出哪些模型真的能檢索到東西,以及每百萬 token 各要花多少錢。以下是排名、價格,以及一個讓我們向量儲存縮減 3 倍的截斷技巧。嵌入只是整個 RAG 技術棧的一層,但這一層搞錯,下游全部受累。
重點整理
- 最佳檢索品質(API):Voyage-4-large,具備 MoE、Matryoshka 維度,約 $0.12/M tokens。
- 最佳全能 API:Gemini Embedding 001,英文 MTEB 冠軍,3072 維,約 $0.15/M。
- 最佳開源 / 自架:Qwen3-Embedding-8B,MTEB 多語言與程式碼雙料冠軍。
- 最佳性價比:OpenAI text-embedding-3-large 截斷 3072→1024,約 $0.13/M,向量縮小 3 倍。
2026 年嵌入模型有什麼變化?
2026 年的大轉變是 Voyage-4 系列(mixture-of-experts、nano/lite/standard/large 共享嵌入空間,加上 Matryoshka 截斷與 int8/二值量化),以及 voyage-context-4——它將每個 chunk 連同周圍上下文一起編碼。同時,Gemini Embedding 001 登上英文 MTEB 排行榜榜首,Qwen3-Embedding 則在開源多語言檢索中領先。
Voyage 的兩次發布重新定義了格局。Voyage-4(2026 年 1 月 15 日)引入了共享嵌入空間,讓你可以用小模型做廉價的大量索引、用大模型處理高價值查詢,而不必重新索引所有內容。光是這一點,就省下了多數團隊最怕的那筆重新嵌入帳單。
接著 voyage-context-4(2026 年 6 月 29 日)直接對付了 chunking 問題:它不再孤立地嵌入一個段落,而是將 chunk 加上文件上下文一起編碼。實務上,這代表你不用再手動調整 chunk 邊界來避免邊緣語意流失。
記住這一句就好:上下文 chunk 嵌入把 chunking 從脆弱的調參工作,變成接近可以信賴的預設值。想看託管 API 的正面對決?我們的 Voyage vs OpenAI vs Cohere 完整比較就是配套指南。
RAG 最佳 9 大嵌入模型排名
對 2026 年的多數團隊而言,三個選擇就能涵蓋 90% 的場景:Voyage-4-large 是託管 API 中檢索品質最高者,Gemini Embedding 001 是評分最佳的全能選手,Qwen3-Embedding-8B 則是自架首選。完整排名與總表就在下方,依 RAG 檢索適用度排序,先 API 模型,再開源模型。
| 模型 | 供應商 | MTEB(檢索,含日期) | 維度(Matryoshka?) | 上下文視窗 | 價格 /1M tokens | 多語言 | 開源 vs API/自架 |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | 供應商評測,未上公開 MTEB(2026 年 1 月) | 2048/1024/512/256(是,MRL) | ~32K tokens | ~$0.12 | 強 | API |
| Gemini Embedding 001 | ~67.7 檢索 / 68.3 總分(MTEB,2026 年 4 月) | 3072(是,MRL) | ~2K tokens | ~$0.15 | 強 | API | |
| text-embedding-3-large | OpenAI | 見即時 MTEB(非供應商公布),2026 | 3072→1024→256(是,MRL) | ~8K tokens | ~$0.13 | 良好 | API |
| Cohere Embed v4 | Cohere | 供應商評測,多模態(2026) | 1536(可設定) | ~128K tokens | ~$0.12 | 強 | API |
| Voyage-context-4 | Voyage AI | 上下文評測(2026 年 6 月) | 2048/1024/512/256(是,MRL) | ~32K tokens | ~$0.12 | 強 | API |
| Qwen3-Embedding-8B | Alibaba | ~70.6 多語言 / ~80.7 程式碼(MTEB,2026) | 32–4096(彈性) | ~32K tokens | 免費權重(GPU 成本) | 領先 | 自架 |
| BGE-M3 | BAAI | 多語言表現強(HF 排行榜,2026) | 1024(密集+稀疏+多向量) | ~8K tokens | 免費權重(GPU 成本) | 強 | 自架 |
| NV-Embed-v2 | NVIDIA | ~72.3 英文平均(HF MTEB,待確認,2026) | 4096 | ~32K tokens | 免費權重(GPU 成本) | 以英文為主 | 自架 |
| nomic-embed-text | Nomic AI | 普通,筆電級(2026) | 768 | ~8K tokens | 免費(本機) | 有限 | 自架 |
將這些向量存入向量資料庫時,要根據維度數量來規劃容量,因為在規模化之後,3072 維的索引比 1024 維貴得多。
1. Voyage-4-large
API 中純檢索品質最佳。它是 mixture-of-experts 模型,具有共享嵌入空間(可混用 nano/lite/large 而無需重新索引)以及 2048/1024/512/256 的 Matryoshka 維度,還有 fp32/int8/二值量化以降低儲存成本。大約 $0.12/M tokens 的定價像中階模型,但檢索表現堪比頂級。如果檢索品質是你的瓶頸且能負擔約 $0.12/M,選它。
2. Gemini Embedding 001
最佳全能 API。Google 的模型領先英文 MTEB 排行榜(根據 2026 年 4 月快照,總分 ~68.3、檢索 67.7),提供 3072 維並支援 MRL 截斷,共享多模態空間。**$0.15/M** 是我們首選中最貴的。如果你想要評分最高的通用模型,且 Gemini/Vertex 本來就是你的技術棧,選它。
3. OpenAI text-embedding-3-large
規模化下的最佳預設,也是最容易接上的。3072 維、MRL 截斷至 256,SDK 與教學覆蓋率是所有嵌入器中最廣的。~$0.13/M 是安全選擇,而 text-embedding-3-small(~$0.02/M)是英文語料的省钱兄弟。舊版 ada-002 還能用,但你在花錢買更差的 recall。如果你要零意外和廣泛的生態系支援,選它。
4. Cohere Embed v4
混合媒體與企業多語言的最佳選擇。Embed v4 在單一模型中處理文字、圖片和交錯文件,上下文視窗大、跨語言檢索強,~$0.12/M。如果你的語料混合了 PDF、截圖和文字,或需要在單一 API 下涵蓋大量語言,選它。
5. Voyage-context-4
長文件 RAG 的最新鮮選擇。2026 年 6 月 29 日發布,將每個 chunk 連同周圍上下文一起嵌入,減少了粗糙切分常見的「在 chunk 邊界丟失」問題。與 Voyage-4 系列同樣在 ~$0.12/M 的範圍。如果你的文件很長、chunking 一直是你的痛點,選它。
6. Qwen3-Embedding-8B
整體最佳開源模型,也是程式碼檢索的最佳選擇。Alibaba 的 Qwen3-Embedding 領先開源多語言 MTEB(~70.6),並在 MTEB-Code 登頂(~80.7),根據 Qwen3-Embedding 文件,維度從 32 到 4096 彈性可調,支援 Q4 量化。如果你自架、索引程式碼,或需要強力的多語言檢索而不想按 token 付費,選它。
7. BGE-M3
最佳開源全能選手。BAAI 的 BGE-M3 在單一模型中提供密集、稀疏與多向量檢索,支援 100 多種語言,持續是 Hugging Face 上下載量最高的嵌入器之一。如果你想在單一自架模型中實現密集加稀疏的混合檢索,選它。
8. NV-Embed-v2
純英文準確度的最佳開源權重。NVIDIA 的模型在 HF MTEB 排行榜上報告英文平均 ~72.3(數字因快照而異,請查看即時排行榜),4096 維。運行起來比多數模型重。如果英文準確度是你的首要優先且 GPU 資源充足,選它。
9. nomic-embed-text
最佳本機與筆電選擇。Nomic 的模型原生支援 Ollama,體積小、自架成本低,以頂尖 recall 換取在普通硬體上的速度。同級替代:mxbai-embed-large 和老將 all-MiniLM。如果你要完全本機的嵌入、零 API 成本,且能接受較低的 recall,選它。
我們的測試反覆證實一件事:MTEB 第一名很少是你的語料的最佳模型。下一節正是測量這個。
我們怎麼測的:嵌入 10,000 份文件,量測關鍵指標
我們從內部產品文件與支援工單語料中嵌入了約 10,000 份真實文件,然後以人工標註的約 120 組查詢來評分檢索效果。主要發現:將 OpenAI 的 text-embedding-3-large 從 3072 維截斷到 1024 維,Recall@10 僅下降約 0.03,但向量儲存縮減了約 3 倍。品質損失小,儲存收益大。
我們測試了一個子集(並非窮盡九個模型):Voyage-4-large、Gemini Embedding 001、text-embedding-3-large(完整與截斷版)、自架的 Qwen3-Embedding-8B、BGE-M3 和 nomic-embed-text。我們對標註查詢集量測了 Recall@10 和 nDCG@10、p95 嵌入延遲,以及 API 的每 1M tokens 成本或自架的 GPU 秒數。只有約 120 組查詢,請將這些視為方向性參考,而非排行榜。
| 模型(維度) | Recall@10 | nDCG@10 | p95 延遲 | 成本 |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0.89 | 0.81 | ~180 ms (API) | ~$0.12/M |
| Gemini Embedding 001 (3072) | 0.88 | 0.80 | ~210 ms (API) | ~$0.15/M |
| Qwen3-Embedding-8B(自架) | 0.87 | 0.79 | ~430 ms(冷 GPU) | GPU 秒數 |
| text-embedding-3-large (3072) | 0.86 | 0.78 | ~160 ms (API) | ~$0.13/M |
| text-embedding-3-large (1024) | 0.83 | 0.75 | ~150 ms (API) | ~$0.13/M |
| BGE-M3 (1024) | 0.82 | 0.74 | ~300 ms(自架) | GPU 秒數 |
| nomic-embed-text (768) | 0.76 | 0.69 | ~90 ms(本機) | 免費 |
有兩個結論讓我們印象深刻。第一,自架的 Qwen3-8B 在我們的英文語料上與頂級 API 打平,但沒有暖機 GPU 時 p95 延遲大約翻倍,所以預算中要留一台保持熱機。第二,一旦把成本納入考量,排行榜第一名在我們的語料上並不是贏家。如果你想在自己的資料上端到端評估檢索品質,那才是誠實的選擇方式。如果你好奇 MTEB 排行榜數字為何會誤導人,我們寫了一篇專門解釋 MTEB 分數如何運作於 RAG 的文章。

嵌入模型要多少錢?
2026 年 7 月,託管嵌入 API 大約 $0.02 到 $0.15 每 1M tokens。開源模型的權重「免費」,但你要付 GPU 時間和 VRAM。最便宜的堪用 API 選擇是 text-embedding-3-small 和 voyage-4-lite,約 $0.02/M;最便宜的自架路線是 nomic-embed-text,在 token 層面實質免費。
以下是經驗證的定價快照(截至 2026 年 7 月,2026 上半年嵌入價格變動了兩次,所以決定前請重新確認供應商頁面):
| 模型 | 價格 /1M tokens(2026 年 7 月) | 備註 |
|---|---|---|
| voyage-4-lite | ~$0.02 | Voyage 最便宜方案 |
| voyage-4 | ~$0.06 | 標準方案 |
| voyage-4-large | ~$0.12 | 最佳檢索品質 |
| voyage-context-4 | ~$0.12 | 上下文 chunk |
| OpenAI 3-small | ~$0.02 | 英文省钱選擇 |
| OpenAI 3-large | ~$0.13 | 規模化預設 |
| Cohere Embed v4 | ~$0.12 | 多模態 |
| Gemini Embedding 001 | ~$0.15 | 最高評分 |
| 開源(Qwen3、BGE-M3、nomic) | GPU/VRAM 成本 | 無按 token 計費 |
索引 100M tokens 時,$0.02/M 和 $0.15/M 的差距是 $2 對 $15。很小。但每月重新嵌入該語料、加上查詢時的嵌入,倍數就會快速膨脹。這就是為什麼檢索層 API 的成本值得在預算中佔一個真正的項目,而不是四捨五入的誤差。自架則翻轉了數學:沒有按 token 計費,但無論 GPU 忙碌還是閒置,你都在租它。
成本 vs 品質:哪個嵌入模型性價比最高?
最佳性價比的規則很簡單:選在你的語料上能達到 Recall@10 ≥ 0.80 的最便宜模型。在我們的測試中,那就是截斷至 1024 維的 OpenAI text-embedding-3-large:Recall@10 為 0.83,約 $0.13/M,向量比 3072 維版本小 3 倍。它正好落在甜蜜點象限——recall 夠高、儲存夠低。
想像那張主視覺散佈圖:X 軸是每 1M tokens 成本,Y 軸是檢索品質。頂級 API(Voyage-4-large、Gemini 001)在右上角——recall 極佳、價格較高。經濟方案(3-small、voyage-4-lite)在左下角——便宜但在困難查詢上 recall 較低。最佳性價比象限是多數團隊忽略的那個:中等價格、高 recall、小向量。
跑完數據後我的誠實看法:多數團隊過度購買嵌入品質,卻在 chunking 和 reranking 上投資不足。如果你在 1024 維就能達到 0.80 的 recall,花 3 倍的儲存成本換 0.03 的 recall 提升幾乎不值得。
三行決策規則:
- 如果檢索品質是瓶頸且預算無虞,選 Voyage-4-large 或 Gemini 001。
- 如果有成本上限,選截斷至 1024 的 text-embedding-3-large,簡單語料用 3-small。
- 如果自架,只要 GPU 已經在跑,Qwen3-Embedding-8B 就是性價比之王。
RAG 最佳開源 / 本機嵌入模型是什麼?
整體最佳自架是 Qwen3-Embedding-8B(需要真正的 GPU,Q4 量化下大約 16GB+ VRAM)。最佳筆電/本機選擇是 Ollama 上的 nomic-embed-text,在普通硬體上運行、零 API 成本。自架的優勢在於資料駐留、高吞吐量或消除按 token 計費;API 的優勢在於你不想照顧 GPU。
跑本機嵌入器只需兩道指令。拉取模型,然後嵌入並查詢。以下是 Ollama 本機路線與 OpenAI SDK API 路線的並排對照:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingReddit 上從業者的實際回報與我們的測試一致:自架者反覆指出 GPU 在請求間冷卻後 p95 延遲會飆升。解法是保持一個實例熱機,這悄悄把「免費」自架變成了固定的月度 GPU 帳單。在從 API 遷移之前值得先估價。如果你在搭建評估迴圈,把檢索相關的 prompt 集中管理也有幫助。完整步驟請見我們的用 Ollama 在本機跑嵌入模型指南。
維度越高代表檢索越好嗎?
不,不是線性的。超過某個點之後,額外維度增加的是儲存和延遲成本,recall 增益卻不成比例。Matryoshka Representation Learning(MRL)讓你截斷向量(例如 3072→1024→512),保留大部分 recall 的同時將每個向量縮小 3–6 倍。這直接削減了你的向量資料庫帳單。
我們的數字讓這更具體。將 text-embedding-3-large 從 3072 降到 1024 維,Recall@10 損失約 0.03,但儲存縮減約 3 倍。降到 512,recall 下降會加速,尤其在模糊查詢上。多數英文語料的甜蜜點在 1024 左右。
一句話總結:維度是你在每個向量上都要繳的儲存與延遲稅,所以把它們修剪到仍能達到 recall 門檻的最小尺寸。在 10M+ 向量時,這個決決定了你負擔得起哪個向量資料庫,所以在確定維度之前,先查看哪個向量 DB 能處理你的維度數量與儲存成本。
如何為 RAG 選擇嵌入模型?
為 RAG 選擇嵌入模型歸結為四項檢查,依序進行。用你自己的資料來跑,而不是公開排行榜,候選名單很快就會變短。
- 在你的語料上 Recall@10 ≥ 0.80。 用人工標註的查詢集測試子集。排行榜排名是線索,不是答案。
- 成本在你的 $/1M 上限之內。 把重新嵌入和查詢時嵌入也算進去,不只是初始索引。
- 上下文視窗 ≥ 你的 chunk 大小。 如果你的 chunk 有 1,000 tokens,512-token 的模型會截斷並丟失語意。
- 活躍維護,需要時支援多語言。 2026 年更新的模型勝過 2024 年的過時 checkpoint;直接測試你的目標語言。
用四項標準給兩三個模型打分,贏家通常自己就浮現了。從那裡開始,就是把它接入完整的 RAG 管線:chunk、嵌入、儲存、檢索、rerank。
關於作者
Mert Batur Gurbuz 是 Techsy.io 的聯合創辦人,團隊為 B2B 客戶交付 AI 代理、自動化系統和語音/SDR 管線。他就讀於 University of Birmingham,撰寫 Techsy 團隊在生產環境中實際使用的 LLM 工具棧相關文章。在 LinkedIn 上連結。
選工具是簡單的一半。讓它在真實產品中穩定運行才是多數團隊卡住的地方,而這正是我們的 AI 整合團隊為客戶打造的——從 RAG 管線到客製化代理。
常見問題
MTEB 分數足以挑選 RAG 最佳嵌入模型嗎?
不夠。MTEB 主要是在公開資料集上的單一領域文字檢索,無法反映你的語料、chunk 大小、語言組合或成本上限。在我們 10,000 份文件的基準測試中,一旦納入價格,排行榜第一名在我們的語料上並不是最佳。務必做一次小規模的領域評估。
2026 年 RAG 最佳嵌入模型是什麼?
純檢索品質選 Voyage-4-large,最佳全能 API 選 Gemini Embedding 001,自架選 Qwen3-Embedding-8B。「最佳」取決於你的成本上限和語言需求,所以先選兩個候選,在自己的資料上測試後再決定。
RAG 最佳開源嵌入模型是什麼?
Qwen3-Embedding-8B 是整體開源冠軍(MTEB 多語言和程式碼分數最高),BGE-M3 是多功能的混合全能選手,nomic-embed-text 是透過 Ollama 的筆電選擇。權重免費,但你要付 GPU 和 VRAM 來運行它們。
開源 vs API 嵌入,哪個更適合 RAG?
API 勝在零維運和最新品質;自架勝在資料駐留、高吞吐量和無按 token 計費。損益平衡通常由吞吐量和合規需求驅動,而非原始品質。每月低於幾億 tokens 時,API 在實務上幾乎總是更便宜。
在 Ollama 上跑的最佳本機嵌入模型是什麼?
nomic-embed-text 是首選(ollama pull nomic-embed-text):輕量、在普通硬體上快速、token 層面免費。如果你有閒置的 GPU VRAM,較小的 Qwen3-Embedding 變體檢索效果更好。兩者都在本機索引,零 API 成本、資料不出你的機器。
嵌入維度越高代表檢索越好嗎?
不是線性的。超過某個點後,額外維度增加儲存和延遲,recall 增益卻不成比例。Matryoshka 模型讓你截斷(例如 3072→1024),保留大部分 recall 的同時將每個向量縮小約 3 倍,直接削減向量資料庫成本。
最便宜但仍適合 RAG 的嵌入模型是什麼?
text-embedding-3-small($0.02/M)或 voyage-4-lite($0.02/M)對多數英文語料能達到穩健的 Recall@10。如果你能跑 GPU,nomic-embed-text 在 token 層面實質免費。先在你的資料上測試;便宜模型在模糊查詢上會明顯衰退。
RAG 最佳多語言嵌入模型是什麼?
Qwen3-Embedding-8B 和 BGE-M3 領先開源多語言檢索,Cohere Embed v4 和 Gemini Embedding 001 則是強力的託管選項。務必在你的目標語言上測試,因為 MTEB 多語言排名高不保證在你的特定語言對上表現最佳。
有了好的嵌入模型,還需要 reranker 嗎?
對高精度 RAG 而言,通常需要。強的嵌入器把候選送進 top-50;reranker 重新排序 top-k 以達到最終精度。較便宜的嵌入器加 reranker 經常勝過單獨使用昂貴嵌入器,而且總成本更低。
結論
API 最佳整體檢索歸 Voyage-4-large;Gemini Embedding 001 是評分最高的全能選手;Qwen3-Embedding-8B 領先開源與程式碼檢索;nomic-embed-text 是本機筆電選擇。但對多數團隊而言,性價比贏家是截斷至 1024 維的 text-embedding-3-large:Recall@10 為 0.83、約 $0.13/M、向量小 3 倍。從 10,000 份文件中得到的真正教訓是:MTEB 第一名很少是你的語料的最佳模型,所以請在自己的資料上測試。正在打造生產級 RAG,想要第二雙眼睛?預約免費諮詢。