
De 9 bedste embedding-modeller til RAG i 2026 (jeg benchmarkede søgning, latency og pris)
Voyage-4 udkom 15. januar 2026. Så landede voyage-context-4 den 29. juni. Hvis din RAG-pipeline stadig indekserer med OpenAIs ada-002, går du glip af målbar Recall@10 og betaler endda for fornøjelsen. At vælge de bedste embedding-modeller til RAG i 2026 handler ikke om at gribe det, der topper MTEB-hitlisten den uge. Vi embeddede 10.000 af vores egne dokumenter for at finde ud af, hvilke modeller der faktisk henter resultater, og hvad hver enkelt koster pr. million tokens. Herunder: rangeringen, priserne og ét trunkeringstrick, der skar vores vektorlager ned med 3x. Embeddings er blot ét lag i den bredere RAG-stack, men får du det lag forkert, lider alt nedstrøms.
Nøglepointer
- Bedste søgekvalitet (API): Voyage-4-large med MoE, Matryoshka-dimensioner og ~$0,12/M tokens.
- Bedste allround-API: Gemini Embedding 001, engelsk MTEB-fører, 3072-dim, ~$0,15/M.
- Bedste open source / self-host: Qwen3-Embedding-8B, MTEB-fører på flersproget og kode.
- Bedste værdi: OpenAI text-embedding-3-large trunkeret 3072→1024, ~$0,13/M, 3x mindre vektorer.
Hvad ændrede sig for embedding-modeller i 2026?
Det store skift i 2026 er Voyage-4-familien (mixture-of-experts, et fælles embedding-rum på tværs af nano/lite/standard/large, plus Matryoshka-trunkering og int8/binær kvantisering) samt voyage-context-4, som koder hver chunk sammen med dens omgivende kontekst. Samtidig topper Gemini Embedding 001 den engelske MTEB-hitliste, og Qwen3-Embedding fører åben flersproget søgning.
To Voyage-lanceringer rystede feltet. Voyage-4 (15. jan. 2026) introducerede et fælles embedding-rum, så du kan blande en lille model til billig masseindeksering og en stor model til værdifulde forespørgsler uden at genindeksere det hele. Det alene sparer en gen-embedding-regning, de fleste teams frygter.
Så angreb voyage-context-4 (29. jun. 2026) chunking-problemet direkte: i stedet for at embedde et afsnit isoleret, koder den chunken plus dens dokumentkontekst. I praksis betyder det, at du kan holde op med at finjustere chunk-grænser i hånden for at undgå at miste mening i kanterne.
Her er den ene linje, du skal huske: kontekstuelle chunk-embeddings forvandler chunking fra en skrøbelig justeringsøvelse til noget, der ligner en standard, du kan stole på. Vil du have head-to-head på de hostede API'er? Vores fulde Voyage vs OpenAI vs Cohere-gennemgang er følgesvenden til det.
De 9 bedste embedding-modeller til RAG, rangeret
For de fleste teams i 2026 dækker tre valg 90 % af tilfældene: Voyage-4-large til den højeste søgekvalitet på et hostet API, Gemini Embedding 001 som den bedst scorende allrounder og Qwen3-Embedding-8B, hvis du self-hoster. Den fulde rangering og oversigtstabel ligger lige herunder, sorteret efter egnethed til RAG-søgning, API-modeller først, derefter open source.
| Model | Udbyder | MTEB (retrieval, m/ dato) | Dimensioner (Matryoshka?) | Kontekstvindu | Pris /1M tokens | Flersproget | Åben vs API/self-host |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Leverandøreval, ikke på offentlig MTEB (jan. 2026) | 2048/1024/512/256 (ja, MRL) | ~32K tokens | ~$0,12 | Stærk | API |
| Gemini Embedding 001 | ~67,7 retrieval / 68,3 samlet (MTEB, apr. 2026) | 3072 (ja, MRL) | ~2K tokens | ~$0,15 | Stærk | API | |
| text-embedding-3-large | OpenAI | Se live MTEB (ikke leverandørpostet), 2026 | 3072→1024→256 (ja, MRL) | ~8K tokens | ~$0,13 | God | API |
| Cohere Embed v4 | Cohere | Leverandøreval, multimodal (2026) | 1536 (konfigurerbar) | ~128K tokens | ~$0,12 | Stærk | API |
| Voyage-context-4 | Voyage AI | Kontekstuel eval (jun. 2026) | 2048/1024/512/256 (ja, MRL) | ~32K tokens | ~$0,12 | Stærk | API |
| Qwen3-Embedding-8B | Alibaba | ~70,6 flersproget / ~80,7 kode (MTEB, 2026) | 32–4096 (fleksibel) | ~32K tokens | Gratis vægte (GPU-omk.) | Førende | Self-host |
| BGE-M3 | BAAI | Stærk flersproget (HF-hitliste, 2026) | 1024 (dense+sparse+multi) | ~8K tokens | Gratis vægte (GPU-omk.) | Stærk | Self-host |
| NV-Embed-v2 | NVIDIA | ~72,3 engelsk gns. (HF MTEB, verificér, 2026) | 4096 | ~32K tokens | Gratis vægte (GPU-omk.) | Engelskfokuseret | Self-host |
| nomic-embed-text | Nomic AI | Begrænset, laptop-niveau (2026) | 768 | ~8K tokens | Gratis (lokal) | Begrænset | Self-host |
Gem disse vektorer i en vektordatabase dimensioneret til dit dimensionsantal, for et 3072-dim indeks koster langt mere end et 1024-dim i skala.
1. Voyage-4-large
Bedste rene søgekvalitet blandt API'er. Det er en mixture-of-experts-model med et fælles embedding-rum (bland nano/lite/large uden genindeksering) og Matryoshka-dimensioner på 2048/1024/512/256, plus fp32/int8/binær kvantisering til billigere lagring. Til cirka $0,12/M tokens er den prissat som en mellemklassemodel, men henter resultater som en premiummodel. Vælg denne, hvis søgekvalitet er din flaskehals, og du kan betale ~$0,12/M.
2. Gemini Embedding 001
Bedste allround-API. Googles model fører den engelske MTEB-hitliste (~68,3 samlet, 67,7 retrieval ifølge apr. 2026-snapshot), leverer 3072 dimensioner med MRL-trunkering og deler et multimodalt rum. Til **$0,15/M** er den den dyreste af vores topvalg. Vælg denne, hvis du vil have den bedst scorende generelle model, og Gemini/Vertex allerede er din stack.
3. OpenAI text-embedding-3-large
Bedste standardvalg i skala og den nemmeste at integrere. 3072 dimensioner, MRL-trunkering ned til 256 og den bredeste SDK- og tutorial-dækning af nogen embedder. Til ~$0,13/M er den et sikkert valg, og text-embedding-3-small (~$0,02/M) er budget-søskenden til engelske korpusser. Legacy ada-002 virker stadig, men du betaler for dårligere recall. Vælg denne, hvis du vil have nul overraskelser og bred økosystemunderstøttelse.
4. Cohere Embed v4
Bedste valg til blandede medier og enterprise-flersproget. Embed v4 håndterer tekst, billeder og sammenflettede dokumenter i én model med et stort kontekstvindu og stærk tværsproglig søgning til ~$0,12/M. Vælg denne, hvis dit korpus blander PDF'er, skærmbilleder og tekst, eller du har brug for seriøs flersproget dækning under ét API.
5. Voyage-context-4
Det friske valg til langdokument-RAG. Lancaret 29. juni 2026, embedder den hver chunk med dens omgivende kontekst, hvilket skærer ned på "tabt ved chunk-grænsen"-fejl, der plager naiv opsplitning. Samme ~$0,12/M-klasse som Voyage-4-serien. Vælg denne, hvis dine dokumenter er lange, og chunking har været din hovedpine.
6. Qwen3-Embedding-8B
Bedste open source-model samlet set og det bedste valg til kodesøgning. Alibabas Qwen3-Embedding fører åben flersproget MTEB (~70,6) og topper MTEB-Code (~80,7) ifølge Qwen3-Embedding-dokumentationen med fleksible dimensioner fra 32 til 4096 og Q4-kvantisering. Vælg denne, hvis du self-hoster, indekserer kode eller har brug for stærk flersproget søgning uden en pr.-token-regning.
7. BGE-M3
Bedste åbne allrounder. BAAIs BGE-M3 giver dig dense, sparse og multi-vektor-søgning i én model, håndterer 100+ sprog og forbliver en af de mest downloadede embeddere på Hugging Face. Vælg denne, hvis du vil have hybrid dense-plus-sparse-søgning ud af én self-hostet model.
8. NV-Embed-v2
Bedste åbne vægte til engelsk-only nøjagtighed. NVIDIAs model rapporterer ~72,3 engelsk gennemsnit på HF MTEB-hitlisten (tallene varierer efter snapshot, så tjek den live hitliste) med 4096 dimensioner. Tungere at køre end de fleste. Vælg denne, hvis engelsk nøjagtighed er din topprioritet, og du har GPU-kapaciteten.
9. nomic-embed-text
Bedste lokale og laptop-valg. Nomics model er Ollama-native, lille og billig at self-hoste og bytter top-recall ud med hastighed på beskeden hardware. Alternativer i samme klasse: mxbai-embed-large og veteranen all-MiniLM. Vælg denne, hvis du vil have fuldt lokale embeddings uden API-omkostninger og kan acceptere lavere recall.
Én ting bekræftede vores test gang på gang: MTEB-hitlistens #1 er sjældent den bedste model til dit korpus. Det er præcis, hvad næste afsnit måler.
Sådan testede vi: Embedding af 10.000 dokumenter og måling af det, der betyder noget
Vi embeddede ~10.000 rigtige dokumenter fra vores interne produktdokumentations- og supportbilletkorpus og scorede derefter søgning mod et håndmarkeret sæt af ~120 forespørgsler. Hovedresultatet: at trunkere OpenAIs text-embedding-3-large fra 3072 til 1024 dimensioner kostede kun cirka 0,03 fald i Recall@10, mens vektorlageret skrumpede ~3x. Lille kvalitetstab, stor lagergevinst.
Vi testede et udsnit (ikke alle ni modeller udtømmende): Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (fuld og trunkeret), Qwen3-Embedding-8B self-hostet, BGE-M3 og nomic-embed-text. Vi målte Recall@10 og nDCG@10 mod det mærkede forespørgselssæt, p95 embedding-latency og omkostninger pr. 1M tokens for API'er eller GPU-sekunder for self-host. Med kun ~120 forespørgsler skal disse ses som retningsgivende, ikke som en hitliste.
| Model (dim) | Recall@10 | nDCG@10 | p95 latency | Omkostninger |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0,89 | 0,81 | ~180 ms (API) | ~$0,12/M |
| Gemini Embedding 001 (3072) | 0,88 | 0,80 | ~210 ms (API) | ~$0,15/M |
| Qwen3-Embedding-8B (self-host) | 0,87 | 0,79 | ~430 ms (kold GPU) | GPU-sekunder |
| text-embedding-3-large (3072) | 0,86 | 0,78 | ~160 ms (API) | ~$0,13/M |
| text-embedding-3-large (1024) | 0,83 | 0,75 | ~150 ms (API) | ~$0,13/M |
| BGE-M3 (1024) | 0,82 | 0,74 | ~300 ms (self-host) | GPU-sekunder |
| nomic-embed-text (768) | 0,76 | 0,69 | ~90 ms (lokal) | Gratis |
To pointer blev hængende. For det første matchede self-hostet Qwen3-8B et top-API på vores engelske sæt, men dens p95-latency blev næsten fordoblet uden en varm GPU, så budgettér med at holde én varm. For det andet var hitlistens #1 ikke vinderen på vores korpus, når omkostninger kom ind i billedet. Hvis du vil evaluere søgekvalitet ende-til-ende på dine egne data, er det den ærlige måde at vælge på. Og hvis du er nysgerrig efter, hvorfor MTEB-hitlistens tal kan vildlede, skrev vi en dedikeret forklaring på, hvordan MTEB-scores fungerer for RAG.

Hvad koster embedding-modeller?
Hostede embedding-API'er ligger på cirka $0,02 til $0,15 pr. 1M tokens i juli 2026. Open source-modeller har "gratis" vægte, men du betaler i GPU-tid og VRAM. De billigste gode-nok API-valg er text-embedding-3-small og voyage-4-lite til ~$0,02/M; den billigste self-host-mulighed er nomic-embed-text, reelt gratis på tokenniveau.
Her er det verificerede prisbillede (pr. juli 2026, og embedding-priserne flyttede sig to gange i H1 2026, så tjek leverandørens side igen, før du binder dig):
| Model | Pris /1M tokens (jul. 2026) | Noter |
|---|---|---|
| voyage-4-lite | ~$0,02 | Billigste Voyage-niveau |
| voyage-4 | ~$0,06 | Standardniveau |
| voyage-4-large | ~$0,12 | Bedste søgekvalitet |
| voyage-context-4 | ~$0,12 | Kontekstuelle chunks |
| OpenAI 3-small | ~$0,02 | Budget-engelskvalg |
| OpenAI 3-large | ~$0,13 | Standardvalg i skala |
| Cohere Embed v4 | ~$0,12 | Multimodal |
| Gemini Embedding 001 | ~$0,15 | Højest scorende |
| Open source (Qwen3, BGE-M3, nomic) | GPU/VRAM-omk. | Ingen pr.-token-afgift |
Ved 100M indekserede tokens er forskellen mellem $0,02/M og $0,15/M $2 mod $15. Lille. Men gen-embed det korpus månedligt, tilføj forespørgselstids-embeddings, og multiplikatoren vokser hurtigt. Derfor fortjener omkostningerne ved retrieval-lags-API'er en reel linje i dit budget, ikke en afrundingsfejl. Self-hosting vender regnestykket: ingen pr.-token-afgift, men du lejer en GPU, hvad enten den er travlt optaget eller tom.
Omkostninger vs kvalitet: Hvilken embedding-model er den bedste værdi?
Reglen for bedste værdi er enkel: vælg den billigste model, der klarer Recall@10 ≥ 0,80 på dit korpus. I vores test er det OpenAI text-embedding-3-large trunkeret til 1024 dimensioner: Recall@10 0,83 til ~$0,13/M med vektorer, der er 3x mindre end 3072-dim-versionen. Den ligger lige midt i sweet spot-kvadranten, høj nok recall, lav nok lagerplads.
Forestil dig hero-spredningsdiagrammet: omkostninger pr. 1M tokens på X-aksen, søgekvalitet på Y-aksen. Premium-API'erne (Voyage-4-large, Gemini 001) ligger øverst til højre, fantastisk recall, højere pris. Budgetklassen (3-small, voyage-4-lite) ligger nederst til venstre, billig men lavere recall på svære forespørgsler. Bedste-værdi-kvadranten er den, de fleste teams springer over: mellempris, høj recall, små vektorer.
Min ærlige vurdering efter at have kørt tallene: de fleste teams overkøber embedding-kvalitet og underinvesterer i chunking og reranking. Hvis du klarer 0,80 recall ved 1024 dimensioner, er det sjældent værd at bruge 3x på lager for et 0,03 recall-løft.
Beslutningsreglen i tre linjer:
- Hvis søgekvalitet er din flaskehals, og budgettet er i orden, så vælg Voyage-4-large eller Gemini 001.
- Hvis du er omkostningsbegrænset, så vælg text-embedding-3-large trunkeret til 1024 eller 3-small til nemme korpusser.
- Hvis du self-hoster, er Qwen3-Embedding-8B værdikongen, når din GPU allerede kører.
Hvad er den bedste open source / lokale embedding-model til RAG?
Bedste self-hostede samlet set er Qwen3-Embedding-8B (kræver en rigtig GPU, cirka 16GB+ VRAM ved Q4). Bedste laptop/lokale valg er nomic-embed-text på Ollama, som kører på beskeden hardware uden API-omkostninger. Self-host vinder, når du har brug for dataresidens, høj volumen eller vil slippe for pr.-token-afgifter; API'er vinder, når du hellere vil slippe for at passe en GPU.
At køre en lokal embedder er en to-kommandos affære. Hent modellen, embed og forespørg derefter. Her er den lokale vej med Ollama plus API-vejen med OpenAI SDK, side om side:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingDet, praktikere faktisk rapporterer på Reddit, stemmer overens med vores test: self-hostere bliver ved med at flagge p95-latency-spidser, når GPU'en bliver kold mellem forespørgsler. Løsningen er at holde én instans varm, hvilket stille og roligt forvandler "gratis" self-hosting til en fast månedlig GPU-regning. Værd at prissætte, før du migrerer væk fra et API. Hvis du bygger en eval-løkke, hjælper det også at administrere prompts omkring din søgning ét sted. For den fulde gennemgang, se vores guide til at køre embedding-modeller lokalt med Ollama.
Betyder højere dimension bedre søgning?
Nej, ikke lineært. Ud over et vist punkt tilføjer ekstra dimensioner lager- og latency-omkostninger uden en proportional recall-gevinst. Matryoshka Representation Learning (MRL) lader dig trunkere en vektor (f.eks. 3072→1024→512) og beholde det meste af recall, mens hver vektor skrumper 3–6x. Det er en direkte besparelse på din vektordatabaseregning.
Vores tal gør det konkret. At droppe text-embedding-3-large fra 3072 til 1024 dimensioner kostede ~0,03 Recall@10, men skar lageret cirka 3x. Gå ned til 512, og recall-faldet bliver stejlere, især på tvetydige forespørgsler. Sweet spot for de fleste engelske korpusser ligger omkring 1024.
Étlinjeren: dimensioner er en lager- og latency-skat, du betaler på hver eneste vektor, så trim dem til den mindste størrelse, der stadig klarer dit recall-krav. Ved 10M+ vektorer afgør den beslutning, hvilken vektordatabase du har råd til, så tjek hvilken vektor-DB der håndterer dit dimensionsantal og lageromkostninger, før du låser en dimension fast.
Hvordan vælger man en embedding-model til RAG?
At vælge en embedding-model til RAG koges ned til fire tjek, i rækkefølge. Kør dem mod dine egne data, ikke en offentlig hitliste, så bliver shortlisten hurtigt kort.
- Recall@10 ≥ 0,80 på DIT korpus. Test et udsnit med et håndmarkeret forespørgselssæt. Hitlisteplacering er et hint, ikke et svar.
- Omkostninger under din $/1M-grænse. Medregn gen-embedding og forespørgselstids-embeddings, ikke kun det første indeks.
- Kontekstvindu ≥ din chunk-størrelse. Hvis dine chunks er 1.000 tokens, trunkerer en 512-token-model og mister mening.
- Aktiv vedligeholdelse og flersproget, hvis nødvendigt. En model opdateret i 2026 slår et forældet 2024-checkpoint; test dine målsprog direkte.
Score to-tre modeller på alle fire, og vinderen vælger som regel sig selv. Derfra handler det om at integrere det i en fuld RAG-pipeline: chunk, embed, gem, hent, rerank.
Om forfatteren
Mert Batur Gurbuz er medstifter af Techsy.io, hvor teamet leverer AI-agenter, automatiseringssystemer og voice/SDR-pipelines til B2B-klienter. Han studerer på University of Birmingham og skriver om LLM-værktøjsstacken, som Techsy-teamet faktisk bruger i produktion. Forbind på LinkedIn.
At vælge et værktøj er den nemme halvdel. At få det til at køre stabilt i et rigtigt produkt er der, de fleste teams går i stå, og det er præcis, hvad vores AI-integrationsteam bygger for klienter, fra RAG-pipelines til brugerdefinerede agenter.
Ofte stillede spørgsmål
Er MTEB-score nok til at vælge den bedste embedding-model til RAG?
Nej. MTEB er mest enkelt-domæne tekstsøgning på offentlige datasæt, så den afspejler ikke dit korpus, din chunk-størrelse, dit sprogmiks eller din omkostningsgrænse. I vores 10.000-dokumenters benchmark var hitlistens #1 ikke den bedste på vores korpus, når prisen var medregnet. Kør altid en lille domæne-eval.
Hvad er den bedste embedding-model til RAG i 2026?
Voyage-4-large til ren søgekvalitet, Gemini Embedding 001 som det bedste allround-API og Qwen3-Embedding-8B, hvis du self-hoster. "Bedste" afhænger af din omkostningsgrænse og sprogbehov, så shortlist to og test dem på dine egne data, før du binder dig.
Hvad er den bedste open source-embedding-model til RAG?
Qwen3-Embedding-8B er den samlede open source-fører (top MTEB flersproget og kode-scores), BGE-M3 er den alsidige hybrid-allrounder, og nomic-embed-text er laptop-valget via Ollama. Vægtene er gratis, men du betaler for GPU'en og VRAM'en til at køre dem.
Open source vs API-embeddings, hvad er bedst til RAG?
API'er vinder på nul drift og den seneste kvalitet; self-hosting vinder på dataresidens, høj volumen og ingen pr.-token-afgift. Break-even drives som regel af volumen og compliance, ikke rå kvalitet. Under et par hundrede millioner tokens om måneden er API'er næsten altid billigere i praksis.
Hvad er den bedste lokale embedding-model at køre på Ollama?
nomic-embed-text er standardvalget (ollama pull nomic-embed-text): let, hurtig på beskeden hardware og gratis på tokenniveau. Hvis du har ledig GPU-VRAM, henter en mindre Qwen3-Embedding-variant bedre resultater. Begge indekserer lokalt uden API-omkostninger eller data, der forlader din maskine.
Betyder en højere embedding-dimension bedre søgning?
Ikke lineært. Ud over et vist punkt tilføjer ekstra dimensioner lager og latency uden en proportional recall-gevinst. Matryoshka-modeller lader dig trunkere (f.eks. 3072→1024) og beholde det meste af recall, mens hver vektor skrumper cirka 3x, hvilket skærer din vektordatabaseomkostning direkte.
Hvad er den billigste embedding-model, der stadig er god til RAG?
text-embedding-3-small ($0,02/M) eller voyage-4-lite ($0,02/M) klarer en solid Recall@10 for de fleste engelske korpusser. Hvis du kan køre en GPU, er nomic-embed-text reelt gratis på tokenniveau. Test på dine data først; billige modeller falder fra på tvetydige forespørgsler.
Hvad er den bedste flersprogede embedding-model til RAG?
Qwen3-Embedding-8B og BGE-M3 fører åben flersproget søgning, mens Cohere Embed v4 og Gemini Embedding 001 er stærke hostede muligheder. Test altid på dine målsprog, da en høj MTEB-flersproget placering ikke garanterer topydelse i dit specifikke sprogpar.
Har jeg stadig brug for en reranker med en god embedding-model?
Ofte ja til højpræcisions-RAG. En stærk embedder får kandidater ind i top-50; en reranker omarrangerer top-k for endelig præcision. En billigere embedder plus en reranker slår ofte en dyr embedder alene og koster mindre samlet.
Konklusionen
Bedste samlede søgning på et API går til Voyage-4-large; Gemini Embedding 001 er den højest scorende allrounder; Qwen3-Embedding-8B fører open source og kodesøgning; og nomic-embed-text er det lokale laptop-valg. Men værdi-vinderen for de fleste teams er en trunkeret text-embedding-3-large ved 1024 dimensioner: 0,83 Recall@10, ~$0,13/M og vektorer, der er 3x mindre. Den reelle lektie fra 10.000 dokumenter er, at MTEB-hitlistens #1 sjældent er den bedste model til dit korpus, så test på dine egne data. Bygger du produktions-RAG og vil have et ekstra par øjne? Få en gratis konsultation.