
9 Beste Embedding-modeller for RAG i 2026 (Vi testet søk, ventetid og kostnad)
Voyage-4 ble lansert 15. januar 2026. Så kom voyage-context-4 29. juni. Hvis RAG-pipelinen din fortsatt indekserer med OpenAIs ada-002, taper du målbar Recall@10 og betaler ekstra for det. Å velge de beste embedding-modellene for RAG i 2026 handler ikke om å plukke det som topper MTEB-listen den uken. Vi embeddet 10 000 av våre egne dokumenter for å finne ut hvilke modeller som faktisk henter riktig, og hva hver av dem koster per million tokens. Under følger rangeringen, prisene, og et avkortingstriks som kuttet vektorlagringen vår med 3x. Embeddings er bare ett lag i den bredere RAG-stacken, men får du dette laget feil, lider alt nedstrøms.
Viktigste poeng
- Beste søkekvalitet (API): Voyage-4-large, med MoE, Matryoshka-dimensjoner og ~$0,12/M tokens.
- Beste alt-i-ett-API: Gemini Embedding 001, ledende på engelsk MTEB, 3072 dimensjoner, ~$0,15/M.
- Beste åpen kildekode / selvhosting: Qwen3-Embedding-8B, MTEB-leder på flerspråklig og kode.
- Beste verdi: OpenAI text-embedding-3-large avkortet 3072→1024, ~$0,13/M, 3x mindre vektorer.
Hva endret seg i embedding-modeller i 2026?
Det store skiftet i 2026 er Voyage-4-familien (mixture-of-experts, et delt embedding-rom på tvers av nano/lite/standard/large, pluss Matryoshka-avkorting og int8/binær kvantisering), og voyage-context-4, som embedder hver del sammen med konteksten rundt. Samtidig topper Gemini Embedding 001 den engelske MTEB-listen, og Qwen3-Embedding leder åpen flerspråklig søk.
To Voyage-lanseringer snudde opp ned på feltet. Voyage-4 (15. januar 2026) introduserte et delt embedding-rom, slik at du kan kombinere en liten modell for billig masseindeksering med en stor modell for høyverdi-spørringer uten å reindeksere alt. Det alene sparer deg for en re-embedding-regning de fleste team gruer seg til.
Så tok voyage-context-4 (29. juni 2026) tak i chunking-problemet direkte: i stedet for å embedde et avsnitt isolert, koder den chunken sammen med dokumentkonteksten. I praksis betyr det at du kan slutte å håndjustere chunk-grenser for å unngå å miste mening i kantene.
Én ting er verdt å huske: kontekstuelle chunk-embeddings gjør chunking om fra en skjør justeringsøvelse til noe nærmere en standard du kan stole på. Vil du ha en direkte sammenligning av de hostede API-ene? En full Voyage vs. OpenAI vs. Cohere-gjennomgang er en tilhørende guide vi publiserer neste gang.
De 9 beste embedding-modellene for RAG, rangert
For de fleste team i 2026 dekker tre valg 90 % av tilfellene: Voyage-4-large for høyest søkekvalitet på et hostet API, Gemini Embedding 001 som den best skårende alt-i-ett-modellen, og Qwen3-Embedding-8B hvis du selvhoster. Den fullstendige rangeringen og hovedtabellen finner du rett under, sortert etter egnethet for RAG-søk, API-modeller først, deretter åpen kildekode.
| Modell | Leverandør | MTEB (søk, m/ dato) | Dimensjoner (Matryoshka?) | Kontekstvindu | Pris /1M tokens | Flerspråklig | Åpen vs. API/selvhosting |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Leverandørevaluering, ikke på offentlig MTEB (jan. 2026) | 2048/1024/512/256 (ja, MRL) | ~32K tokens | ~$0,12 | Sterk | API |
| Gemini Embedding 001 | ~67,7 søk / 68,3 totalt (MTEB, apr. 2026) | 3072 (ja, MRL) | ~2K tokens | ~$0,15 | Sterk | API | |
| text-embedding-3-large | OpenAI | Se live MTEB (ikke oppgitt av leverandør), 2026 | 3072→1024→256 (ja, MRL) | ~8K tokens | ~$0,13 | God | API |
| Cohere Embed v4 | Cohere | Leverandørevaluering, multimodal (2026) | 1536 (konfigurerbar) | ~128K tokens | ~$0,12 | Sterk | API |
| Voyage-context-4 | Voyage AI | Kontekstuell evaluering (jun. 2026) | 2048/1024/512/256 (ja, MRL) | ~32K tokens | ~$0,12 | Sterk | API |
| Qwen3-Embedding-8B | Alibaba | ~70,6 flerspråklig / ~80,7 kode (MTEB, 2026) | 32–4096 (fleksibel) | ~32K tokens | Gratis vekter (GPU-kostnad) | Leder | Selvhosting |
| BGE-M3 | BAAI | Sterk flerspråklig (HF-liste, 2026) | 1024 (dense+sparse+multi) | ~8K tokens | Gratis vekter (GPU-kostnad) | Sterk | Selvhosting |
| NV-Embed-v2 | NVIDIA | ~72,3 engelsk snitt (HF MTEB, verifiser, 2026) | 4096 | ~32K tokens | Gratis vekter (GPU-kostnad) | Engelskfokusert | Selvhosting |
| nomic-embed-text | Nomic AI | Beskjeden, laptop-nivå (2026) | 768 | ~8K tokens | Gratis (lokalt) | Begrenset | Selvhosting |
Lagre disse vektorene i en vektordatabase dimensjonert for antall dimensjoner du bruker, for en indeks med 3072 dimensjoner koster mye mer enn en med 1024 dimensjoner i stor skala.
1. Voyage-4-large
Best ren søkekvalitet blant API-ene. Dette er en mixture-of-experts-modell med et delt embedding-rom (kombiner nano/lite/large uten reindeksering) og Matryoshka-dimensjoner på 2048/1024/512/256, pluss fp32/int8/binær kvantisering for billigere lagring. Til rundt $0,12/M tokens er den priset som en midtsjikt-modell, men henter som en premiummodell. Velg denne hvis søkekvalitet er flaskehalsen din og du kan betale ~$0,12/M.
2. Gemini Embedding 001
Beste alt-i-ett-API. Googles modell leder den engelske MTEB-listen (~68,3 totalt, 67,7 på søk ifølge april 2026-øyeblikksbildet), leverer 3072 dimensjoner med MRL-avkorting, og deler et multimodalt rom. Til **$0,15/M** er den den dyreste av topplukkene våre. Velg denne hvis du vil ha den høyest skårende generelle modellen og Gemini/Vertex allerede er stacken din.
3. OpenAI text-embedding-3-large
Beste standardvalg i stor skala og enklest å koble til. 3072 dimensjoner, MRL-avkorting ned til 256, og bredest SDK- og tutorial-dekning av noen embedder. Til ~$0,13/M er den et trygt valg, og text-embedding-3-small (~$0,02/M) er budsjettsøsteren for engelske korpus. Gamle ada-002 fungerer fortsatt, men du betaler for dårligere recall. Velg denne hvis du vil ha null overraskelser og bred økosystemstøtte.
4. Cohere Embed v4
Beste valg for blandet medieinnhold og flerspråklig bedriftsbruk. Embed v4 håndterer tekst, bilder og flettede dokumenter i én modell, med et stort kontekstvindu og sterkt søk på tvers av språk, til ~$0,12/M. Velg denne hvis korpuset ditt blander PDF-er, skjermbilder og tekst, eller du trenger seriøs flerspråklig dekning under ett API.
5. Voyage-context-4
Ferskvarevalget for RAG med lange dokumenter. Lansert 29. juni 2026, embedder den hver chunk sammen med konteksten rundt, noe som kutter «tapt ved chunk-grensen»-feilene som plager naiv oppdeling. Samme ~$0,12/M-nivå som Voyage-4-linjen. Velg denne hvis dokumentene dine er lange og chunking har vært hodepinen din.
6. Qwen3-Embedding-8B
Beste åpen kildekode-modell totalt sett, og det beste valget for kodesøk. Alibabas Qwen3-Embedding leder åpen flerspråklig MTEB (~70,6) og topper MTEB-Code (~80,7) ifølge Qwen3-Embedding-dokumentasjonen, med fleksible dimensjoner fra 32 til 4096 og Q4-kvantisering. Velg denne hvis du selvhoster, indekserer kode, eller trenger sterkt flerspråklig søk uten en per-token-regning.
7. BGE-M3
Beste åpne alt-i-ett-modell. BAAIs BGE-M3 gir deg dense, sparse og multi-vektor-søk i én modell, håndterer over 100 språk, og er fortsatt en av de mest nedlastede embedderne på Hugging Face. Velg denne hvis du vil ha hybrid dense-pluss-sparse-søk fra én selvhostet modell.
8. NV-Embed-v2
Beste åpne vekter for ren engelsk nøyaktighet. NVIDIAs modell rapporterer ~72,3 i engelsk snitt på HF MTEB-listen (tallene varierer mellom øyeblikksbilder, så sjekk den live listen), med 4096 dimensjoner. Tyngre å kjøre enn de fleste. Velg denne hvis engelsk nøyaktighet er høyeste prioritet og du har GPU-kapasiteten.
9. nomic-embed-text
Beste lokale og laptop-valg. Nomics modell er Ollama-native, liten og billig å selvhoste, og bytter topp-recall mot hastighet på beskjeden maskinvare. Reservevalg i samme sjikt: mxbai-embed-large og veteranen all-MiniLM. Velg denne hvis du vil ha helt lokale embeddings uten API-kostnad og kan akseptere lavere recall.
Én ting testen vår stadig bekreftet: MTEB-nummer én er sjelden den beste modellen for ditt korpus. Det er nøyaktig det neste avsnitt måler.
Slik testet vi: Embedding av 10 000 dokumenter og hva som faktisk betyr noe
Vi embeddet rundt 10 000 reelle dokumenter fra vårt interne korpus av produktdokumentasjon og supportsaker, og skåret deretter søket mot et håndmerket sett med rundt 120 spørringer. Hovedfunnet: å avkorte OpenAIs text-embedding-3-large fra 3072 til 1024 dimensjoner kostet bare rundt 0,03 i fall på Recall@10, mens vektorlagringen krympet ~3x. Liten kvalitetsulempe, stor lagringsgevinst.
Vi testet et utvalg (ikke alle ni modellene uttømmende): Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (full og avkortet), Qwen3-Embedding-8B selvhostet, BGE-M3 og nomic-embed-text. Vi målte Recall@10 og nDCG@10 mot det merkede spørringssettet, p95-embeddingventetid, og kostnad per 1M tokens for API-er eller GPU-sekunder for selvhosting. Med bare rundt 120 spørringer er disse tallene veiledende (~120 søk), ikke en toppliste.
| Modell (dim.) | Recall@10 | nDCG@10 | p95-ventetid | Kostnad |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0,89 | 0,81 | ~180 ms (API) | ~$0,12/M |
| Gemini Embedding 001 (3072) | 0,88 | 0,80 | ~210 ms (API) | ~$0,15/M |
| Qwen3-Embedding-8B (selvhostet) | 0,87 | 0,79 | ~430 ms (kald GPU) | GPU-sekunder |
| text-embedding-3-large (3072) | 0,86 | 0,78 | ~160 ms (API) | ~$0,13/M |
| text-embedding-3-large (1024) | 0,83 | 0,75 | ~150 ms (API) | ~$0,13/M |
| BGE-M3 (1024) | 0,82 | 0,74 | ~300 ms (selvhostet) | GPU-sekunder |
| nomic-embed-text (768) | 0,76 | 0,69 | ~90 ms (lokalt) | Gratis |
To ting satt igjen hos oss. For det første matchet selvhostet Qwen3-8B en toppmodell fra API-siden på det engelske settet vårt, men p95-ventetiden nesten doblet seg uten en varm GPU, så budsjetter for å holde én kjørende. For det andre var ikke toppliste-vinneren vinneren på vårt korpus når kostnad kom inn i bildet. Hvis du vil evaluere søkekvalitet ende til ende på egne data, er det den ærlige måten å velge på. Og hvis du lurer på hvorfor MTEB-listetallet kan villede, publiserer vi en egen forklaringsartikkel neste gang.

Hvor mye koster embedding-modeller?
Hostede embedding-API-er koster grovt sett $0,02 til $0,15 per 1M tokens i juli 2026. Åpen kildekode-modeller har «gratis» vekter, men du betaler i GPU-tid og VRAM. De billigste gode-nok API-valgene er text-embedding-3-small og voyage-4-lite til ~$0,02/M; den billigste selvhostingveien er nomic-embed-text, i praksis gratis på tokennivå.
Her er det verifiserte prisøyeblikksbildet (per juli 2026 — embedding-priser endret seg to ganger i første halvår 2026, så dobbeltsjekk leverandørsiden før du forplikter deg):
| Modell | Pris /1M tokens (jul. 2026) | Merknad |
|---|---|---|
| voyage-4-lite | ~$0,02 | Billigste Voyage-nivå |
| voyage-4 | ~$0,06 | Standardnivå |
| voyage-4-large | ~$0,12 | Best søkekvalitet |
| voyage-context-4 | ~$0,12 | Kontekstuelle chunker |
| OpenAI 3-small | ~$0,02 | Budsjettvalg for engelsk |
| OpenAI 3-large | ~$0,13 | Standard i stor skala |
| Cohere Embed v4 | ~$0,12 | Multimodal |
| Gemini Embedding 001 | ~$0,15 | Høyest skår |
| Åpen kildekode (Qwen3, BGE-M3, nomic) | GPU-/VRAM-kostnad | Ingen per-token-avgift |
Ved 100 millioner indekserte tokens er forskjellen mellom $0,02/M og $0,15/M bare $2 mot $15. Lite. Men re-embed det korpuset månedlig, legg til embeddings ved spørretidspunkt, og multiplikatoren vokser fort. Derfor fortjener kostnaden ved søke-API-er en reell linje i budsjettet ditt, ikke en avrundingsfeil. Selvhosting snur regnestykket: ingen per-token-avgift, men du leier en GPU enten den er opptatt eller ledig.
Kostnad vs. kvalitet: Hvilken embedding-modell gir best verdi?
Beste-verdi-regelen er enkel: velg den billigste modellen som klarer Recall@10 ≥ 0,80 på ditt korpus. I vår test er det OpenAI text-embedding-3-large avkortet til 1024 dimensjoner: Recall@10 0,83 til ~$0,13/M, med vektorer 3x mindre enn 3072-dim-versjonen. Den sitter midt i den perfekte kvadranten, høy nok recall, lav nok lagring.
Se for deg spredningsdiagrammet i toppbildet: kostnad per 1M tokens på X-aksen, søkekvalitet på Y-aksen. Premium-API-ene (Voyage-4-large, Gemini 001) ligger øverst til høyre, god recall, høyere pris. Budsjettnivået (3-small, voyage-4-lite) ligger nederst til venstre, billig, men lavere recall på vanskelige spørringer. Beste-verdi-kvadranten er den de fleste team hopper over: middels pris, høy recall, små vektorer.
Min ærlige vurdering etter å ha kjørt tallene: de fleste team overkjøper embeddingkvalitet og underinvesterer i chunking og reranking. Klarer du 0,80 i recall på 1024 dimensjoner, er det sjelden verdt å bruke 3x på lagring for en økning på 0,03 i recall.
Beslutningsregelen på tre linjer:
- Er søkekvalitet flaskehalsen og budsjettet greit, velg Voyage-4-large eller Gemini 001.
- Er du kostnadsbegrenset, velg text-embedding-3-large avkortet til 1024, eller 3-small for enkle korpus.
- Selvhoster du, er Qwen3-Embedding-8B verdikongen når GPU-en allerede kjører.
Hva er den beste åpen kildekode-/lokale embedding-modellen for RAG?
Beste selvhostede modell totalt sett er Qwen3-Embedding-8B (krever en ordentlig GPU, rundt 16 GB+ VRAM ved Q4). Beste laptop-/lokale valg er nomic-embed-text på Ollama, som kjører på beskjeden maskinvare uten API-kostnad. Selvhosting vinner når du trenger dataresidens, høyt volum, eller vil kvitte deg med per-token-avgifter; API-er vinner når du helst slipper å passe en GPU.
Å kjøre en lokal embedder er gjort med to kommandoer. Hent modellen, embed og spør. Her er den lokale veien med Ollama sammen med API-veien med OpenAI SDK-en, side om side:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingDet praktikere faktisk rapporterer på Reddit stemmer med testen vår: selvhostere flagger stadig p95-ventetidstopper når GPU-en blir kald mellom forespørsler. Løsningen er å holde én instans varm, noe som stille gjør «gratis» selvhosting om til en fast månedlig GPU-regning. Verdt å prise inn før du migrerer bort fra et API. Kjører du en evalueringsløkke, hjelper det også å samle prompt-styringen rundt søket på ett sted. For hele gjennomgangen kommer vår fullstendige oppsettguide for lokal Ollama-embedding neste gang.
Betyr høyere dimensjon bedre søk?
Nei, ikke lineært. Forbi et visst punkt legger ekstra dimensjoner til lagrings- og ventetidskostnad uten en tilsvarende recall-gevinst. Matryoshka Representation Learning (MRL) lar deg avkorte en vektor (si 3072→1024→512) og beholde det meste av recall mens hver vektor krymper 3–6x. Det er et direkte kutt i vektordatabase-regningen din.
Tallene våre gjør det konkret. Å senke text-embedding-3-large fra 3072 til 1024 dimensjoner kostet ~0,03 i Recall@10, men kuttet lagringen med rundt 3x. Går du ned til 512, blir recall-fallet brattere, spesielt på tvetydige spørringer. Sweet spot for de fleste engelske korpus ligger rundt 1024.
Kort sagt: dimensjoner er en lagrings- og ventetidsskatt du betaler på hver eneste vektor, så trim dem til den minste størrelsen som fortsatt klarer recall-kravet ditt. Ved 10 millioner+ vektorer styrer den beslutningen hvilken vektordatabase du har råd til, så sjekk hvilken vektordatabase som håndterer dimensjonsantallet ditt og lagringskostnaden før du låser deg til en dimensjon.
Hvordan velger du en embedding-modell for RAG?
Å velge embedding-modell for RAG koker ned til fire sjekker, i rekkefølge. Kjør dem mot dine egne data, ikke en offentlig toppliste, så blir kortlisten kort fort.
- Recall@10 ≥ 0,80 på DITT korpus. Test et utvalg med et håndmerket spørringssett. Topplisteplassering er et hint, ikke et svar.
- Kostnad under ditt $/1M-tak. Ta med re-embedding og embeddings ved spørretidspunkt, ikke bare den første indekseringen.
- Kontekstvindu ≥ din chunk-størrelse. Kjører chunkene dine på 1000 tokens, avkorter en 512-token-modell og mister mening.
- Aktivt vedlikehold og flerspråklighet hvis nødvendig. En modell oppdatert i 2026 slår et foreldet 2024-sjekkpunkt; test målspråkene dine direkte.
Skår to eller tre modeller på alle fire, og vinneren velger seg selv som regel. Derfra handler det om å koble dette inn i en full RAG-pipeline: chunk, embed, lagre, hent, rerank.
Om forfatteren
Mert Batur er medgründer av Techsy.io, der teamet leverer AI-agenter, automatiseringssystemer og stemme-/SDR-pipeliner til B2B-kunder. Han skriver om LLM-verktøystacken Techsy-teamet faktisk bruker i produksjon. Ta kontakt på LinkedIn.
Å velge verktøy er den enkle delen. Å få det til å kjøre stabilt i et ekte produkt er der de fleste team står fast, og det er akkurat det vårt AI-integrasjonsteam bygger for kundene, fra RAG-pipelines til skreddersydde agenter.
Ofte stilte spørsmål
Er MTEB-skår nok til å velge den beste embedding-modellen for RAG?
Nei. MTEB er stort sett enkeltdomene-tekstsøk på offentlige datasett, så den reflekterer ikke ditt korpus, chunk-størrelse, språkmiks eller kostnadstak. I vår 10 000-dokument-benchmark var ikke toppliste-nummer én den beste på vårt korpus når pris ble tatt med. Kjør alltid en liten domeneevaluering.
Hva er den beste embedding-modellen for RAG i 2026?
Voyage-4-large for ren søkekvalitet, Gemini Embedding 001 som beste alt-i-ett-API, og Qwen3-Embedding-8B hvis du selvhoster. «Best» avhenger av kostnadstaket og språkbehovet ditt, så kortlist to og test dem på egne data før du forplikter deg.
Hva er den beste åpen kildekode-embedding-modellen for RAG?
Qwen3-Embedding-8B er den samlede lederen innen åpen kildekode (topp MTEB-skår på flerspråklig og kode), BGE-M3 er den allsidige hybridmodellen, og nomic-embed-text er laptop-valget via Ollama. Vektene er gratis, men du betaler for GPU-en og VRAM-en for å kjøre dem.
Åpen kildekode vs. API-embeddings, hva er best for RAG?
API-er vinner på null drift og nyeste kvalitet; selvhosting vinner på dataresidens, høyt volum og ingen per-token-avgift. Break-even styres som regel av volum og compliance, ikke ren kvalitet. Under noen hundre millioner tokens i måneden er API-er i praksis nesten alltid billigst.
Hva er den beste lokale embedding-modellen å kjøre på Ollama?
nomic-embed-text er favoritten (ollama pull nomic-embed-text): lett, rask på beskjeden maskinvare, og gratis på tokennivå. Har du ledig GPU-VRAM, henter en mindre Qwen3-Embedding-variant bedre. Begge indekserer lokalt uten API-kostnad eller data som forlater maskinen din.
Betyr en høyere embedding-dimensjon bedre søk?
Ikke lineært. Forbi et visst punkt legger ekstra dimensjoner til lagring og ventetid uten en tilsvarende recall-gevinst. Matryoshka-modeller lar deg avkorte (for eksempel 3072→1024) og beholde det meste av recall mens hver vektor krymper med rundt 3x, noe som kutter vektordatabase-kostnaden direkte.
Hva er den billigste embedding-modellen som fortsatt er god for RAG?
text-embedding-3-small ($0,02/M) eller voyage-4-lite ($0,02/M) klarer en solid Recall@10 for de fleste engelske korpus. Kan du kjøre en GPU, er nomic-embed-text i praksis gratis på tokennivå. Test på dine egne data først; billige modeller faller av på tvetydige spørringer.
Hva er den beste flerspråklige embedding-modellen for RAG?
Qwen3-Embedding-8B og BGE-M3 leder åpent flerspråklig søk, mens Cohere Embed v4 og Gemini Embedding 001 er sterke hostede alternativer. Test alltid på målspråkene dine, siden en høy MTEB-flerspråklig-plassering ikke garanterer toppytelse i ditt spesifikke språkpar.
Trenger jeg fortsatt en reranker med en god embedding-modell?
Ofte ja for RAG med toppresisjon. En sterk embedder får kandidater inn i topp-50; en reranker sorterer topp-k på nytt for endelig presisjon. En billigere embedder pluss en reranker slår ofte en dyr embedder alene, og koster mindre totalt sett.
Konklusjonen
Beste samlede søk på et API går til Voyage-4-large; Gemini Embedding 001 er den høyest skårende alt-i-ett-modellen; Qwen3-Embedding-8B leder åpen kildekode og kodesøk; og nomic-embed-text er det lokale laptop-valget. Men verdivinneren for de fleste team er en avkortet text-embedding-3-large på 1024 dimensjoner: 0,83 Recall@10, ~$0,13/M, og vektorer 3x mindre. Den egentlige lærdommen fra 10 000 dokumenter er at MTEB-nummer én sjelden er den beste modellen for ditt korpus, så test på egne data. Bygger du RAG i produksjon og vil ha et ekstra par øyne på det? Få en gratis konsultasjon.