
9 parasta upotusmallia RAG-käyttöön vuonna 2026 (testasin haun, viiveen ja hinnan)
Voyage-4 julkaistiin 15. tammikuuta 2026. Sen jälkeen voyage-context-4 saapui 29. kesäkuuta. Jos RAG-putkesi indeksoi yhä OpenAI:n ada-002-mallilla, jätät mitattavaa Recall@10-tulosta pöydälle — ja maksat vielä etuoikeudesta. Parhaiden RAG-upotusmallien valitseminen vuonna 2026 ei tarkoita sen nappaamista, mikä sattuu olemaan MTEB-tulostaulun kärjessä sillä viikolla. Upotimme 10 000 omaa dokumenttiamme selvittääksemme, mitkä mallit oikeasti hakevat hyvin ja mitä kukin maksaa miljoonaa tokenia kohden. Alla: ranking, hinnat ja yksi katkaisutemppu, joka pienensi vektorivarastoamme kolminkertaisesti. Upotukset ovat vain yksi kerros laajemmasta RAG-pinosta, mutta jos tämä kerros on pielessä, kaikki sen alla kärsii.
Keskeiset havainnot
- Paras hakulaatu (API): Voyage-4-large, MoE:lla, Matryoshka-dimensioilla ja noin 0,12 $/M tokenia.
- Paras yleis-API: Gemini Embedding 001, englannin MTEB-kärki, 3072-dim, noin 0,15 $/M.
- Paras avoin / itse ylläpidetty: Qwen3-Embedding-8B, MTEB:n monikielisyys- ja koodikärki.
- Paras hinta-laatusuhde: OpenAI text-embedding-3-large katkaistuna 3072→1024, noin 0,13 $/M, 3× pienemmät vektorit.
Mitä upotusmalleissa muuttui vuonna 2026?
Vuoden 2026 suuri muutos on Voyage-4-perhe (asiantuntijasekoitus, jaettu upotusavaruus nano/lite/standard/large-mallien välillä sekä Matryoshka-katkaisu ja int8/binäärikvantisointi) sekä voyage-context-4, joka koodaa jokaisen lohkon yhdessä sen ympäröivän kontekstin kanssa. Samaan aikaan Gemini Embedding 001 johtaa englannin MTEB-tulostaulua ja Qwen3-Embedding johtaa avointa monikielistä hakua.
Kaksi Voyage-julkaisua muuttivat kentän. Voyage-4 (15.1.2026) esitteli jaetun upotusavaruuden, joten voit sekoittaa pientä mallia halpaan joukkoindeksointiin ja suurta mallia arvokkaisiin kyselyihin ilman koko aineiston uudelleenindeksointia. Pelkästään se säästää uudelleenupotuslaskun, jota useimmat tiimit kavahtavat.
Sitten voyage-context-4 (29.6.2026) tarttui suoraan lohkointiongelmaan: sen sijaan että kappale upotettaisiin erillään, malli koodaa lohkon plus sen dokumenttikontekstin. Käytännössä voit lopettaa lohkorajojen käsin säätämisen välttääksesi merkityksen katoamista reunoilla.
Tässä yksi muistettava lause: kontekstuaaliset lohkopotukset muuttavat lohkoinnista hauraan virittelyn joksikin lähemmäs luotettavaa oletusta. Haluatko suoran vertailun isännöidyistä API:sta? Täysi Voyage vs OpenAI vs Cohere -vertailumme on siihen kumppaniopas.
9 parasta RAG-upotusmallia, rankattuna
Useimmille tiimeille vuonna 2026 kolme valintaa kattaa 90 % tapauksista: Voyage-4-large korkeimpaan hakulaatuun isännöidyllä API:lla, Gemini Embedding 001 parhaana yleismallina ja Qwen3-Embedding-8B, jos ajat omalla palvelimella. Täysi ranking ja vertailutaulukko ovat alla, järjestettynä RAG-hakuun sopivuuden mukaan, ensin API-mallit, sitten avoimen lähdekoodin vaihtoehdot.
| Malli | Toimittaja | MTEB (haku, pvm) | Dimensiot (Matryoshka?) | Konteksti-ikkuna | Hinta /1M tokenia | Monikielinen | Avoin vs API/oma palvelin |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Toimittajan arvio, ei julkisessa MTEB:ssä (tammi 2026) | 2048/1024/512/256 (kyllä, MRL) | ~32K tokenia | ~0,12 $ | Vahva | API |
| Gemini Embedding 001 | ~67,7 haku / 68,3 yleis (MTEB, huhti 2026) | 3072 (kyllä, MRL) | ~2K tokenia | ~0,15 $ | Vahva | API | |
| text-embedding-3-large | OpenAI | Katso live-MTEB (ei toimittajan ilmoittama), 2026 | 3072→1024→256 (kyllä, MRL) | ~8K tokenia | ~0,13 $ | Hyvä | API |
| Cohere Embed v4 | Cohere | Toimittajan arvio, multimodaalinen (2026) | 1536 (säädettävä) | ~128K tokenia | ~0,12 $ | Vahva | API |
| Voyage-context-4 | Voyage AI | Kontekstuaalinen arvio (kesä 2026) | 2048/1024/512/256 (kyllä, MRL) | ~32K tokenia | ~0,12 $ | Vahva | API |
| Qwen3-Embedding-8B | Alibaba | ~70,6 monikielinen / ~80,7 koodi (MTEB, 2026) | 32–4096 (joustava) | ~32K tokenia | Ilmaispainot (GPU-kulu) | Kärki | Oma palvelin |
| BGE-M3 | BAAI | Vahva monikielinen (HF-tulostaulu, 2026) | 1024 (tiheä+harva+multi) | ~8K tokenia | Ilmaispainot (GPU-kulu) | Vahva | Oma palvelin |
| NV-Embed-v2 | NVIDIA | ~72,3 englannin keskiarvo (HF MTEB, vahvista, 2026) | 4096 | ~32K tokenia | Ilmaispainot (GPU-kulu) | Englanti-painotteinen | Oma palvelin |
| nomic-embed-text | Nomic AI | Vaatimaton, kannettavatason (2026) | 768 | ~8K tokenia | Ilmais (paikallinen) | Rajoitettu | Oma palvelin |
Säilytä nämä vektorit vektoritietokannassa, joka on mitoitettu dimensioidesi mukaan, koska 3072-dim-indeksi maksaa mittakaavassa huomattavasti enemmän kuin 1024-dim-indeksi.
1. Voyage-4-large
Paras puhdas hakulaatu API-mallien joukossa. Kyseessä on asiantuntijasekoitusmalli, jolla on jaettu upotusavaruus (sekoita nano/lite/large ilman uudelleenindeksointia) ja Matryoshka-dimensiot 2048/1024/512/256 sekä fp32/int8/binäärikvantisointi edullisempaan tallennukseen. Noin 0,12 $/M tokenia — hinnoiteltu keskitason malliksi mutta hakee kuin premium-malli. Valitse tämä, jos hakulaatu on pullonkaulasi ja voit maksaa noin 0,12 $/M.
2. Gemini Embedding 001
Paras yleis-API. Googlen malli johtaa englannin MTEB-tulostaulua (~68,3 yleis, ~67,7 haku huhtikuun 2026 tilannekuvan mukaan), tarjoaa 3072 dimensiota MRL-katkaisulla ja jakaa multimodaalisen avaruuden. Noin 0,15 $/M — kallein huippuvalinnoistamme. Valitse tämä, jos haluat korkeimman pistemäärän yleismallin ja Gemini/Vertex on jo pinossasi.
3. OpenAI text-embedding-3-large
Paras oletus mittakaavassa ja helpoin liittää. 3072 dimensiota, MRL-katkaisu 256:een asti ja laajin SDK- ja opastuskattavuus kaikista upottajista. Noin 0,13 $/M — turvallinen valinta, ja text-embedding-3-small (~0,02 $/M) on budjettiversio englanninkielisille aineistoille. Vanha ada-002 toimii yhä, mutta maksat huonommasta recallista. Valitse tämä, jos haluat nolla yllätystä ja laajan ekosysteemtuen.
4. Cohere Embed v4
Paras sekatyypin media- ja yritystason monikielisyysvalinta. Embed v4 käsittelee tekstiä, kuvia ja lomittaisia dokumentteja yhdessä mallissa, suurella konteksti-ikkunalla ja vahvalla kieltenvälisellä haulla, noin 0,12 $/M. Valitse tämä, jos aineistosi sekoittaa PDF:iä, kuvakaappauksia ja tekstiä tai tarvitset vakavaa monikielisyyttä yhdellä API:lla.
5. Voyage-context-4
Tuorein valinta pitkien dokumenttien RAG:lle. Julkaistu 29. kesäkuuta 2026, upottaa jokaisen lohkon ympäröivän kontekstin kanssa, mikä vähentää "katosi lohkorajalla" -virheitä, jotka vaivaavat naiivia pilkkomista. Sama noin 0,12 $/M hintaluokka kuin Voyage-4-sarjalla. Valitse tämä, jos dokumenttisi ovat pitkiä ja lohkointi on ollut päänsärkysi.
6. Qwen3-Embedding-8B
Paras avoimen lähdekoodin malli kokonaisuudessaan ja paras valinta koodihakuun. Alibaban Qwen3-Embedding johtaa avointa monikielistä MTEB:tä (~70,6) ja kärkisijaa MTEB-Codessa (~80,7) Qwen3-Embedding-dokumentaation mukaan, joustavilla dimensioilla 32–4096 ja Q4-kvantisoinnilla. Valitse tämä, jos ajat omalla palvelimella, indeksoit koodia tai tarvitset vahvaa monikielistä hakua ilman tokenikohtaista laskua.
7. BGE-M3
Paras avoin yleismalli. BAAI:n BGE-M3 antaa tiheän, harvan ja monivektorihaku yhdessä mallissa, käsittelee yli 100 kieltä ja on yhä yksi ladatuimmista upottajista Hugging Facessa. Valitse tämä, jos haluat hybridisen tiheä-plus-harva-haun yhdestä itse ylläpidetystä mallista.
8. NV-Embed-v2
Parhaat avoimet painot englanninkieliseen tarkkuuteen. NVIDIAn malli raportoi ~72,3 englannin keskiarvon HF MTEB -tulostaululla (luvut vaihtelevat tilannekuvan mukaan, joten tarkista live-taulu), 4096 dimensiolla. Raskaampi ajaa kuin useimmat. Valitse tämä, jos englannin tarkkuus on ykkösprioriteettisi ja sinulla on GPU-kapasiteettia.
9. nomic-embed-text
Paras paikallinen ja kannettavatason valinta. Nomicin malli on Ollama-natiivi, pieni ja halpa ylläpitää, vaihtaen huipputason recallin nopeuteen vaatimattomalla laitteistolla. Saman tason varavaihtoehdot: mxbai-embed-large ja konkari all-MiniLM. Valitse tämä, jos haluat täysin paikalliset upotukset ilman API-kuluja ja voit hyväksyä matalamman recallin.
Yksi asia, jonka testimme vahvisti toistuvasti: MTEB:n ykkönen on harvoin paras malli sinun aineistollesi. Juuri sitä seuraava osio mittaa.
Miten testasimme: 10 000 dokumentin upottaminen ja olennaisen mittaaminen
Upotimme noin 10 000 todellista dokumenttia sisäisestä tuotedokumentaatio- ja tukilippuaineistostamme ja pisteytimme haun käsin merkittyä noin 120 kyselyn joukkoa vastaan. Päähavainto: OpenAI:n text-embedding-3-large-mallin katkaiseminen 3072:sta 1024 dimensioon maksoi vain noin 0,03 Recall@10-pudotuksen samalla kun vektorivarasto pieneni noin kolminkertaisesti. Pieni laatuhäviö, iso tallennusvoitto.
Testasimme osajoukon (emme kaikkia yhdeksää mallia tyhjentävästi): Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (täysi ja katkaistu), Qwen3-Embedding-8B omalla palvelimella, BGE-M3 ja nomic-embed-text. Mittasimme Recall@10 ja nDCG@10 merkittyä kyselyjoukkoa vastaan, p95-upotusviiveen ja hinnan per 1M tokenia API:lle tai GPU-sekunnit itse ylläpidolle. Vain noin 120 kyselyllä näitä on pidettävä suuntaa-antavina, ei tulostauluna.
| Malli (dim) | Recall@10 | nDCG@10 | p95-viive | Hinta |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0,89 | 0,81 | ~180 ms (API) | ~0,12 $/M |
| Gemini Embedding 001 (3072) | 0,88 | 0,80 | ~210 ms (API) | ~0,15 $/M |
| Qwen3-Embedding-8B (oma palvelin) | 0,87 | 0,79 | ~430 ms (kylmä GPU) | GPU-sekunnit |
| text-embedding-3-large (3072) | 0,86 | 0,78 | ~160 ms (API) | ~0,13 $/M |
| text-embedding-3-large (1024) | 0,83 | 0,75 | ~150 ms (API) | ~0,13 $/M |
| BGE-M3 (1024) | 0,82 | 0,74 | ~300 ms (oma palvelin) | GPU-sekunnit |
| nomic-embed-text (768) | 0,76 | 0,69 | ~90 ms (paikallinen) | Ilmais |
Kaksi havaintoa jäi mieleen. Ensinnäkin itse ylläpidetty Qwen3-8B vastasi huippu-API:ta englanninkielisellä aineistollamme, mutta sen p95-viive suunnilleen kaksinkertaistui ilman lämmintä GPU:ta, joten budjetoi yhden pitäminen kuumana. Toiseksi tulostaulun ykkönen ei ollut voittaja aineistollamme, kun hinta otettiin mukaan. Jos haluat arvioida hakulaatua päästä päähän omalla datallasi, se on rehellinen tapa valita. Ja jos olet utelias, miksi MTEB-tulostaulun luku voi johtaa harhaan, kirjoitimme oman selityksen MTEB-pisteiden toiminnasta RAG:ssä.

Paljonko upotusmallit maksavat?
Isännöidyt upotus-API:t maksavat suunnilleen 0,02–0,15 $ per 1M tokenia heinäkuussa 2026. Avoimen lähdekoodin malleilla on "ilmaiset" painot, mutta maksat GPU-ajassa ja VRAM:issa. Halvimmat riittävän hyvät API-valinnat ovat text-embedding-3-small ja voyage-4-lite noin 0,02 $/M; halvin itse ylläpidetty polku on nomic-embed-text, käytännössä ilmainen tokenitasolla.
Tässä vahvistettu hintatilannekuva (heinäkuu 2026, ja upotushinnat liikkuivat kahdesti H1 2026 aikana, joten tarkista toimittajan sivu ennen sitoutumista):
| Malli | Hinta /1M tokenia (heinä 2026) | Huomautukset |
|---|---|---|
| voyage-4-lite | ~0,02 $ | Halvin Voyage-taso |
| voyage-4 | ~0,06 $ | Perustaso |
| voyage-4-large | ~0,12 $ | Paras hakulaatu |
| voyage-context-4 | ~0,12 $ | Kontekstuaaliset lohkot |
| OpenAI 3-small | ~0,02 $ | Budjetti englantiin |
| OpenAI 3-large | ~0,13 $ | Oletus mittakaavassa |
| Cohere Embed v4 | ~0,12 $ | Multimodaalinen |
| Gemini Embedding 001 | ~0,15 $ | Korkein pistemäärä |
| Avoin lähdekoodi (Qwen3, BGE-M3, nomic) | GPU/VRAM-kulu | Ei tokenikohtaista maksua |
100 miljoonalla indeksoidulla tokenilla ero 0,02 $/M ja 0,15 $/M välillä on 2 $ versus 15 $. Pieni. Mutta uudelleenupota se aineisto kuukausittain, lisää kyselyaikaiset upotukset, ja kerroin kasvaa nopeasti. Siksi haku-API:den kustannus ansaitsee oikean rivin budjetissasi, ei pyöristysvirheen. Oma palvelin kääntää laskelman: ei tokenikohtaista maksua, mutta vuokraat GPU:ta oli se kiireinen tai idle.
Hinta vs laatu: Mikä upotusmalli on paras vastine rahalle?
Paras hinta-laatusuhde -sääntö on yksinkertainen: valitse halvin malli, joka ylittää Recall@10 ≥ 0,80 aineistollasi. Meidän testissämme se on OpenAI text-embedding-3-large katkaistuna 1024 dimensioon: Recall@10 0,83 noin 0,13 $/M, vektorit 3× pienempiä kuin 3072-dim-versiossa. Se istuu suoraan makeaan pisteeseen — riittävän korkea recall, riittävän pieni tallennus.
Kuvittele sankari-hajontakaavio: hinta per 1M tokenia X-akselilla, hakulaatu Y-akselilla. Premium-API:t (Voyage-4-large, Gemini 001) ovat oikealla ylhäällä — loistava recall, korkeampi hinta. Budjettitaso (3-small, voyage-4-lite) on vasemmalla alhaalla — halpa mutta matalampi recall vaikeilla kyselyillä. Paras hinta-laatusuhde -neljännes on se, jonka useimmat tiimit ohittavat: keskihinta, korkea recall, pienet vektorit.
Rehellinen näkemykseni lukujen jälkeen: useimmat tiimit ostavat liikaa upotuslaatua ja sijoittavat liian vähän lohkointiin ja uudelleenjärjestämiseen. Jos ylität 0,80 recallin 1024 dimensiossa, 3× maksaminen tallennuksesta 0,03 recall-parannuksesta on harvoin sen arvoista.
Päätössääntö kolmella rivillä:
- Jos hakulaatu on pullonkaulasi ja budjetti riittää, valitse Voyage-4-large tai Gemini 001.
- Jos hinta on rajattu, valitse text-embedding-3-large katkaistuna 1024:ään tai 3-small helpoille aineistoille.
- Jos ajat omalla palvelimella, Qwen3-Embedding-8B on hinta-laatusuhteen kuningas, kun GPU on jo käynnissä.
Mikä on paras avoimen lähdekoodin / paikallinen upotusmalli RAG:lle?
Paras itse ylläpidetty kokonaisuudessaan on Qwen3-Embedding-8B (tarvitsee oikean GPU:n, suunnilleen 16GB+ VRAM Q4:llä). Paras kannettava/paikallinen valinta on nomic-embed-text Ollamalla, joka pyörii vaatimattomalla laitteistolla ilman API-kuluja. Oma palvelin voittaa, kun tarvitset datan sijaintia, suurta volyymiä tai haluat poistaa tokenikohtaiset maksut; API:t voittavat, kun et halua vahtia GPU:ta.
Paikallisen upottajan ajaminen on kahden komennon juttu. Lataa malli, sitten upota ja kysy. Tässä paikallinen polku Ollamalla plus API-polku OpenAI SDK:lla rinnakkain:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingKäyttäjien Redditissä raportoimat kokemukset vastaavat testiämme: itse ylläpitäjät raportoivat toistuvasti p95-viivepiikkejä, kun GPU jäähtyy pyyntöjen välissä. Korjaus on pitää yksi instanssi lämpimänä, mikä hiljalleen muuttaa "ilmaisen" itse ylläpidon kiinteäksi kuukausittaiseksi GPU-laskuksi. Kannattaa hinnoitella ennen API:sta siirtymistä. Jos rakennat eval-silmukkaa, auttaa myös hallita kehotteita hakusi ympärillä yhdessä paikassa. Koko läpikäyntiin katso oppaamme upotusmallien ajamiseen paikallisesti Ollamalla.
Tarkoittaako suurempi dimensio parempaa hakua?
Ei lineaarisesti. Tietyn pisteen jälkeen lisädimensiot lisäävät tallennus- ja viivekustannuksia ilman suhteellista recall-hyötyä. Matryoshka Representation Learning (MRL) mahdollistaa vektorin katkaisemisen (esim. 3072→1024→512) ja suurimman osan recallista säilyttämisen samalla kun jokainen vektori pienenee 3–6-kertaisesti. Se on suora leikkaus vektoritietokantasi laskuun.
Meidän lukumme tekevät sen konkreettiseksi: text-embedding-3-large-mallin pudottaminen 3072:sta 1024 dimensioon maksoi ~0,03 Recall@10 mutta leikkasi tallennuksen suunnilleen kolminkertaisesti. Mene 512:een ja recall-pudotus jyrkkenee, erityisesti monitulkintaisilla kyselyillä. Makea piste useimmille englanninkielisille aineistoille on noin 1024.
Yksi lause: dimensiot ovat tallennus- ja viivevero, jonka maksat jokaisesta vektorista, joten karsi ne pienimpään kokoon, joka yhä ylittää recall-rajasi. Yli 10 miljoonalla vektorilla se päätös määrittää, minkä vektoritietokannan voit varata, joten tarkista mikä vektoritietokanta käsittelee dimensioidesi määrän ja tallennuskulun ennen kuin lukitset dimension.
Miten valitset upotusmallin RAG:lle?
Upotusmallin valinta RAG:lle tiivistyy neljään tarkistukseen järjestyksessä. Aja ne omalla datallasi, ei julkisella tulostaululla, ja lyhytlista lyhenee nopeasti.
- Recall@10 ≥ 0,80 SINUN aineistollasi. Testaa osajoukko käsin merkityllä kyselyjoukolla. Tulostaulusijoitus on vihje, ei vastaus.
- Hinta alle $/1M-kattosi. Ota huomioon uudelleenupotus ja kyselyaikaiset upotukset, ei vain alkuperäinen indeksi.
- Konteksti-ikkuna ≥ lohkosi koko. Jos lohkosi ovat 1 000 tokenia, 512-tokenin malli katkaisee ja menettää merkitystä.
- Aktiivinen ylläpito ja monikielisyys tarvittaessa. Vuonna 2026 päivitetty malli voittaa vanhentuneen 2024-tarkistuspisteen; testaa kohdekieliäsi suoraan.
Pisteytä kaksi tai kolme mallia kaikilla neljällä ja voittaja valikoituu yleensä itsestään. Siitä eteenpäin kyse on tämän liittämisestä täyteen RAG-putkeen: lohko, upota, tallenna, hae, järjestä uudelleen.
Tekijästä
Mert Batur Gurbuz on Techsy.io:n perustajajäsen, missä tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja ääni/SDR-putkia B2B-asiakkaille. Hän opiskelee Birminghamin yliopistossa ja kirjoittaa LLM-työkalupinosta, jota Techsy-tiimi oikeasti käyttää tuotannossa. Yhdistä LinkedInissä.
Työkalun valitseminen on helppo puolisko. Sen saaminen toimimaan luotettavasti oikeassa tuotteessa on missä useimmat tiimit jumittuvat, ja juuri sitä meidän AI-integraatiotiimimme rakentaa asiakkaille — RAG-putkista räätälöityihin agentteihin.
Usein kysytyt kysymykset
Riittääkö MTEB-piste parhaan RAG-upotusmallin valintaan?
Ei. MTEB on pääosin yksittäisen domainin tekstihakua julkisilla dataseteillä, joten se ei heijasta aineistoasi, lohkokokoa, kielisekoitusta tai hintakattoa. Meidän 10 000 dokumentin benchmarkissamme tulostaulun ykkönen ei ollut paras aineistollamme, kun hinta otettiin mukaan. Aja aina pieni domain-kohtainen eval.
Mikä on paras upotusmalli RAG:lle vuonna 2026?
Voyage-4-large puhtaaseen hakulaatuun, Gemini Embedding 001 parhaana yleis-API:na ja Qwen3-Embedding-8B, jos ajat omalla palvelimella. "Paras" riippuu hintakatostasi ja kielitarpeistasi, joten lyhytlistaa kaksi ja testaa ne omalla datallasi ennen sitoutumista.
Mikä on paras avoimen lähdekoodin upotusmalli RAG:lle?
Qwen3-Embedding-8B on avoimen lähdekoodin yleiskärki (MTEB:n monikielisyys- ja koodikärkisijat), BGE-M3 on monipuolinen hybridi-yleismalli ja nomic-embed-text on kannettavatason valinta Ollamalla. Painot ovat ilmaiset, mutta maksat GPU:sta ja VRAM:ista niiden ajamiseen.
Avoin lähdekoodi vs API-upotukset, kumpi on parempi RAG:lle?
API:t voittavat nolla ylläpidolla ja uusimmalla laadulla; oma palvelin voittaa datan sijainnilla, suurella volyymilla ja ei tokenikohtaista maksua. Kannattavuusraja määräytyy yleensä volyymin ja compliance-tarpeiden mukaan, ei raakalaadun. Alle muutama sata miljoonaa tokenia kuukaudessa, API:t ovat lähes aina halvempia käytännössä.
Mikä on paras paikallinen upotusmalli Ollamalla ajettavaksi?
nomic-embed-text on vakiintunut valinta (ollama pull nomic-embed-text): kevyt, nopea vaatimattomalla laitteistolla ja ilmainen tokenitasolla. Jos sinulla on ylimääräistä GPU-VRAM:ia, pienempi Qwen3-Embedding-variantti hakee paremmin. Molemmat indeksoivat paikallisesti ilman API-kuluja tai datan poistumista koneeltasi.
Tarkoittaako suurempi upotusdimensio parempaa hakua?
Ei lineaarisesti. Tietyn pisteen jälkeen lisädimensiot lisäävät tallennusta ja viivettä ilman suhteellista recall-hyötyä. Matryoshka-mallit mahdollistavat katkaisemisen (esimerkiksi 3072→1024) ja suurimman osan recallista säilyttämisen samalla kun jokainen vektori pienenee noin kolminkertaisesti, leikaten vektoritietokantasi kustannuksia suoraan.
Mikä on halvin upotusmalli, joka on yhä hyvä RAG:lle?
text-embedding-3-small (~0,02 $/M) tai voyage-4-lite (~0,02 $/M) ylittävät vakaan Recall@10:n useimmille englanninkielisille aineistoille. Jos voit ajaa GPU:ta, nomic-embed-text on käytännössä ilmainen tokenitasolla. Testaa omalla datallasi ensin; halvat mallit putoavat monitulkintaisilla kyselyillä.
Mikä on paras monikielinen upotusmalli RAG:lle?
Qwen3-Embedding-8B ja BGE-M3 johtavat avointa monikielistä hakua, kun taas Cohere Embed v4 ja Gemini Embedding 001 ovat vahvoja isännöityjä vaihtoehtoja. Testaa aina kohdekielilläsi, koska korkea MTEB-multilingual-sijoitus ei takaa huipputulosta juuri sinun kieliparissasi.
Tarvitsenko yhä uudelleenjärjestäjän hyvän upotusmallin kanssa?
Usein kyllä huipputarkkuuden RAG:lle. Vahva upottaja saa ehdokkaat top-50:een; uudelleenjärjestäjä järjestää top-k:n lopullista tarkkuutta varten. Halvempi upottaja plus uudelleenjärjestäjä voittaa usein kalliin upottajan yksinään ja maksaa vähemmän kokonaisuudessaan.
Tuomio
Paras kokonaishaku API:lla menee Voyage-4-large:lle; Gemini Embedding 001 on korkeimman pistemäärän yleismalli; Qwen3-Embedding-8B johtaa avointa lähdekoodia ja koodihakua; ja nomic-embed-text on paikallinen kannettavatason valinta. Mutta useimmille tiimeille hinta-laatusuhteen voittaja on katkaistu text-embedding-3-large 1024 dimensiossa: 0,83 Recall@10, ~0,13 $/M ja vektorit 3× pienempiä. Todellinen opetus 10 000 dokumentista on, että MTEB:n ykkönen on harvoin paras malli aineistollesi, joten testaa omalla datallasi. Rakennatko tuotanto-RAG:ta ja haluat toisen parin silmiä? Ota ilmainen konsultaatio.