
MTEB-pisteet selitettynä: Miksi ykkösmalli ei ole paras valintasi RAG-järjestelmään
Hugging Facen MTEB-lista sisältää yli 5 000 upotusmallien julkaisua, ja lähes joka viikko uusi malli kiilaa kärkipaikalle. Tässä on ansa: kyseinen ykkösmalli ei todennäköisesti ole se, jonka sinun kannattaisi ottaa tuotantoon. MTEB-piste, jota tuijotat, on keskiarvo kahdeksasta eri tehtävätyypistä, ja vain yksi niistä ennustaa, kuinka hyvin retrieval-augmented generation (RAG) toimii omilla dokumenteillasi. Opimme tämän kantapään kautta. Huhtikuussa 2026 korkeimmalle rankattu valintamme hävisi halvemmalle mallille omalla aineistollamme. Tämä opas purkaa numeroiden todellisen merkityksen, kertoo, mihin sarakkeeseen kannattaa luottaa RAG:n osalta, ja miksi lista on lähtökohta, ei lopullinen tuomio.
Keskeiset huomiot
- MTEB on monitehtäväinen benchmark; otsikon ”kokonaispiste” yhdistää 8 tehtävätyyppiä yhdeksi keskiarvoksi.
- RAG:n kannalta vain Retrieval-alivälilehti (nDCG@10) ennustaa tuotantolaatua, ei kokonaiskeskiarvo.
- Todelliset upotusmallit saavat zero-shot-tilassa 0,4–0,7 nDCG@10 -pisteet; 1,0 tarkoittaisi täydellistä järjestystä.
- Käytä MTEB:tä ehdokkaiden karsintaan ja testaa sitten omalla aineistollasi. Ykkösmalli häviää usein.
Mikä on MTEB-piste?
MTEB tarkoittaa Massive Text Embedding Benchmark -hanketta, joka on avoin, monitehtäväinen sarja tekstiupotusmallien arviointiin. MTEB-piste on tehtäväkohtainen mittari, joka keskiarvoidaan yhdeksi kokonaisluvuksi kahdeksan tehtävätyypin yli. Sen esittelivät Muennighoff ja kollegat vuonna 2022 (arXiv 2210.07316, julkaistu EACL 2023 -konferenssissa).
Benchmark toimii julkisena Hugging Face -Spacena, jonne kuka tahansa voi lähettää mallin. Useimmiten siteerattu luku on ”kokonaiskeskiarvo”, joka yhdistää haun, luokittelun, klusteroinnin ja viisi muuta tehtäväperhettä yhdeksi luvuksi. Juuri siksi otsikkosijoitus johtaa harhaan: malli voi voittaa keskiarvon olemalla vahva klusteroinnissa, vaikka se olisi vain keskinkertainen siinä yhdessä tehtävässä, johon tuotteesi perustuu. Alkuperäinen tutkimus kattaa 8 tehtävätyyppiä noin 58 datajoukossa ja 112 kielessä.
Kahdeksan MTEB-tehtäväkategoriaa (ja mitä kukin piste mittaa)
MTEB ryhmittelee upotusten arvioinnin 8 tehtävätyyppiin, ja kutakin pisteytetään eri mittarilla. Siksi ”korkea MTEB-piste” ei tarkoita juuri mitään, ennen kuin tiedät, mitä tehtävää luet. 0,85 luokittelussa (tarkkuus) ja 0,85 haussa (nDCG@10) kuvaavat täysin erilaisia kykyjä.
Tässä on dekooderitaulukko, jota kukaan ei näytä julkaisevan siististi. Mittari muuttuu tehtävän mukaan:
| Tehtäväkategoria | Mitä se testaa | Mittari |
|---|---|---|
| Haku (Retrieval) | Relevanttien dokumenttien löytäminen kyselylle (tämä on RAG) | nDCG@10 |
| Luokittelu (Classification) | Tekstin luokitteleminen kategorioihin | tarkkuus (accuracy) |
| Klusterointi (Clustering) | Samankaltaisten tekstien ryhmittely | v-measure |
| Pariluokittelu (Pair Classification) | Ovatko kaksi tekstiä match? | keskimääräinen tarkkuus (average precision) |
| Uudelleenjärjestely (Reranking) | Ehdokastulosten uudelleenjärjestely | MAP |
| STS (semanttinen tekstin samankaltaisuus) | Kuinka samanmerkityksisiä kaksi lausetta ovat | Spearmanin korrelaatio |
| Tiivistäminen (Summarization) | Tiivistelmän laadun arviointi | Spearmanin korrelaatio |
| Bitext mining | Käännösten parittaminen kielten välillä | F1 |
Yllä oleva tehtävä-mittari-kartta on varmistettu MTEB-tutkimuksesta (arXiv 2210.07316). Yksi keskeinen havainto: malli, joka johtaa kokonais-MTEB-keskiarvoa, voi silti olla keskinkertainen siinä yksittäisessä tehtävässä, jota tuotteesi käyttää.
Mikä MTEB-piste todella merkitsee RAG:lle?
RAG:n osalta unohda kokonaiskeskiarvo ja katso Retrieval-alivälilehteä, jota pisteytetään nDCG@10:llä. RAG on semanttista hakua dokumenttiesi yli, mikä on täsmälleen hakutehtävä. STS on löyhästi korreloiva, mutta toissijainen. Malli voi voittaa kokonaislistan, vaikka sen sijoitus haussa olisi keskikastia, joten hakusarake on se, joka ennustaa tuotantolaatua.
Miksi kokonaiskeskiarvo johtaa harhaan? Hakualajoukko on rakennettu yleisistä verkko- ja QA-datajoukoista, kuten MS MARCO, Natural Questions ja HotpotQA. Malli, joka loistaa luokittelussa, voi saada hyvän keskiarvon, vaikka sen hakuluku olisikin heikko. Avaa Hugging Facen lista (huggingface.co/spaces/mteb/leaderboard, käytetty 2026-07-13) ja suodata retrieval-välilehdelle ennen kuin vertaat mitään.
Jos skriptaat oman arviontisi, sama suodatin pätee koodissa:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksKun olet lukenut hakusarakkeen, seuraava kysymys on, mikä malli valitaan. Hub-artikkelimme käy läpi mikä upotusmalli kannattaa todella ottaa tuotantoon koko benchmark-numeroiden kera, ja jos valitset, mihin vektorit tallennetaan, oppaamme parhaista vektoritietokannoista vuonna 2026 sopii siihen pariin.
Mitä nDCG@10-piste todella tarkoittaa?
nDCG@10 mittaa, kuinka hyvin 10 parhaan haetun tuloksen järjestys on onnistunut. Piste 1,0 tarkoittaa, että kaikki relevantit dokumentit ovat aivan kärjessä; 0 tarkoittaa, ettei yksikään ole. Todelliset upotusmallit asettuvat zero-shot-tilassa noin 0,4–0,7 väliin, joten 0,55 on normaalia, ei rikki.
Ajattele tätä kuin hakukentän arviointia. Välität siitä, tuleeako oikea vastaus ensimmäiseksi, ei vain jonnekin listalle, koska LLM:llesi syötetään vain muutama ensimmäinen chunk. Kukaan ei saavuta 1,0:tta, koska kyselyt ovat epäselviä ja relevantit dokumentit harvoin asettuvat täydelliseen järjestykseen. Jos nDCG@10-arvo 0,55 saa sinut panikoimaan, älä tee sitä; se on normaali, tuotantokelpoinen zero-shot-piste, ja 0,4–0,7 vaihteluväli on tyypillinen alue (varmistettu zeroentropy.dev:lta), ei fysiikan laki.
Asetimme MTEB:n ykkösmallin vasten omaa RAG-aineistoamme (ja se ei voittanut)
Otimme MTEB:n englanninkielisen retrieval-välilehden kärjessä olevan mallin ja ajoimme sen kuutta muuta vastaan omalla 10 000 dokumentin teknisen dokumentaation aineistollamme, pisteytettynä noin 120 käsin labeloidun kyselyn joukkoa vastaan. Listan johtaja sai vahvan Recall@10-tuloksen, mutta se ei sijoittunut ensimmäiseksi, ja kaksi halvempaa vaihtoehtoa päätyi tarpeeksi lähelle muuttaakseen päätöstä. Vain noin 120 kyselyllä nämä tulokset ovat suuntaa antavia, eivät virallinen lista.
MTEB:n englanninkielisen listan johtaja testiaikamme aikana oli Gemini Embedding 001 (se johti huhtikuun 2026 snapshotia); alla olevat sijoitukset tulevat Hugging Facen MTEB-listalta, ja koska numerot muuttuvat snapshotin mukaan, lainaamme omiamme päivämäärällä:
| Malli (dimensiot) | MTEB English -sijoitus (HF, 2026) | Oma aineisto Recall@10 | Kustannus |
|---|---|---|---|
| Gemini Embedding 001 (3072) | johtaa englanninkielistä retrieval-välilehteä | 0,88 | ~0,15 $/M |
| Voyage-4-large (1024) | ei julkaistu julkisella listalla | 0,89 | ~0,12 $/M |
| Qwen3-Embedding-8B (self-host) | avoimen mallin johtaja | 0,87 | vain GPU |
| text-embedding-3-large @1024 (trunkattu) | keskitaso | 0,83 | ~0,13 $/M |
Kaksi asiaa, joita lista ei kertonut meille. Ensinnäkin, julkinen ykkönen (Gemini) hävisi omalla aineistollamme Voyage-4-largelle, mallille, jota ei edes ole listalla. Toiseksi, itse hostattu avoin malli (Qwen3-8B) tuli hiuskarvan päähän ilman token-kohtaista kustannusta, ja OpenAI:n trunkatut 1024-dimensioiset vektorit pitivät 0,83 Recall@10 -tuloksen 3x pienemmällä tallennustilalla. MTEB rankkaa haun yleisen verkon ja QA-tekstin perusteella; meidän aineistomme on erikoistunutta teknistä sanastoa, joka on chunkattu omalla tavallaan, joten järjestys sekoittuu. Tämä on koko argumentti oman datan testaamisen puolesta. Läpikotaisin ohjeemme oman RAG-aineiston testaamisesta kattaa evaluointipuolen, ja hub-artikkeli sisältää koko metodologian.
Miksi listan ykkönen ei ole paras valintasi
Kolme asiaa, joita lista ei näe, ratkaisevat todellisen voittajan: domain-sanasto (slangi, jota yleiset datajoukot eivät sisällä), chunk-koko (lyhyet vs. pitkät pätkät suosivat eri malleja) ja kyselykieli. Siksi MTEB on karsintatyökalu, ei lopullinen vastaus. Sijoitus kertoo, mitkä mallit ovat uskottavia, ei sitä, mikä sopii dataasi.
Tässä ovat aineistotekijät, jotka kääntävät sijoituksia käytännössä:
- Domain-shift: juridinen, lääketieteellinen tai koodikantateksti sisältää sanastoa, jota MS MARCO ei koskaan näytellyt.
- Chunk-koko: lyhyisiin pätkiin viritetty malli voi kompastua 800 tokenin chunkeihin.
- Kyselykieli ja tyyli: monikieliset tai avainsanapainotteiset kyselyt sekoittavat järjestystä nopeasti.
Kokemuksemme mukaan luotettava työnkulku on tylsä, mutta se toimii: käytä MTEB:n retrieval-välilehteä karsiaksesi 3–4 ehdokasta, mittaa sitten Recall@10 ja nDCG@10 omilla dokumenteillasi. Katsauksemme yleisistä RAG-työkaluista auttaa putken rakentamisessa, ja strukturoituun tapaan arvioida malleja omalla datalla tämä katsaus kattaa evaluointipuolen. Kaksi aiheeseen liittyvää lukemista, jotka kannattaa bookmarkata: upotusmallien ajaminen paikallisesti Ollamalla ja head-to-head-vertailu Voyagen, OpenAI:n ja Coheren upotuksista.
MTEB vs MMTEB ja miksi numerot muuttuvat jatkuvasti
MMTEB on MTEB:n monikielinen v2-laajennus (arXiv 2502.13595, v2 julkaistu 8.4.2025). Se lisää 500+ yhteisövetoista tehtävää yli 250 kielelle sekä pitkien dokumenttien, ohjeiden noudattamisen ja koodihaun. Jos RAG-järjestelmäsi on vain englanninkielinen, alkuperäinen englanninkielinen MTEB-retrieval-välilehti on edelleen se, jota kannattaa lukea. MMTEB on tärkein silloin, kun kyselysi ja dokumenttisi kattavat useita kieliä.
Tässä rehellinen osuus. MTEB-numerot ristiriitaisia eri snapshotien ja jopa tutkimusversioiden välillä: alkuperäinen tutkimus raportoi 56 datajoukkoa yhdessä versiossa ja 58 toisessa, joten älä koskaan pidä yhtä lukua kanonisena. Sijoitukset sekoittuvat jatkuvasti, kun 5 000+ julkaisua saapuu, joten ota aina kuvakaappaus listasta päivämäärän kanssa. Ja jos sivu ei lataudu, Hugging Face Space pyörii CPU-päivityksellä ja on usein hidas tai epävaka, ei sinun yhteytesi vika.
Yhteenveto
MTEB on paras julkinen lähtökohta upotusmallin valintaan, kunhan osaat lukea sitä oikein. Lue retrieval-välilehteä, älä kokonaiskeskiarvoa. Pidä nDCG@10-arvoa 0,4–0,7 normaalina. Karsi ehdokkaat listan avulla ja testaa sitten niitä omalla aineistollasi, koska ykkösmalli häviää usein todellisella datalla (meillä kävi niin). Kun olet valmis valitsemaan, palaa upotusmallihubiimme saadaksesi koko benchmarkin ja suositukset. Ja jos todellinen työ on valitun mallin kytkeminen tuotantoputkeen, tuo karsi-ja-testaa-evaluointi on osa AI-integraatiotyötämme.
Kirjoittajasta
Mert Batur Gurbuz on Techsy.io:n co-founder, jossa tiimi toimittaa AI-agentteja, automaatiojärjestelmiä ja voice/SDR-putkia B2B-asiakkaille. Hän opiskelee Birminghamin yliopistossa ja kirjoittaa LLM-työkalupakista, jota Techsyn tiimi todella käyttää tuotannossa.
Yhdistä LinkedInissä.
Usein kysytyt kysymykset
Mikä on MTEB?
MTEB on Massive Text Embedding Benchmark, avoin sarja, joka arvioi, kuinka hyvin tekstiupotusmallit suorittavat 8 eri tehtävätyypissä, mukaan lukien haku, luokittelu ja klusterointi. Muennighoff ja kollegat esittelivät sen vuonna 2022 (arXiv 2210.07316), ja se on hostattu julkisena listana Hugging Facessa.
Mitä MTEB tarkoittaa?
MTEB tarkoittaa Massive Text Embedding Benchmark. Nimi on tärkeä, koska ”massive” viittaa tehtävien ja datajoukkojen laajuuteen, ei yhteen testiin. MTEB-pisteesi on oikeasti keskiarvo monista erillisistä evaluoinneista, minkä vuoksi kokonaisluku voi piilottaa heikkouksia siinä tehtävässä, joka sinua kiinnostaa.
Mikä MTEB-piste merkitsee RAG:lle?
RAG:n osalta lue Retrieval-alivälilehteä, jota pisteytetään nDCG@10:llä, älä kokonaiskeskiarvoa. RAG on semanttista hakua dokumenttiesi yli, mikä on täsmälleen se hakutehtävä, jonka lista mittaa. Malli voi saada vahvan kokonaispisteen, vaikka sen sijoitus haussa olisi keskikastia, joten haku on luotettava signaali.
Mikä on hyvä MTEB-hakupiste?
Todelliset upotusmallit saavat tyypillisesti 0,4–0,7 nDCG@10 -pisteet zero-shot-tilassa, joten mikä tahansa tuolla välillä on normaalia ja tuotantokelpoista. 0,55 ei ole punainen lippu. Kukaan ei saavuta 1,0:tta, koska kyselyt ovat epäselviä ja relevantit dokumentit harvoin asettuvat täydelliseen järjestykseen. Vertaa ehdokkaita toisiinsa, älä täydelliseen 1,0:aan.
Mikä on nDCG@10?
nDCG@10 mittaa, kuinka hyvin 10 parhaan haetun tuloksen järjestys on onnistunut. Piste 1,0 tarkoittaa, että kaikki relevantit dokumentit ovat aivan kärjessä; 0 tarkoittaa, ettei yksikään ole. Se palkitsee parhaan vastauksen nostamista ensimmäiseksi, mikä on tärkeää RAG:lle, koska LLM:llesi syötetään vain muutama ensimmäinen chunk.
Mikä on ero MTEB:n ja MMTEB:n (v1 vs v2) välillä?
MMTEB on MTEB:n monikielinen v2-laajennus (arXiv 2502.13595, huhtikuu 2025). Se kasvaa benchmarkin 500+ yhteisövetoiseen tehtävään yli 250 kielelle ja lisää pitkien dokumenttien, ohjeiden ja koodihaun. Jos RAG-järjestelmäsi on vain englanninkielinen, pysy alkuperäisessä englanninkielisessä MTEB-retrieval-välilehdessä.
Miksi MTEB-lista muuttuu niin usein (ja miksi se ei lataudu)?
Sijoitukset sekoittuvat jatkuvasti, koska uusia malleja lähetetään koko ajan, ja entries määrä on yli 5 000 ja kasvaa. Maaliskuun snapshot ei vastaa heinäkuun snapshotia, joten ota aina kuvakaappaus listasta päivämäärän kanssa. Jos sivu ei lataudu, Hugging Face Space pyörii CPU-päivityksellä ja on usein hidas tai epävaka.
Kannattaako minun vain valita MTEB-listan ykkösmalli?
Ei. Ykkösmalli on karsintaehdokas, ei tuomio. Lista ei näe domain-sanastoasi, chunk-kokoasi tai kyselykieltäsi, jotka kaikki vaikuttavat siihen, mikä malli voittaa. Käytä retrieval-välilehteä karsiaksesi 3–4 mallia ja testaa sitten omalla aineistollasi. Testissämme julkinen listaykkönen hävisi omalla aineistollamme mallille, jota ei edes ole listalla, ja tasoihin pääsi halvempi self-hosted-vaihtoehto.