
Wyjaśnienie wyniku MTEB: Dlaczego model nr 1 nie jest najlepszym wyborem do RAG
Leaderboard MTEB na platformie Hugging Face zawiera ponad 5000 zgłoszeń modeli osadzania (embedding models), a prawie co tydzień nowy model wskakuje na pierwsze miejsce. Oto pułapka: ten model nr 1 prawdopodobnie nie jest tym, który powinieneś wdrożyć. Wynik MTEB, na który patrzysz, to średnia z 8 różnych typów zadań, a tylko jedno z nich przewiduje, jak dobrze generowanie wspomagane pobieraniem (RAG) zadziała na Twoich dokumentach. Nauczyliśmy się tego w bolesny sposób. W kwietniu 2026 roku nasz faworyt z czołówki rankingu przegrał z tańszym modelem na naszym własnym korpusie. Ten przewodnik wyjaśnia, co tak naprawdę oznaczają te liczby, której kolumnie ufać w przypadku RAG i dlaczego leaderboard jest punktem wyjścia, a nie ostatecznym wyrokiem.
Kluczowe wnioski
- MTEB to benchmark wielozadaniowy; nagłówkowy wynik „ogólny” łączy 8 typów zadań w jedną średnią.
- Dla RAG jedynie podzakładka Retrieval (pobieranie), oceniana przez nDCG@10, przewiduje jakość produkcyjną, a nie ogólna średnia.
- Rzeczywiste modele osadzania osiągają wyniki 0,4–0,7 nDCG@10 w trybie zero-shot; 1,0 oznaczałoby idealne rankingowanie.
- Użyj MTEB do stworzenia krótkiej listy kandydatów, a następnie przetestuj je na własnym korpusie. Model nr 1 często przegrywa.
Czym jest wynik MTEB?
MTEB to skrót od Massive Text Embedding Benchmark, otwartego, wielozadaniowego zestawu narzędzi do oceniania modeli osadzania tekstu. Wynik MTEB to metryka dla każdego zadania, uśredniona do jednej ogólnej liczby across 8 typów zadań. Został on wprowadzony przez Muennighoffa i współpracowników w 2022 roku (arXiv 2210.07316, opublikowany na EACL 2023).
Benchmark istnieje jako publiczna przestrzeń Hugging Face, gdzie każdy może przesłać model. Liczba, którą większość ludzi przytacza, to „średnia ogólna”, która miesza pobieranie, klasyfikację, klasteryzację i pięć innych rodzin zadań w jedną figurę. To właśnie dlatego nagłówkowy ranking myli: model może wygrać średnią, będąc silnym w klasteryzacji, podczas gdy tylko przeciętnym w jedynym zadaniu, od którego zależy Twój produkt. Oryginalny artykuł obejmuje 8 typów zadań na około 58 zbiorach danych i w 112 językach.
8 kategorii zadań MTEB (i co mierzy każdy wynik)
MTEB grupuje ewaluację osadzania w 8 typów zadań, a każdy z nich jest oceniany za pomocą innej metryki. Dlatego „wysoki wynik MTEB” nie znaczy prawie nic, dopóki nie wiesz, które zadanie czytasz. Wynik 0,85 w klasyfikacji (dokładność) i 0,85 w pobieraniu (nDCG@10) opisują zupełnie różne zdolności.
Oto tabela dekodująca, której nikt nie publikuje w przejrzysty sposób. Metryka zmienia się wraz z zadaniem:
| Kategoria zadania | Co testuje | Metryka |
|---|---|---|
| Retrieval (Pobieranie) | Znajdowanie odpowiednich dokumentów dla zapytania (to jest RAG) | nDCG@10 |
| Classification (Klasyfikacja) | Przypisywanie tekstom etykiet kategorii | accuracy (dokładność) |
| Clustering (Klasteryzacja) | Grupowanie podobnych tekstów | v-measure |
| Pair Classification (Klasyfikacja par) | Czy dwa teksty pasują do siebie? | average precision (średnia precyzja) |
| Reranking (Przerankowywanie) | Ponowne uporządkowanie wyników kandydujących | MAP |
| STS (semantyczna podobieństwo tekstowe) | Jak bardzo podobne są znaczeniowo dwa zdania | Korelacja Spearmana |
| Summarization (Podsumowywanie) | Ocena jakości podsumowań | Korelacja Spearmana |
| Bitext mining (Wydobycie bitextów) | Dopasowywanie tłumaczeń między językami | F1 |
Powyższe mapowanie zadań do metryk zostało zweryfikowane na podstawie artykułu MTEB (arXiv 2210.07316). Główny wniosek: model, który prowadzi w ogólnej średniej MTEB, może nadal być przeciętny w jednym zadaniu, na którym działa Twój produkt.
Który wynik MTEB naprawdę ma znaczenie dla RAG?
W przypadku RAG zignoruj ogólną średnią i sprawdź podzakładkę Retrieval (Pobieranie), ocenianą przez nDCG@10. RAG to wyszukiwanie semantyczne po Twoich dokumentach, co jest dokładnie zadaniem pobierania. STS jest luźno skorelowane, ale drugorzędne. Model może wygrać ogólny leaderboard, zajmując środkowe miejsca w pobieraniu, więc kolumna retrieval to ta, która przewiduje jakość produkcyjną.
Dlaczego ogólna mieszana średnia myli? Podzbiór retrieval jest budowany na podstawie ogólnych datasetów internetowych i QA, takich jak MS MARCO, Natural Questions i HotpotQA. Model, który błyszczy w klasyfikacji, może uzyskać świetną średnią, podczas gdy jego wynik w pobieraniu spada. Otwórz leaderboard Hugging Face (huggingface.co/spaces/mteb/leaderboard, dostęp 2026-07-13) i przed porównywaniem czegokolwiek filtruj do zakładki retrieval.
Jeśli skryptujesz własną ewaluację, ten sam filtr stosuje się w kodzie:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksGdy już przeczytasz kolumnę retrieval, kolejnym pytaniem jest wybór modelu. Nasz wpis na hubie przeprowadza przez proces wyboru modelu osadzania do wdrożenia z pełnymi liczbami z benchmarku, a jeśli wybierasz, gdzie przechowywać te wektory, nasz przewodnik po najlepszych bazach wektorowych w 2026 roku idealnie go uzupełnia.
Co tak naprawdę oznacza wynik nDCG@10?
nDCG@10 mierzy, jak dobrze uporządkowanych jest 10 najlepszych wyników pobierania. Wynik 1,0 oznacza, że każdy odpowiedni dokument znajduje się na samej górze; 0 oznacza, że żaden z nich tam nie jest. Rzeczywiste modele osadzania lądują wokół 0,4–0,7 w trybie zero-shot, więc 0,55 jest normą, a nie błędem.
Myśl o tym jak o ocenianiu pola wyszukiwania. Zależy Ci na tym, czy właściwa odpowiedź pojawi się pierwsza, a nie gdzieś tam, ponieważ Twój LLM czyta tylko kilka pierwszych fragmentów, które mu podajesz. Nikt nie osiąga 1,0, ponieważ zapytania są niejednoznaczne, a odpowiednie dokumenty rzadko układają się w idealnej kolejności. Jeśli więc nDCG@10 na poziomie 0,55 powoduje u Ciebie panikę, nie martw się; to normalny, gotowy do wdrożenia wynik zero-shot, a przedział 0,4–0,7 jest typowym zakresem (potwierdzonym przez zeroentropy.dev), a nie prawem fizyki.
Postawiliśmy lidera MTEB przeciwko naszemu własnemu korpusowi RAG (i nie wygrał)
Wzięliśmy model prowadzący w angielskiej zakładce retrieval MTEB i uruchomiliśmy go przeciwko sześciu innym na naszym własnym korpusie 10 000 dokumentów technicznych, ocenianym względem ręcznie oznaczonego zestawu ~120 zapytań. Lider leaderboarda uzyskał silny wynik Recall@10, ale nie zajął pierwszego miejsca, a dwie tańsze opcje były wystarczająco blisko, aby zmienić decyzję. Przy tylko ~120 zapytaniach traktuj te wyniki jako wskazujące kierunek, a nie jako oficjalny ranking.
Liderem angielskiego leaderboarda MTEB w naszym oknie testowym był Gemini Embedding 001 (prowadzi w snapshotcie z kwietnia 2026); poniższe zestawienie pochodzi z tablicy MTEB Hugging Face, a ponieważ liczby zmieniają się w zależności od snapshotu, podajemy nasze z datą:
| Model (wymiar) | Pozycja w MTEB English (HF, 2026) | Nasz korpus Recall@10 | Koszt |
|---|---|---|---|
| Gemini Embedding 001 (3072) | lider angielskiej zakładki retrieval | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | nieopublikowany na publicznej tablicy | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (self-host) | lider wśród modeli open-source | 0.87 | tylko GPU |
| text-embedding-3-large @1024 (obcięty) | średnia półka | 0.83 | ~$0.13/M |
Dwie rzeczy, których leaderboard nam nie powiedział. Po pierwsze, publiczny nr 1 (Gemini) został wyprzedzony na naszym korpusie przez Voyage-4-large, model, który nawet nie figuruje na tej tablicy. Po drugie, self-hostowany model open-source (Qwen3-8B) był o włos od zwycięstwa, bez kosztu za token, a obcięte wektory OpenAI o wymiarze 1024 utrzymały Recall@10 na poziomie 0,83 przy 3-krotnie mniejszym zapotrzebowaniu na storage. MTEB rankuje pobieranie na ogólnym tekście internetowym i QA; nasz korpus to specjalistyczne słownictwo techniczne pocięte w specyficzny sposób, więc kolejność się przetasowuje. To cały argument za testowaniem na własnych danych. Nasz przewodnik po testowaniu na własnym korpusie RAG omawia stronę ewaluacyjną, a wpis na hubie zawiera pełną metodologię.
Dlaczego lider leaderboarda nie jest Twoim najlepszym wyborem
Trzy rzeczy, których leaderboard nie widzi, decydują o prawdziwym zwycięzcy: słownictwo domenowe (żargon, którego ogólne datasety nigdy nie zawierają), rozmiar chunka (krótkie versus długie fragmenty faworyzują różne modele) oraz język zapytań. Dlatego MTEB to narzędzie do tworzenia shortlisty, a nie ostateczna odpowiedź. Ranking mówi Ci, które modele są prawdopodobne, a nie który pasuje do Twoich danych.
Oto czynniki związane z korpusem, które w praktyce odwracają ranking:
- Przesunięcie domeny: teksty prawne, medyczne lub kod źródłowy zawierają słownictwo, którego MS MARCO nigdy nie próbkował.
- Rozmiar chunka: model dostrojony na krótkich fragmentach może potknąć się na chunkach o długości 800 tokenów.
- Język i styl zapytań: zapytania wielojęzyczne lub heavily oparte na słowach kluczowych szybko przetasowują kolejność.
Z naszego doświadczenia wynika, że niezawodny workflow jest nudny, ale działa: użyj zakładki retrieval MTEB, aby wytypować 3–4 kandydatów, a następnie zmierz Recall@10 i nDCG@10 na swoich własnych dokumentach. Nasze zestawienie narzędzi RAG pomaga w pipeline'ie, a dla strukturalnego podejścia do ewaluacji modeli na własnych danych, ta recenzja omawia stronę ewaluacyjną. Dwa powiązane artykuły warte zapisania: uruchamianie modeli osadzania lokalnie z Ollama oraz bezpośrednie porównanie osadzań Voyage vs OpenAI vs Cohere.
MTEB vs MMTEB i dlaczego liczby ciągle się zmieniają
MMTEB to wielojęzyczna ekspansja v2 MTEB (arXiv 2502.13595, v2 opublikowana 8 kwietnia 2025). Dodaje ponad 500 zadań napędzanych przez społeczność w ponad 250 językach, plus pobieranie długich dokumentów, śledzenie instrukcji i kodu. Jeśli Twój RAG jest tylko po angielsku, oryginalna angielska zakładka retrieval MTEB jest nadal tą, którą należy czytać. MMTEB ma największe znaczenie, gdy Twoje zapytania i dokumenty obejmują wiele języków.
Oto część dotycząca szczerości. Liczby MTEB kłócą się między snapshotami, a nawet wersjami artykułów: oryginalny artykuł raportuje 56 zbiorów danych w jednej wersji i 58 w innej, więc nigdy nie traktuj pojedynczej liczby jako kanonicznej. Rankingi przetasowują się ciągle, gdy napływa ponad 5000 zgłoszeń, więc zawsze rób screenshot leaderboarda z datą odczytu. A jeśli strona się nie ładuje, przestrzeń Hugging Face działa na CPU po upgrade'i i jest często wolna lub niestabilna, to nie problem z Twoim połączeniem.
Podsumowanie
MTEB to najlepszy publiczny punkt wyjścia do wyboru modelu osadzania, pod warunkiem, że czytasz go poprawnie. Czytaj zakładkę retrieval, a nie ogólną średnią. Traktuj nDCG@10 na poziomie 0,4–0,7 jako normę. Stwórz shortlistę za pomocą leaderboarda, a następnie przetestuj tę shortlistę na własnym korpusie, ponieważ model nr 1 często przegrywa na rzeczywistych danych (nasz przegrał). Gdy będziesz gotowy do wyboru, wróć do naszego hubu modeli osadzania po pełny benchmark i rekomendacje. A jeśli prawdziwym zadaniem jest wpięcie wybranego modelu w pipeline produkcyjny, ta ewaluacja „shortlista-then-test” jest częścią naszej pracy integracyjnej AI.
O autorze
Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline'y voice/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stacku narzędziowym LLM, z którego zespół Techsy faktycznie korzysta w produkcji.
Połącz się na LinkedIn.
Często zadawane pytania
Czym jest MTEB?
MTEB to Massive Text Embedding Benchmark, otwarty zestaw narzędzi do oceniania, jak dobrze modele osadzania tekstu radzą sobie w 8 typach zadań, w tym pobieraniu, klasyfikacji i klasteryzacji. Wprowadzony przez Muennighoffa i współpracowników w 2022 roku (arXiv 2210.07316), jest hostowany jako publiczny leaderboard na Hugging Face.
Co oznacza skrót MTEB?
MTEB oznacza Massive Text Embedding Benchmark. Nazwa ma znaczenie, ponieważ „massive” odnosi się do szerokości zadań i zbiorów danych, a nie do pojedynczego testu. Twój wynik MTEB to tak naprawdę średnia z wielu oddzielnych ewaluacji, dlatego ogólna liczba może ukrywać słabe punkty w zadaniu, które Cię interesuje.
Który wynik MTEB ma znaczenie dla RAG?
Dla RAG czytaj podzakładkę Retrieval, ocenianą przez nDCG@10, a nie ogólną średnią. RAG to wyszukiwanie semantyczne po Twoich dokumentach, co jest dokładnie zadaniem pobierania mierzonym przez leaderboard. Model może uzyskać silny wynik ogólny, zajmując środkowe miejsca w pobieraniu, więc retrieval jest wiarygodnym sygnałem.
Jaki jest dobry wynik retrieval w MTEB?
Rzeczywiste modele osadzania zazwyczaj osiągają wyniki 0,4–0,7 nDCG@10 w trybie zero-shot, więc wszystko w tym przedziale jest normalne i gotowe do wdrożenia. 0,55 to nie czerwona flaga. Nikt nie osiąga 1,0, ponieważ zapytania są niejednoznaczne, a odpowiednie dokumenty rzadko układają się w idealnej kolejności. Porównuj kandydatów między sobą, a nie z perfekcyjnym 1,0.
Czym jest nDCG@10?
nDCG@10 mierzy, jak dobrze uporządkowanych jest 10 najlepszych wyników pobierania. Wynik 1,0 oznacza, że każdy odpowiedni dokument znajduje się na samej górze; 0 oznacza, że żaden z nich tam nie jest. Nagradza umieszczanie najlepszej odpowiedzi na pierwszym miejscu, co ma znaczenie dla RAG, ponieważ Twój LLM czyta tylko kilka pierwszych fragmentów, które pobierzesz.
Jaka jest różnica między MTEB a MMTEB (v1 vs v2)?
MMTEB to wielojęzyczna ekspansja v2 MTEB (arXiv 2502.13595, kwiecień 2025). Rozszerza benchmark do ponad 500 zadań napędzanych przez społeczność w ponad 250 językach i dodaje pobieranie długich dokumentów, instrukcji i kodu. Jeśli Twój RAG jest tylko po angielsku, trzymaj się oryginalnej angielskiej zakładki retrieval MTEB.
Dlaczego leaderboard MTEB zmienia się tak często (i dlaczego się nie ładuje)?
Rankingi przetasowują się ciągle, ponieważ nowe modele są zgłaszane non-stop, z ponad 5000 wpisami i rosnącą liczbą. Snapshot z marca nie będzie pasował do tego z lipca, więc zawsze rób screenshot leaderboarda z datą. Jeśli strona się nie ładuje, przestrzeń Hugging Face działa na CPU po upgrade'i i jest często wolna lub niestabilna.
Czy powinienem po prostu wybrać model nr 1 na leaderboardzie MTEB?
Nie. Model nr 1 to kandydat do shortlisty, a nie wyrok. Leaderboard nie widzi Twojego słownictwa domenowego, rozmiaru chunka ani języka zapytań, a wszystkie te czynniki zmieniają to, który model wygrywa. Użyj zakładki retrieval, aby wytypować 3–4 modele, a następnie przetestuj je na swoim korpusie. W naszym teście publiczny lider leaderboarda został wyprzedzony na naszym własnym korpusie przez model, którego nawet nie ma na tej tablicy, i zrównany przez tańszą opcję self-hosted.