Techsy
Kontakt
Rozpocznij
Powrót do bloga
ai-machine-learning

Wyjaśnienie wyniku MTEB: Dlaczego model nr 1 nie jest najlepszym wyborem do RAG

Napisane przez Mert Batur Gürbüz
Jul 13, 2026
10 min
Spis treści
Wyjaśnienie wyniku MTEB: Dlaczego model nr 1 nie jest najlepszym wyborem do RAG

Wyjaśnienie wyniku MTEB: Dlaczego model nr 1 nie jest najlepszym wyborem do RAG

Leaderboard MTEB na platformie Hugging Face zawiera ponad 5000 zgłoszeń modeli osadzania (embedding models), a prawie co tydzień nowy model wskakuje na pierwsze miejsce. Oto pułapka: ten model nr 1 prawdopodobnie nie jest tym, który powinieneś wdrożyć. Wynik MTEB, na który patrzysz, to średnia z 8 różnych typów zadań, a tylko jedno z nich przewiduje, jak dobrze generowanie wspomagane pobieraniem (RAG) zadziała na Twoich dokumentach. Nauczyliśmy się tego w bolesny sposób. W kwietniu 2026 roku nasz faworyt z czołówki rankingu przegrał z tańszym modelem na naszym własnym korpusie. Ten przewodnik wyjaśnia, co tak naprawdę oznaczają te liczby, której kolumnie ufać w przypadku RAG i dlaczego leaderboard jest punktem wyjścia, a nie ostatecznym wyrokiem.

Kluczowe wnioski

  • MTEB to benchmark wielozadaniowy; nagłówkowy wynik „ogólny” łączy 8 typów zadań w jedną średnią.
  • Dla RAG jedynie podzakładka Retrieval (pobieranie), oceniana przez nDCG@10, przewiduje jakość produkcyjną, a nie ogólna średnia.
  • Rzeczywiste modele osadzania osiągają wyniki 0,4–0,7 nDCG@10 w trybie zero-shot; 1,0 oznaczałoby idealne rankingowanie.
  • Użyj MTEB do stworzenia krótkiej listy kandydatów, a następnie przetestuj je na własnym korpusie. Model nr 1 często przegrywa.

Czym jest wynik MTEB?

MTEB to skrót od Massive Text Embedding Benchmark, otwartego, wielozadaniowego zestawu narzędzi do oceniania modeli osadzania tekstu. Wynik MTEB to metryka dla każdego zadania, uśredniona do jednej ogólnej liczby across 8 typów zadań. Został on wprowadzony przez Muennighoffa i współpracowników w 2022 roku (arXiv 2210.07316, opublikowany na EACL 2023).

Benchmark istnieje jako publiczna przestrzeń Hugging Face, gdzie każdy może przesłać model. Liczba, którą większość ludzi przytacza, to „średnia ogólna”, która miesza pobieranie, klasyfikację, klasteryzację i pięć innych rodzin zadań w jedną figurę. To właśnie dlatego nagłówkowy ranking myli: model może wygrać średnią, będąc silnym w klasteryzacji, podczas gdy tylko przeciętnym w jedynym zadaniu, od którego zależy Twój produkt. Oryginalny artykuł obejmuje 8 typów zadań na około 58 zbiorach danych i w 112 językach.

8 kategorii zadań MTEB (i co mierzy każdy wynik)

MTEB grupuje ewaluację osadzania w 8 typów zadań, a każdy z nich jest oceniany za pomocą innej metryki. Dlatego „wysoki wynik MTEB” nie znaczy prawie nic, dopóki nie wiesz, które zadanie czytasz. Wynik 0,85 w klasyfikacji (dokładność) i 0,85 w pobieraniu (nDCG@10) opisują zupełnie różne zdolności.

Oto tabela dekodująca, której nikt nie publikuje w przejrzysty sposób. Metryka zmienia się wraz z zadaniem:

Kategoria zadaniaCo testujeMetryka
Retrieval (Pobieranie)Znajdowanie odpowiednich dokumentów dla zapytania (to jest RAG)nDCG@10
Classification (Klasyfikacja)Przypisywanie tekstom etykiet kategoriiaccuracy (dokładność)
Clustering (Klasteryzacja)Grupowanie podobnych tekstówv-measure
Pair Classification (Klasyfikacja par)Czy dwa teksty pasują do siebie?average precision (średnia precyzja)
Reranking (Przerankowywanie)Ponowne uporządkowanie wyników kandydującychMAP
STS (semantyczna podobieństwo tekstowe)Jak bardzo podobne są znaczeniowo dwa zdaniaKorelacja Spearmana
Summarization (Podsumowywanie)Ocena jakości podsumowańKorelacja Spearmana
Bitext mining (Wydobycie bitextów)Dopasowywanie tłumaczeń między językamiF1

Powyższe mapowanie zadań do metryk zostało zweryfikowane na podstawie artykułu MTEB (arXiv 2210.07316). Główny wniosek: model, który prowadzi w ogólnej średniej MTEB, może nadal być przeciętny w jednym zadaniu, na którym działa Twój produkt.

Który wynik MTEB naprawdę ma znaczenie dla RAG?

W przypadku RAG zignoruj ogólną średnią i sprawdź podzakładkę Retrieval (Pobieranie), ocenianą przez nDCG@10. RAG to wyszukiwanie semantyczne po Twoich dokumentach, co jest dokładnie zadaniem pobierania. STS jest luźno skorelowane, ale drugorzędne. Model może wygrać ogólny leaderboard, zajmując środkowe miejsca w pobieraniu, więc kolumna retrieval to ta, która przewiduje jakość produkcyjną.

Dlaczego ogólna mieszana średnia myli? Podzbiór retrieval jest budowany na podstawie ogólnych datasetów internetowych i QA, takich jak MS MARCO, Natural Questions i HotpotQA. Model, który błyszczy w klasyfikacji, może uzyskać świetną średnią, podczas gdy jego wynik w pobieraniu spada. Otwórz leaderboard Hugging Face (huggingface.co/spaces/mteb/leaderboard, dostęp 2026-07-13) i przed porównywaniem czegokolwiek filtruj do zakładki retrieval.

Jeśli skryptujesz własną ewaluację, ten sam filtr stosuje się w kodzie:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Gdy już przeczytasz kolumnę retrieval, kolejnym pytaniem jest wybór modelu. Nasz wpis na hubie przeprowadza przez proces wyboru modelu osadzania do wdrożenia z pełnymi liczbami z benchmarku, a jeśli wybierasz, gdzie przechowywać te wektory, nasz przewodnik po najlepszych bazach wektorowych w 2026 roku idealnie go uzupełnia.

Co tak naprawdę oznacza wynik nDCG@10?

nDCG@10 mierzy, jak dobrze uporządkowanych jest 10 najlepszych wyników pobierania. Wynik 1,0 oznacza, że każdy odpowiedni dokument znajduje się na samej górze; 0 oznacza, że żaden z nich tam nie jest. Rzeczywiste modele osadzania lądują wokół 0,4–0,7 w trybie zero-shot, więc 0,55 jest normą, a nie błędem.

Myśl o tym jak o ocenianiu pola wyszukiwania. Zależy Ci na tym, czy właściwa odpowiedź pojawi się pierwsza, a nie gdzieś tam, ponieważ Twój LLM czyta tylko kilka pierwszych fragmentów, które mu podajesz. Nikt nie osiąga 1,0, ponieważ zapytania są niejednoznaczne, a odpowiednie dokumenty rzadko układają się w idealnej kolejności. Jeśli więc nDCG@10 na poziomie 0,55 powoduje u Ciebie panikę, nie martw się; to normalny, gotowy do wdrożenia wynik zero-shot, a przedział 0,4–0,7 jest typowym zakresem (potwierdzonym przez zeroentropy.dev), a nie prawem fizyki.

Postawiliśmy lidera MTEB przeciwko naszemu własnemu korpusowi RAG (i nie wygrał)

Wzięliśmy model prowadzący w angielskiej zakładce retrieval MTEB i uruchomiliśmy go przeciwko sześciu innym na naszym własnym korpusie 10 000 dokumentów technicznych, ocenianym względem ręcznie oznaczonego zestawu ~120 zapytań. Lider leaderboarda uzyskał silny wynik Recall@10, ale nie zajął pierwszego miejsca, a dwie tańsze opcje były wystarczająco blisko, aby zmienić decyzję. Przy tylko ~120 zapytaniach traktuj te wyniki jako wskazujące kierunek, a nie jako oficjalny ranking.

Liderem angielskiego leaderboarda MTEB w naszym oknie testowym był Gemini Embedding 001 (prowadzi w snapshotcie z kwietnia 2026); poniższe zestawienie pochodzi z tablicy MTEB Hugging Face, a ponieważ liczby zmieniają się w zależności od snapshotu, podajemy nasze z datą:

Model (wymiar)Pozycja w MTEB English (HF, 2026)Nasz korpus Recall@10Koszt
Gemini Embedding 001 (3072)lider angielskiej zakładki retrieval0.88~$0.15/M
Voyage-4-large (1024)nieopublikowany na publicznej tablicy0.89~$0.12/M
Qwen3-Embedding-8B (self-host)lider wśród modeli open-source0.87tylko GPU
text-embedding-3-large @1024 (obcięty)średnia półka0.83~$0.13/M

Dwie rzeczy, których leaderboard nam nie powiedział. Po pierwsze, publiczny nr 1 (Gemini) został wyprzedzony na naszym korpusie przez Voyage-4-large, model, który nawet nie figuruje na tej tablicy. Po drugie, self-hostowany model open-source (Qwen3-8B) był o włos od zwycięstwa, bez kosztu za token, a obcięte wektory OpenAI o wymiarze 1024 utrzymały Recall@10 na poziomie 0,83 przy 3-krotnie mniejszym zapotrzebowaniu na storage. MTEB rankuje pobieranie na ogólnym tekście internetowym i QA; nasz korpus to specjalistyczne słownictwo techniczne pocięte w specyficzny sposób, więc kolejność się przetasowuje. To cały argument za testowaniem na własnych danych. Nasz przewodnik po testowaniu na własnym korpusie RAG omawia stronę ewaluacyjną, a wpis na hubie zawiera pełną metodologię.

Dlaczego lider leaderboarda nie jest Twoim najlepszym wyborem

Trzy rzeczy, których leaderboard nie widzi, decydują o prawdziwym zwycięzcy: słownictwo domenowe (żargon, którego ogólne datasety nigdy nie zawierają), rozmiar chunka (krótkie versus długie fragmenty faworyzują różne modele) oraz język zapytań. Dlatego MTEB to narzędzie do tworzenia shortlisty, a nie ostateczna odpowiedź. Ranking mówi Ci, które modele są prawdopodobne, a nie który pasuje do Twoich danych.

Oto czynniki związane z korpusem, które w praktyce odwracają ranking:

  • Przesunięcie domeny: teksty prawne, medyczne lub kod źródłowy zawierają słownictwo, którego MS MARCO nigdy nie próbkował.
  • Rozmiar chunka: model dostrojony na krótkich fragmentach może potknąć się na chunkach o długości 800 tokenów.
  • Język i styl zapytań: zapytania wielojęzyczne lub heavily oparte na słowach kluczowych szybko przetasowują kolejność.

Z naszego doświadczenia wynika, że niezawodny workflow jest nudny, ale działa: użyj zakładki retrieval MTEB, aby wytypować 3–4 kandydatów, a następnie zmierz Recall@10 i nDCG@10 na swoich własnych dokumentach. Nasze zestawienie narzędzi RAG pomaga w pipeline'ie, a dla strukturalnego podejścia do ewaluacji modeli na własnych danych, ta recenzja omawia stronę ewaluacyjną. Dwa powiązane artykuły warte zapisania: uruchamianie modeli osadzania lokalnie z Ollama oraz bezpośrednie porównanie osadzań Voyage vs OpenAI vs Cohere.

MTEB vs MMTEB i dlaczego liczby ciągle się zmieniają

MMTEB to wielojęzyczna ekspansja v2 MTEB (arXiv 2502.13595, v2 opublikowana 8 kwietnia 2025). Dodaje ponad 500 zadań napędzanych przez społeczność w ponad 250 językach, plus pobieranie długich dokumentów, śledzenie instrukcji i kodu. Jeśli Twój RAG jest tylko po angielsku, oryginalna angielska zakładka retrieval MTEB jest nadal tą, którą należy czytać. MMTEB ma największe znaczenie, gdy Twoje zapytania i dokumenty obejmują wiele języków.

Oto część dotycząca szczerości. Liczby MTEB kłócą się między snapshotami, a nawet wersjami artykułów: oryginalny artykuł raportuje 56 zbiorów danych w jednej wersji i 58 w innej, więc nigdy nie traktuj pojedynczej liczby jako kanonicznej. Rankingi przetasowują się ciągle, gdy napływa ponad 5000 zgłoszeń, więc zawsze rób screenshot leaderboarda z datą odczytu. A jeśli strona się nie ładuje, przestrzeń Hugging Face działa na CPU po upgrade'i i jest często wolna lub niestabilna, to nie problem z Twoim połączeniem.

Podsumowanie

MTEB to najlepszy publiczny punkt wyjścia do wyboru modelu osadzania, pod warunkiem, że czytasz go poprawnie. Czytaj zakładkę retrieval, a nie ogólną średnią. Traktuj nDCG@10 na poziomie 0,4–0,7 jako normę. Stwórz shortlistę za pomocą leaderboarda, a następnie przetestuj tę shortlistę na własnym korpusie, ponieważ model nr 1 często przegrywa na rzeczywistych danych (nasz przegrał). Gdy będziesz gotowy do wyboru, wróć do naszego hubu modeli osadzania po pełny benchmark i rekomendacje. A jeśli prawdziwym zadaniem jest wpięcie wybranego modelu w pipeline produkcyjny, ta ewaluacja „shortlista-then-test” jest częścią naszej pracy integracyjnej AI.

O autorze

Mert Batur Gurbuz jest współzałożycielem Techsy.io, gdzie zespół dostarcza agentów AI, systemy automatyzacji oraz pipeline'y voice/SDR dla klientów B2B. Studiuje na University of Birmingham i pisze o stacku narzędziowym LLM, z którego zespół Techsy faktycznie korzysta w produkcji.

Połącz się na LinkedIn.

Często zadawane pytania

Czym jest MTEB?

MTEB to Massive Text Embedding Benchmark, otwarty zestaw narzędzi do oceniania, jak dobrze modele osadzania tekstu radzą sobie w 8 typach zadań, w tym pobieraniu, klasyfikacji i klasteryzacji. Wprowadzony przez Muennighoffa i współpracowników w 2022 roku (arXiv 2210.07316), jest hostowany jako publiczny leaderboard na Hugging Face.

Co oznacza skrót MTEB?

MTEB oznacza Massive Text Embedding Benchmark. Nazwa ma znaczenie, ponieważ „massive” odnosi się do szerokości zadań i zbiorów danych, a nie do pojedynczego testu. Twój wynik MTEB to tak naprawdę średnia z wielu oddzielnych ewaluacji, dlatego ogólna liczba może ukrywać słabe punkty w zadaniu, które Cię interesuje.

Który wynik MTEB ma znaczenie dla RAG?

Dla RAG czytaj podzakładkę Retrieval, ocenianą przez nDCG@10, a nie ogólną średnią. RAG to wyszukiwanie semantyczne po Twoich dokumentach, co jest dokładnie zadaniem pobierania mierzonym przez leaderboard. Model może uzyskać silny wynik ogólny, zajmując środkowe miejsca w pobieraniu, więc retrieval jest wiarygodnym sygnałem.

Jaki jest dobry wynik retrieval w MTEB?

Rzeczywiste modele osadzania zazwyczaj osiągają wyniki 0,4–0,7 nDCG@10 w trybie zero-shot, więc wszystko w tym przedziale jest normalne i gotowe do wdrożenia. 0,55 to nie czerwona flaga. Nikt nie osiąga 1,0, ponieważ zapytania są niejednoznaczne, a odpowiednie dokumenty rzadko układają się w idealnej kolejności. Porównuj kandydatów między sobą, a nie z perfekcyjnym 1,0.

Czym jest nDCG@10?

nDCG@10 mierzy, jak dobrze uporządkowanych jest 10 najlepszych wyników pobierania. Wynik 1,0 oznacza, że każdy odpowiedni dokument znajduje się na samej górze; 0 oznacza, że żaden z nich tam nie jest. Nagradza umieszczanie najlepszej odpowiedzi na pierwszym miejscu, co ma znaczenie dla RAG, ponieważ Twój LLM czyta tylko kilka pierwszych fragmentów, które pobierzesz.

Jaka jest różnica między MTEB a MMTEB (v1 vs v2)?

MMTEB to wielojęzyczna ekspansja v2 MTEB (arXiv 2502.13595, kwiecień 2025). Rozszerza benchmark do ponad 500 zadań napędzanych przez społeczność w ponad 250 językach i dodaje pobieranie długich dokumentów, instrukcji i kodu. Jeśli Twój RAG jest tylko po angielsku, trzymaj się oryginalnej angielskiej zakładki retrieval MTEB.

Dlaczego leaderboard MTEB zmienia się tak często (i dlaczego się nie ładuje)?

Rankingi przetasowują się ciągle, ponieważ nowe modele są zgłaszane non-stop, z ponad 5000 wpisami i rosnącą liczbą. Snapshot z marca nie będzie pasował do tego z lipca, więc zawsze rób screenshot leaderboarda z datą. Jeśli strona się nie ładuje, przestrzeń Hugging Face działa na CPU po upgrade'i i jest często wolna lub niestabilna.

Czy powinienem po prostu wybrać model nr 1 na leaderboardzie MTEB?

Nie. Model nr 1 to kandydat do shortlisty, a nie wyrok. Leaderboard nie widzi Twojego słownictwa domenowego, rozmiaru chunka ani języka zapytań, a wszystkie te czynniki zmieniają to, który model wygrywa. Użyj zakładki retrieval, aby wytypować 3–4 modele, a następnie przetestuj je na swoim korpusie. W naszym teście publiczny lider leaderboarda został wyprzedzony na naszym własnym korpusie przez model, którego nawet nie ma na tej tablicy, i zrównany przez tańszą opcję self-hosted.

Tagi

wyjaśnienie wyniku MTEBnDCG@10pobieranie MTEBosadzania RAGMMTEB

Udostępnij artykuł

Powiązane artykuły

Więcej w ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 już jest: inteligencja bliska Fable 5 za połowę ceny

Anthropic wydał Claude Opus 5 24 lipca 2026. Model ponad dwukrotnie przebija Opus 4.8 w Frontier-Bench i utrzymuje cenę Opus, ale przegrywa kilka testów z Fable 5 i Mythos 5. Oto tabela benchmarków, ceny i rekomendacja: przejść, poczekać czy zostać.

10 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

8 najlepszych API do scrapingu AI w 2026 (przetestowane na naszym stacku agentów)

Przetestowaliśmy 8 API do scrapingu AI z realnymi cenami z 2026 roku, pobranymi przez nasz własny stack agentów. Firecrawl, Bright Data, ScrapingBee i 5 innych — ranking pod kątem wyjścia gotowego dla LLM, omijania antybotów i obsługi MCP.

9 min read min
Czytaj
ai-machine-learning
Jul 20, 2026

Inżynieria promptów dla programistów: 7 wzorców, których używamy codziennie w Claude Code i Cursor (2026)

Większość artykułów o „promptach do kodowania z AI” serwuje 50 szablonów do skopiowania. Ten uczy 7 wzorców, których używamy każdego dnia do obsługi potoku 16 agentów Claude Code, z rzeczywistymi przykładami „przed i po” oraz informacją, gdzie każdy wzorzec stosować w Claude Code, Cursor i Copilot w 2026 roku.

11 min read min
Czytaj
Zobacz wszystkie artykuły
Rozpocznij swój projekt

Gotowi, by zbudować coś co Cię wyróżnia?

Zamieńmy Twoją wizję w rzeczywistość. Nasz zespół jest gotowy, by pomóc Ci stworzyć oprogramowanie, które robi różnicę.

Umów 30-minutowe spotkanie wstępneZobacz nasze realizacje

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Z naszej biblioteki

Umiejętności Claude

Zobacz wszystkie
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Automatyzacje AI

Zobacz wszystkie
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt

Prawne

  • Polityka prywatności
  • Regulamin
  • Polityka cookies

Usługi

  • Rozwiązania Enterprise
  • Aplikacje mobilne
  • Aplikacje webowe

Rozwiązania

  • Systemy CRM
  • Integracja AI
  • Rozwiązania ERP
  • Agenci głosowi
  • Automatyzacja procesów
  • Cyberbezpieczeństwo

Biblioteka

  • Blog
  • Portfel realizacji

Społeczność

  • Automatyzacje AI
  • Umiejętności Claude

Narzędzia

  • Kalkulator kosztów aplikacji mobilnej
  • Kalkulator kosztów API OpenAI / LLM
  • Kalkulator kosztów MVP
  • Kalkulator kosztów agenta Voice AI

Firma

  • O nas
  • Partnerzy
  • Kontakt
PrawnePolityka prywatnościRegulaminPolityka cookies
TECHSY
© 2026 Techsy. Wszystkie prawa zastrzeżone.