
Рейтинг MTEB пояснено: чому модель №1 не найкращий вибір для RAG
У лідерборді Hugging Face MTEB представлено понад 5000 моделей ембедінгів, і майже щотижня нова модель займає перше місце. Ось у чому пастка: ця модель під номером 1, ймовірно, не та, яку вам варто використовувати у продакшені. Рейтинг MTEB, на який ви дивитеся, є середнім значенням по 8 різних типах завдань, і лише один із них передбачає, наскільки добре працюватиме генерація з доповненням пошуком (RAG) на ваших документах. Ми усвідомили це на власному досвіді. У квітні 2026 року наш фаворит з топ-рейтингу програв дешевшій моделі на нашому власному наборі даних. Цей гайд роз’яснює, що насправді означають ці цифри, якій колонці довіряти для RAG і чому лідерборд — це лише відправна точка, а не остаточний вирок.
Ключові висновки
- MTEB — це багатозадачний бенчмарк; загальний «сумарний» бал усереднює 8 типів завдань в одну цифру.
- Для RAG лише підкатегорія Retrieval (пошук), оцінена за метрикою nDCG@10, передбачає якість у продакшені, а не загальний середній бал.
- Реальні моделі ембедінгів показують 0.4–0.7 nDCG@10 у zero-shot режимі; 1.0 означало б ідеальне ранжування.
- Використовуйте MTEB для формування короткого списку кандидатів, а потім тестуйте на своєму корпусі. Модель №1 часто програє.
Що таке рейтинг MTEB?
MTEB розшифровується як Massive Text Embedding Benchmark — відкритий багатозадачний набір інструментів для оцінки моделей текстових ембедінгів. Рейтинг MTEB — це метрика для кожного завдання, усереднена в один загальний показник по 8 типах завдань. Його представили Muennighoff та колеги у 2022 році (arXiv 2210.07316, опубліковано на EACL 2023).
Бенчмарк доступний як публічний простір Hugging Face, де будь-хто може подати свою модель. Число, яке цитують найчастіше, — це «загальний середній бал», який змішує пошук, класифікацію, кластеризацію та п’ять інших сімейств завдань в одну фігуру. Саме тому заголовковий рейтинг вводить в оману: модель може виграти за середнім балом, будучи сильною в кластеризації, але посередньою в тому єдиному завданні, від якого залежить ваш продукт. Оригінальна стаття охоплює 8 типів завдань на приблизно 58 наборах даних і 112 мовах.
8 категорій завдань MTEB (і що вимірює кожна метрика)
MTEB групує оцінку ембедінгів на 8 типів завдань, і кожне оцінюється за різною метрикою. Тож «високий рейтинг MTEB» майже нічого не вартий, доки ви не знаєте, яке саме завдання читаєте. 0.85 у класифікації (точність) і 0.85 у пошуку (nDCG@10) описують абсолютно різні здібності.
Ось таблиця-декодер, яку ніхто, здається, не публікує чітко. Метрика змінюється залежно від завдання:
| Категорія завдання | Що тестує | Метрика |
|---|---|---|
| Пошук (Retrieval) | Пошук релевантних документів за запитом (це і є RAG) | nDCG@10 |
| Класифікація | Маркування тексту за категоріями | accuracy (точність) |
| Кластеризація | Групування схожих текстів | v-measure |
| Парна класифікація | Чи є два тексти збігом? | average precision (середня точність) |
| Переранжування (Reranking) | Переупорядкування кандидатів | MAP |
| STS (семантична текстова схожість) | Наскільки схожі за змістом два речення | Кореляція Спірмена |
| Самаризація | Ранжування якості резюме | Кореляція Спірмена |
| Бітекстний майнінг | Зіставлення перекладів між мовами | F1 |
Наведена вище карта «завдання-метрика» перевірена за статтею MTEB (arXiv 2210.07316). Головний висновок: модель, яка лідирує за загальним середнім балом MTEB, все одно може бути посередньою в єдиному завданні, на якому працює ваш продукт.
Який рейтинг MTEB дійсно важливий для RAG?
Для RAG ігноруйте загальний середній бал і дивіться на вкладку Retrieval (Пошук), оцінену за nDCG@10. RAG — це семантичний пошук по ваших документах, що є точно тим самим завданням пошуку. STS має слабкий кореляційний зв'язок, але є вторинним. Модель може виграти загальний лідерборд, посідаючи середні позиції в пошуку, тому саме колонка пошуку передбачає якість у продакшені.
Чому загальний усереднений бал вводить в оману? Підмножина пошукових завдань побудована на загальних веб-датахетах та QA-наборах, таких як MS MARCO, Natural Questions і HotpotQA. Модель, яка блищить у класифікації, може показати чудовий середній бал, тоді як її показник пошуку буде низьким. Відкрийте лідерборд Hugging Face (huggingface.co/spaces/mteb/leaderboard, доступно станом на 2026-07-13) і відфільтруйте за вкладкою retrieval перед будь-яким порівнянням.
Якщо ви пишете скрипт для власної оцінки, той самий фільтр застосовується в коді:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksПісля того, як ви переглянули колонку пошуку, наступне питання — яку модель обрати. Наш пост у хабі детально розповідає, яку модель ембедінгів дійсно варто використовувати, з повними цифрами бенчмарку, а якщо ви обираєте, де зберігати ці вектори, наш гайд про найкращі векторні бази даних у 2026 році стане гарним доповненням.
Що насправді означає бал nDCG@10?
nDCG@10 вимірює, наскільки добре ранжуються топ-10 отриманих результатів. Бал 1.0 означає, що кожен релевантний документ знаходиться на самому верху; 0 означає, що жодного немає. Реальні моделі ембедінгів показують близько 0.4–0.7 у zero-shot режимі, тож 0.55 — це норма, а не поломка.
Уявіть це як оцінку роботи пошукового рядка. Вам важливо, чи правильна відповідь з’являється першою, а не просто десь у списку, тому що ваша LLM читає лише кілька верхніх чанків, які ви їй подаєте. Ніхто не отримує 1.0, тому що запити неоднозначні, а релевантні документи рідко вибудовуються в ідеальному порядку. Тож якщо nDCG@10 на рівні 0.55 викликає у вас паніку, не варто; це нормальний, придатний для використання zero-shot бал, а діапазон 0.4–0.7 є типовим (підтверджено zeroentropy.dev), а не законом фізики.
Ми зіставили лідера MTEB з нашим власним RAG-корпусом (і він не виграв)
Ми взяли модель, яка лідирувала в англійській вкладці пошуку MTEB, і протестували її проти шести інших на нашому власному корпусі технічної документації з 10 000 документів, оцінюючи результати за ручно розміченим набором із ~120 запитів. Лідер лідерборду показав сильний Recall@10, але не посів першого місця, а два дешевші варіанти виявилися достатньо близькими, щоб вплинути на рішення. Маючи лише ~120 запитів, сприймайте ці дані як орієнтир, а не як офіційний лідерборд.
Лідером англійського лідерборду MTEB у період нашого тестування була Gemini Embedding 001 (вона очолює знімок за квітень 2026 року); наведені нижче позиції взяті з дошки MTEB на Hugging Face, і оскільки цифри змінюються залежно від знімка, ми наводимо свої дані з датою:
| Модель (розмірність) | Позиція в MTEB English (HF, 2026) | Наш корпус Recall@10 | Вартість |
|---|---|---|---|
| Gemini Embedding 001 (3072) | очолює вкладку англійського пошуку | 0.88 | ~$0.15/млн токенів |
| Voyage-4-large (1024) | не представлена на публічній дошці | 0.89 | ~$0.12/млн токенів |
| Qwen3-Embedding-8B (self-host) | лідер серед open-source моделей | 0.87 | тільки GPU |
| text-embedding-3-large @1024 (урізана) | середній рівень | 0.83 | ~$0.13/млн токенів |
Дві речі, яких лідерборд нам не показав. По-перше, публічний лідер (Gemini) на нашому корпусі поступився моделі Voyage-4-large, яка навіть не представлена на тій дошці. По-друге, self-hosted open-source модель (Qwen3-8B) відстала зовсім незначно, не маючи витрат на токени, а урізані 1024-вимірні вектори від OpenAI забезпечили Recall@10 на рівні 0.83 при зменшенні сховища втричі. MTEB ранжує пошук за загальними веб-текстами та QA; наш корпус містить спеціалізовану технічну термінологію, розбиту на чанки своїм способом, тому порядок змінюється. Це й є головним аргументом на користь тестування на власних даних. Наш огляд про те, як тестувати на власному RAG-корпусі, охоплює сторону оцінки, а пост у хабі містить повну методологію.
Чому лідер лідерборду №1 не є вашим найкращим вибором
Три фактори, які лідерборд не бачить, визначають реального переможця: доменна лексика (жаргон, якого немає в загальних датахетах), розмір чанка (короткі проти довгих уривків благоприятують різним моделям) та мова запитів. Ось чому MTEB — це інструмент для відбору, а не фінальна відповідь. Ранг повідомляє вам, які моделі є правдоподібними кандидатами, а не яка з них підходить саме для ваших даних.
Ось фактори корпусу, які на практиці перевертають рейтинг з ніг на голову:
- Зсув домену: юридичні, медичні тексти або код містять лексику, яку MS MARCO ніколи не семплював.
- Розмір чанка: модель, налаштована на короткі уривки, може захлинутися на чанках із 800 токенів.
- Мова та стиль запитів: багатомовні або запити, насичені ключовими словами, швидко змінюють порядок.
За нашим досвідом, надійний робочий процес нудний, але працює: використовуйте вкладку retrieval у MTEB, щоб відібрати 3–4 кандидатів, а потім виміряйте Recall@10 та nDCG@10 на своїх документах. Наш огляд загальних інструментів для RAG допоможе з пайплайном, а для структурованого підходу до оцінки моделей на власних даних той огляд охоплює сторону оцінки. Два пов’язані матеріали, які варто закладати в закладки: запуск моделей ембедінгів локально з Ollama та пряме порівняння ембедінгів Voyage проти OpenAI проти Cohere.
MTEB проти MMTEB, і чому цифри постійно змінюються
MMTEB — це багатомовне розширення v2 для MTEB (arXiv 2502.13595, v2 опубліковано 8 квітня 2025 року). Воно додає понад 500 завдань, керованих спільнотою, для більш ніж 250 мов, а також пошук довгих документів, виконання інструкцій та пошук коду. Якщо ваш RAG працює лише з англійською мовою, оригінальна англійська вкладка пошуку MTEB залишається тією, на яку варто звертати увагу. MMTEB найбільш важливий, коли ваші запити та документи охоплюють кілька мов.
А тепер частина про чесність. Цифри MTEB конфліктують між різними знімками і навіть версіями статей: оригінальна стаття повідомляє про 56 датасетів в одній версії та 58 в іншій, тому ніколи не сприймайте окрему цифру як канонічну. Рейтинги постійно перетасовуються, оскільки надходить понад 5000 подань, тому завжди робіть скріншот лідерборду з датою перегляду. І якщо сторінка не завантажується, простір Hugging Face працює на оновленому CPU і часто буває повільним або нестабільним, проблема не у вашому з’єднанні.
Підсумок
MTEB — це найкраща публічна відправна точка для вибору моделі ембедінгів, якщо правильно її читати. Дивіться на вкладку пошуку, а не на загальний середній бал. Сприймайте nDCG@10 у межах 0.4–0.7 як норму. Відберіть кандидатів за лідербордом, а потім протестуйте цей короткий список на своєму корпусі, тому що модель №1 часто програє на реальних даних (наша так і зробила). Коли будете готові обирати, повертайтеся до нашого хабу моделей ембедінгів для повного бенчмарку та рекомендацій. А якщо реальне завдання полягає в інтеграції обраної моделі в продакшен-пайплайн, така оцінка «відбір-потім-тест» є частиною нашої роботи з інтеграції ШІ.
Про автора
Мерт Батур Гюрбюз — співзасновник Techsy.io, де команда постачає ШІ-агентів, системи автоматизації та голосові/SDR-пайплайни для B2B-клієнтів. Він навчається в Університеті Бірмінгема і пише про стек інструментів для LLM, який команда Techsy реально використовує у продакшені.
Слідкуйте на LinkedIn.
Часті запитання
Що таке MTEB?
MTEB — це Massive Text Embedding Benchmark, відкритий набір інструментів для оцінки того, наскільки добре моделі текстових ембедінгів працюють у 8 типах завдань, включаючи пошук, класифікацію та кластеризацію. Представлений Muennighoff та колегами у 2022 році (arXiv 2210.07316), він розміщений як публічний лідерборд на Hugging Face.
Що означає абревіатура MTEB?
MTEB розшифровується як Massive Text Embedding Benchmark. Назва важлива, тому що «massive» (масивний) стосується широти завдань та датасетів, а не одного тесту. Ваш рейтинг MTEB — це насправді середнє значення багатьох окремих оцінок, саме тому загальна цифра може приховувати слабкі місця в завданні, яке вас цікавить.
Який рейтинг MTEB важливий для RAG?
Для RAG дивіться на підкатегорію Retrieval (Пошук), оцінену за nDCG@10, а не на загальний середній бал. RAG — це семантичний пошук по ваших документах, що є точно тим завданням пошуку, яке вимірює лідерборд. Модель може показати сильний загальний бал, посідаючи середні позиції в пошуку, тому пошук є надійним сигналом.
Який рейтинг пошуку MTEB вважається хорошим?
Реальні моделі ембедінгів зазвичай показують 0.4–0.7 nDCG@10 у zero-shot режимі, тож будь-що в цьому діапазоні є нормальним і придатним для використання. 0.55 — це не червоний прапорець. Ніхто не отримує 1.0, тому що запити неоднозначні, а релевантні документи рідко вибудовуються в ідеальному порядку. Порівнюйте кандидатів між собою, а не з ідеальною одиницею.
Що таке nDCG@10?
nDCG@10 вимірює, наскільки добре ранжуються топ-10 отриманих результатів. Бал 1.0 означає, що кожен релевантний документ знаходиться на самому верху; 0 означає, що жодного немає. Він винагороджує розміщення найкращої відповіді першою, що важливо для RAG, тому що ваша LLM читає лише кілька верхніх чанків, які ви отримуєте.
У чому різниця між MTEB та MMTEB (v1 проти v2)?
MMTEB — це багатомовне розширення v2 для MTEB (arXiv 2502.13595, квітень 2025). Воно розширює бенчмарк до понад 500 завдань, керованих спільнотою, для більш ніж 250 мов і додає пошук довгих документів, інструкцій та коду. Якщо ваш RAG працює лише з англійською мовою, дотримуйтесь оригінальної англійської вкладки пошуку MTEB.
Чому лідерборд MTEB так часто змінюється (і чому він не завантажується)?
Рейтинги постійно перетасовуються, тому що нові моделі подаються весь час, із понад 5000 записами, кількість яких зростає. Знімок за березень не збігатиметься зі знімком за липень, тому завжди робіть скріншот лідерборду з датою. Якщо сторінка не завантажується, простір Hugging Face працює на оновленому CPU і часто буває повільним або нестабільним.
Чи варто просто обирати модель №1 у лідерборді MTEB?
Ні. Модель №1 — це кандидат для короткого списку, а не вирок. Лідерборд не бачить вашої доменної лексики, розміру чанка або мови запитів, усе це змінює те, яка модель виграє. Використовуйте вкладку пошуку, щоб відібрати 3–4 моделі, а потім протестуйте їх на своєму корпусі. У нашому тесті публічний лідер лідерборду №1 поступився на нашому власному корпусі моделі, якої навіть немає на тій дошці, і зрівнялася з дешевшим self-hosted варіантом.