Techsy
Контакти
Розпочати
Назад до блогу
ai-machine-learning

Рейтинг MTEB пояснено: чому модель №1 не найкращий вибір для RAG

Автор Mert Batur Gürbüz
Jul 13, 2026
10 хв на читання
Зміст
Рейтинг MTEB пояснено: чому модель №1 не найкращий вибір для RAG

Рейтинг MTEB пояснено: чому модель №1 не найкращий вибір для RAG

У лідерборді Hugging Face MTEB представлено понад 5000 моделей ембедінгів, і майже щотижня нова модель займає перше місце. Ось у чому пастка: ця модель під номером 1, ймовірно, не та, яку вам варто використовувати у продакшені. Рейтинг MTEB, на який ви дивитеся, є середнім значенням по 8 різних типах завдань, і лише один із них передбачає, наскільки добре працюватиме генерація з доповненням пошуком (RAG) на ваших документах. Ми усвідомили це на власному досвіді. У квітні 2026 року наш фаворит з топ-рейтингу програв дешевшій моделі на нашому власному наборі даних. Цей гайд роз’яснює, що насправді означають ці цифри, якій колонці довіряти для RAG і чому лідерборд — це лише відправна точка, а не остаточний вирок.

Ключові висновки

  • MTEB — це багатозадачний бенчмарк; загальний «сумарний» бал усереднює 8 типів завдань в одну цифру.
  • Для RAG лише підкатегорія Retrieval (пошук), оцінена за метрикою nDCG@10, передбачає якість у продакшені, а не загальний середній бал.
  • Реальні моделі ембедінгів показують 0.4–0.7 nDCG@10 у zero-shot режимі; 1.0 означало б ідеальне ранжування.
  • Використовуйте MTEB для формування короткого списку кандидатів, а потім тестуйте на своєму корпусі. Модель №1 часто програє.

Що таке рейтинг MTEB?

MTEB розшифровується як Massive Text Embedding Benchmark — відкритий багатозадачний набір інструментів для оцінки моделей текстових ембедінгів. Рейтинг MTEB — це метрика для кожного завдання, усереднена в один загальний показник по 8 типах завдань. Його представили Muennighoff та колеги у 2022 році (arXiv 2210.07316, опубліковано на EACL 2023).

Бенчмарк доступний як публічний простір Hugging Face, де будь-хто може подати свою модель. Число, яке цитують найчастіше, — це «загальний середній бал», який змішує пошук, класифікацію, кластеризацію та п’ять інших сімейств завдань в одну фігуру. Саме тому заголовковий рейтинг вводить в оману: модель може виграти за середнім балом, будучи сильною в кластеризації, але посередньою в тому єдиному завданні, від якого залежить ваш продукт. Оригінальна стаття охоплює 8 типів завдань на приблизно 58 наборах даних і 112 мовах.

8 категорій завдань MTEB (і що вимірює кожна метрика)

MTEB групує оцінку ембедінгів на 8 типів завдань, і кожне оцінюється за різною метрикою. Тож «високий рейтинг MTEB» майже нічого не вартий, доки ви не знаєте, яке саме завдання читаєте. 0.85 у класифікації (точність) і 0.85 у пошуку (nDCG@10) описують абсолютно різні здібності.

Ось таблиця-декодер, яку ніхто, здається, не публікує чітко. Метрика змінюється залежно від завдання:

Категорія завданняЩо тестуєМетрика
Пошук (Retrieval)Пошук релевантних документів за запитом (це і є RAG)nDCG@10
КласифікаціяМаркування тексту за категоріямиaccuracy (точність)
КластеризаціяГрупування схожих текстівv-measure
Парна класифікаціяЧи є два тексти збігом?average precision (середня точність)
Переранжування (Reranking)Переупорядкування кандидатівMAP
STS (семантична текстова схожість)Наскільки схожі за змістом два реченняКореляція Спірмена
СамаризаціяРанжування якості резюмеКореляція Спірмена
Бітекстний майнінгЗіставлення перекладів між мовамиF1

Наведена вище карта «завдання-метрика» перевірена за статтею MTEB (arXiv 2210.07316). Головний висновок: модель, яка лідирує за загальним середнім балом MTEB, все одно може бути посередньою в єдиному завданні, на якому працює ваш продукт.

Який рейтинг MTEB дійсно важливий для RAG?

Для RAG ігноруйте загальний середній бал і дивіться на вкладку Retrieval (Пошук), оцінену за nDCG@10. RAG — це семантичний пошук по ваших документах, що є точно тим самим завданням пошуку. STS має слабкий кореляційний зв'язок, але є вторинним. Модель може виграти загальний лідерборд, посідаючи середні позиції в пошуку, тому саме колонка пошуку передбачає якість у продакшені.

Чому загальний усереднений бал вводить в оману? Підмножина пошукових завдань побудована на загальних веб-датахетах та QA-наборах, таких як MS MARCO, Natural Questions і HotpotQA. Модель, яка блищить у класифікації, може показати чудовий середній бал, тоді як її показник пошуку буде низьким. Відкрийте лідерборд Hugging Face (huggingface.co/spaces/mteb/leaderboard, доступно станом на 2026-07-13) і відфільтруйте за вкладкою retrieval перед будь-яким порівнянням.

Якщо ви пишете скрипт для власної оцінки, той самий фільтр застосовується в коді:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Після того, як ви переглянули колонку пошуку, наступне питання — яку модель обрати. Наш пост у хабі детально розповідає, яку модель ембедінгів дійсно варто використовувати, з повними цифрами бенчмарку, а якщо ви обираєте, де зберігати ці вектори, наш гайд про найкращі векторні бази даних у 2026 році стане гарним доповненням.

Що насправді означає бал nDCG@10?

nDCG@10 вимірює, наскільки добре ранжуються топ-10 отриманих результатів. Бал 1.0 означає, що кожен релевантний документ знаходиться на самому верху; 0 означає, що жодного немає. Реальні моделі ембедінгів показують близько 0.4–0.7 у zero-shot режимі, тож 0.55 — це норма, а не поломка.

Уявіть це як оцінку роботи пошукового рядка. Вам важливо, чи правильна відповідь з’являється першою, а не просто десь у списку, тому що ваша LLM читає лише кілька верхніх чанків, які ви їй подаєте. Ніхто не отримує 1.0, тому що запити неоднозначні, а релевантні документи рідко вибудовуються в ідеальному порядку. Тож якщо nDCG@10 на рівні 0.55 викликає у вас паніку, не варто; це нормальний, придатний для використання zero-shot бал, а діапазон 0.4–0.7 є типовим (підтверджено zeroentropy.dev), а не законом фізики.

Ми зіставили лідера MTEB з нашим власним RAG-корпусом (і він не виграв)

Ми взяли модель, яка лідирувала в англійській вкладці пошуку MTEB, і протестували її проти шести інших на нашому власному корпусі технічної документації з 10 000 документів, оцінюючи результати за ручно розміченим набором із ~120 запитів. Лідер лідерборду показав сильний Recall@10, але не посів першого місця, а два дешевші варіанти виявилися достатньо близькими, щоб вплинути на рішення. Маючи лише ~120 запитів, сприймайте ці дані як орієнтир, а не як офіційний лідерборд.

Лідером англійського лідерборду MTEB у період нашого тестування була Gemini Embedding 001 (вона очолює знімок за квітень 2026 року); наведені нижче позиції взяті з дошки MTEB на Hugging Face, і оскільки цифри змінюються залежно від знімка, ми наводимо свої дані з датою:

Модель (розмірність)Позиція в MTEB English (HF, 2026)Наш корпус Recall@10Вартість
Gemini Embedding 001 (3072)очолює вкладку англійського пошуку0.88~$0.15/млн токенів
Voyage-4-large (1024)не представлена на публічній дошці0.89~$0.12/млн токенів
Qwen3-Embedding-8B (self-host)лідер серед open-source моделей0.87тільки GPU
text-embedding-3-large @1024 (урізана)середній рівень0.83~$0.13/млн токенів

Дві речі, яких лідерборд нам не показав. По-перше, публічний лідер (Gemini) на нашому корпусі поступився моделі Voyage-4-large, яка навіть не представлена на тій дошці. По-друге, self-hosted open-source модель (Qwen3-8B) відстала зовсім незначно, не маючи витрат на токени, а урізані 1024-вимірні вектори від OpenAI забезпечили Recall@10 на рівні 0.83 при зменшенні сховища втричі. MTEB ранжує пошук за загальними веб-текстами та QA; наш корпус містить спеціалізовану технічну термінологію, розбиту на чанки своїм способом, тому порядок змінюється. Це й є головним аргументом на користь тестування на власних даних. Наш огляд про те, як тестувати на власному RAG-корпусі, охоплює сторону оцінки, а пост у хабі містить повну методологію.

Чому лідер лідерборду №1 не є вашим найкращим вибором

Три фактори, які лідерборд не бачить, визначають реального переможця: доменна лексика (жаргон, якого немає в загальних датахетах), розмір чанка (короткі проти довгих уривків благоприятують різним моделям) та мова запитів. Ось чому MTEB — це інструмент для відбору, а не фінальна відповідь. Ранг повідомляє вам, які моделі є правдоподібними кандидатами, а не яка з них підходить саме для ваших даних.

Ось фактори корпусу, які на практиці перевертають рейтинг з ніг на голову:

  • Зсув домену: юридичні, медичні тексти або код містять лексику, яку MS MARCO ніколи не семплював.
  • Розмір чанка: модель, налаштована на короткі уривки, може захлинутися на чанках із 800 токенів.
  • Мова та стиль запитів: багатомовні або запити, насичені ключовими словами, швидко змінюють порядок.

За нашим досвідом, надійний робочий процес нудний, але працює: використовуйте вкладку retrieval у MTEB, щоб відібрати 3–4 кандидатів, а потім виміряйте Recall@10 та nDCG@10 на своїх документах. Наш огляд загальних інструментів для RAG допоможе з пайплайном, а для структурованого підходу до оцінки моделей на власних даних той огляд охоплює сторону оцінки. Два пов’язані матеріали, які варто закладати в закладки: запуск моделей ембедінгів локально з Ollama та пряме порівняння ембедінгів Voyage проти OpenAI проти Cohere.

MTEB проти MMTEB, і чому цифри постійно змінюються

MMTEB — це багатомовне розширення v2 для MTEB (arXiv 2502.13595, v2 опубліковано 8 квітня 2025 року). Воно додає понад 500 завдань, керованих спільнотою, для більш ніж 250 мов, а також пошук довгих документів, виконання інструкцій та пошук коду. Якщо ваш RAG працює лише з англійською мовою, оригінальна англійська вкладка пошуку MTEB залишається тією, на яку варто звертати увагу. MMTEB найбільш важливий, коли ваші запити та документи охоплюють кілька мов.

А тепер частина про чесність. Цифри MTEB конфліктують між різними знімками і навіть версіями статей: оригінальна стаття повідомляє про 56 датасетів в одній версії та 58 в іншій, тому ніколи не сприймайте окрему цифру як канонічну. Рейтинги постійно перетасовуються, оскільки надходить понад 5000 подань, тому завжди робіть скріншот лідерборду з датою перегляду. І якщо сторінка не завантажується, простір Hugging Face працює на оновленому CPU і часто буває повільним або нестабільним, проблема не у вашому з’єднанні.

Підсумок

MTEB — це найкраща публічна відправна точка для вибору моделі ембедінгів, якщо правильно її читати. Дивіться на вкладку пошуку, а не на загальний середній бал. Сприймайте nDCG@10 у межах 0.4–0.7 як норму. Відберіть кандидатів за лідербордом, а потім протестуйте цей короткий список на своєму корпусі, тому що модель №1 часто програє на реальних даних (наша так і зробила). Коли будете готові обирати, повертайтеся до нашого хабу моделей ембедінгів для повного бенчмарку та рекомендацій. А якщо реальне завдання полягає в інтеграції обраної моделі в продакшен-пайплайн, така оцінка «відбір-потім-тест» є частиною нашої роботи з інтеграції ШІ.

Про автора

Мерт Батур Гюрбюз — співзасновник Techsy.io, де команда постачає ШІ-агентів, системи автоматизації та голосові/SDR-пайплайни для B2B-клієнтів. Він навчається в Університеті Бірмінгема і пише про стек інструментів для LLM, який команда Techsy реально використовує у продакшені.

Слідкуйте на LinkedIn.

Часті запитання

Що таке MTEB?

MTEB — це Massive Text Embedding Benchmark, відкритий набір інструментів для оцінки того, наскільки добре моделі текстових ембедінгів працюють у 8 типах завдань, включаючи пошук, класифікацію та кластеризацію. Представлений Muennighoff та колегами у 2022 році (arXiv 2210.07316), він розміщений як публічний лідерборд на Hugging Face.

Що означає абревіатура MTEB?

MTEB розшифровується як Massive Text Embedding Benchmark. Назва важлива, тому що «massive» (масивний) стосується широти завдань та датасетів, а не одного тесту. Ваш рейтинг MTEB — це насправді середнє значення багатьох окремих оцінок, саме тому загальна цифра може приховувати слабкі місця в завданні, яке вас цікавить.

Який рейтинг MTEB важливий для RAG?

Для RAG дивіться на підкатегорію Retrieval (Пошук), оцінену за nDCG@10, а не на загальний середній бал. RAG — це семантичний пошук по ваших документах, що є точно тим завданням пошуку, яке вимірює лідерборд. Модель може показати сильний загальний бал, посідаючи середні позиції в пошуку, тому пошук є надійним сигналом.

Який рейтинг пошуку MTEB вважається хорошим?

Реальні моделі ембедінгів зазвичай показують 0.4–0.7 nDCG@10 у zero-shot режимі, тож будь-що в цьому діапазоні є нормальним і придатним для використання. 0.55 — це не червоний прапорець. Ніхто не отримує 1.0, тому що запити неоднозначні, а релевантні документи рідко вибудовуються в ідеальному порядку. Порівнюйте кандидатів між собою, а не з ідеальною одиницею.

Що таке nDCG@10?

nDCG@10 вимірює, наскільки добре ранжуються топ-10 отриманих результатів. Бал 1.0 означає, що кожен релевантний документ знаходиться на самому верху; 0 означає, що жодного немає. Він винагороджує розміщення найкращої відповіді першою, що важливо для RAG, тому що ваша LLM читає лише кілька верхніх чанків, які ви отримуєте.

У чому різниця між MTEB та MMTEB (v1 проти v2)?

MMTEB — це багатомовне розширення v2 для MTEB (arXiv 2502.13595, квітень 2025). Воно розширює бенчмарк до понад 500 завдань, керованих спільнотою, для більш ніж 250 мов і додає пошук довгих документів, інструкцій та коду. Якщо ваш RAG працює лише з англійською мовою, дотримуйтесь оригінальної англійської вкладки пошуку MTEB.

Чому лідерборд MTEB так часто змінюється (і чому він не завантажується)?

Рейтинги постійно перетасовуються, тому що нові моделі подаються весь час, із понад 5000 записами, кількість яких зростає. Знімок за березень не збігатиметься зі знімком за липень, тому завжди робіть скріншот лідерборду з датою. Якщо сторінка не завантажується, простір Hugging Face працює на оновленому CPU і часто буває повільним або нестабільним.

Чи варто просто обирати модель №1 у лідерборді MTEB?

Ні. Модель №1 — це кандидат для короткого списку, а не вирок. Лідерборд не бачить вашої доменної лексики, розміру чанка або мови запитів, усе це змінює те, яка модель виграє. Використовуйте вкладку пошуку, щоб відібрати 3–4 моделі, а потім протестуйте їх на своєму корпусі. У нашому тесті публічний лідер лідерборду №1 поступився на нашому власному корпусі моделі, якої навіть немає на тій дошці, і зрівнялася з дешевшим self-hosted варіантом.

Теги

пояснення рейтингу MTEBnDCG@10пошук MTEBембедінги для RAGMMTEB

Поділилися статтею

Схожі статті

Більше у категорії ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 вже тут: інтелект рівня Fable 5 за пів ціни

Anthropic випустив Claude Opus 5 24 липня 2026 року. На Frontier-Bench він більш ніж удвічі перевершує Opus 4.8 і зберігає ціну Opus, але поступається Fable 5 та Mythos 5 у кількох тестах. Ось таблиця бенчмарків, ціни та рекомендація: перейти / почекати / залишитися.

10 min read хв на читання
Читати
ai-machine-learning
Jul 20, 2026

8 найкращих AI API для веб-скрапінгу у 2026 (перевірено на нашому агент-стеку)

Ми протестували 8 AI API для веб-скрапінгу з реальними цінами 2026 року, отриманими через наш власний агент-стек. Firecrawl, Bright Data, ScrapingBee та ще 5 — за готовністю виводу для LLM, антибот-захистом і підтримкою MCP.

9 min read хв на читання
Читати
ai-machine-learning
Jul 20, 2026

Інжиніринг промптів для кодування: 7 шаблонів, які ми щодня використовуємо в Claude Code та Cursor (2026)

Більшість статей про «промпти для AI-кодування» просто дають вам 50 шаблонів для копіювання. Ця стаття навчає 7 шаблонам, які ми використовуємо щодня для керування пайплайном із 16 агентів у Claude Code, із реальними прикладами «до» і «після» для кожного, а також пояснює, де кожен шаблон застосовується в Claude Code, Cursor і Copilot у 2026 році.

11 min read хв на читання
Читати
Переглянути всі публікації
Розпочати проєкт

Готові створити щось щось надзвичайне?

Втілимо ваше бачення в реальність. Наша команда готова допомогти вам створити програмне забезпечення, яке справді має значення.

Записатись на 30-хвилинну дзвінокНаші проєкти

З бібліотеки

Навички Claude

Переглянути всі
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-автоматизації

Переглянути всі
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

З бібліотеки

Навички Claude

Переглянути всі
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-автоматизації

Переглянути всі
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Послуги

  • Корпоративні рішення
  • Мобільні додатки
  • Веб-додатки

Рішення

  • CRM-системи
  • Інтеграція ШІ
  • ERP-розв'язання
  • Голосові аґенти
  • Автоматизація процесів
  • кібербезпека

Бібліотека

  • Блог
  • Портфоліо

Спільнота

  • AI-автоматизації
  • Навички Claude

Інструменти

  • Калькулятор вартості мобільного додатка
  • Калькулятор вартості OpenAI / LLM API
  • Калькулятор вартості MVP
  • Калькулятор вартості голосового AI-агента

Компанія

  • Про нас
  • Партнери
  • Контакти

Юридична інформація

  • Політика конфіденційності
  • Умови використання
  • Політика cookie

Послуги

  • Корпоративні рішення
  • Мобільні додатки
  • Веб-додатки

Рішення

  • CRM-системи
  • Інтеграція ШІ
  • ERP-розв'язання
  • Голосові аґенти
  • Автоматизація процесів
  • кібербезпека

Бібліотека

  • Блог
  • Портфоліо

Спільнота

  • AI-автоматизації
  • Навички Claude

Інструменти

  • Калькулятор вартості мобільного додатка
  • Калькулятор вартості OpenAI / LLM API
  • Калькулятор вартості MVP
  • Калькулятор вартості голосового AI-агента

Компанія

  • Про нас
  • Партнери
  • Контакти
Юридична інформаціяПолітика конфіденційностіУмови використанняПолітика cookie
TECHSY
© 2026 Techsy. Усі права захищені.