
Επεξήγηση του MTEB Score: Γιατί το Νο1 Μοντέλο Δεν Είναι η Καλύτερη Επιλογή για RAG
Το leaderboard MTEB της Hugging Face παραθέτει πάνω από 5.000 υποβολές μοντέλων ενσωμάτωσης (embedding models) και σχεδόν κάθε εβδομάδα ένα νέο μοντέλο καταλαμβάνει την πρώτη θέση. Εδώ βρίσκεται η παγίδα: αυτό το μοντέλο Νο1 πιθανότατα δεν είναι αυτό που πρέπει να χρησιμοποιήσετε στην παραγωγή. Το MTEB score που κοιτάζετε είναι ένας μέσος όρος across 8 διαφορετικών τύπων εργασιών και μόνο μία από αυτές προβλέπει πόσο καλά λειτουργεί η παραγωγή κειμένου με ενίσχυση ανάκτησης (RAG) στα έγγραφά σας. Το μάθαμε με τον σκληρό τρόπο. Τον Απρίλιο του 2026, η επιλογή μας με την υψηλότερη κατάταξη έχασε από ένα φθηνότερο μοντέλο στο δικό μας corpus. Αυτός ο οδηγός αναλύει τι σημαίνουν πραγματικά οι αριθμοί, ποια στήλη να εμπιστευτείτε για το RAG και γιατί το leaderboard είναι ένα σημείο εκκίνησης, όχι μια τελεσίδικη κρίση.
Βασικά Συμπεράσματα
- Το MTEB είναι ένα benchmark πολλαπλών εργασιών· ο τίτλος «γενικός» βαθμός συνδυάζει 8 τύπους εργασιών σε έναν μέσο όρο.
- Για το RAG, μόνο η υποκατηγορία Ανάκτησης (nDCG@10) προβλέπει την ποιότητα στην παραγωγή, όχι ο γενικός μέσος όρος.
- Τα πραγματικά μοντέλα ενσωμάτωσης πετυχαίνουν 0.4–0.7 nDCG@10 zero-shot· το 1.0 θα σήμαινε τέλεια κατάταξη.
- Χρησιμοποιήστε το MTEB για να δημιουργήσετε μια σύντομη λίστα και στη συνέχεια δοκιμάστε στο δικό σας corpus. Το μοντέλο Νο1 συχνά χάνει.
Τι Είναι το MTEB Score;
Το MTEB σημαίνει Massive Text Embedding Benchmark, μια ανοιχτή, πολυ任务ική σουίτα για την αξιολόγηση μοντέλων ενσωμάτωσης κειμένου. Ένα MTEB score είναι μια μετρική ανά εργασία που averaged σε έναν γενικό αριθμό across 8 τύπους εργασιών. Παρουσιάστηκε από τους Muennighoff και συναδέλφους το 2022 (arXiv 2210.07316, δημοσιεύτηκε στο EACL 2023).
Το benchmark φιλοξενείται ως δημόσιος χώρος Hugging Face όπου οποιοσδήποτε μπορεί να υποβάλει ένα μοντέλο. Ο αριθμός που επικαλούνται οι περισσότεροι είναι ο «γενικός μέσος όρος», ο οποίος συνδυάζει ανάκτηση, ταξινόμηση, ομαδοποίηση και πέντε άλλες οικογένειες εργασιών σε ένα σχήμα. Αυτός είναι ακριβώς ο λόγος για τον οποίο η κατάταξη στον τίτλο παραπλανεί: ένα μοντέλο μπορεί να κερδίσει τον μέσο όρο επειδή είναι ισχυρό στην ομαδοποίηση, ενώ είναι μόνο μέτριο στην μοναδική εργασία από την οποία εξαρτάται το προϊόν σας. Η αρχική εργασία καλύπτει 8 τύπους εργασιών across περίπου 58 datasets και 112 γλώσσες.
Οι 8 Κατηγορίες Εργασιών MTEB (και Τι Μετρά Κάθε Βαθμός)
Το MTEB ομαδοποιεί την αξιολόγηση ενσωμάτωσης σε 8 τύπους εργασιών και καθένας βαθμολογείται με διαφορετική μετρική. Επομένως, «ένα υψηλό MTEB score» δεν σημαίνει σχεδόν τίποτα μέχρι να γνωρίζετε ποια εργασία διαβάζετε. Ένα 0.85 στην ταξινόμηση (accuracy) και ένα 0.85 στην ανάκτηση (nDCG@10) περιγράφουν completely different abilities.
Ακολουθεί ο πίνακας αποκωδικοποίησης που κανείς δεν φαίνεται να δημοσιεύει καθαρά. Η μετρική αλλάζει ανάλογα με την εργασία:
| Κατηγορία εργασίας | Τι δοκιμάζει | Μετρική |
|---|---|---|
| Ανάκτηση | Εύρεση σχετικών εγγράφων για ένα ερώτημα (αυτό είναι RAG) | nDCG@10 |
| Ταξινόμηση | Ετικέτες κειμένου σε κατηγορίες | accuracy |
| Ομαδοποίηση | Ομαδοποίηση παρόμοιων κειμένων | v-measure |
| Ζευγαρωτή Ταξινόμηση | Είναι δύο κείμενα ταιριαστά; | average precision |
| Επανακατάταξη | Αναδιάταξη υποψήφιων αποτελεσμάτων | MAP |
| STS (σημασιολογική ομοιότητα κειμένου) | Πόσο παρόμοιο είναι το νόημα δύο προτάσεων | Spearman correlation |
| Περίληψη | Κατάταξη ποιότητας περίληψης | Spearman correlation |
| Εξόρυξη bitext | Ταιριάσμα μεταφράσεων across γλώσσες | F1 |
Ο χάρτης εργασιών-μετρικών παραπάνω επαληθεύεται από την εργασία MTEB (arXiv 2210.07316). Το βασικό συμπέρασμα: ένα μοντέλο που κορυφώνει τον γενικό μέσο όρο MTEB μπορεί still να είναι μέτριο στη μοναδική εργασία στην οποία βασίζεται το προϊόν σας.
Ποιο MTEB Score Έχει Πραγματικά Σημασία για το RAG;
Για το RAG, αγνοήστε τον γενικό μέσο όρο και διαβάστε την υποκατηγορία Ανάκτηση, η οποία βαθμολογείται με nDCG@10. Το RAG είναι σημασιολογική αναζήτηση στα έγγραφά σας, which is exactly the retrieval task. Το STS έχει loose correlation but is secondary. Ένα μοντέλο μπορεί να κερδίσει το γενικό leaderboard while ranking mid-pack on retrieval, so the retrieval column is the one that predicts production quality.
Γιατί ο γενικός συνδυασμός παραπλανεί; Το υποσύνολο ανάκτησης είναι built from general web and QA datasets like MS MARCO, Natural Questions, and HotpotQA. Ένα μοντέλο που λάμπει στην ταξινόμηση μπορεί να έχει great average while its retrieval number sags. Ανοίξτε το leaderboard της Hugging Face (huggingface.co/spaces/mteb/leaderboard, accessed 2026-07-13) και filtrate to the retrieval tab before comparing anything.
Αν script your own evaluation, the same filter applies in code:
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasksΜόλις διαβάσετε τη στήλη ανάκτησης, το επόμενο ερώτημα είναι ποιο μοντέλο να επιλέξετε. Η ανάρτησή μας στον hub εξηγεί ποιο μοντέλο ενσωμάτωσης να χρησιμοποιήσετε πραγματικά με τους πλήρεις αριθμούς benchmark, και αν επιλέγετε πού θα αποθηκευτούν αυτά τα vectors, ο οδηγός μας για τις καλύτερες βάσεις δεδομένων vector το 2026 ταιριάζει με αυτό.
Τι Σημαίνει Πραγματικά ένας Βαθμός nDCG@10;
Το nDCG@10 μετρά πόσο καλά κατατάσσονται τα top 10 retrieved results. Ένας βαθμός 1.0 σημαίνει ότι κάθε σχετικό έγγραφο βρίσκεται στην κορυφή· το 0 σημαίνει ότι κανένα δεν βρίσκεται εκεί. Τα πραγματικά μοντέλα ενσωμάτωσης land around 0.4–0.7 zero-shot, so a 0.55 is normal, not broken.
Σκεφτείτε το σαν βαθμολόγηση ενός search box. Σας ενδιαφέρει αν η σωστή απάντηση εμφανίζεται πρώτη, not just somewhere, because your LLM only reads the top few chunks you feed it. Κανείς δεν πετυχαίνει 1.0, because queries are ambiguous and relevant docs rarely line up perfectly. So if an nDCG@10 of 0.55 makes you panic, don't; that's a normal, shippable zero-shot score, and the 0.4–0.7 band is a typical range (corroborated by zeroentropy.dev), not a law of physics.
Βάλαμε το Νο1 MTEB Against Our Own RAG Corpus (και Δεν Κέρδισε)
Πήραμε το μοντέλο που κορυφώνει την αγγλική καρτέλα ανάκτησης MTEB και το τρέξαμε against six others on our own 10,000-document technical-docs corpus, scored against a hand-labeled set of ~120 queries. Ο ηγέτης του leaderboard posted a strong Recall@10, but it did not finish first, and two cheaper options landed close enough to change the decision. With only ~120 queries, treat these as directional, not a leaderboard.
Ο ηγέτης του αγγλικού leaderboard MTEB στο παράθυρο δοκιμών μας ήταν το Gemini Embedding 001 (κορυφώνει το snapshot του Απριλίου 2026)· οι θέσεις παρακάτω προέρχονται από τον πίνακα MTEB της Hugging Face, και since numbers shift by snapshot we quote ours with a date:
| Μοντέλο (dims) | Κατάσταση MTEB Αγγλικά (HF, 2026) | Recall@10 στο corpus μας | Κόστος |
|---|---|---|---|
| Gemini Embedding 001 (3072) | κορυφώνει την αγγλική καρτέλα ανάκτησης | 0.88 | ~$0.15/M |
| Voyage-4-large (1024) | δεν έχει δημοσιευτεί στον δημόσιο πίνακα | 0.89 | ~$0.12/M |
| Qwen3-Embedding-8B (self-host) | ηγέτης open-model | 0.87 | Μόνο GPU |
| text-embedding-3-large @1024 (truncated) | μεσαία κατηγορία | 0.83 | ~$0.13/M |
Δύο πράγματα που δεν μας είπε το leaderboard. Πρώτον, το δημόσιο Νο1 (Gemini) was edged on our corpus by Voyage-4-large, a model that doesn't even post to that board. Δεύτερον, ένα self-hosted open model (Qwen3-8B) came within a hair at no per-token cost, and OpenAI's truncated 1024-dim vectors held 0.83 Recall@10 with 3x smaller storage. Το MTEB κατατάσσει την ανάκτηση σε general web and QA text· το corpus μας είναι specialized technical vocabulary chunked its own way, so the order reshuffles. That's the whole argument for testing on your own data. Το walkthrough μας sobre πώς να δοκιμάσετε στο δικό σας RAG corpus καλύπτει την πλευρά της αξιολόγησης, και η ανάρτηση hub carries the full methodology.
Γιατί το Νο1 του Leaderboard Δεν Είναι η Καλύτερη Επιλογή Σας
Τρία πράγματα που το leaderboard δεν μπορεί να δει decide your real winner: domain vocabulary (jargon the general datasets never contain), chunk size (short versus long passages favor different models), and query language. That's why MTEB is a shortlisting tool, not a final answer. The rank tells you which models are plausible, not which one fits your data.
Ακολουθούν οι παράγοντες του corpus που flip a ranking in practice:
- Domain shift: legal, medical, or codebase text carries vocabulary MS MARCO never sampled.
- Chunk size: a model tuned on short passages can stumble on 800-token chunks.
- Query language and style: multilingual or keyword-heavy queries reshuffle the order fast.
Στην εμπειρία μας, το reliable workflow is boring but it works: use the MTEB retrieval tab to shortlist 3–4 candidates, then measure Recall@10 and nDCG@10 on your own documents. Η συλλογή μας από γενικά εργαλεία RAG helps with the pipeline, and for a structured way to evaluate models on your own data, that review covers the eval side. Two related reads worth bookmarking: εκτέλεση μοντέλων ενσωμάτωσης locally με Ollama, και μια head-to-head σύγκριση των ενσωματώσεων Voyage vs OpenAI vs Cohere.
MTEB vs MMTEB, και Γιατί οι Αριθμοί Συνεχίζουν να Αλλάζουν
Το MMTEB είναι η multilingual v2 expansion του MTEB (arXiv 2502.13595, v2 published April 8 2025). Προσθέτει 500+ community-driven tasks across 250+ languages, plus long-document, instruction-following, and code retrieval. If your RAG is English-only, the original English MTEB retrieval tab is still the one to read. MMTEB matters most when your queries and documents span multiple languages.
Εδώ είναι το ειλικρινές μέρος. Οι αριθμοί MTEB conflict across snapshots and even across paper versions: the original paper reports 56 datasets in one version and 58 in another, so never treat a single figure as canonical. Rankings reshuffle constantly as 5,000+ submissions arrive, so always screenshot the leaderboard with the date you read it. And if the page won't load, the Hugging Face Space runs on a CPU upgrade and is often slow or flaky, not your connection.
Το Τελικό Συμπέρασμα
Το MTEB είναι το best public starting point for choosing an embedding model, once you read it right. Διαβάστε την καρτέλα ανάκτησης, not the overall average. Treat an nDCG@10 of 0.4–0.7 as normal. Shortlist with the leaderboard, then test that shortlist on your own corpus, because the #1 model often loses on real data (ours did). When you're ready to pick, head back to our hub μοντέλων ενσωμάτωσης for the full benchmark and recommendations. And if the real job is wiring the model you pick into a production pipeline, that shortlist-then-test evaluation is part of our έργο ενσωμάτωσης AI.
Σχετικά με τον Συγγραφέα
Ο Mert Batur Gurbuz είναι Συνιδρυτής της Techsy.io, όπου η ομάδα αναπτύσσει agents AI, συστήματα αυτοματοποίησης και pipelines voice/SDR για πελάτες B2B. Σπουδάζει στο Πανεπιστήμιο του Birmingham και γράφει για το stack εργαλείων LLM που χρησιμοποιεί πραγματικά η ομάδα Techsy στην παραγωγή.
Συνδεθείτε στο LinkedIn.
Συχνές Ερωτήσεις
Τι είναι το MTEB;
Το MTEB είναι το Massive Text Embedding Benchmark, μια ανοιχτή σουίτα για την αξιολόγηση της απόδοσης των μοντέλων ενσωμάτωσης κειμένου across 8 τύπους εργασιών, including retrieval, classification, and clustering. Introduced by Muennighoff and colleagues in 2022 (arXiv 2210.07316), it's hosted as a public leaderboard on Hugging Face.
Τι σημαίνει MTEB;
Το MTEB σημαίνει Massive Text Embedding Benchmark. Το όνομα έχει σημασία επειδή το «massive» αναφέρεται στο breadth of tasks and datasets, not a single test. Your MTEB score is really an average across many separate evaluations, which is why the overall number can hide weak spots on the task you care about.
Ποιο MTEB score έχει σημασία για το RAG;
Για το RAG, διαβάστε την υποκατηγορία Ανάκτηση, scored by nDCG@10, not the overall average. Το RAG είναι σημασιολογική αναζήτηση στα έγγραφά σας, which is exactly the retrieval task the leaderboard measures. Ένα μοντέλο μπορεί να έχει strong overall score while ranking mid-pack on retrieval, so retrieval is the reliable signal.
Ποιος είναι ένας καλός βαθμός ανάκτησης MTEB;
Τα πραγματικά μοντέλα ενσωμάτωσης typically score 0.4–0.7 nDCG@10 zero-shot, so anything in that band is normal and shippable. Ένα 0.55 δεν είναι red flag. Κανείς δεν πετυχαίνει 1.0, because queries are ambiguous and relevant documents rarely line up in perfect order. Compare candidates against each other, not against a perfect 1.0.
Τι είναι το nDCG@10;
Το nDCG@10 μετρά πόσο καλά κατατάσσονται τα top 10 retrieved results. Ένας βαθμός 1.0 σημαίνει ότι κάθε σχετικό έγγραφο βρίσκεται στην κορυφή· το 0 σημαίνει ότι κανένα δεν βρίσκεται εκεί. Επιβραβεύει την τοποθέτηση της καλύτερης απάντησης πρώτα, which matters for RAG because your LLM only reads the top few chunks you retrieve.
Ποια είναι η διαφορά μεταξύ MTEB και MMTEB (v1 vs v2);
Το MMTEB είναι η multilingual v2 expansion του MTEB (arXiv 2502.13595, Απρίλιος 2025). Αυξάνει το benchmark σε 500+ community-driven tasks across 250+ languages και προσθέτει long-document, instruction, and code retrieval. If your RAG is English-only, stick with the original English MTEB retrieval tab.
Γιατί αλλάζει τόσο συχνά το leaderboard MTEB (και γιατί δεν φορτώνει);
Οι κατατάξεις reshuffle constantly because new models are submitted all the time, with 5,000+ entries and growing. Ένα snapshot του Μαρτίου won't match a July one, so always screenshot the leaderboard with the date. If the page won't load, the Hugging Face Space runs on a CPU upgrade and is frequently slow or flaky.
Πρέπει απλώς να επιλέξω το μοντέλο Νο1 στο leaderboard MTEB;
Όχι. Το μοντέλο Νο1 είναι candidate για shortlist, not a verdict. Το leaderboard δεν μπορεί να δει το domain vocabulary σας, το chunk size ή τη γλώσσα του ερωτήματος, all of which change which model wins. Use the retrieval tab to shortlist 3–4 models, then test on your corpus. In our test, the public leaderboard #1 was edged on our own corpus by a model that isn't even on that board, and matched by a cheaper self-hosted option.