ai-machine-learning

MTEB Skoru Açıklaması: #1 Model Neden En İyi RAG Seçiminiz Değil

Yazan Mert Batur
Jul 13, 2026
9 okuma
MTEB Skoru Açıklaması: #1 Model Neden En İyi RAG Seçiminiz Değil

MTEB Skoru Açıklaması: #1 Model Neden En İyi RAG Seçiminiz Değil

Hugging Face MTEB lider tablosu 5.000'den fazla embedding modeli gönderimini listeliyor ve neredeyse her hafta yeni bir model zirveye tırmanıyor. İşte tuzak: o #1 model muhtemelen göndermeniz gereken model değil. Karşınızdaki MTEB skoru, 8 farklı görev türü üzerinden alınan bir ortalama ve bunlardan sadece biri, retrieval-augmented generation'ın (RAG) dokümanlarınızda ne kadar iyi çalışacağını öngörüyor. Bunu zor yoldan öğrendik. Nisan 2026'da en üst sıradaki tercihimiz, kendi korpusumuzda daha ucuz bir modele kaybetti. Bu rehber, sayıların gerçekte ne anlama geldiğini, RAG için hangi sütuna güvenmeniz gerektiğini ve lider tablonun neden bir başlangıç noktası olduğunu, bir hüküm olmadığını açıklıyor.

Öne Çıkan Noktalar

  • MTEB çok görevli bir kıyaslamadır; başlıktaki "genel" skor 8 farklı görev türünü tek bir ortalamada birleştirir.
  • RAG için yalnızca Retrieval alt sekmesi (nDCG@10) üretim kalitesini öngörür, genel ortalama değil.
  • Gerçek embedding modelleri sıfır atışta (zero-shot) 0,4-0,7 nDCG@10 arasında skor alır; 1,0 mükemmel sıralama demektir.
  • MTEB'i kısa liste çıkarmak için kullanın, sonra kendi korpusunuzda test edin. #1 model çoğu zaman kaybediyor.

MTEB Skoru Nedir?

MTEB, Massive Text Embedding Benchmark'ın kısaltmasıdır; metin embedding modellerini puanlamak için açık, çok görevli bir test paketidir. Bir MTEB skoru, 8 görev türü üzerinden hesaplanan görev başına metriklerin tek bir genel sayıda ortalanmasıdır. Muennighoff ve meslektaşları tarafından 2022'de tanıtılmıştır (arXiv 2210.07316, EACL 2023'te yayımlanmıştır).

Kıyaslama, herkesin model gönderebildiği herkese açık bir Hugging Face Space'i olarak yaşıyor. İnsanların çoğunun bahsettiği sayı "genel ortalama"dır; bu da retrieval, classification, clustering ve beş diğer görev ailesini tek bir rakamda birleştirir. Başlıktaki sıralamanın yanıltıcı olmasının tam nedeni bu: bir model, ürününüzün bağlı olduğu tek görevde orta karar olsa bile, clustering'te güçlü olarak ortalamayı kazanabilir. Orijinal makale, kabaca 58 veri kümesi ve 112 dil üzerinden 8 görev türünü kapsıyor.

8 MTEB Görev Kategorisi (ve Her Biri Neyi Ölçer)

MTEB, embedding değerlendirmesini 8 görev türüne ayırır ve her biri farklı bir metrikle puanlanır. Yani "yüksek bir MTEB skoru", hangi görevi okuduğunuzu bilene kadar neredeyse hiçbir şey ifade etmez. Classification'da 0,85 ile retrieval'da (nDCG@10) 0,85, tamamen farklı iki yeteneği tarif eder.

İşte kimsenin düzgünce yayımlamadığı çözücü tablo. Metrik, göreve göre değişiyor:

Görev kategorisiNeyi test ederMetrik
RetrievalBir sorgu için ilgili dokümanları bulma (RAG budur)nDCG@10
ClassificationMetni kategorilere etiketlemeaccuracy
ClusteringBenzer metinleri gruplamav-measure
Pair Classificationİki metin eşleşiyor mu?average precision
RerankingAday sonuçları yeniden sıralamaMAP
STS (anlamsal metin benzerliği)İki cümlenin anlamca ne kadar benzediğiSpearman correlation
SummarizationÖzet kalitesini sıralamaSpearman correlation
Bitext miningDiller arası çevirileri eşleştirmeF1

Yukarıdaki görev-metrik eşleştirmesi MTEB makalesinden (arXiv 2210.07316) doğrulanmıştır. Çıkarılacak tek ders şu: genel MTEB ortalamasında zirvede olan bir model, ürününüzün çalıştığı tek görevde yine de vasat olabilir.

RAG İçin Hangi MTEB Skoru Gerçekten Önemli?

RAG için genel ortalamayı görmezden gelin ve nDCG@10 ile puanlanan Retrieval alt sekmesini okuyun. RAG, dokümanlarınız üzerinde yapılan bir anlamsal aramadır ve bu da tam olarak retrieval görevidir. STS gevşek bir korelasyona sahiptir ama ikincildir. Bir model genel lider tablosunu kazanırken retrieval'da orta sıralarda kalabilir, bu yüzden üretim kalitesini öngören sütun retrieval sütunudur.

Genel ortalama neden yanıltıyor? Retrieval alt kümesi, MS MARCO, Natural Questions ve HotpotQA gibi genel web ve soru-cevap veri kümelerinden oluşturulmuştur. Classification'da parlayan bir model, retrieval skoru düşükken harika bir ortalama gösterebilir. Herhangi bir karşılaştırma yapmadan önce Hugging Face lider tablosunu (huggingface.co/spaces/mteb/leaderboard, erişim tarihi 2026-07-13) açın ve retrieval sekmesine göre filtreleyin.

Kendi değerlendirmenizi kodluyorsanız, aynı filtre kodda da geçerlidir:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Retrieval sütununu okuduktan sonra sıradaki soru hangi modeli seçeceğinizdir. Hub yazımız, tam kıyaslama sayılarıyla birlikte hangi embedding modelini gerçekten göndermeniz gerektiğini ele alıyor; o vektörlerin nerede yaşayacağını seçiyorsanız da 2026'nın en iyi vektör veritabanları rehberimiz bununla eşleşiyor.

nDCG@10 Skoru Gerçekte Ne Anlama Gelir?

nDCG@10, getirilen ilk 10 sonucun ne kadar iyi sıralandığını ölçer. 1,0 skoru, her ilgili dokümanın en tepede olduğu; 0 ise hiçbirinin olmadığı anlamına gelir. Gerçek embedding modelleri sıfır atışta genellikle 0,4-0,7 aralığında kalır, yani 0,55 kırık değil, normaldir.

Bunu bir arama kutusunu notlandırmak gibi düşünün. Doğru cevabın herhangi bir yerde değil, ilk sırada çıkıp çıkmadığı önemlidir; çünkü LLM'iniz size beslediğiniz sadece en üstteki birkaç parçayı okur. Kimse 1,0'a ulaşamaz, çünkü sorgular belirsizdir ve ilgili dokümanlar nadiren mükemmel şekilde sıralanır. Yani 0,55'lik bir nDCG@10 sizi paniğe sürüklüyorsa sürüklemesin; bu, normal ve gönderilebilir bir sıfır atış skorudur ve 0,4-0,7 aralığı bir fizik kanunu değil, tipik bir bant aralığıdır (zeroentropy.dev tarafından da doğrulanmıştır).

MTEB #1'ini Kendi RAG Korpusumuzla Test Ettik (ve Kazanamadı)

MTEB İngilizce retrieval sekmesinin zirvesindeki modeli aldık ve onu, elle etiketlenmiş yaklaşık 120 sorgudan oluşan bir sette puanlanan, kendi 10.000 dokümanlık teknik dokümantasyon korpusumuzda altı diğer modele karşı çalıştırdık. Lider tablosunun lideri güçlü bir Recall@10 skoru elde etti ama birinci gelemedi ve iki daha ucuz seçenek, kararı değiştirecek kadar yakınında bitirdi. Sadece ~120 sorgu ile, bunları bir lider tablosu değil, yön gösterici olarak değerlendirin.

Test penceremizdeki MTEB İngilizce lider tablosu lideri Gemini Embedding 001'di (Nisan 2026 anlık görüntüsünün zirvesinde); aşağıdaki sıralama Hugging Face MTEB panosundan geliyor ve sayılar anlık görüntüden anlık görüntüye değiştiği için kendi sayılarımızı bir tarihle birlikte veriyoruz:

Model (boyut)MTEB İngilizce sıralaması (HF, 2026)Kendi korpusumuzda Recall@10Maliyet
Gemini Embedding 001 (3072)İngilizce retrieval sekmesinde zirvede0,88~$0,15/M
Voyage-4-large (1024)genel panoya gönderilmemiş0,89~$0,12/M
Qwen3-Embedding-8B (kendi sunucunuzda)açık model lideri0,87Sadece GPU
text-embedding-3-large @1024 (kısaltılmış)orta seviye0,83~$0,13/M

Lider tablosunun bize söylemediği iki şey var. Birincisi, kamuya açık #1 (Gemini), o panoya gönderim bile yapmayan bir model olan Voyage-4-large tarafından kendi korpusumuzda geride bırakıldı. İkincisi, kendi sunucunuzda barındırılan açık bir model (Qwen3-8B), token başına hiçbir maliyet olmadan neredeyse aynı sonuca ulaştı ve OpenAI'nin kısaltılmış 1024 boyutlu vektörleri, 3 kat daha küçük depolama alanıyla 0,83 Recall@10 tuttu. MTEB, retrieval'ı genel web ve soru-cevap metinleri üzerinden sıralar; bizim korpusumuz ise kendine özgü şekilde parçalanmış, özel teknik kelime dağarcığından oluşuyor, bu yüzden sıralama karışıyor. Kendi verinizde test etmenin tüm gerekçesi bu. Kendi RAG korpusunuzda nasıl test edeceğinize dair rehberimiz değerlendirme tarafını, hub yazımız ise tüm metodolojiyi kapsıyor.

Lider Tablosundaki #1 Neden En İyi Seçiminiz Değil

Lider tablosunun göremediği üç şey gerçek kazananınızı belirliyor: alan kelime dağarcığı (genel veri kümelerinin hiç içermediği jargon), parça boyutu (kısa ve uzun pasajlar farklı modelleri kayırır) ve sorgu dili. MTEB'in bir kısa listeleme aracı olup nihai bir cevap olmamasının nedeni de bu. Sıralama size hangi modellerin makul olduğunu söyler, hangisinin verinize uyduğunu değil.

Pratikte bir sıralamayı tersine çeviren korpus faktörleri şunlar:

  • Alan kayması: hukuki, tıbbi veya kod tabanı metinleri MS MARCO'nun hiç örneklemediği kelime dağarcığı taşır.
  • Parça boyutu: kısa pasajlarla ayarlanmış bir model, 800 token'lık parçalarda tökezleyebilir.
  • Sorgu dili ve stili: çok dilli veya anahtar kelime ağırlıklı sorgular sıralamayı hızla karıştırır.

Deneyimlerimize göre güvenilir iş akışı sıkıcı ama işe yarıyor: MTEB retrieval sekmesini kullanarak 3-4 aday çıkarın, sonra bunları kendi dokümanlarınızda Recall@10 ve nDCG@10 ile ölçün. Genel RAG araçları derlememiz boru hattı konusunda yardımcı olur; kendi verinizde modelleri değerlendirmenin yapılandırılmış bir yolu için bu inceleme değerlendirme tarafını ele alıyor. Yer imlerine eklemeye değer iki ilgili yazı daha var: embedding modellerini Ollama ile yerel olarak çalıştırma ve Voyage, OpenAI ile Cohere embeddinglerinin karşı karşıya geldiği bir karşılaştırma.

MTEB'e Karşı MMTEB ve Sayılar Neden Sürekli Değişiyor

MMTEB, MTEB'in çok dilli v2 genişlemesidir (arXiv 2502.13595, v2 8 Nisan 2025'te yayımlanmıştır). 250'den fazla dilde 500'den fazla topluluk kaynaklı görev ekler; ayrıca uzun doküman, talimat takibi ve kod retrieval'ı da içerir. RAG'iniz yalnızca İngilizce ise, orijinal İngilizce MTEB retrieval sekmesi hâlâ okumanız gereken sekmedir. MMTEB, sorgularınız ve dokümanlarınız birden fazla dile yayıldığında en çok işe yarar.

İşte dürüstlük kısmı. MTEB sayıları anlık görüntüler arasında, hatta makale sürümleri arasında bile çelişiyor: orijinal makale bir sürümde 56 veri kümesi, diğerinde 58 raporluyor, yani tek bir rakamı asla kesin kabul etmeyin. 5.000'den fazla gönderim geldikçe sıralamalar sürekli karışıyor, bu yüzden lider tablosunun ekran görüntüsünü her zaman okuduğunuz tarihle birlikte alın. Sayfa yüklenmiyorsa bu sizin bağlantınız değil; Hugging Face Space CPU yükseltmesiyle çalışıyor ve sık sık yavaş veya kararsız oluyor.

Sonuç

MTEB, doğru okunduğunda embedding modeli seçmek için en iyi herkese açık başlangıç noktasıdır. Genel ortalamayı değil, retrieval sekmesini okuyun. 0,4-0,7 arasındaki bir nDCG@10'u normal kabul edin. Lider tablosuyla kısa liste oluşturun, sonra o kısa listeyi kendi korpusunuzda test edin; çünkü #1 model gerçek veride çoğu zaman kaybediyor (bizimki kaybetti). Seçime hazır olduğunuzda, tam kıyaslama ve önerilerimiz için embedding modelleri hub yazımıza geri dönün. Asıl iş, seçtiğiniz modeli üretim hattına bağlamaksa, bu kısa liste-sonra-test değerlendirmesi bizim yapay zeka entegrasyonu çalışmamızın bir parçasıdır.

Yazar Hakkında

Mert Batur, Techsy.io'nun Kurucu Ortağıdır; ekip burada B2B müşterileri için AI ajanları, otomasyon sistemleri ve sesli/SDR boru hatları geliştiriyor. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor.

LinkedIn üzerinden bağlantı kurun.

Sık Sorulan Sorular

MTEB nedir?

MTEB, Massive Text Embedding Benchmark'tır; metin embedding modellerinin retrieval, classification ve clustering dahil 8 görev türünde ne kadar iyi performans gösterdiğini puanlayan açık bir test paketidir. Muennighoff ve meslektaşları tarafından 2022'de tanıtılmıştır (arXiv 2210.07316) ve Hugging Face üzerinde herkese açık bir lider tablosu olarak barındırılmaktadır.

MTEB neyin kısaltmasıdır?

MTEB, Massive Text Embedding Benchmark'ın kısaltmasıdır. İsim önemlidir çünkü "massive" (devasa) tek bir teste değil, görev ve veri kümelerinin genişliğine işaret eder. MTEB skorunuz aslında birçok ayrı değerlendirmenin ortalamasıdır, bu yüzden genel sayı önemsediğiniz görevdeki zayıf noktaları gizleyebilir.

RAG için hangi MTEB skoru önemli?

RAG için genel ortalamayı değil, nDCG@10 ile puanlanan Retrieval alt sekmesini okuyun. RAG, dokümanlarınız üzerinde yapılan bir anlamsal aramadır ve bu tam olarak lider tablonun ölçtüğü retrieval görevidir. Bir model güçlü bir genel skor gösterirken retrieval'da orta sıralarda kalabilir, bu yüzden güvenilir sinyal retrieval'dır.

İyi bir MTEB retrieval skoru nedir?

Gerçek embedding modelleri sıfır atışta genellikle 0,4-0,7 nDCG@10 arasında skor alır, yani bu aralıktaki her şey normal ve gönderilebilirdir. 0,55 kırmızı bayrak değildir. Kimse 1,0'a ulaşamaz, çünkü sorgular belirsizdir ve ilgili dokümanlar nadiren mükemmel sırada dizilir. Adayları birbirleriyle karşılaştırın, mükemmel bir 1,0 ile değil.

nDCG@10 nedir?

nDCG@10, getirilen ilk 10 sonucun ne kadar iyi sıralandığını ölçer. 1,0 skoru her ilgili dokümanın en tepede olduğu; 0 ise hiçbirinin olmadığı anlamına gelir. En iyi cevabı ilk sıraya koymayı ödüllendirir, bu da RAG için önemlidir çünkü LLM'iniz sadece getirdiğiniz en üstteki birkaç parçayı okur.

MTEB ile MMTEB (v1'e karşı v2) arasındaki fark nedir?

MMTEB, MTEB'in çok dilli v2 genişlemesidir (arXiv 2502.13595, Nisan 2025). Kıyaslamayı 250'den fazla dilde 500'den fazla topluluk kaynaklı göreve büyütür ve uzun doküman, talimat ile kod retrieval'ı ekler. RAG'iniz yalnızca İngilizce ise, orijinal İngilizce MTEB retrieval sekmesinde kalın.

MTEB lider tablosu neden bu kadar sık değişiyor (ve neden yüklenmiyor)?

Sıralamalar sürekli karışıyor çünkü yeni modeller sürekli gönderiliyor; şu anda 5.000'den fazla gönderim var ve sayı artıyor. Mart anlık görüntüsü Temmuz'unkiyle eşleşmez, bu yüzden lider tablosunun ekran görüntüsünü her zaman tarihiyle birlikte alın. Sayfa yüklenmiyorsa Hugging Face Space CPU yükseltmesiyle çalışıyor ve sık sık yavaş veya kararsız oluyor.

MTEB lider tablosundaki #1 modeli direkt seçmeli miyim?

Hayır. #1 model bir kısa liste adayıdır, bir hüküm değil. Lider tablo, alan kelime dağarcığınızı, parça boyutunuzu veya sorgu dilinizi göremez; bunların hepsi hangi modelin kazandığını değiştirir. Retrieval sekmesini kullanarak 3-4 model kısa listeleyin, sonra kendi korpusunuzda test edin. Bizim testimizde, kamuya açık lider tablosunun #1'i kendi korpusumuzda o panoya bile gönderilmemiş bir model tarafından geride bırakıldı ve daha ucuz, kendi sunucunuzda barındırılan bir seçenek tarafından da yakalandı.

Etiketler

mteb-skoru-aciklamasindcg-10mteb-retrievalrag-embeddinglerimmteb

Bu makaleyi paylaş

Projenize Başlayın

Harika bir şey inşa etmeye hazır mısınız?

Vizyonunuzu hayata geçirelim. Fark yaratan yazılımlar için ekibimiz hazır.