Techsy
Kontak
Mulai Sekarang
Kembali ke Blog
ai-machine-learning

Skor MTEB Dijelaskan: Mengapa Model Peringkat #1 Bukan Pilihan RAG Terbaik Anda

Ditulis oleh Mert Batur Gürbüz
Jul 13, 2026
10 baca
Daftar Isi
Skor MTEB Dijelaskan: Mengapa Model Peringkat #1 Bukan Pilihan RAG Terbaik Anda

Skor MTEB Dijelaskan: Mengapa Model Peringkat #1 Bukan Pilihan RAG Terbaik Anda

Papan peringkat MTEB dari Hugging Face mencantumkan lebih dari 5.000 kiriman model embedding, dan hampir setiap minggu ada model baru yang menyusup ke posisi teratas. Inilah jebakannya: model peringkat #1 tersebut kemungkinan besar bukan yang seharusnya Anda gunakan dalam produksi. Skor MTEB yang Anda lihat adalah rata-rata dari 8 jenis tugas yang berbeda, dan hanya satu di antaranya yang memprediksi seberapa baik Retrieval-Augmented Generation (RAG) bekerja pada dokumen Anda. Kami mempelajarinya dengan cara yang sulit. Pada April 2026, pilihan terperingkat kami kalah dari model yang lebih murah saat diuji pada korpus kami sendiri. Panduan ini menguraikan apa arti angka-angka tersebut sebenarnya, kolom mana yang dapat dipercaya untuk RAG, dan mengapa papan peringkat hanyalah titik awal, bukan putusan final.

Poin Utama

  • MTEB adalah tolok ukur multi-tugas; skor "keseluruhan" utama menggabungkan 8 jenis tugas menjadi satu rata-rata.
  • Untuk RAG, hanya sub-tab Retrieval (nDCG@10) yang memprediksi kualitas produksi, bukan rata-rata keseluruhan.
  • Model embedding nyata mencetak skor nDCG@10 zero-shot sebesar 0,4–0,7; skor 1,0 berarti pemeringkatan sempurna.
  • Gunakan MTEB untuk membuat daftar pendek, lalu uji pada korpus Anda sendiri. Model peringkat #1 sering kali kalah.

Apa Itu Skor MTEB?

MTEB adalah singkatan dari Massive Text Embedding Benchmark, sebuah suite terbuka dan multi-tugas untuk menilai model embedding teks. Skor MTEB adalah metrik per tugas yang dirata-ratakan menjadi satu angka keseluruhan di seluruh 8 jenis tugas. Ini diperkenalkan oleh Muennighoff dan rekan-rekannya pada tahun 2022 (arXiv 2210.07316, diterbitkan di EACL 2023).

Tolak ukur ini hidup sebagai Ruang Hugging Face publik di mana siapa pun dapat mengirimkan model. Angka yang paling sering dikutip orang adalah "rata-rata keseluruhan", yang menggabungkan pengambilan, klasifikasi, pengelompokan, dan lima keluarga tugas lainnya menjadi satu angka. Itulah tepatnya mengapa peringkat utama menyesatkan: sebuah model bisa memenangkan rata-rata karena kuat dalam pengelompokan sambil hanya biasa-biasa saja dalam satu tugas yang menjadi andalan produk Anda. Makalah aslinya mencakup 8 jenis tugas di sekitar 58 dataset dan 112 bahasa.

8 Kategori Tugas MTEB (dan Apa yang Diukur oleh Setiap Skor)

MTEB mengelompokkan evaluasi embedding ke dalam 8 jenis tugas, dan masing-masing dinilai dengan metrik yang berbeda. Jadi, "skor MTEB tinggi" hampir tidak berarti apa-apa sampai Anda tahu tugas mana yang sedang Anda baca. Skor 0,85 pada klasifikasi (akurasi) dan 0,85 pada pengambilan (nDCG@10) menggambarkan kemampuan yang sepenuhnya berbeda.

Berikut adalah tabel decoder yang tampaknya tidak pernah dipublikasikan dengan rapi. Metriknya berubah sesuai dengan tugas:

Kategori tugasApa yang diujiMetrik
Retrieval (Pengambilan)Menemukan dokumen relevan untuk kueri (ini adalah RAG)nDCG@10
Classification (Klasifikasi)Melabeli teks ke dalam kategoriakurasi
Clustering (Pengelompokan)Mengelompokkan teks yang serupav-measure
Pair Classification (Klasifikasi Berpasangan)Apakah dua teks cocok?average precision
Reranking (Pemeringkatan Ulang)Mengurutkan ulang hasil kandidatMAP
STS (kemiripan teks semantik)Seberapa mirip makna dua kalimatKorelasi Spearman
Summarization (Ringkasan)Memeringkat kualitas ringkasanKorelasi Spearman
Bitext miningMencocokkan terjemahan antar bahasaF1

Peta tugas-ke-metrik di atas diverifikasi dari makalah MTEB (arXiv 2210.07316). Satu hal yang perlu diambil: model yang memimpin rata-rata MTEB keseluruhan masih bisa menjadi biasa-biasa saja dalam satu tugas tunggal yang dijalankan oleh produk Anda.

Skor MTEB Mana yang Sebenarnya Penting untuk RAG?

Untuk RAG, abaikan rata-rata keseluruhan dan baca sub-tab Retrieval, yang dinilai dengan nDCG@10. RAG adalah pencarian semantik atas dokumen Anda, yang persis merupakan tugas pengambilan. STS memiliki korelasi longgar tetapi bersifat sekunder. Sebuah model bisa memenangkan papan peringkat keseluruhan sambil berada di tengah pack pada pengambilan, sehingga kolom pengambilanlah yang memprediksi kualitas produksi.

Mengapa campuran keseluruhan menyesatkan? Subset pengambilan dibangun dari dataset web umum dan Tanya Jawab (QA) seperti MS MARCO, Natural Questions, dan HotpotQA. Model yang bersinar dalam klasifikasi dapat menampilkan rata-rata yang bagus sementara angka pengambilannya menurun. Buka papan peringkat Hugging Face (huggingface.co/spaces/mteb/leaderboard, diakses 2026-07-13) dan filter ke tab retrieval sebelum membandingkan apa pun.

Jika Anda menulis skrip evaluasi sendiri, filter yang sama berlaku dalam kode:

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

Setelah Anda membaca kolom retrieval, pertanyaan berikutnya adalah model mana yang harus dipilih. Postingan hub kami menjabarkan model embedding mana yang sebenarnya harus digunakan dengan angka tolok ukur lengkap, dan jika Anda memilih tempat menyimpan vektor tersebut, panduan kami tentang basis data vektor terbaik di tahun 2026 melengkapinya.

Apa Arti Sebenarnya dari Skor nDCG@10?

nDCG@10 mengukur seberapa baik 10 hasil pengambilan teratas diperingkat. Skor 1,0 berarti setiap dokumen relevan berada di posisi paling atas; 0 berarti tidak ada satupun yang demikian. Model embedding nyata berada di sekitar 0,4–0,7 secara zero-shot, jadi 0,55 adalah normal, bukan rusak.

Anggap saja seperti memberi nilai pada kotak pencarian. Anda peduli apakah jawaban yang tepat muncul pertama, bukan hanya muncul di suatu tempat, karena LLM Anda hanya membaca beberapa potongan teratas yang Anda berikan kepadanya. Tidak ada yang mencapai 1,0, karena kueri bersifat ambigu dan dokumen relevan jarang sejajar dengan sempurna. Jadi, jika nDCG@10 sebesar 0,55 membuat Anda panik, jangan lakukan itu; itu adalah skor zero-shot yang normal dan siap pakai, dan rentang 0,4–0,7 adalah kisaran tipikal (dik corroborated oleh zeroentropy.dev), bukan hukum fisika.

Kami Menguji Model MTEB #1 Melawan Korpus RAG Kami Sendiri (dan Ia Tidak Menang)

Kami mengambil model yang memimpin tab pengambilan bahasa Inggris MTEB dan menjalankannya melawan enam lainnya pada korpus dokumen teknis 10.000 dokumen kami sendiri, dinilai terhadap set ~120 kueri yang dilabeli secara manual. Pemimpin papan peringkat mencetak Recall@10 yang kuat, tetapi ia tidak finish pertama, dan dua opsi yang lebih murah berada cukup dekat untuk mengubah keputusan. Dengan hanya ~120 kueri, anggap ini sebagai indikator arah, bukan papan peringkat resmi.

Pemimpin papan peringkat bahasa Inggris MTEB dalam jendela uji kami adalah Gemini Embedding 001 (memuncaki snapshot Apr 2026); standings di bawah ini berasal dari papan MTEB Hugging Face, dan karena angka berubah berdasarkan snapshot, kami mengutip milik kami dengan tanggal:

Model (dimensi)Posisi MTEB Bahasa Inggris (HF, 2026)Recall@10 Korpus KamiBiaya
Gemini Embedding 001 (3072)Memuncaki tab retrieval bahasa Inggris0,88~$0,15/Juta token
Voyage-4-large (1024)Tidak diposting ke papan publik0,89~$0,12/Juta token
Qwen3-Embedding-8B (self-host)Pemimpin model terbuka0,87Hanya GPU
text-embedding-3-large @1024 (terpotong)Tingkat menengah0,83~$0,13/Juta token

Ada dua hal yang tidak diberitahukan oleh papan peringkat kepada kami. Pertama, peringkat #1 publik (Gemini) dikalahkan pada korpus kami oleh Voyage-4-large, model yang bahkan tidak posting ke papan tersebut. Kedua, model terbuka yang di-host sendiri (Qwen3-8B) berada sangat dekat tanpa biaya per-token, dan vektor 1024-dim terpotongan dari OpenAI mempertahankan Recall@10 sebesar 0,83 dengan penyimpanan 3x lebih kecil. MTEB memeringkat pengambilan pada teks web umum dan QA; korpus kami adalah kosakata teknis khusus yang dipotong dengan caranya sendiri, sehingga urutannya berubah. Itulah seluruh argumen untuk melakukan pengujian pada data Anda sendiri. Panduan langkah demi langkah kami tentang cara menguji pada korpus RAG Anda sendiri mencakup sisi evaluasi, dan postingan hub membawa metodologi lengkap.

Mengapa Peringkat #1 di Papan Peringkat Bukan Pilihan Terbaik Anda

Tiga hal yang tidak dapat dilihat oleh papan peringkat menentukan pemenang nyata Anda: kosakata domain (jargon yang tidak pernah terkandung dalam dataset umum), ukuran potongan (passage pendek versus panjang mendukung model yang berbeda), dan bahasa kueri. Itulah mengapa MTEB adalah alat penyusun daftar pendek, bukan jawaban final. Peringkat tersebut memberitahu Anda model mana yang masuk akal, bukan model mana yang cocok dengan data Anda.

Berikut adalah faktor-faktor korpus yang membalikkan peringkat dalam praktik:

  • Pergeseran domain: teks hukum, medis, atau basis kode membawa kosakata yang tidak pernah disampel oleh MS MARCO.
  • Ukuran potongan: model yang disetel pada passage pendek bisa gagal pada potongan 800 token.
  • Bahasa dan gaya kueri: kueri multibahasa atau yang berat kata kunci mengacak urutan dengan cepat.

Dalam pengalaman kami, alur kerja yang andal memang membosankan tetapi berhasil: gunakan tab retrieval MTEB untuk membuat daftar pendek 3–4 kandidat, lalu ukur Recall@10 dan nDCG@10 pada dokumen Anda sendiri. Ringkasan kami tentang peralatan RAG umum membantu dengan pipeline, dan untuk cara terstruktur untuk mengevaluasi model pada data Anda sendiri, ulasan tersebut mencakup sisi evaluasi. Dua bacaan terkait yang layak disimpan: menjalankan model embedding secara lokal dengan Ollama, dan head-to-head antara embedding Voyage vs OpenAI vs Cohere.

MTEB vs MMTEB, dan Mengapa Angkanya Terus Berubah

MMTEB adalah ekspansi multibahasa v2 dari MTEB (arXiv 2502.13595, v2 diterbitkan 8 April 2025). Ini menambahkan 500+ tugas berbasis komunitas di lebih dari 250 bahasa, plus pengambilan dokumen panjang, pengikuti instruksi, dan kode. Jika RAG Anda hanya berbahasa Inggris, tab retrieval MTEB bahasa Inggris asli tetap menjadi yang harus dibaca. MMTEB paling penting ketika kueri dan dokumen Anda mencakup banyak bahasa.

Ini bagian jujuarnya. Angka MTEB bertentangan lintas snapshot dan bahkan lintas versi makalah: makalah asli melaporkan 56 dataset dalam satu versi dan 58 dalam versi lain, jadi jangan pernah menganggap satu angka sebagai kanonik. Peringkat terus berubah seiring masuknya 5.000+ kiriman, jadi selalu ambil tangkapan layar papan peringkat dengan tanggal Anda membacanya. Dan jika halaman tidak dimuat, Ruang Hugging Face berjalan pada upgrade CPU dan sering kali lambat atau tidak stabil, bukan koneksi Anda.

Intisari

MTEB adalah titik awal publik terbaik untuk memilih model embedding, sekali Anda membacanya dengan benar. Baca tab retrieval, bukan rata-rata keseluruhan. Anggap nDCG@10 sebesar 0,4–0,7 sebagai hal yang normal. Buat daftar pendek dengan papan peringkat, lalu uji daftar pendek tersebut pada korpus Anda sendiri, karena model peringkat #1 sering kalah pada data nyata (milik kami juga demikian). Ketika Anda siap memilih, kembali ke hub model embedding kami untuk tolok ukur lengkap dan rekomendasi. Dan jika pekerjaan sesungguhnya adalah menghubungkan model yang Anda pilih ke dalam pipeline produksi, evaluasi daftar pendek-lalu-uji tersebut adalah bagian dari pekerjaan integrasi AI kami.

Tentang Penulis

Mert Batur Gurbuz adalah Co-Founder Techsy.io, di mana timnya mengirimkan agen AI, sistem otomasi, dan pipeline voice/SDR untuk klien B2B. Ia belajar di University of Birmingham dan menulis tentang tumpukan alat LLM yang benar-benar digunakan oleh tim Techsy dalam produksi.

Terhubung di LinkedIn.

Pertanyaan yang Sering Diajukan

Apa itu MTEB?

MTEB adalah Massive Text Embedding Benchmark, sebuah suite terbuka untuk menilai seberapa baik model embedding teks berkinerja di seluruh 8 jenis tugas, termasuk pengambilan, klasifikasi, dan pengelompokan. Diperkenalkan oleh Muennighoff dan rekan-rekannya pada tahun 2022 (arXiv 2210.07316), ini dihosting sebagai papan peringkat publik di Hugging Face.

Apa kepanjangan MTEB?

MTEB adalah singkatan dari Massive Text Embedding Benchmark. Nama ini penting karena "massive" mengacu pada luasnya tugas dan dataset, bukan satu tes tunggal. Skor MTEB Anda sebenarnya adalah rata-rata di banyak evaluasi terpisah, itulah sebabnya angka keseluruhan dapat menyembunyikan kelemahan pada tugas yang Anda pedulikan.

Skor MTEB mana yang penting untuk RAG?

Untuk RAG, baca sub-tab Retrieval, yang dinilai dengan nDCG@10, bukan rata-rata keseluruhan. RAG adalah pencarian semantik atas dokumen Anda, yang persis merupakan tugas pengambilan yang diukur oleh papan peringkat. Sebuah model dapat menampilkan skor keseluruhan yang kuat sambil berada di tengah pack pada pengambilan, sehingga retrieval adalah sinyal yang andal.

Berapa skor retrieval MTEB yang baik?

Model embedding nyata biasanya mencetak skor nDCG@10 zero-shot sebesar 0,4–0,7, jadi apa pun dalam rentang itu adalah normal dan siap pakai. Skor 0,55 bukanlah bendera merah. Tidak ada yang mencapai 1,0, karena kueri bersifat ambigu dan dokumen relevan jarang sejajar dalam urutan sempurna. Bandingkan kandidat satu sama lain, bukan terhadap 1,0 yang sempurna.

Apa itu nDCG@10?

nDCG@10 mengukur seberapa baik 10 hasil pengambilan teratas diperingkat. Skor 1,0 berarti setiap dokumen relevan berada di posisi paling atas; 0 berarti tidak ada satupun. Ini memberi hadiah untuk menempatkan jawaban terbaik pertama, yang penting untuk RAG karena LLM Anda hanya membaca beberapa potongan teratas yang Anda ambil.

Apa perbedaan antara MTEB dan MMTEB (v1 vs v2)?

MMTEB adalah ekspansi multibahasa v2 dari MTEB (arXiv 2502.13595, April 2025). Ini mengembangkan tolok ukur menjadi 500+ tugas berbasis komunitas di lebih dari 250 bahasa dan menambahkan pengambilan dokumen panjang, instruksi, dan kode. Jika RAG Anda hanya berbahasa Inggris, tetap gunakan tab retrieval MTEB bahasa Inggris asli.

Mengapa papan peringkat MTEB berubah begitu sering (dan mengapa tidak mau dimuat)?

Peringkat terus berubah karena model baru dikirimkan sepanjang waktu, dengan 5.000+ entri dan terus bertambah. Snapshot Maret tidak akan cocok dengan Juli, jadi selalu ambil tangkapan layar papan peringkat dengan tanggalnya. Jika halaman tidak dimuat, Ruang Hugging Face berjalan pada upgrade CPU dan sering kali lambat atau tidak stabil.

Haruskah saya hanya memilih model #1 di papan peringkat MTEB?

Tidak. Model #1 adalah kandidat daftar pendek, bukan putusan final. Papan peringkat tidak dapat melihat kosakata domain, ukuran potongan, atau bahasa kueri Anda, yang semuanya mengubah model mana yang menang. Gunakan tab retrieval untuk membuat daftar pendek 3–4 model, lalu uji pada korpus Anda. Dalam uji kami, peringkat #1 papan peringkat publik dikalahkan pada korpus kami sendiri oleh model yang bahkan tidak ada di papan tersebut, dan diseimbangi oleh opsi self-hosted yang lebih murah.

Tag

penjelasan skor MTEBnDCG@10pengambilan MTEBembedding RAGMMTEB

Bagikan artikel ini

Artikel Terkait

Lebih lanjut di ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 Resmi Hadir: Kecerdasan Setara Fable 5 dengan Harga Separuhnya

Anthropic merilis Claude Opus 5 pada 24 Juli 2026. Model ini menggandakan skor Opus 4.8 di Frontier-Bench dan mempertahankan harga Opus, tetapi kalah di beberapa uji dari Fable 5 dan Mythos 5. Berikut tabel benchmark, harga, dan rekomendasi ganti/tunggu/tetap.

10 min read baca
Baca
ai-machine-learning
Jul 20, 2026

8 API Web Scraping AI Terbaik 2026 (Diuji di Stack Agent Kami Sendiri)

Kami menguji 8 API web scraping AI dengan harga asli 2026 yang ditarik lewat stack agent kami sendiri. Firecrawl, Bright Data, ScrapingBee dan 5 lainnya, diranking untuk output siap-LLM, anti-bot, dan dukungan MCP.

9 min read baca
Baca
ai-machine-learning
Jul 20, 2026

Prompt Engineering untuk Coding: 7 Pola yang Kami Gunakan Setiap Hari di Claude Code dan Cursor (2026)

Sebagian besar artikel 'prompt coding AI' hanya memberi Anda 50 templat untuk disalin. Artikel ini mengajarkan 7 pola yang kami gunakan setiap hari untuk menjalankan pipeline Claude Code dengan 16 agen, lengkap dengan contoh sebelum dan sesudah yang nyata, serta penjelasan di mana setiap pola diterapkan di Claude Code, Cursor, dan Copilot pada tahun 2026.

11 min read baca
Baca
Lihat Semua Postingan
Mulai Proyek Anda

Siap membangun sesuatu lu biasa?

Mari wujudkan visi Anda menjadi kenyataan. Tim kami siap membantu Anda menciptakan software yang benar-benar berdampak.

Jadwalkan panggilan scoping 30 menitLihat Karya Kami

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Terbaru dari library

Skill Claude

Lihat semua
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

Otomatisasi AI

Lihat semua
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak

Hukum

  • Kebijakan Privasi
  • Syarat Layanan
  • Kebijakan Kuki

Layanan

  • Solusi Enterprise
  • Aplikasi Mobile
  • Aplikasi Web

Solusi

  • Sistem CRM
  • Integrasi AI
  • Solusi ERP
  • Agen Suara
  • Otomasi Proses
  • Keamanan Siber

Perpustakaan

  • Blog
  • Portofolio

Komunitas

  • Otomatisasi AI
  • Skill Claude

Alat

  • Kalkulator Biaya Aplikasi Mobile
  • Kalkulator Biaya API OpenAI / LLM
  • Kalkulator Biaya MVP
  • Kalkulator Biaya Voice AI Agent

Perusahaan

  • Tentang
  • Mitra
  • Kontak
HukumKebijakan PrivasiSyarat LayananKebijakan Kuki
TECHSY
© 2026 Techsy. Seluruh hak cipta dilindungi.