Techsy
문의하기
시작하기
블로그로 돌아가기
ai-machine-learning

MTEB 점수 해부: 왜 1위 모델이 최고의 RAG 선택지가 아닐까

작성자 Mert Batur Gürbüz
Jul 13, 2026
8 분 읽기
목차
MTEB 점수 해부: 왜 1위 모델이 최고의 RAG 선택지가 아닐까

MTEB 점수 해부: 왜 1위 모델이 최고의 RAG 선택지가 아닐까

Hugging Face의 MTEB 리더보드에는 5,000개 이상의 임베딩 모델 제출 내역이 등록되어 있으며, 거의 매주 새로운 모델이 최상위권에 진입합니다. 여기서 함정이 있습니다. 그 1위 모델은 실제로 배포하기에 가장 적합한 모델이 아닐 가능성이 높습니다. 당신이 보고 있는 MTEB 점수는 8가지 유형의 태스크 평균값이며, 이 중 단 한 가지 유형만이 문서에 대한 검색 증강 생성(RAG)의 성능을 예측해 줍니다. 우리는 이를 뼈저린 경험을 통해 배웠습니다. 2026년 4월, 당시 순위가 가장 높았던 모델은 우리만의 코퍼스에서 더 저렴한 모델에게 패배했습니다. 이 가이드에서는 숫자가 실제로 의미하는 바, RAG를 위해 신뢰해야 할 열(column), 그리고 리더보드가 최종 판결이 아닌 시작점인 이유를 설명합니다.

핵심 요약

  • MTEB는 다중 태스크 벤치마크입니다. 헤드라인에 나오는 '전체(overall)' 점수는 8가지 태스크 유형을 하나의 평균으로 합친 것입니다.
  • RAG의 경우, 전체 평균이 아닌 검색(Retrieval) 하위 탭(nDCG@10)만이 프로덕션 품질을 예측합니다.
  • 실제 임베딩 모델의 제로샷(zero-shot) nDCG@10 점수는 0.4~0.7 사이입니다. 1.0은 완벽한 순위를 의미합니다.
  • MTEB를 이용해 후보군을 추린 후, 반드시 자체 코퍼스에서 테스트하십시오. 1위 모델은 종종 실제 데이터에서 패배합니다.

MTEB 점수란 무엇인가?

MTEB는 Massive Text Embedding Benchmark의 약자로, 텍스트 임베딩 모델의 점수를 측정하기 위한 오픈 소스 다중 태스크 스위트입니다. MTEB 점수는 8가지 태스크 유형에 걸쳐 계산된 각 태스크별 지표를 하나의 전체 수치로 평균낸 값입니다. 이는 Muennighoff와 동료들이 2022년에 소개했으며(arXiv 2210.07316, EACL 2023에서 발표됨), 이후 표준으로 자리 잡았습니다.

이 벤치마크는 누구나 모델을 제출할 수 있는 공개 Hugging Face 스페이스로 운영됩니다. 대부분의 사람이 인용하는 숫자는 "전체 평균"으로, 검색, 분류, 클러스터링 및 기타 다섯 가지 태스크 군을 하나의 수치로 혼합합니다. 이것이 바로 헤드라인 순위가 오해를 불러일으키는 정확한 이유입니다. 모델은 클러스터링에서 강점을 보이며 평균 점수에서는 승리할 수 있지만, 정작 귀하의 제품이 의존하는 단일 태스크에서는 평범한 성능을 보일 수 있기 때문입니다. 원래 논문은 약 58개의 데이터셋과 112개 언어에 걸쳐 8가지 태스크 유형을 다루고 있습니다.

8가지 MTEB 태스크 카테고리 (및 각 점수가 측정하는 내용)

MTEB는 임베딩 평가를 8가지 태스크 유형으로 그룹화하며, 각각은 다른 지표로 점수가 매겨집니다. 따라서 "높은 MTEB 점수"라는 말은 어떤 태스크를 보고 있는지 알기 전까지는 거의 무의미합니다. 분류(정확도)에서의 0.85점과 검색(nDCG@10)에서의 0.85점은 완전히 다른 능력을 나타냅니다.

다음은 깔끔하게 공개되지 않는 경우가 많은 해석표입니다. 지표는 태스크에 따라 달라집니다.

태스크 카테고리측정 내용지표
검색 (Retrieval)쿼리에 관련된 문서 찾기 (RAG의 핵심)nDCG@10
분류 (Classification)텍스트를 카테고리로 라벨링정확도 (accuracy)
클러스터링 (Clustering)유사한 텍스트 그룹화v-measure
쌍 분류 (Pair Classification)두 텍스트가 일치하는지 여부평균 정밀도 (average precision)
재순위 (Reranking)후보 결과의 순서 재조정MAP
STS (문장 간 의미적 유사성)두 문장의 의미적 유사성 정도스피어만 상관계수
요약 (Summarization)요약 품질 순위 평가스피어만 상관계수
병렬 텍스트 마이닝 (Bitext mining)언어 간 번역 매칭F1

위의 태스크-지표 맵은 MTEB 논문(arXiv 2210.07316)에서 검증된 내용입니다. 여기서 얻어야 할 교훈은 하나입니다. 전체 MTEB 평균에서 상위권을 차지한 모델이라도, 정작 귀하의 제품이 실행되는 단일 태스크에서는 посредственный(평범한) 성능을 보일 수 있다는 점입니다.

RAG에서 실제로 중요한 MTEB 점수는 무엇인가?

RAG의 경우, 전체 평균은 무시하고 nDCG@10으로 점수가 매겨지는 검색(Retrieval) 하위 탭을 확인하십시오. RAG는 문서에 대한 의미론적 검색이며, 이는 정확히 검색 태스크에 해당합니다. STS는 느슨하게 상관관계가 있지만 보조적인 역할만 합니다. 모델이 전체 리더보드에서는 우승하더라도 검색에서는 중위권에 머물 수 있으므로, 프로덕션 품질을 예측하는 것은 검색 열(column)입니다.

왜 전체 혼합 점수가 오해를 불러일으킬까요? 검색 하위 집합은 MS MARCO, Natural Questions, HotpotQA와 같은 일반적인 웹 및 QA 데이터셋으로 구성되어 있습니다. 분류에서 뛰어난 성과를 보이는 모델은 검색 점수가 낮더라도 훌륭한 평균 점수를 기록할 수 있습니다. Hugging Face 리더보드(huggingface.co/spaces/mteb/leaderboard, 2026-07-13 접속)를 열고 무엇을 비교하기 전에 먼저 검색 탭으로 필터링하십시오.

자체 평가를 스크립트로 작성한다면, 코드에서도 동일한 필터링이 적용됩니다.

python
from mteb import MTEB
# keep only Retrieval, the column that matters for RAG
tasks = MTEB(task_types=["Retrieval"]).tasks

검색 열을 확인한 후, 다음 질문은 어떤 모델을 선택할 것인가입니다. 저희 허브 게시글에서는 전체 벤치마크 숫자와 함께 실제로 배포해야 할 임베딩 모델을 선정하는 과정을 안내하며, 벡터를 저장할 곳을 선택하는 경우 2026년 최고의 벡터 데이터베이스 가이드가 도움이 될 것입니다.

nDCG@10 점수는 실제로 무엇을 의미하는가?

nDCG@10은 상위 10개의 검색 결과가 얼마나 잘 순위가 매겨졌는지 측정합니다. 점수가 1.0이면 모든 관련 문서가 최상단에 위치한다는 의미이며, 0이면 그중 어느 것도 상단에 없다는 뜻입니다. 실제 임베딩 모델의 제로샷 점수는 대략 0.4~0.7 사이에 분포하므로, 0.55점은 결함이 아닌 정상적인 수치입니다.

이를 검색창 채점으로 생각해보십시오. LLM은 귀하가 제공하는 상위 몇 개의 청크(chunk)만 읽기 때문에, 정답이 단순히 존재하는지가 아니라 첫 번째로 표시되는지가 중요합니다. 쿼리는 모호한 경우가 많고 관련 문서가 완벽하게 정렬되는 경우는 드물기 때문에 아무도 1.0점에 도달하지 못합니다. 따라서 nDCG@10이 0.55라고 해서 당황하지 마십시오. 이는 정상적이고 배포 가능한 제로샷 점수이며, 0.4~0.7 구간은 (zeroentropy.dev에서 입증된 바와 같이) 물리 법칙이 아닌 전형적인 범위입니다.

MTEB 1위 모델을 우리만의 RAG 코퍼스에서 테스트했다 (그리고 승리지 못했다)

우리는 MTEB 영어 검색 탭에서 1위를 차지한 모델을 가져와, 우리만의 10,000개 문서로 구성된 기술 문서 코퍼스에서 다른 6개 모델과 비교 테스트를 진행했습니다. 점수는 수동으로 라벨링된 약 120개의 쿼리 세트를 기준으로 산출되었습니다. 리더보드 선두 주자는 강력한 Recall@10을 기록했지만, 최종 1위는 아니었으며 두 개의 더 저렴한 옵션이 결정에 영향을 줄 만큼 근접한 점수를 보였습니다. 약 120개의 쿼리만 사용했으므로, 이러한 결과는 리더보드라기보다 방향성을 나타내는 지표로看待해야 합니다.

테스트 기간 동안 MTEB 영어 리더보드 선두는 Gemini Embedding 001이었습니다(2026년 4월 스냅샷 기준). 아래 순위는 Hugging Face MTEB 보드에서 가져온 것이며, 숫자는 스냅샷에 따라 변동되므로 날짜를 명시하여 인용합니다.

모델 (차원)MTEB 영어 순위 (HF, 2026)우리 코퍼스 Recall@10비용
Gemini Embedding 001 (3072)영어 검색 탭 1위0.88~$0.15/M
Voyage-4-large (1024)공개 보드에 게시되지 않음0.89~$0.12/M
Qwen3-Embedding-8B (자체 호스팅)오픈 모델 리더0.87GPU 전용
text-embedding-3-large @1024 (축소)중위권0.83~$0.13/M

리더보드가 알려주지 않은 두 가지 사실이 있습니다. 첫째, 공개 1위(Gemini)는 우리 코퍼스에서는 해당 보드에 게시조차 되지 않은 Voyage-4-large에게 근소한 차이로 밀렸습니다. 둘째, 자체 호스팅 오픈 모델(Qwen3-8B)은 토큰당 비용 없이 근접한 성능을 보였으며, OpenAI의 축소된 1024차원 벡터는 저장 공간을 3배 절약하면서도 0.83의 Recall@10을 유지했습니다. MTEB는 일반적인 웹 및 QA 텍스트에 대한 검색을 순위로 매기지만, 우리 코퍼스는 고유한 방식으로 청킹된 전문 기술 어휘로 구성되어 있어 순서가 뒤바뀝니다. 이것이 바로 자체 데이터로 테스트해야 하는 근본적인 이유입니다. 자체 RAG 코퍼스에서 테스트하는 방법에 대한 우리의 워크스루는 평가 측면을 다루며, 허브 게시글에는 전체 방법론이 실려 있습니다.

왜 리더보드 1위가 최고의 선택이 아닌가

리더보드가 볼 수 없는 세 가지 요소가 실제 승자를 결정합니다. 도메인 어휘(일반 데이터셋에 포함되지 않은 전문 용어), 청크 크기(짧은 구절과 긴 구절은 서로 다른 모델에 유리함), 그리고 쿼리 언어입니다. 이것이 MTEB가 최종 답안이 아닌 후보군 선정 도구인 이유입니다. 순위는 어떤 모델이 타당한지 알려줄 뿐, 어떤 모델이 귀하의 데이터에 적합한지는 알려주지 않습니다.

실무에서 순위를 뒤집는 코퍼스 요인은 다음과 같습니다.

  • 도메인 편이(Domain shift): 법률, 의료 또는 코드베이스 텍스트에는 MS MARCO가 샘플링하지 않은 어휘가 포함되어 있습니다.
  • 청크 크기: 짧은 구절에 맞춰 튜닝된 모델은 800토큰 청크에서 어려움을 겪을 수 있습니다.
  • 쿼리 언어 및 스타일: 다국어 또는 키워드 중심 쿼리는 순서를 빠르게 재편합니다.

우리의 경험상, 신뢰할 수 있는 워크플로는 지루하지만 효과적입니다. MTEB 검색 탭을 사용하여 3~4개의 후보군을 추린 후, 자체 문서에서 Recall@10과 nDCG@10을 측정하십시오. 일반적인 RAG 툴링 요약은 파이프라인 구축에 도움이 되며, 자체 데이터로 모델을 평가하는 구조화된 방법에 대해서는 해당 리뷰가 평가 측면을 다룹니다. 북마크해 둘 만한 두 가지 관련 자료: Ollama로 로컬에서 임베딩 모델 실행하기, 그리고 Voyage vs OpenAI vs Cohere 임베딩의 헤드투헤드 비교입니다.

MTEB 대 MMTEB, 그리고 숫자가 계속 변하는 이유

MMTEB는 MTEB의 다국어 v2 확장 버전입니다(arXiv 2502.13595, v2는 2025년 4월 8일 발표). 이는 250개 이상의 언어에 걸쳐 500개 이상의 커뮤니티 주도 태스크를 추가하며, 장문 문서, 지시 따르기(instruction-following) 및 코드 검색 기능을 포함합니다. RAG가 영어 전용이라면, 여전히 원래의 영어 MTEB 검색 탭을 확인해야 합니다. MMTEB는 쿼리와 문서가 여러 언어에 걸쳐 있을 때 가장 중요합니다.

솔직히 말씀드리면, MTEB 숫자는 스냅샷 간뿐만 아니라 논문 버전 간에도 충돌합니다. 원래 논문은 한 버전에서는 56개 데이터셋을 보고하고 다른 버전에서는 58개를 보고하므로, 단일 수치를 절대적인 기준으로 삼아서는 안 됩니다. 5,000개 이상의 제출 건수가 들어오면서 순위는 끊임없이 재편되므로, 리더보드를 확인할 때는 항상 날짜와 함께 스크린샷을 찍어두십시오. 페이지가 로드되지 않는다면, 이는 귀하의 연결 문제가 아니라 Hugging Face 스페이스가 CPU 업그레이드 과정에서 자주 느려지거나 불안정하기 때문일 수 있습니다.

결론

MTEB는 올바르게 읽을 경우 임베딩 모델 선택을 위한 최고의 공개 시작점입니다. 전체 평균이 아닌 검색 탭을 확인하십시오. nDCG@10이 0.4~0.7인 것을 정상으로 간주하십시오. 리더보드로 후보군을 추린 후, 반드시 자체 코퍼스에서 테스트하십시오. 1위 모델은 실제 데이터(우리의 경우 그랬듯)에서 종종 패배하기 때문입니다. 선택할 준비가 되었다면, 전체 벤치마크와 권장 사항을 위해 임베딩 모델 허브로 돌아가십시오. 그리고 선택한 모델을 프로덕션 파이프라인에 연결하는 것이 실제 과제라면, 그러한 후보군 선정 및 테스트 평가는 우리의 AI 통합 작업의 일부입니다.

저자 소개

Mert Batur Gurbuz는 Techsy.io의 공동 창립자로, 팀은 B2B 고객을 위한 AI 에이전트, 자동화 시스템 및 음성/SDR 파이프라인을 제공합니다. 그는 버밍엄 대학교에서 공부하며, Techsy 팀이 프로덕션에서 실제로 사용하는 LLM 툴링 스택에 대해 글을 씁니다.

LinkedIn에서 연결하세요.

자주 묻는 질문

MTEB란 무엇인가?

MTEB는 Massive Text Embedding Benchmark의 약자로, 검색, 분류, 클러스터링 등 8가지 태스크 유형에서 텍스트 임베딩 모델의 성능을 평가하기 위한 오픈 소스 스위트입니다. Muennighoff와 동료들이 2022년에 소개했으며(arXiv 2210.07316), Hugging Face에서 공개 리더보드 형태로 호스팅됩니다.

MTEB는 무엇의 약자인가?

MTEB는 Massive Text Embedding Benchmark를 의미합니다. 이름이 중요한 이유는 "Massive(대규모)"가 단일 테스트가 아닌 태스크와 데이터셋의 광범위함을指하기 때문입니다. MTEB 점수는 실제로 많은 별도의 평가에 대한 평균값이므로, 전체 숫자가 귀하가关心的인 태스크의 약점을 숨길 수 있습니다.

RAG에서 어떤 MTEB 점수가 중요한가?

RAG의 경우, 전체 평균이 아닌 nDCG@10으로 점수가 매겨지는 검색(Retrieval) 하위 탭을 확인하십시오. RAG는 문서에 대한 의미론적 검색이며, 이는 리더보드가 측정하는 검색 태스크와 정확히 일치합니다. 모델은 강력한 전체 점수를 기록하면서도 검색에서는 중위권에 머물 수 있으므로, 검색이 신뢰할 수 있는 신호입니다.

좋은 MTEB 검색 점수는 얼마인가?

실제 임베딩 모델은 일반적으로 제로샷 nDCG@10에서 0.4~0.7 점을 기록하므로, 이 범위에 속하는 것은 정상적이고 배포 가능합니다. 0.55점은 경고 신호가 아닙니다. 쿼리는 모호하고 관련 문서가 완벽한 순서로 정렬되는 경우는 드물기 때문에 아무도 1.0점에 도달하지 못합니다. 완벽한 1.0점이 아닌 후보군 간 상호 비교를 수행하십시오.

nDCG@10이란 무엇인가?

nDCG@10은 상위 10개의 검색 결과가 얼마나 잘 순위가 매겨졌는지 측정합니다. 점수가 1.0이면 모든 관련 문서가 최상단에 위치한다는 의미이며, 0이면 그중 어느 것도 상단에 없다는 뜻입니다. 이는 최상의 답변을 첫 번째로 배치하는 것에 가중치를 두며, LLM이 검색한 상위 몇 개의 청크만 읽기 때문에 RAG에서 중요합니다.

MTEB와 MMTEB(v1 대 v2)의 차이점은 무엇인가?

MMTEB는 MTEB의 다국어 v2 확장 버전입니다(arXiv 2502.13595, 2025년 4월). 이는 벤치마크를 250개 이상의 언어에 걸쳐 500개 이상의 커뮤니티 주도 태스크로 확장하며, 장문 문서, 지시 및 코드 검색을 추가합니다. RAG가 영어 전용이라면, 원래의 영어 MTEB 검색 탭을 사용하십시오.

왜 MTEB 리더보드는 자주 변경되며(그리고 왜 로드되지 않는가)?

새로운 모델이 끊임없이 제출되고 5,000개 이상의 항목이 증가함에 따라 순위는 지속적으로 재편됩니다. 3월 스냅샷은 7월 스냅샷과 일치하지 않으므로, 항상 날짜와 함께 리더보드를 스크린샷으로 저장하십시오. 페이지가 로드되지 않는다면, Hugging Face 스페이스가 CPU 업그레이드 과정에 있어 자주 느려지거나 불안정하기 때문일 수 있습니다.

MTEB 리더보드에서 1위 모델을 그냥 선택해야 하는가?

아닙니다. 1위 모델은 최종 판결이 아닌 후보군입니다. 리더보드는 귀하의 도메인 어휘, 청크 크기 또는 쿼리 언어를 볼 수 없으며, 이 모든 요소가 어떤 모델이 승리할지 변경합니다. 검색 탭을 사용하여 3~4개의 모델을 후보로 추린 후, 코퍼스에서 테스트하십시오. 우리 테스트에서 공개 리더보드 1위는 해당 보드에 있지도 않은 모델에게 우리 코퍼스에서 근소하게 밀렸으며, 더 저렴한 자체 호스팅 옵션과 비슷한 성능을 보였습니다.

태그

MTEB 점수 해설nDCG@10MTEB 검색RAG 임베딩MMTEB

이 기사 공유하기

관련 글

더 많은 글 보기 ai-machine-learning

ai-machine-learning
Jul 24, 2026

Claude Opus 5 출시: Fable 5에 근접한 지능, 가격은 절반

Anthropic이 2026년 7월 24일 Claude Opus 5를 출시했습니다. Frontier-Bench에서 Opus 4.8을 두 배 이상 앞서면서도 Opus 가격을 유지하지만, 일부 테스트에서는 Fable 5와 Mythos 5에 뒤처집니다. 벤치마크 표, 가격, 전환/대기/유지 판단을 정리했습니다.

10 min read 분 읽기
읽어보기
ai-machine-learning
Jul 20, 2026

2026년 최고의 AI 웹 스크래핑 API 8선 (자체 에이전트 스택으로 직접 테스트)

자체 에이전트 스택으로 실제 2026년 요금을 확인하며 AI 웹 스크래핑 API 8종을 테스트했습니다. Firecrawl, Bright Data, ScrapingBee 외 5종을 LLM 최적화 출력, 안티봇, MCP 지원 기준으로 순위를 매겼습니다.

9 min read 분 읽기
읽어보기
ai-machine-learning
Jul 20, 2026

코딩을 위한 프롬프트 엔지니어링: Claude Code와 Cursor에서 매일 사용하는 7가지 패턴 (2026)

대부분의 'AI 코딩 프롬프트' 글은 복사해서 쓸 수 있는 템플릿 50개를 제시합니다. 이 글은 우리가 16개 에이전트 Claude Code 파이프라인을 운영하는 데 매일 사용하는 7가지 패턴을 가르쳐주며, 각 패턴별 실제 Before/After 예시와 2026년 기준 Claude Code, Cursor, Copilot에서 각 패턴이 어떻게 적용되는지 설명합니다.

11 min read 분 읽기
읽어보기
모든 글 보기
프로젝트 시작하기

새로운 것을 만들 준비가 되었다면 특별함은?

여러분의 비전을 현실로 만들어 보세요. 차이를 만드는 소프트웨어, 우리 팀이 함께 만들겠습니다.

30분 스코핑 미팅 예약프로젝트 보기

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기

법적 고지사항

  • 개인정보 처리방침
  • 서비스 약관
  • 쿠키 정책

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기
법적 고지사항개인정보 처리방침서비스 약관쿠키 정책
TECHSY
© 2026 Techsy. 무단전재 및 재배포 금지.