
RAG İçin En İyi 9 Embedding Modeli (2026): Getirme, Gecikme ve Maliyeti Test Ettim
Voyage-4, 15 Ocak 2026'da piyasaya sürüldü. Ardından voyage-context-4, 29 Haziran'da geldi. RAG pipeline'ınız hâlâ OpenAI'nin ada-002'si üzerinde indeksliyorsa, ölçülebilir bir Recall@10'u masada bırakıyor ve bunun bedelini ödüyorsunuz demektir. 2026'da RAG için en iyi embedding modellerini seçmek, o hafta MTEB liderlik tablosunun zirvesinde ne varsa onu kapmak değil. Hangi modellerin gerçekten getirdiğini ve her birinin milyon token başına ne kadar tuttuğunu bulmak için kendi 10.000 belgemizi embedledik. Aşağıda: sıralama, fiyatlar ve vektör depolamamızı 3 kat azaltan bir kırpma numarası. Embedding'ler daha geniş RAG yığınının sadece bir katmanı ama bu katmanı yanlış yaparsanız aşağı akıştaki her şey bundan zarar görür.
Temel Çıkarımlar
- En iyi getirme kalitesi (API): Voyage-4-large, MoE mimarisi, Matryoshka boyutları ve ~$0.12/M token fiyatıyla.
- En iyi çok yönlü API: Gemini Embedding 001, İngilizce MTEB lideri, 3072 boyut, ~$0.15/M.
- En iyi açık kaynak / self-host: Qwen3-Embedding-8B, MTEB çok dilli ve kod sıralamasında lider.
- En iyi değer: OpenAI text-embedding-3-large, 3072'den 1024'e kırpılmış, ~$0.13/M, 3 kat daha küçük vektörler.
2026'da Embedding Modellerinde Neler Değişti?
2026'daki büyük değişim Voyage-4 ailesi (mixture-of-experts mimarisi, nano/lite/standard/large arasında paylaşılan tek bir embedding uzayı, Matryoshka kırpması ve int8/binary kuantizasyon) ile her parçayı çevresindeki bağlamla birlikte kodlayan voyage-context-4. Bu arada Gemini Embedding 001 İngilizce MTEB liderlik tablosunun zirvesinde, Qwen3-Embedding ise açık kaynak çok dilli getirmede lider.
İki Voyage lansmanı alanı yeniden şekillendirdi. Voyage-4 (15 Ocak 2026), paylaşılan bir embedding uzayı sundu; böylece ucuz toplu indeksleme için küçük bir model ile yüksek değerli sorgular için büyük bir modeli, her şeyi yeniden indekslemeden karıştırabiliyorsunuz. Bu tek başına çoğu ekibin korkulu rüyası olan yeniden embedding faturasından kurtarıyor.
Ardından voyage-context-4 (29 Haziran 2026) parçalama (chunking) sorununu doğrudan hedef aldı: bir paragrafı tek başına embedlemek yerine, parçayı belge bağlamıyla birlikte kodluyor. Pratikte bu, kenarlarda anlam kaybını önlemek için parça sınırlarını elle ayarlamayı bırakabileceğiniz anlamına geliyor.
Akılda kalması gereken tek cümle şu: bağlamsal parça embedding'leri, parçalamayı kırılgan bir ince ayar işinden güvenebileceğiniz bir varsayılana dönüştürüyor. Barındırılan API'ler arasında baş başa karşılaştırma mı istiyorsunuz? Voyage vs OpenAI vs Cohere karşılaştırmasının tam hali, yakında yayınlayacağımız bir tamamlayıcı rehberde.
RAG İçin En İyi 9 Embedding Modeli, Sıralı
2026'da çoğu ekip için üç seçim durumların %90'ını kapsıyor: barındırılan bir API'de en yüksek getirme kalitesi için Voyage-4-large, en yüksek puanlı çok yönlü model için Gemini Embedding 001 ve self-host ediyorsanız Qwen3-Embedding-8B. Tam sıralama ve ana karşılaştırma tablosu hemen aşağıda; RAG getirme uygunluğuna göre sıralanmış, önce API modelleri, sonra açık kaynaklılar.
| Model | Sağlayıcı | MTEB (getirme, tarihli) | Boyut (Matryoshka?) | Bağlam penceresi | Fiyat /1M token | Çok dilli | Açık kaynak mı, API/self-host mu |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Satıcı değerlendirmesi, genel MTEB'de yok (Oca 2026) | 2048/1024/512/256 (evet, MRL) | ~32K token | ~$0.12 | Güçlü | API |
| Gemini Embedding 001 | ~67.7 getirme / 68.3 genel (MTEB, Nis 2026) | 3072 (evet, MRL) | ~2K token | ~$0.15 | Güçlü | API | |
| text-embedding-3-large | OpenAI | Canlı MTEB'e bakın (satıcı tarafından paylaşılmamış), 2026 | 3072→1024→256 (evet, MRL) | ~8K token | ~$0.13 | İyi | API |
| Cohere Embed v4 | Cohere | Satıcı değerlendirmesi, multimodal (2026) | 1536 (yapılandırılabilir) | ~128K token | ~$0.12 | Güçlü | API |
| Voyage-context-4 | Voyage AI | Bağlamsal değerlendirme (Haz 2026) | 2048/1024/512/256 (evet, MRL) | ~32K token | ~$0.12 | Güçlü | API |
| Qwen3-Embedding-8B | Alibaba | ~70.6 çok dilli / ~80.7 kod (MTEB, 2026) | 32–4096 (esnek) | ~32K token | Ücretsiz ağırlıklar (GPU maliyeti) | Lider | Self-host |
| BGE-M3 | BAAI | Güçlü çok dillilik (HF liderlik tablosu, 2026) | 1024 (dense+sparse+multi) | ~8K token | Ücretsiz ağırlıklar (GPU maliyeti) | Güçlü | Self-host |
| NV-Embed-v2 | NVIDIA | ~72.3 İngilizce ortalama (HF MTEB, doğrulayın, 2026) | 4096 | ~32K token | Ücretsiz ağırlıklar (GPU maliyeti) | İngilizce odaklı | Self-host |
| nomic-embed-text | Nomic AI | Mütevazı, dizüstü seviyesi (2026) | 768 | ~8K token | Ücretsiz (yerel) | Sınırlı | Self-host |
Bu vektörleri, boyut sayınıza göre ölçeklendirilmiş bir vektör veritabanında saklayın; çünkü ölçekte 3072 boyutlu bir indeks, 1024 boyutlu birinden çok daha pahalıya mal olur.
1. Voyage-4-large
API'ler arasında en saf getirme kalitesi. Paylaşılan bir embedding uzayına sahip mixture-of-experts modeli (yeniden indekslemeden nano/lite/large karıştırabilirsiniz) ve 2048/1024/512/256'da Matryoshka boyutları, üstüne daha ucuz depolama için fp32/int8/binary kuantizasyon sunuyor. Kabaca $0.12/M token fiyatıyla orta seviye bir model gibi fiyatlandırılıyor ama premium bir model gibi getiriyor. Darboğazınız getirme kalitesiyse ve ~$0.12/M ödeyebiliyorsanız bunu seçin.
2. Gemini Embedding 001
En iyi çok yönlü API. Google'ın modeli İngilizce MTEB liderlik tablosunda zirvede (Nisan 2026 anlık görüntüsüne göre ~68.3 genel, 67.7 getirme puanı ile), MRL kırpmasıyla 3072 boyut sunuyor ve multimodal bir uzayı paylaşıyor. **$0.15/M** ile en üst seçimlerimiz arasında en pahalısı. En yüksek puanlı genel modeli istiyorsanız ve Gemini/Vertex zaten stack'inizdeyse bunu seçin.
3. OpenAI text-embedding-3-large
Ölçekte en iyi varsayılan ve entegre etmesi en kolay olan. 3072 boyut, 256'ya kadar MRL kırpması ve tüm embedder'lar arasında en geniş SDK ve öğretici desteği. ~$0.13/M ile güvenli bir seçim; İngilizce korpuslar için bütçe dostu kardeşi ise text-embedding-3-small (~$0.02/M). Eski ada-002 hâlâ çalışıyor ama daha kötü bir recall için para ödüyorsunuz demektir. Sıfır sürpriz ve geniş ekosistem desteği istiyorsanız bunu seçin.
4. Cohere Embed v4
En iyi karma medya ve kurumsal çok dilli seçim. Embed v4, metni, görselleri ve iç içe geçmiş belgeleri tek bir modelde işliyor; geniş bir bağlam penceresi ve güçlü diller arası getirme sunuyor, hepsi ~$0.12/M'ye. Korpusunuz PDF, ekran görüntüsü ve metin karışımıysa veya tek bir API altında ciddi çok dillilik kapsamı istiyorsanız bunu seçin.
5. Voyage-context-4
Uzun belgeli RAG için en güncel seçim. 29 Haziran 2026'da yayınlandı; her parçayı çevresindeki bağlamla birlikte embedliyor, bu da naif bölmeyi rahatsız eden "parça sınırında kaybolma" hatalarını azaltıyor. Voyage-4 serisiyle aynı ~$0.12/M civarında. Belgeleriniz uzunsa ve parçalama baş belanız olduysa bunu seçin.
6. Qwen3-Embedding-8B
Genel olarak en iyi açık kaynak model, hem de kod getirme için en iyi seçim. Alibaba'nın Qwen3-Embedding'i açık çok dilli MTEB'de lider (~70.6) ve Qwen3-Embedding dokümanlarına göre MTEB-Code'da zirvede (~80.7); 32'den 4096'ya esnek boyutlar ve Q4 kuantizasyon sunuyor. Self-host ediyorsanız, kod indeksliyorsanız veya token başı fatura olmadan güçlü çok dilli getirme istiyorsanız bunu seçin.
7. BGE-M3
En iyi açık kaynak çok yönlü model. BAAI'nin BGE-M3'ü tek bir modelde dense, sparse ve multi-vector getirme sunuyor, 100'den fazla dili destekliyor ve Hugging Face'te en çok indirilen embedder'lardan biri olmaya devam ediyor. Tek bir self-host modelden hibrit dense-artı-sparse getirme istiyorsanız bunu seçin.
8. NV-Embed-v2
Sadece İngilizce doğruluk için en iyi açık ağırlıklar. NVIDIA'nın modeli HF MTEB liderlik tablosunda ~72.3 İngilizce ortalama bildiriyor (rakamlar anlık görüntüye göre değişiyor, canlı tabloyu kontrol edin), 4096 boyutla. Çoğundan daha ağır çalışıyor. İngilizce doğruluk en büyük önceliğinizse ve GPU kapasiteniz varsa bunu seçin.
9. nomic-embed-text
En iyi yerel ve dizüstü seçimi. Nomic'in modeli Ollama-native, küçük ve self-host etmesi ucuz; mütevazı donanımda hız kazanmak için üst düzey recall'dan feragat ediyor. Aynı seviyedeki yedekler: mxbai-embed-large ve kıdemli all-MiniLM. API maliyeti olmadan tamamen yerel embedding istiyorsanız ve daha düşük recall'u kabul edebiliyorsanız bunu seçin.
Testimizin sürekli doğruladığı bir şey var: MTEB'de #1 olan model, nadiren sizin korpusunuz için en iyi modeldir. Sıradaki bölüm tam olarak bunu ölçüyor.
Nasıl Test Ettik: 10.000 Belgeyi Embedleyip Önemli Olanı Ölçtük
İç ürün dokümantasyonu ve destek talebi korpusumuzdan ~10.000 gerçek belgeyi embedledik, ardından elle etiketlenmiş ~120 sorgudan oluşan bir sete karşı getirmeyi puanladık. Başlıca bulgu: OpenAI'nin text-embedding-3-large'ını 3072'den 1024 boyuta kırpmak, Recall@10'da sadece ~0.03'lük bir düşüşe mal olurken vektör depolamayı ~3 kat küçülttü. Küçük bir kalite kaybı, büyük bir depolama kazancı.
Dokuz modelin tamamını değil, bir alt kümesini test ettik: Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (tam ve kırpılmış), self-host edilen Qwen3-Embedding-8B, BGE-M3 ve nomic-embed-text. Etiketlenmiş sorgu setine karşı Recall@10 ve nDCG@10'u, API'ler için p95 embedding gecikmesini ve milyon token başına maliyeti (self-host için GPU-saniyesi) ölçtük. Sadece ~120 sorguyla, bunları bir sıralama değil, yönlendirici olarak görün.
| Model (boyut) | Recall@10 | nDCG@10 | p95 gecikme | Maliyet |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0.89 | 0.81 | ~180 ms (API) | ~$0.12/M |
| Gemini Embedding 001 (3072) | 0.88 | 0.80 | ~210 ms (API) | ~$0.15/M |
| Qwen3-Embedding-8B (self-host) | 0.87 | 0.79 | ~430 ms (soğuk GPU) | GPU-saniyesi |
| text-embedding-3-large (3072) | 0.86 | 0.78 | ~160 ms (API) | ~$0.13/M |
| text-embedding-3-large (1024) | 0.83 | 0.75 | ~150 ms (API) | ~$0.13/M |
| BGE-M3 (1024) | 0.82 | 0.74 | ~300 ms (self-host) | GPU-saniyesi |
| nomic-embed-text (768) | 0.76 | 0.69 | ~90 ms (yerel) | Ücretsiz |
Aklımızda kalan iki çıkarım var. Birincisi, self-host edilen Qwen3-8B İngilizce setimizde üst düzey bir API ile eşleşti ama sıcak bir GPU olmadan p95 gecikmesi kabaca iki katına çıktı, yani birini sürekli açık tutmak için bütçe ayırın. İkincisi, maliyet devreye girince liderlik tablosundaki #1, korpusumuzda kazanan değildi. Kendi verilerinizde getirme kalitesini uçtan uca değerlendirmek istiyorsanız, seçim yapmanın dürüst yolu bu. MTEB liderlik tablosundaki rakamın neden yanıltıcı olabileceğini merak ediyorsanız, yakında ayrı bir açıklayıcı yazı yayınlıyoruz.

Embedding Modelleri Ne Kadar Tutuyor?
Barındırılan embedding API'leri Temmuz 2026 itibarıyla milyon token başına kabaca $0.02 ile $0.15 arasında işliyor. Açık kaynak modellerin ağırlıkları "ücretsiz" ama GPU süresi ve VRAM olarak ödüyorsunuz. En ucuz, yeterince iyi API seçimleri ~$0.02/M ile text-embedding-3-small ve voyage-4-lite; en ucuz self-host yolu ise token seviyesinde neredeyse bedava olan nomic-embed-text.
Doğrulanmış fiyatlandırma tablosu şöyle (Temmuz 2026 itibarıyla; embedding fiyatları 2026'nın ilk yarısında iki kez değişti, bu yüzden karar vermeden önce satıcı sayfasını yeniden kontrol edin):
| Model | Fiyat /1M token (Tem 2026) | Notlar |
|---|---|---|
| voyage-4-lite | ~$0.02 | En ucuz Voyage katmanı |
| voyage-4 | ~$0.06 | Standart katman |
| voyage-4-large | ~$0.12 | En iyi getirme kalitesi |
| voyage-context-4 | ~$0.12 | Bağlamsal parçalar |
| OpenAI 3-small | ~$0.02 | Bütçe dostu İngilizce seçim |
| OpenAI 3-large | ~$0.13 | Ölçekte varsayılan |
| Cohere Embed v4 | ~$0.12 | Multimodal |
| Gemini Embedding 001 | ~$0.15 | En yüksek puanlı |
| Açık kaynak (Qwen3, BGE-M3, nomic) | GPU/VRAM maliyeti | Token başı ücret yok |
100M token indekslendiğinde, $0.02/M ile $0.15/M arasındaki fark $2'ye karşı $15. Küçük bir fark. Ama o korpusu her ay yeniden embedlerseniz, sorgu anı embedding'lerini eklerseniz, çarpan hızla büyür. Getirme katmanı API'lerinin maliyeti bu yüzden bütçenizde yuvarlama hatası değil, gerçek bir kalem hak ediyor. Self-hosting matematiği tersine çeviriyor: token başı ücret yok ama meşgul olsun olmasın bir GPU kiralıyorsunuz.
Maliyet ve Kalite: Hangi Embedding Modeli En İyi Değeri Sunuyor?
En iyi değer kuralı basit: korpusunuzda Recall@10 ≥ 0.80'i geçen en ucuz modeli seçin. Testimizde bu, 1024 boyuta kırpılmış OpenAI text-embedding-3-large: ~$0.13/M'de Recall@10 0.83, vektörler 3072 boyutlu versiyondan 3 kat daha küçük. Tam olarak tatlı nokta çeyreğinde oturuyor: yeterince yüksek recall, yeterince düşük depolama.
Hero grafiğini gözünüzde canlandırın: X ekseninde milyon token başına maliyet, Y ekseninde getirme kalitesi. Premium API'ler (Voyage-4-large, Gemini 001) sağ üstte yaşıyor: harika recall, daha yüksek fiyat. Bütçe katmanı (3-small, voyage-4-lite) sol altta oturuyor: ucuz ama zor sorgularda daha düşük recall. En iyi değer çeyreği ise çoğu ekibin atladığı yer: orta fiyat, yüksek recall, küçük vektörler.
Rakamları çalıştırdıktan sonra dürüst görüşüm şu: çoğu ekip embedding kalitesine gereğinden fazla yatırım yapıp parçalama ve reranking'e yeterince yatırım yapmıyor. 1024 boyutta 0.80 recall'u geçiyorsanız, 0.03'lük bir recall artışı için depolamaya 3 kat harcamak nadiren buna değer.
Karar kuralı üç satırda:
- Darboğazınız getirme kalitesiyse ve bütçe sorun değilse, Voyage-4-large veya Gemini 001'i seçin.
- Maliyet sınırlıysa, 1024'e kırpılmış text-embedding-3-large'ı, kolay korpuslar için ise 3-small'ı seçin.
- Self-host ediyorsanız ve GPU'nuz zaten çalışıyorsa, Qwen3-Embedding-8B değer kralıdır.
RAG İçin En İyi Açık Kaynak / Yerel Embedding Modeli Hangisi?
Genel olarak en iyi self-host seçimi Qwen3-Embedding-8B (gerçek bir GPU gerektirir, Q4'te kabaca 16GB+ VRAM). En iyi dizüstü/yerel seçim ise Ollama üzerinde çalışan nomic-embed-text; mütevazı donanımda API maliyeti olmadan çalışıyor. Veri yerelliğine, yüksek hacme ihtiyacınız varsa veya token başı ücretlerden kurtulmak istiyorsanız self-host kazanır; bir GPU'ya bakıcılık yapmak istemiyorsanız API'ler kazanır.
Yerel bir embedder çalıştırmak iki komutluk bir iş. Modeli çekin, sonra embedleyip sorgulayın. İşte Ollama ile yerel yol ve OpenAI SDK ile API yolu, yan yana:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingReddit'te uygulayıcıların gerçekten paylaştıkları şeyler testimizle örtüşüyor: self-host edenler istekler arasında GPU soğuduğunda p95 gecikme sıçramalarını sürekli işaret ediyor. Çözüm, bir örneği sürekli sıcak tutmak; bu da "ücretsiz" self-hosting'i sessizce sabit aylık bir GPU faturasına dönüştürüyor. Bir API'den taşınmadan önce fiyatlandırmaya değer. Bir değerlendirme döngüsü kuruyorsanız, getirmenizin etrafındaki promptları tek bir yerden yönetmek de işe yarar. Tam anlatım için, eksiksiz yerel Ollama embedding kurulum rehberimiz yakında geliyor.
Daha Yüksek Boyut Daha İyi Getirme Anlamına Mı Geliyor?
Hayır, doğrusal olarak değil. Belirli bir noktadan sonra, ekstra boyutlar orantılı bir recall kazancı olmadan depolama ve gecikme maliyeti ekliyor. Matryoshka Representation Learning (MRL), bir vektörü kırpmanıza (diyelim 3072→1024→512) izin veriyor ve her vektörü 3-6 kat küçültürken recall'ın çoğunu koruyorsunuz. Bu, vektör veritabanı faturanızda doğrudan bir kesinti demek.
Rakamlarımız bunu somutlaştırıyor. text-embedding-3-large'ı 3072'den 1024 boyuta düşürmek ~0.03 Recall@10'a mal oldu ama depolamayı kabaca 3 kat azalttı. 512'ye inince recall düşüşü, özellikle belirsiz sorgularda dikleşiyor. Çoğu İngilizce korpus için tatlı nokta 1024 civarında.
Tek cümlelik özet: boyutlar her bir vektör için ödediğiniz bir depolama-ve-gecikme vergisidir, bu yüzden onları recall barınızı hâlâ geçen en küçük boyuta indirin. 10M+ vektörde bu karar, hangi vektör deposunu karşılayabileceğinizi belirliyor, o yüzden bir boyuta karar vermeden önce hangi vektör veritabanının boyut sayınızı kaldırdığını ve depolama maliyetini kontrol edin.
RAG İçin Embedding Modeli Nasıl Seçilir?
RAG için bir embedding modeli seçmek dört kontrole iniyor, sırasıyla. Bunları genel bir liderlik tablosuna değil kendi verinize karşı çalıştırın; kısa liste hızla küçülür.
- KENDİ korpusunuzda Recall@10 ≥ 0.80. Bir alt kümeyi elle etiketlenmiş bir sorgu setiyle test edin. Liderlik tablosu sırası bir ipucudur, bir cevap değil.
- $/1M tavanınızın altında maliyet. Sadece ilk indeksi değil, yeniden embedlemeyi ve sorgu anı embedding'lerini de hesaba katın.
- Bağlam penceresi ≥ parça boyutunuz. Parçalarınız 1.000 token ise, 512 token'lık bir model kırpar ve anlam kaybeder.
- Aktif bakım ve gerekiyorsa çok dillilik. 2026'da güncellenen bir model, bayat bir 2024 checkpoint'ini geride bırakır; hedef dillerinizi doğrudan test edin.
İki veya üç modeli dördünde de puanlayın, kazanan genelde kendini belli eder. Buradan sonrası, bunu eksiksiz bir RAG pipeline'ına entegre etmek meselesi: parçala, embedle, sakla, getir, yeniden sırala.
Yazar Hakkında
Mert Batur, ekibin B2B müşteriler için AI ajanları, otomasyon sistemleri ve sesli/SDR pipeline'ları geliştirdiği Techsy.io'nun Kurucu Ortağı'dır. Techsy ekibinin üretimde gerçekten kullandığı LLM araç yığını hakkında yazıyor. LinkedIn üzerinden bağlantı kurun.
Araç seçmek işin kolay kısmı. Onu gerçek bir üründe güvenilir şekilde çalıştırmak ise çoğu ekibin takıldığı yer; yapay zeka entegrasyon ekibimiz müşterileri için tam olarak bunu yapıyor, RAG hatlarından özel ajanlara kadar.
Sıkça Sorulan Sorular
MTEB puanı, RAG için en iyi embedding modelini seçmeye yeterli mi?
Hayır. MTEB, çoğunlukla genel veri setlerinde tek alanlı metin getirmesidir, bu yüzden korpusunuzu, parça boyutunuzu, dil karışımınızı veya maliyet tavanınızı yansıtmaz. 10.000 belgelik testimizde, fiyat dahil edildiğinde liderlik tablosundaki #1, korpusumuzda en iyisi değildi. Her zaman küçük bir alan değerlendirmesi çalıştırın.
2026'da RAG için en iyi embedding modeli hangisi?
Saf getirme kalitesi için Voyage-4-large, en iyi çok yönlü API için Gemini Embedding 001 ve self-host ediyorsanız Qwen3-Embedding-8B. "En iyi" maliyet tavanınıza ve dil ihtiyaçlarınıza bağlı, o yüzden iki modeli kısa listeye alın ve karar vermeden önce kendi verinizde test edin.
RAG için en iyi açık kaynak embedding modeli hangisi?
Qwen3-Embedding-8B genel açık kaynak lideridir (en üst MTEB çok dilli ve kod puanları), BGE-M3 çok yönlü hibrit seçimdir ve nomic-embed-text Ollama üzerinden dizüstü seçimidir. Ağırlıklar ücretsiz ama onları çalıştırmak için GPU ve VRAM'e ödüyorsunuz.
Açık kaynak mı API embedding mi, RAG için hangisi daha iyi?
API'ler sıfır operasyon ve en güncel kalitede kazanır; self-hosting ise veri yerelliği, yüksek hacim ve token başı ücret olmamasında kazanır. Başa baş noktası genelde ham kaliteden değil, hacim ve uyumluluktan belirlenir. Ayda birkaç yüz milyon token'ın altında, API'ler pratikte neredeyse her zaman daha ucuzdur.
Ollama'da çalıştırmak için en iyi yerel embedding modeli hangisi?
nomic-embed-text baş vurulacak seçim (ollama pull nomic-embed-text): hafif, mütevazı donanımda hızlı ve token seviyesinde ücretsiz. Boşta GPU VRAM'iniz varsa, daha küçük bir Qwen3-Embedding varyantı daha iyi getiriyor. İkisi de API maliyeti veya makinenizden veri çıkışı olmadan yerel olarak indeksliyor.
Daha yüksek embedding boyutu daha iyi getirme anlamına mı geliyor?
Doğrusal olarak hayır. Belirli bir noktadan sonra, ekstra boyutlar orantılı bir recall kazancı olmadan depolama ve gecikme ekliyor. Matryoshka modelleri kırpmanıza izin veriyor (örneğin 3072→1024) ve her vektörü yaklaşık 3 kat küçültürken recall'ın çoğunu koruyorsunuz; bu da vektör veritabanı maliyetinizi doğrudan azaltır.
RAG için hâlâ iyi olan en ucuz embedding modeli hangisi?
text-embedding-3-small ($0.02/M) veya voyage-4-lite ($0.02/M), çoğu İngilizce korpus için sağlam bir Recall@10'u geçiyor. Bir GPU çalıştırabiliyorsanız, nomic-embed-text token seviyesinde neredeyse bedava. Önce kendi verinizde test edin; ucuz modeller belirsiz sorgularda geriliyor.
RAG için en iyi çok dilli embedding modeli hangisi?
Qwen3-Embedding-8B ve BGE-M3 açık çok dilli getirmede öne çıkarken, Cohere Embed v4 ve Gemini Embedding 001 güçlü barındırılan seçeneklerdir. Yüksek bir MTEB çok dilli sırası, kendi dil çiftinizde en üst performansı garanti etmediği için her zaman hedef dillerinizde test edin.
İyi bir embedding modeliyle hâlâ bir reranker'a ihtiyacım var mı?
En üst hassasiyetli RAG için genelde evet. Güçlü bir embedder adayları ilk 50'ye sokar; bir reranker ise nihai hassasiyet için ilk k'yı yeniden sıralar. Daha ucuz bir embedder artı bir reranker, genelde pahalı tek başına bir embedder'ı geride bırakır ve toplamda daha az maliyete mal olur.
Sonuç Olarak
Bir API'de genel olarak en iyi getirme Voyage-4-large'a ait; Gemini Embedding 001 en yüksek puanlı çok yönlü model; Qwen3-Embedding-8B açık kaynak ve kod getirmesinde lider; nomic-embed-text ise yerel dizüstü seçimi. Ama çoğu ekip için değer kazananı, 1024 boyuta kırpılmış text-embedding-3-large: 0.83 Recall@10, ~$0.13/M ve 3 kat daha küçük vektörler. 10.000 belgeden çıkan gerçek ders şu: MTEB'de #1 olan model, nadiren korpusunuz için en iyisidir, o yüzden kendi verinizde test edin. Üretim RAG'i kuruyor ve ikinci bir göz mü istiyorsunuz? Ücretsiz danışmanlık alın.