
9 найкращих моделей ембедінгів для RAG у 2026 (я протестував пошук, латентність і вартість)
Voyage-4 вийшов 15 січня 2026 року. Потім з'явився voyage-context-4 — 29 червня. Якщо ваш RAG-пайплайн досі індексує на ada-002 від OpenAI, ви втрачаєте вимірюваний Recall@10 і ще й платите за це. Вибір найкращих моделей ембедінгів для RAG у 2026 — це не про те, щоб хапати те, що цього тижня на першому місці в лідерборді MTEB. Ми вбудували 10 000 власних документів, щоб з'ясувати, які моделі реально знаходять потрібне і скільки коштує мільйон токенів для кожної. Нижче: рейтинг, ціни та один трюк із обрізанням, який зменшив наше векторне сховище втричі. Ембедінги — лише один шар ширшого стека RAG, але якщо тут помилитися, усе далі страждає.
Ключові висновки
- Найкраща якість пошуку (API): Voyage-4-large, з MoE, розмірностями Matryoshka та ~$0,12/млн токенів.
- Найкращий універсальний API: Gemini Embedding 001, лідер англомовного MTEB, 3072-вим, ~$0,15/млн.
- Найкращий open-source / self-host: Qwen3-Embedding-8B, лідер MTEB у мультилінгвальному пошуку та коді.
- Найкраща цінність: OpenAI text-embedding-3-large, обрізаний з 3072→1024, ~$0,13/млн, вектори в 3 рази менші.
Що змінилося в моделях ембедінгів у 2026?
Головний зсув 2026 року — родина Voyage-4 (mixture-of-experts, спільний простір ембедінгів для nano/lite/standard/large, плюс обрізання Matryoshka та квантування int8/binary), і voyage-context-4, який кодує кожен чанк разом із навколишнім контекстом. Тим часом Gemini Embedding 001 очолює англомовний лідерборд MTEB, а Qwen3-Embedding лідирує у відкритому мультилінгвальному пошуку.
Два запуски Voyage змінили розклад сил. Voyage-4 (15 січня 2026) запровадив спільний простір ембедінгів, тож можна змішувати малу модель для дешевого масового індексування та велику для цінних запитів — без переіндексації всього. Це саме по собі економить рахунок за повторне вбудовування, якого боїться більшість команд.
Потім voyage-context-4 (29 червня 2026) вдарив безпосередньо по проблемі чанкінгу: замість вбудовування абзацу ізольовано, він кодує чанк плюс контекст документа. На практиці це означає, що можна припинити вручну підганяти межі чанків, аби не втрачати зміст на краях.
Ось єдине речення, яке варто запам'ятати: контекстні ембедінги чанків перетворюють чанкінг із крихкого налаштування на щось ближче до надійного стандарту. Хочете порівняння hosted-API віч-на-віч? Наш повний розбір Voyage проти OpenAI проти Cohere — супутній гід саме для цього.
9 найкращих моделей ембедінгів для RAG — рейтинг
Для більшості команд у 2026 три варіанти покривають 90% випадків: Voyage-4-large для найвищої якості пошуку серед hosted-API, Gemini Embedding 001 як найкращий за оцінками універсал, і Qwen3-Embedding-8B, якщо хостите самі. Повний рейтинг і зведена таблиця — одразу нижче, відсортовані за придатністю для RAG-пошуку: спочатку API-моделі, потім open-source.
| Модель | Провайдер | MTEB (пошук, з датою) | Розмірності (Matryoshka?) | Контекстне вікно | Ціна /1 млн токенів | Мультилінгвальність | Open vs API/self-host |
|---|---|---|---|---|---|---|---|
| Voyage-4-large | Voyage AI | Оцінка вендора, немає в публічному MTEB (січ 2026) | 2048/1024/512/256 (так, MRL) | ~32K токенів | ~$0,12 | Сильна | API |
| Gemini Embedding 001 | ~67,7 пошук / 68,3 загалом (MTEB, квіт 2026) | 3072 (так, MRL) | ~2K токенів | ~$0,15 | Сильна | API | |
| text-embedding-3-large | OpenAI | Див. живий MTEB (не від вендора), 2026 | 3072→1024→256 (так, MRL) | ~8K токенів | ~$0,13 | Хороша | API |
| Cohere Embed v4 | Cohere | Оцінка вендора, мультимодальна (2026) | 1536 (налаштовується) | ~128K токенів | ~$0,12 | Сильна | API |
| Voyage-context-4 | Voyage AI | Контекстна оцінка (черв 2026) | 2048/1024/512/256 (так, MRL) | ~32K токенів | ~$0,12 | Сильна | API |
| Qwen3-Embedding-8B | Alibaba | ~70,6 мультилінгв. / ~80,7 код (MTEB, 2026) | 32–4096 (гнучкі) | ~32K токенів | Безкоштовні ваги (витрати на GPU) | Лідер | Self-host |
| BGE-M3 | BAAI | Сильна мультилінгвальність (лідерборд HF, 2026) | 1024 (dense+sparse+multi) | ~8K токенів | Безкоштовні ваги (витрати на GPU) | Сильна | Self-host |
| NV-Embed-v2 | NVIDIA | ~72,3 англ. середнє (HF MTEB, перевірити, 2026) | 4096 | ~32K токенів | Безкоштовні ваги (витрати на GPU) | Англійська | Self-host |
| nomic-embed-text | Nomic AI | Помірна, рівень ноутбука (2026) | 768 | ~8K токенів | Безкоштовно (локально) | Обмежена | Self-host |
Зберігайте ці вектори у векторній базі даних, підібраній під вашу розмірність, бо індекс на 3072 виміри коштує значно дорожче за 1024-вимірний на масштабі.
1. Voyage-4-large
Найкраща чиста якість пошуку серед API. Це модель mixture-of-experts зі спільним простором ембедінгів (мішайте nano/lite/large без переіндексації) та розмірностями Matryoshka 2048/1024/512/256, плюс квантування fp32/int8/binary для дешевшого зберігання. За ціною приблизно $0,12/млн токенів вона коштує як модель середнього рівня, а шукає як преміальна. Обирайте, якщо якість пошуку — ваше вузьке місце і ви готові платити ~$0,12/млн.
2. Gemini Embedding 001
Найкращий універсальний API. Модель Google лідирує в англомовному лідерборді MTEB (~68,3 загалом, 67,7 пошук за знімком на квітень 2026), має 3072 виміри з обрізанням MRL і спільний мультимодальний простір. За ціною **$0,15/млн** це найдорожчий із наших топ-варіантів. Обирайте, якщо хочете найвищу оцінку серед загальних моделей і Gemini/Vertex вже у вашому стеку.
3. OpenAI text-embedding-3-large
Найкращий вибір за замовчуванням на масштабі та найпростіший у підключенні. 3072 виміри, обрізання MRL до 256 і найширше покриття SDK та туторіалів серед усіх ембедерів. За ціною ~$0,13/млн це безпечний вибір, а text-embedding-3-small (~$0,02/млн) — бюджетний побратим для англомовних корпусів. Легасний ada-002 досі працює, але ви платите за гірший recall. Обирайте, якщо хочете нуль сюрпризів і широку підтримку екосистеми.
4. Cohere Embed v4
Найкращий вибір для змішаних медіа та корпоративної мультилінгвальності. Embed v4 обробляє текст, зображення та змішані документи в одній моделі, з великим контекстним вікном і сильним крос-мовним пошуком, за ціною ~$0,12/млн. Обирайте, якщо ваш корпус містить PDF, скріншоти й текст, або потрібне серйозне мультилінгвальне покриття під одним API.
5. Voyage-context-4
Свіжий вибір для RAG на довгих документах. Запущений 29 червня 2026, він вбудовує кожен чанк разом із навколишнім контекстом, що зменшує помилки «загубилося на межі чанка», які переслідують наївне розбиття. Та сама цінова зона ~$0,12/млн, що й лінійка Voyage-4. Обирайте, якщо ваші документи довгі й чанкінг був вашим головним болем.
6. Qwen3-Embedding-8B
Загалом найкраща open-source модель і найкращий вибір для пошуку в коді. Qwen3-Embedding від Alibaba лідирує у відкритому мультилінгвальному MTEB (~70,6) і очолює MTEB-Code (~80,7) згідно з документацією Qwen3-Embedding, з гнучкими розмірностями від 32 до 4096 та квантуванням Q4. Обирайте, якщо хостите самі, індексуєте код або потрібен сильний мультилінгвальний пошук без оплати за токени.
7. BGE-M3
Найкращий відкритий універсал. BGE-M3 від BAAI дає dense, sparse та multi-vector пошук в одній моделі, підтримує 100+ мов і залишається одним із найбільш завантажуваних ембедерів на Hugging Face. Обирайте, якщо хочете гібридний dense-plus-sparse пошук із однієї self-hosted моделі.
8. NV-Embed-v2
Найкращі відкриті ваги для точності лише англійською. Модель NVIDIA показує ~72,3 середнього за англійською в лідерборді HF MTEB (цифри відрізняються залежно від знімка, тож перевіряйте живу таблицю), з 4096 вимірами. Важча для запуску, ніж більшість. Обирайте, якщо точність англійською — ваш пріоритет і є запас GPU.
9. nomic-embed-text
Найкращий локальний вибір для ноутбука. Модель Nomic нативна для Ollama, крихітна й дешева для self-host, обмінюючи топовий recall на швидкість на скромному залізлі. Альтернативи того ж рівня: mxbai-embed-large та ветеран all-MiniLM. Обирайте, якщо хочете повністю локальні ембедінги без витрат на API й готові прийняти нижчий recall.
Одне, що наш тест постійно підтверджував: модель №1 в MTEB рідко буває найкращою для вашого корпусу. Саме це вимірює наступний розділ.
Як ми тестували: вбудовування 10 000 документів і вимірювання важливого
Ми вбудували ~10 000 реальних документів із нашого внутрішнього корпусу продуктової документації та тікетів підтримки, потім оцінили пошук на вручну розміченій вибірці з ~120 запитів. Головний висновок: обрізання OpenAI text-embedding-3-large з 3072 до 1024 вимірів коштувало лише ~0,03 падіння Recall@10, зменшивши векторне сховище приблизно в 3 рази. Невелика втрата якості, великий виграш у зберіганні.
Ми протестували підмножину (не всі дев'ять моделей вичерпно): Voyage-4-large, Gemini Embedding 001, text-embedding-3-large (повний і обрізаний), Qwen3-Embedding-8B на власному хостингу, BGE-M3 та nomic-embed-text. Ми виміряли Recall@10 і nDCG@10 на розміченій вибірці запитів, p95 латентність вбудовування та вартість за 1 млн токенів для API або GPU-секунди для self-host. З лише ~120 запитами сприймайте це як орієнтовні дані, а не лідерборд.
| Модель (виміри) | Recall@10 | nDCG@10 | p95 латентність | Вартість |
|---|---|---|---|---|
| Voyage-4-large (1024) | 0,89 | 0,81 | ~180 мс (API) | ~$0,12/млн |
| Gemini Embedding 001 (3072) | 0,88 | 0,80 | ~210 мс (API) | ~$0,15/млн |
| Qwen3-Embedding-8B (self-host) | 0,87 | 0,79 | ~430 мс (холодний GPU) | GPU-секунди |
| text-embedding-3-large (3072) | 0,86 | 0,78 | ~160 мс (API) | ~$0,13/млн |
| text-embedding-3-large (1024) | 0,83 | 0,75 | ~150 мс (API) | ~$0,13/млн |
| BGE-M3 (1024) | 0,82 | 0,74 | ~300 мс (self-host) | GPU-секунди |
| nomic-embed-text (768) | 0,76 | 0,69 | ~90 мс (локально) | Безкоштовно |
Два висновки запам'яталися. Перший: self-hosted Qwen3-8B зрівнявся з топовим API на нашій англомовній вибірці, але його p95 латентність приблизно подвоїлася без прогрітого GPU, тож закладайте бюджет на підтримку одного гарячого інстансу. Другий: №1 лідерборду не став переможцем на нашому корпусі, коли в гру вступила вартість. Якщо хочете оцінити якість пошуку end-to-end на власних даних, це чесний спосіб обрати. А якщо цікаво, чому цифра лідерборду MTEB може вводити в оману, ми написали окремий розбір про те, як працюють оцінки MTEB для RAG.

Скільки коштують моделі ембедінгів?
Hosted API для ембедінгів коштують приблизно від $0,02 до $0,15 за 1 млн токенів станом на липень 2026. Open-source моделі мають «безкоштовні» ваги, але ви платите часом GPU та VRAM. Найдешевші достатньо якісні API-варіанти — text-embedding-3-small і voyage-4-lite за ~$0,02/млн; найдешевший self-host — nomic-embed-text, фактично безкоштовний на рівні токенів.
Ось перевірений знімок цін (станом на липень 2026; ціни на ембедінги двічі змінювалися в першому півріччі 2026, тож перевірте сторінку вендора перед прийняттям рішення):
| Модель | Ціна /1 млн токенів (лип 2026) | Примітки |
|---|---|---|
| voyage-4-lite | ~$0,02 | Найдешевший рівень Voyage |
| voyage-4 | ~$0,06 | Стандартний рівень |
| voyage-4-large | ~$0,12 | Найкраща якість пошуку |
| voyage-context-4 | ~$0,12 | Контекстні чанки |
| OpenAI 3-small | ~$0,02 | Бюджетний англійський вибір |
| OpenAI 3-large | ~$0,13 | Стандарт на масштабі |
| Cohere Embed v4 | ~$0,12 | Мультимодальна |
| Gemini Embedding 001 | ~$0,15 | Найвища оцінка |
| Open-source (Qwen3, BGE-M3, nomic) | Витрати на GPU/VRAM | Без оплати за токени |
При 100 млн проіндексованих токенів різниця між $0,02/млн і $0,15/млн — $2 проти $15. Небагато. Але переіндексуйте цей корпус щомісяця, додайте вбудовування на етапі запитів — і множник зростає швидко. Тому вартість API пошукового шару заслуговує на окремий рядок у бюджеті, а не на округлення. Self-host перевертає математику: немає оплати за токени, але ви орендуєте GPU, зайнятий він чи простоює.
Вартість проти якості: яка модель ембедінгів найвигідніша?
Правило найкращої цінності просте: обирайте найдешевшу модель, що долає Recall@10 ≥ 0,80 на вашому корпусі. У нашому тесті це OpenAI text-embedding-3-large, обрізаний до 1024 вимірів: Recall@10 0,83 за ~$0,13/млн, з векторами в 3 рази меншими за 3072-вимірну версію. Він чітко в квадранті солодкої точки: достатньо високий recall, достатньо мале зберігання.
Уявіть головну діаграму розсіювання: вартість за 1 млн токенів на осі X, якість пошуку на осі Y. Преміальні API (Voyage-4-large, Gemini 001) — угорі праворуч: чудовий recall, вища ціна. Бюджетний рівень (3-small, voyage-4-lite) — унизу ліворуч: дешево, але нижчий recall на складних запитах. Квадрант найкращої цінності — той, який більшість команд пропускає: середня ціна, високий recall, малі вектори.
Моя чесна думка після підрахунків: більшість команд переплачують за якість ембедінгів і недоінвестують у чанкінг і переранжування. Якщо ви долаєте recall 0,80 при 1024 вимірах, витрачати в 3 рази більше на зберігання заради стрибка recall на 0,03 майже ніколи не варто.
Правило рішення в трьох рядках:
- Якщо якість пошуку — ваше вузьке місце і бюджет дозволяє, обирайте Voyage-4-large або Gemini 001.
- Якщо бюджет обмежений, обирайте text-embedding-3-large, обрізаний до 1024, або 3-small для простих корпусів.
- Якщо хостите самі, Qwen3-Embedding-8B — король цінності, коли GPU вже працює.
Яка найкраща open-source / локальна модель ембедінгів для RAG?
Найкраща загалом для self-host — Qwen3-Embedding-8B (потрібен справжній GPU, приблизно 16 ГБ+ VRAM при Q4). Найкращий вибір для ноутбука/локально — nomic-embed-text на Ollama, працює на скромному залізлі без витрат на API. Self-host виграє, коли потрібна резидентність даних, великий обсяг або хочете прибрати оплату за токени; API виграє, коли не хочете няньчити GPU.
Запуск локального ембедера — справа двох команд. Завантажте модель, потім вбудовуйте та запитуйте. Ось локальний шлях з Ollama та API-шлях з OpenAI SDK пліч-о-пліч:
# Local: pull a small, fast embedder
ollama pull nomic-embed-text# Local (Ollama) — embed a query with no API cost
import ollama
vec = ollama.embed(model="nomic-embed-text", input="How do I reset my API key?")["embeddings"][0]
# Hosted (OpenAI SDK) — same idea, higher recall
from openai import OpenAI
client = OpenAI()
vec = client.embeddings.create(
model="text-embedding-3-large",
input="How do I reset my API key?",
dimensions=1024, # Matryoshka truncation: 3x smaller vectors
).data[0].embeddingТе, що практики реально пишуть на Reddit, збігається з нашим тестом: self-hostери постійно фіксують стрибки p95 латентності, коли GPU остигає між запитами. Рішення — тримати один інстанс прогрітим, що непомітно перетворює «безкоштовний» self-host на фіксований місячний рахунок за GPU. Варто порахувати перед міграцією з API. Якщо налагоджуєте цикл оцінки, також корисно керувати промптами навколо вашого пошуку в одному місці. Повний покроковий гід — у нашій статті про запуск моделей ембедінгів локально з Ollama.
Чи означає більша розмірність кращий пошук?
Ні, не лінійно. Після певної межі додаткові виміри додають вартість зберігання та латентності без пропорційного виграшу в recall. Matryoshka Representation Learning (MRL) дозволяє обрізати вектор (скажімо, 3072→1024→512) і зберегти більшість recall, зменшивши кожен вектор у 3–6 разів. Це пряме скорочення рахунку за векторну базу.
Наші цифри роблять це конкретним. Зменшення text-embedding-3-large з 3072 до 1024 вимірів коштувало ~0,03 Recall@10, але скоротило зберігання приблизно в 3 рази. Знизьте до 512 — і падіння recall крутішає, особливо на неоднозначних запитах. Солодка точка для більшості англомовних корпусів — близько 1024.
Коротко: розмірності — це податок на зберігання й латентність, який ви платите за кожен вектор, тож обрізайте до найменшого розміру, що ще долає вашу планку recall. При 10 млн+ векторів це рішення визначає, яку векторну базу ви можете собі дозволити, тож перевірте, яка векторна БД витримує вашу розмірність і вартість зберігання, перш ніж фіксувати розмірність.
Як обрати модель ембедінгів для RAG?
Вибір моделі ембедінгів для RAG зводиться до чотирьох перевірок, за порядком. Проганяйте їх на власних даних, а не на публічному лідерборді — і шорт-лист швидко скоротиться.
- Recall@10 ≥ 0,80 на ВАШОМУ корпусі. Протестуйте підмножину з вручну розміченою вибіркою запитів. Позиція в лідерборді — підказка, а не відповідь.
- Вартість у межах вашої стелі $/1 млн. Врахуйте переіндексацію та вбудовування на етапі запитів, не лише початковий індекс.
- Контекстне вікно ≥ розміру вашого чанка. Якщо ваші чанки по 1000 токенів, модель із 512-токенним вікном обрізає і втрачає зміст.
- Активна підтримка та мультилінгвальність за потреби. Модель, оновлена в 2026, краща за застарілий чекпоінт 2024; тестуйте ваші цільові мови безпосередньо.
Оцініть дві-три моделі за всіма чотирма — і переможець зазвичай визначається сам. Далі — підключення цього до повного RAG-пайплайну: чанкінг, вбудовування, зберігання, пошук, переранжування.
Про автора
Мерт Батур Гюрбюз — співзасновник Techsy.io, де команда створює AI-агентів, системи автоматизації та voice/SDR-пайплайни для B2B-клієнтів. Він навчається в Бірмінгемському університеті та пише про стек інструментів для LLM, який команда Techsy реально використовує в продакшені. Підключайтеся в LinkedIn.
Обрати інструмент — легша половина. Змусити його надійно працювати всередині реального продукту — там більшість команд застрягає, і саме це наша команда AI-інтеграції будує для клієнтів: від RAG-пайплайнів до кастомних агентів.
Часті запитання
Чи достатньо оцінки MTEB, щоб обрати найкращу модель ембедінгів для RAG?
Ні. MTEB — це переважно пошук тексту в одній предметній області на публічних датасетах, тож він не відображає ваш корпус, розмір чанків, мовний мікс чи стелю вартості. У нашому бенчмарку на 10 000 документів №1 лідерборду не став найкращим на нашому корпусі, коли врахували ціну. Завжди проводьте невелику доменну оцінку.
Яка найкраща модель ембедінгів для RAG у 2026?
Voyage-4-large для чистої якості пошуку, Gemini Embedding 001 як найкращий універсальний API, і Qwen3-Embedding-8B, якщо хостите самі. «Найкраща» залежить від вашої стелі вартості та мовних потреб, тож відберіть дві та протестуйте на власних даних перед прийняттям рішення.
Яка найкраща open-source модель ембедінгів для RAG?
Qwen3-Embedding-8B — загальний лідер серед open-source (найвищі оцінки MTEB у мультилінгвальному пошуку та коді), BGE-M3 — універсальний гібридний варіант, а nomic-embed-text — вибір для ноутбука через Ollama. Ваги безкоштовні, але ви платите за GPU та VRAM для їх запуску.
Open-source чи API-ембедінги — що краще для RAG?
API виграє нульовою операційною роботою та найновішою якістю; self-host виграє резидентністю даних, великим обсягом і відсутністю оплати за токени. Точка беззбитковості зазвичай визначається обсягом і комплаєнсом, а не чистою якістю. Нижче кількох сотень мільйонів токенів на місяць API майже завжди дешевший на практиці.
Яку найкращу локальну модель ембедінгів запустити на Ollama?
nomic-embed-text — стандартний вибір (ollama pull nomic-embed-text): легкий, швидкий на скромному залізлі, безкоштовний на рівні токенів. Якщо є вільна VRAM на GPU, менший варіант Qwen3-Embedding шукає краще. Обидва індексують локально без витрат на API і дані не залишають вашу машину.
Чи означає більша розмірність ембедінгу кращий пошук?
Не лінійно. Після певної межі додаткові виміри додають зберігання та латентність без пропорційного виграшу в recall. Моделі Matryoshka дозволяють обрізати (наприклад, 3072→1024) і зберегти більшість recall, зменшивши кожен вектор приблизно в 3 рази, що напряму скорочує вартість векторної бази.
Яка найдешевша модель ембедінгів, яка ще достатньо хороша для RAG?
text-embedding-3-small ($0,02/млн) або voyage-4-lite ($0,02/млн) долають солідний Recall@10 для більшості англомовних корпусів. Якщо можете запустити GPU, nomic-embed-text фактично безкоштовний на рівні токенів. Спершу протестуйте на своїх даних; дешеві моделі просідають на неоднозначних запитах.
Яка найкраща мультилінгвальна модель ембедінгів для RAG?
Qwen3-Embedding-8B і BGE-M3 лідирують у відкритому мультилінгвальному пошуку, а Cohere Embed v4 та Gemini Embedding 001 — сильні hosted-варіанти. Завжди тестуйте на ваших цільових мовах, бо висока позиція в MTEB-multilingual не гарантує топову продуктивність у вашій конкретній мовній парі.
Чи потрібен мені переранжувач із хорошою моделлю ембедінгів?
Часто так для RAG із топ-точністю. Сильний ембедер доводить кандидатів до топ-50; переранжувач перевпорядковує топ-k для фінальної точності. Дешевший ембедер плюс переранжувач нерідко б'є дорогий ембедер самотужки й коштує менше загалом.
Вердикт
Найкращий загальний пошук серед API — у Voyage-4-large; Gemini Embedding 001 — найвища оцінка серед універсалів; Qwen3-Embedding-8B лідирує в open-source та пошуку в коді; а nomic-embed-text — локальний вибір для ноутбука. Але переможець за цінністю для більшості команд — обрізаний text-embedding-3-large на 1024 вимірах: Recall@10 0,83, ~$0,13/млн і вектори в 3 рази менші. Справжній урок із 10 000 документів: №1 в MTEB рідко буває найкращою моделлю для вашого корпусу, тож тестуйте на власних даних. Будуєте продакшн-RAG і хочете погляд збоку? Отримайте безкоштовну консультацію.