
RAG vs Fine-Tuning: коли що обирати (з реальними цифрами)
Більшість порад щодо rag vs fine tuning оминають єдиний експеримент, який виміряв обидва підходи на одному завданні. Балаґер і співавтори в arXiv:2401.08406 (162 цитування) прогнали агрономічний QA-набір через обидва: файн-тюнінг дав понад 6 пунктів точності, а RAG додав зверху ще 5. Їхня таблиця 18 показує GPT-4 на рівні 75% без нічого, 81% після файн-тюнінгу і 86% після файн-тюнінгу з пошуком. То чому ми досі радимо більшості команд починати з RAG? Бо свіжість даних, цитування і арифметика витрат нижче вирішують долю більшої кількості проєктів, ніж різниця точності в 1 пункт.
Ключові висновки
- RAG є стандартним вибором, коли знання часто змінюються або відповіді мають містити посилання на джерела; файн-тюнінг виграє у стабільності формату та латентності.
- Витрати на файн-тюнінг припадають на старт (навчання); витрати на RAG припадають на кожен запит (ембедінги плюс додаткові вхідні токени).
- Опубліковані дані на одному завданні: файн-тюнінг додав 6 пунктів точності, RAG ще 5 зверху, а гібрид перевершив обидва підходи окремо.
- Пройдіть п'ять перевірок (свіжість даних, розмічені приклади, латентність, цитування, ML-компетенції команди), перш ніж писати будь-який код навчання.
Коли варто використовувати RAG, а коли Fine-Tuning? (Швидкий вердикт)
Обирайте RAG, якщо ваші знання часто змінюються або відповіді мають містити цитування. Обирайте файн-тюнінг, якщо потрібні стабільний формат виводу й низька латентність, а розмічених прикладів у вас сотні. Коли розгортання дозріє, використовуйте обидва. RAG редагує контекст, який читає модель; файн-тюнінг редагує саму модель. Більшості команд потрібне перше, а не друге.
Один рядок, який варто запам'ятати: RAG змінює те, що модель читає; файн-тюнінг змінює те, чим модель є. Обирайте залежно від того, чого насправді потребує ваше завдання.
| Підхід | Коли використовувати | Коли пропускати | Початкові витрати | Витрати на запит | Складність оновлення |
|---|---|---|---|---|---|
| Промпт-інжиніринг | Поведінка майже влаштовує, знання загальні | Відповідям потрібні приватні або свіжі дані | Години ітерацій | Ніяких, окрім токенів | Правите промпт, розгортаєте заново |
| RAG | Факти змінюються, цитування важливі, дані лишаються приватними | Потрібна латентність під 100 мс | Низькі: побудова індексу | Ембедінги плюс додаткові вхідні токени | Переіндексація, без перенавчання |
| Файн-тюнінг | Фіксований формат, тон або бюджет латентності; є розмічені приклади | Знання дрейфують щотижня | Середні й високі: підготовка даних плюс навчання | Часто вищий тариф за токени | Повне перенавчання на кожен дрейф |
| Гібрид (обидва) | Зрілий продукт: контроль формату плюс свіжі факти | Стадія прототипу, бюджет іще не зрозумілий | Обидва пункти вище | Обидва пункти вище | Дві системи в підтримці |
Глосарій NVIDIA з RAG дає чисте визначення пошукового боку, якщо вам потрібен підручниковий варіант. Але визначення не обирають вашу архітектуру. Її обирають докази, тож почніть із них.
Що показують докази? Одне завдання, обидва підходи, у цифрах
Єдине виміряне на одному завданні порівняння в топ-5 Google за цим запитом — це Balaguer et al. 2024, дослідження Microsoft Research зі 162 цитуваннями. Команда прогнала одне агрономічне QA-завдання через RAG-конвеєр, файн-тюнінгову модель і гібрид із них, а потім попросила GPT-4 оцінити відповіді. На їхньому стенді сам лише файн-тюнінг обійшов сам лише RAG, а поєднання двох підходів перевершило кожен з них із більшим відривом.
Агрономічний кейс (arXiv:2401.08406)
Дослідження, подане в січні 2024 року Енджелс Балаґер і 15 співавторами, ставить питання: що потрібно, щоб давати фермерам поради під конкретну локацію. Їхній конвеєр витягує інформацію з PDF, генерує з неї пари «питання-відповідь» і оцінює Llama2-13B, GPT-3,5 та GPT-4 з пошуком і без нього.
Балаґер і співавтори звітують про приріст точності понад 6 процентних пунктів від файн-тюнінгу, який сумарно додається з RAG, що дав зверху ще 5 пунктів. Гібридний конвеєр перевершив кожен підхід окремо. Їхня таблиця 18 показує такий порядок для GPT-4: 75% без допомоги, 80% з RAG, 81% після файн-тюнінгу, 86% після файн-тюнінгу плюс RAG. Зверніть увагу, як близько стоять 80% і 81%: розрив між самим RAG і самим файн-тюнінгом становить один пункт, тоді як гібрид відривається від обох на п'ять. В одному з експериментів файн-тюнінгова модель спиралася на знання з інших регіонів, відповідаючи на регіональні питання, і підняла схожість відповідей із 47% до 72%.
Економічні докази
Опубліковане дослідження Snorkel AI (листопад 2022) покриває бік витрат. На бенчмарку юридичної класифікації зі 100 класами (LEDGAR, 80 000 положень контрактів) файн-тюнінгова RoBERTa зрівнялася з файн-тюнінговим GPT-3, будучи у 1 400 разів меншою, використовуючи менше 1% еталонних розміток і працюючи за 0,1% вартості продакшн-інференсу файн-тюнінгового GPT-3, приблизно одну тисячну. Загальна собівартість: $1 915 із програмною розміткою проти $7 418 за ручну анотацію плюс файн-тюнінг GPT-3. Одне застереження: це класифікація, а не генеративний QA, тож ставтеся до пропорцій як до орієнтовних.
Наше прочитання
Наша інтерпретація: їхній стенд є найсприятливішим випадком для файн-тюнінгу з можливих, і навіть так він виграв лише один пункт. Балаґер і співавтори навчали модель на фіксованому PDF-корпусі й оцінювали на тому самому замороженому корпусі, тож ніщо з вивченого вагоми не встигало застаріти посеред експерименту. Більшість продакшн-баз знань так не стоять на місці. Сапорт-бот, який відповідає на питання про минулотижневий реліз, заново заробляє ці 6 пунктів на кожному циклі перенавчання, тоді як індекс, який живить RAG, оновлюється того самого дня. Тому ми вважаємо перевагу в 1 пункт точності найслабшим аргументом у цьому рішенні, а свіжість найсильнішим. Де докази не узагальнюються: результат Snorkel є бенчмарком класифікації, і жодне з досліджень не тестує контроль тону чи формату, а це досі найсильніший кейс файн-тюнінгу.
| RAG | Файн-тюнінг | Гібрид | |
|---|---|---|---|
| Точність на завданні (Balaguer et al., з атрибуцією) | +5 п.п., сумарно поверх файн-тюнінгу (не окремо над базовим рівнем) | +6 п.п. над базовим рівнем | Найкращий із трьох: GPT-4 на рівні 86% проти 81% після файн-тюнінгу, 80% з RAG, 75% базово |
| Профіль витрат (Snorkel плюс публічні прайси) | На запит: ембедінги плюс токени контексту | На старті: $1 915–$7 418 в опублікованому кейсі; інференс за 0,1% вартості файн-тюнінгового GPT-3 на малій моделі | Платить обидва |
| Складність оновлення | Переіндексація документів | Повне перенавчання | Обидва |
| Підтримка цитування | Вбудована | Немає | Вбудована через пошуковий бік |
Файн-тюнінг є правильною відповіддю рідше, ніж думають команди: більшість проєктів, які кажуть «файн-тюнінг», насправді мають на увазі «пошук».
Як працює RAG і коли він виграє?
RAG (генерація, доповнена пошуком) відповідає з документів, які контролюєте ви, а не з того, що модель запам'ятала під час навчання. Вперше запропонований Lewis et al. у 2020 році, він став стандартом для роботи зі знаннями, бо знання живуть поза моделлю: оновіть індекс, і завтра кожна відповідь зміниться без перенавчання.
Конвеєр складається з чотирьох кроків:
- Завантаження. Розберіть свої документи (PDF, вікі, тикети) у корпус.
- Нарізка й ембедінг. Розбийте на фрагменти по кілька сотень токенів і перетворіть кожен на вектор за допомогою ембедінг-моделі.
- Пошук. На момент запиту знайдіть top-K найсхожіших фрагментів плюс збіги за ключовими словами для точних рядків на кшталт SKU чи кодів помилок.
- Доповнення й генерація. Покладіть ці фрагменти в промпт і дайте LLM відповісти з прикріпленими джерелами.
RAG виграє за трьома напрямками: свіжість (переіндексація замість перенавчання), цитування (кожна відповідь вказує на фрагмент, з якого вона взята) і контроль даних (клієнтські дані ніколи не потрапляють у навчання). Якщо хочете повний розбір збірки, ось як крок за кроком зібрати RAG-застосунок.
Одне застереження щодо якості пошуку: конвеєр настільки добрий, наскільки добрий його мікс ембедінгів і пошуку. Contextual Retrieval від Anthropic виміряв 5,7% невдалих пошуків у top-20 на простих конфігураціях, що падає до 2,9% з контекстними ембедінгами плюс BM25 і до 1,9% після додавання реранкера. Якщо запити на точну відповідність і далі дають збій, рішенням буде гібридний пошук (BM25 проти вектора).
Коли виграє файн-тюнінг? (І що таке PEFT?)
Файн-тюнінг виграє, коли проблема в тому, як модель відповідає, а не що вона знає: стабільний формат виводу, тон бренду або жорсткий бюджет латентності без пошукового раунд-трипу. Це ще й важіль економіки малих моделей. Наведений вище результат Snorkel «якість GPT-3 за 0,1% ціни» існує лише тому, що хтось зробив файн-тюнінг малої моделі замість того, щоб обслуговувати велику.
Повний файн-тюнінг проти PEFT (LoRA / QLoRA)
Повний файн-тюнінг оновлює кожен ваг у моделі. Це дорого, повільно і рідко трапляється за межами великих лабораторій. Майже всі натомість випускають PEFT (параметрично-ефективний файн-тюнінг). LoRA (Hu et al. 2021) заморожує базові ваги і навчає маленький низькоранговий адаптер, зазвичай 0,1–1% від кількості параметрів. QLoRA додає зверху 4-бітне квантування, тож модель на 13B поміщається на одну споживчу GPU. Варто знати ще один суміжний термін: безперервне преднавчання (continuous pretraining), коли модель продовжує преднавчання на сирому доменному корпусі (без учителя), перш ніж перейти до навчання з учителем на розмічених прикладах.
Мінімальна конфігурація LoRA згідно з документацією Hugging Face PEFT:
from peft import LoraConfig, get_peft_model
config = LoraConfig(
r=16, # low-rank dimension; 8-64 typical
lora_alpha=32, # scaling factor, commonly 2x r
target_modules=["q_proj", "v_proj"],
lora_dropout=0.05,
bias="none",
task_type="CAUSAL_LM",
)
model = get_peft_model(base_model, config)
model.print_trainable_parameters()
# trainable params: ~13M || all params: 6.7B || trainable%: 0.19Щодо підготовки датасету, кількості епох та оцінювання дивіться наш покроковий гайд із файн-тюнінгу.
Ризики реальні: перенавчання на малих датасетах (кілька сотень прикладів модель може просто завчити замість того, щоб навчитися), застарівання (ваги заморожують ваші знання на момент зрізу навчання) і жодної атрибуції джерел (файн-тюнінгова модель не може показати, звідки взяла відповідь). Якщо будь-що з цих трьох є критичним, ви щойно переконали себе назад до RAG.
RAG проти файн-тюнінгу проти промпт-інжинірингу: де місце інших?
Ці три підходи є драбиною, а не суперниками. Промпт-інжиніринг змінює інструкції, RAG змінює контекст, який читає модель, а файн-тюнінг змінює ваги. Власний гайд OpenAI з файн-тюнінгу ставить файн-тюнінг останнім у циклі: спочатку евали, потім промпти, навчання лише тоді, коли промптів уже не вистачає. Дві новіші опції доповнюють набір інструментів.
| Підхід | Що змінюється | Коли використовувати | Коли пропускати | Профіль витрат | Зусилля |
|---|---|---|---|---|---|
| Промпт-інжиніринг | Інструкції | Поведінка готова на 90% | Потрібні приватні або швидкозмінні факти | Лише токени | Години |
| RAG | Контекст, який читається під час запиту | Свіжі або цитовані знання | Жорстка латентність; нічого шукати | Токени на запит плюс індекс | Дні |
| Файн-тюнінг (LoRA) | Ваги | Формат, тон, латентність, обслуговування малої моделі | Немає розмічених даних; знання дрейфують | Навчання на старті; поновлюється з кожним перенавчанням | Тижні |
| CAG (кеш-доповнений) | Попередньо завантажений, кешований контекст | Мала стабільна база знань; доступне кешування промптів | Корпус більший за розмір кешу | Один запис кешу, потім дешеве читання | Дні |
| Агенти плюс використання інструментів | Те, що модель може робити | Відповідям потрібні живі дії або обчислення | Достатньо статичної відповіді | Токени на крок; швидко множаться | Тижні |
Варто назвати одну плутанину: MCP-сервери й агентні фреймворки є оркестрацією, а не кастомізацією. Вони вирішують, до яких інструментів і джерел модель має доступ; вони не змінюють того, як модель відповідає. Ви можете запустити RAG-конвеєр усередині агента і зробити файн-тюнінг моделі під ним, і багато продакшн-систем роблять і те, і те. «Війни автодоповнення» («проти mcp», «проти агентів») є помилкою категорії.
Чи RAG дешевший за файн-тюнінг? Реальна модель витрат
Коротка відповідь: на реалістичних обсягах запитів так. Рахунок за файн-тюнінг приходить на старті (розмічені дані плюс навчання), тоді як рахунок за RAG приходить за кожен запит (ембедінги плюс додаткові вхідні токени). Документація OpenAI з файн-тюнінгу тарифікує навчання за токенами, але платня за токени є дрібницею порівняно з людською вартістю розмічених прикладів. Ось арифметика за публічними прайсами.
| Стаття | Коли платите | Публічний прайс |
|---|---|---|
| Навчання на hosted API (gpt-4o-mini) | Один раз на версію моделі | $3,00 за 1M токенів навчання (прайс OpenAI 2024–25) → 1,5M токенів ≈ $4,50 |
| Розмічені навчальні дані | На старті, поновлюються під час дрейфу | $1 915 програмно проти $7 418 вручну (опублікований кейс Snorkel) |
| Інференс файн-тюнінгової моделі | За запит | Приблизно 2× від базового: $0,30/$1,20 проти $0,15/$0,60 за 1M (gpt-4o-mini, OpenAI 2024–25) |
| Ембедінг корпусу (RAG) | Один раз на оновлення корпусу | $0,02 за 1M токенів (text-embedding-3-small) → корпус на 10M токенів = $0,20 |
| Знайдений контекст (RAG) | За запит | ~2 000 додаткових вхідних токенів × $0,15/1M = $0,0003 за запит |
Питання точки беззбитковості: скільки запитів потрібно, щоб сумарний податок RAG на кожен запит зрівнявся з інвестицією у файн-тюнінг?
break_even = training_cost / per_query_retrieval_delta
= $1,915 / $0.0003
≈ 6.4 million queriesЗа 50 000 запитів на місяць це понад десять років. Для більшості продуктів інвестиція у файн-тюнінг ніколи не відбивається лише на економії токенів; файн-тюнінг роблять заради формату й латентності, а не щоб обійти RAG за вартістю. Арифметика перевертається після мільйонів запитів на місяць або з дуже великими контекстами пошуку. І зверніть увагу на асиметрію: рахунок за файн-тюнінг поновлюється щоразу, коли дрейф даних змушує перенавчати, тоді як RAG масштабується лінійно з обсягом, помноженим на розмір фрагмента. Якщо реальне занепокоєння становлять витрати на запит, почніть зі скорочення вартості запиту до LLM; якщо все ж таки підете шляхом навчання, порівняйте інструменти файн-тюнінгу, перш ніж виписувати чек.
Нотатка про свіжість: станом на липень 2026 року документація OpenAI з файн-тюнінгу повідомляє, що hosted-платформу згортають для нових користувачів, а наявні користувачі зберігають доступ до навчання на найближчі місяці. Це ще одна причина, чому команди схиляються до PEFT на відкритих моделях або звичайного RAG.
5 перевірок перед вибором
Пройдіть ці п'ять перевірок «так чи ні», перш ніж писати будь-який код навчання; візерунок відповідей вказує на RAG, файн-тюнінг або гібрид надійніше за будь-який бенчмарк. Відповідайте чесно, потім порахуйте.
- Знання змінюються швидше, ніж ви встигаєте перенавчати? Так → RAG. Перенавчання на кожне оновлення документів не є планом експлуатації.
- У вас є кілька сотень розмічених прикладів? Ні → RAG або промпт-інжиніринг. Файн-тюнінг на 40 прикладах просто завчає, а не навчається.
- Є жорсткий бюджет латентності? Тісний → схиляємось до файн-тюнінгу. Пропуск пошукового раунд-трипу економить 50–200 мс.
- Відповіді мають містити цитування або аудиторський слід? Так → RAG. Файн-тюнінгові моделі не можуть вказати на вихідний фрагмент.
- Команда має ML-навички плюс бюджет на GPU чи API для навчання? Ні → RAG. Індекс, який можна перебудувати, кращий за ваги, які ви не можете перенавчити.
Здебільшого «так» на 1, 4, 5 → RAG. Здебільшого «так» на 2 і 3 зі стабільним доменом → файн-тюнінг. Змішані відповіді або зрілий продукт із реальним трафіком → гібрид (наступний розділ). Сенс чеклиста полягає в тому, щоб вирішувати на основі доказів, а не тієї техніки, яка цього місяця в тренді у вашій стрічці.
Чи можна використовувати RAG і файн-тюнінг разом?
Так, і для зрілих розгортань гібридний патерн є нормою, а не винятком. Файн-тюнінг роблять заради доменної плинності й формату виводу (як), а пошук залишають для фактів на момент інференсу (що). Балаґер і співавтори звітують саме про це на своєму агрономічному завданні: гібридний конвеєр перевершив кожен підхід окремо, а виграш RAG у 5 пунктів наклався зверху на 6 пунктів файн-тюнінгу.
Шлях зрілості, який ми рекомендуємо: почніть із промпт-інжинірингу, додайте RAG у момент, коли відповідям знадобляться приватні або свіжі дані, і додавайте файн-тюнінг лише тоді, коли невідповідності формату чи латентність почнуть боліти в продакшені. Перестрибніть одразу до файн-тюнінгу, і ви сплатите податок на навчання, перш ніж дізнаєтеся, чи пошук уже розв'язав проблему.
Гібридний патерн не є компромісом; для зрілих розгортань це стандарт: файн-тюнінг для формату, пошук для фактів.
Як оцінити свого переможця?
Обирайте переможця так, як обирали б базу даних: вимірюйте на своєму навантаженні, а не на інтуїції. Рецепт вміщується в один абзац і покриває чотири числа, які насправді вирішують.
- Відкладений набір питань. 100–300 реальних питань користувачів. Не синтетичних, і жодного з тих, що бачили під час навчання чи індексації.
- Faithfulness і коректність відповіді. Faithfulness питає, чи відповідь спирається на знайдений контекст; коректність відповіді питає, чи вона насправді правильна. Ця пара, популяризована RAGAS, ловить і галюцинації, і промахи пошуку.
- Латентність на p95, а не середня. Пошук додає раунд-трип; міряйте хвіст.
- Вартість на 1 000 запитів, токени плюс інфраструктура, виміряна, а не вгадана.
- Перезапуск під час дрейфу. Нові документи, новий снапшот моделі, новий квартал: проженіть набір заново.
Повний розбір метрик, включно з інструментами, у нашому гайді з оцінювання LLM.
Про автора
Мерт Батур є співзасновником Techsy.io, де команда випускає AI-агентів, системи автоматизації та голосові/SDR-конвеєри для B2B-клієнтів. Він пише про стек LLM-інструментів, який команда Techsy насправді використовує в продакшені. Зв'яжіться в LinkedIn.
Часті запитання
Чи можна використовувати RAG і файн-тюнінг разом?
Так. Зробіть файн-тюнінг заради формату виводу й доменної плинності і залиште пошук для фактів на момент інференсу. Балаґер і співавтори виміряли цей гібрид на агрономічному QA-завданні й виявили, що він перевершує кожен підхід окремо, а прирости точності сумарно додаються. Більшість зрілих продакшн-систем закінчують саме тут: ваги для «як», пошук для «що».
Коли не варто робити файн-тюнінг?
Пропускайте файн-тюнінг, коли ваші знання змінюються швидше, ніж ви встигаєте перенавчати, коли розмічених прикладів менше кількох сотень, коли відповіді мають містити цитування або аудиторські сліди, або коли немає бюджету на перенавчання під час дрейфу даних. Ці чотири умови описують більшість ранніх продуктів, тому RAG зазвичай є правильним першим кроком.
Файн-тюнінг спростовано?
Ні, але його територія звузилася. Довгі контекстні вікна і дешевий RAG поглинули кейси, які у 2023 році вимагали файн-тюнінгу. Те, що залишилося, реальне: суворий формат виводу, тон бренду, бюджети латентності без пошукового раунд-трипу й економіка малих моделей. Якщо ваша проблема в тому, як модель відповідає, а не що вона знає, файн-тюнінг досі є інструментом.
Коли використовувати RAG, а коли файн-тюнінг?
Використовуйте RAG, коли відповіді залежать від приватних або часто оновлюваних знань, або коли потрібні цитування. Використовуйте файн-тюнінг, коли потрібні стабільний формат, тон або латентність і у вас достатньо розмічених прикладів. Використовуйте обидва, коли продукт дозріє. Якщо не впевнені, почніть із RAG: скасувати його дешевше, ніж прогін навчання.
Чи RAG дешевший за файн-тюнінг?
На старті так. Вартість RAG припадає на запит (ембедінги плюс додаткові вхідні токени), тоді як файн-тюнінг бере один раз за навчання і розмічені дані, а потім поновлюється з кожним перенавчанням. За публічними прайсами точка беззбитковості в нашому прикладі припадає приблизно на 6,4 мільйона запитів, тож на типових обсягах RAG лишається дешевшим упродовж усього життя продукту.
Чи RAG кращий за файн-тюнінг проти галюцинацій?
Зазвичай, але не задарма. RAG приземлює відповіді на знайдені фрагменти, тож ви можете цитувати джерела й аудитувати збої. Але поганий пошук отруює відповідь: Anthropic виміряв 5,7% невдалих пошуків у top-20 на простих конфігураціях, що падає до 1,9% з контекстним пошуком плюс реранкінгом. Файн-тюнінг тим часом може впекти помилки у ваги без жодної можливості їх відстежити.
RAG проти файн-тюнінгу проти промпт-інжинірингу: у чому різниця?
Промпт-інжиніринг змінює інструкції, які ви надсилаєте. RAG змінює контекст, який модель читає під час запиту. Файн-тюнінг змінює ваги моделі. Кожен наступний є більшим втручанням, ніж попередній: спершу спробуйте промпти, додайте пошук, коли вузьким місцем є знання, і переходьте до навчання лише тоді, коли формат, тон або латентність і далі болять.
Як оцінити продуктивність RAG проти файн-тюнінгу?
Зберіть відкладений набір зі 100–300 реальних питань користувачів і оцініть на ньому обидва підходи: faithfulness (чи є обґрунтування?), коректність відповіді (чи правильно?), латентність p95 і вартість на 1 000 запитів. Проганяйте набір заново щоразу, коли змінюються ваші документи або снапшот моделі. Синтетичні питання лестять обом системам; реальні їх розділяють.
Файн-тюнінг проти RAG для багатокрокових питань про нові знання?
RAG, з кращим пошуком. Це питання вирішує механіка: файн-тюнінгова модель може міркувати лише над тим, що поглинули її ваги, тож знання, яких вона ніколи не бачила, недосяжні, хай би як добре її навчили. Пошук подає їй те, чого бракує, на момент запиту. Пастка в тому, що один прохід пошуку рідко збирає всі кроки, тож плануйте декомпозицію запитів або ітеративний пошук плюс реранкер, а не єдиний top-K-запит.
Висновок
Підсумок без обмовок:
- RAG є стандартом для знань, що змінюються, і цитованих відповідей. Файн-тюнінг є спеціалістом із формату, тону й латентності.
- Докази на одному завданні (Balaguer et al.) дають файн-тюнінгу +6 п.п., а RAG ще +5 п.п. зверху, і гібрид є найкращим із трьох. Наша порада «починайте з RAG» спирається на свіжість, цитування і вартість, а не на цю таблицю результатів.
- Арифметика витрат на реальних обсягах на користь RAG: точка беззбитковості в нашому прикладі припала приблизно на 6,4 мільйона запитів.
- Вирішуйте за п'ятьма перевірками, а не за звичкою.
Обрали RAG? Дивіться наш рейтинг інструментів RAG для стека навколо конвеєра.