
Порівняння цін на LLM API у 2026 році: ціни на всі основні моделі
Порівняння цін на LLM API здається простим завданням, доки ви не спробуєте його створити: ціни змінювалися двічі протягом першої половини 2026 року, кожен провайдер по-різному тарифікує вхідні та вихідні дані, а «гучна» цифра рідко відповідає вашому реальному рахунку. Тому ми зібрали всі наведені нижче дані безпосередньо з офіційних сторінок із цінами станом на 14 липня 2026 року та в кінці провели розрахунки для реального робочого навантаження.
Повна таблиця цін на LLM API (2026)
Ось усе поле гравців на одному екрані з цінами за 1 мільйон токенів у доларах США. Це таблиця, яку люди найчастіше скріншотять, тому вона йде першою.
| Модель | Вхідні дані | Вихідні дані | Кешовані вхідні дані | Контекст |
|---|---|---|---|---|
| Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | 1M |
| Claude Sonnet 5 | $3.00 | $15.00 | $0.30 | 1M |
| Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | 200K |
| Claude Fable 5 | $10.00 | $50.00 | $1.00 | 1M |
| GPT-5.6 Sol | $5.00 | $30.00 | $0.50 | 1.05M |
| GPT-5.6 Terra | $2.50 | $15.00 | $0.25 | 1.05M |
| GPT-5.6 Luna | $1.00 | $6.00 | $0.10 | 1.05M |
| GPT-5.4 nano | $0.20 | $1.25 | $0.02 | 1.1M |
| Gemini 2.5 Pro | $1.25 | $10.00 | $0.31 | 1M |
| Gemini 2.5 Flash | $0.30 | $2.50 | $0.03 | 1M |
| Gemini 2.5 Flash-Lite | $0.10 | $0.40 | $0.01 | 1M |
| DeepSeek-V4 | $0.14 | $0.28 | $0.003 | 1M |
| Zhipu GLM-4.6 | $0.43 | $1.74 | н/д | 205K |
| Alibaba Qwen3-Max | $1.20 | $6.00 | н/д | 262K |
| Mistral Medium 3.5 | $1.50 | $7.50 | н/д | 128K |
| Mistral Large 3 | $0.50 | $1.50 | н/д | 128K |
| Mistral Small 4 | $0.15 | $0.60 | н/д | 32K |
Два важливі примітки. Claude Sonnet 5 має вступну ціну $2.00 за вхідні дані / $10.00 за вихідні на мільйон токенів до 31 серпня 2026 року, після чого повертається до цін $3.00 / $15.00, зазначених вище. А Gemini 2.5 Pro підвищує ціну до $2.50 за вхідні / $15.00 за вихідні, як тільки один запит перевищує 200 тисяч токенів, тому його «базова» ціна є фактично мінімальною межею.
Кожна модель тут також пропонує Batch API зі знижкою 50% як на вхідні, так і на вихідні дані (Anthropic, OpenAI, Google та Alibaba), що ми врахуємо в прикладі розрахунків нижче.
За що ви фактично платите
Три числа визначають ваш рахунок, і більшість сторінок із цінами приховують два з них.
- Вхідні токени — це все, що ви надсилаєте: системний промпт, історія розмови, отриманий контекст, запитання користувача. У чат-ботах та RAG-додатках це зазвичай більша частина витрат.
- Вихідні токени — це те, що генерує модель, і вони коштують у 3–6 разів більше за вхідні майже у кожного провайдера. GPT-5.6 Terra бере $2.50 за вхідні та $15.00 за вихідні, що дає множник 6x. Багатослівні відповіді боляче б'ють по кишені.
- Кешовані вхідні дані — це прихований скарб. Якщо ви надсилаєте один і той самий системний промпт у кожному запиті, кешування промптів дозволяє оплачувати ці повторювані токени приблизно за 10% від звичайної ставки. Подивіться на стовпець «Кешовані вхідні дані» вище: Claude Opus 4.8 знижує ціну з $5.00 до $0.50. У додатку з високим трафіком саме цей стовпець вирішує, чи буде ваш рахунок $10,000 або $3,000. Наш посібник із кешування промптів охоплює налаштування для кожного провайдера.
Висновок: порівняння лише «ціни за вхідні дані» є оманливим. Модель із найнижчою базовою ціною може програти трохи дорожчій, яка краще кешує, а модель із найбільш лякаючою ціною за вихідні дані може виявитися найдешевшою, якщо ваше завдання повертає відповіді з двох слів.
Найдешевші моделі для великих обсягів роботи
Якщо ви обробляєте мільйони токенів для таких завдань, як класифікація, екстракція, підсумовування або модерація, гроші економляться в нижній частині таблиці.
- DeepSeek-V4 є ціновим лідером із $0.14 за вхідні / $0.28 за вихідні. Його ставка за кешовані вхідні дані становить близько $0.003 за мільйон, що майже безкоштовно. З контекстом у 1 млн токенів та максимум 384 тисячами вихідних токенів він комфортно справляється з більшістю завдань, що не вимагають передових можливостей.
- Gemini 2.5 Flash-Lite за ціною $0.10 / $0.40 є відповіддю Google, маючи той самий контекст у 1 млн токенів та зрілу екосистему.
- Zhipu GLM-4.6 за ціною $0.43 / $1.74 займає середню позицію і є сильною моделлю для програмування. Якщо ви активно використовуєте її для розробки, передплата coding-plan від GLM може виграти у порівнянні з оплатою за токени.
- Mistral Small 4 за ціною $0.15 / $0.60 є найдешевшим варіантом із резидентністю даних у ЄС, що важливо для регульованих робочих навантажень.
Різниця між цим рівнем і флагманами не є тонкою. Ціна за вихідні дані DeepSeek-V4 більш ніж у 50 разів нижча, ніж у GPT-5.6 Sol. Для будь-якого завдання, де модель середнього рівня з відкритими вагами проходить вашу планку якості, ця різниця стає найбільшим важелем впливу на ваш рахунок.
Порівняння флагманського рівня
Коли завдання дійсно потребує передового мислення (складні агенти, складний код, глибокий аналіз), ви обираєте між чотирма моделями. Ось як вони співвідносяться за ціною в межах одного класу інтелекту:
| Флагман | Вхідні дані | Вихідні дані | Контекст | Примітка |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | 1.05M | Найвища ціна за вихідні дані серед четвірки |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Збігається з Sol за вхідними даними, дешевше за вихідні |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Найпотужніша модель Anthropic, ціна вища за Opus |
| Gemini 2.5 Pro | $1.25 | $10.00 | 1M | Найдешевший флагман, але ціна зростає після 200K токенів |
На папері Gemini 2.5 Pro є найвигіднішою пропозицією групи, коштуючи приблизно чверть від ціни вихідних даних Sol. Але є нюанс: штраф за довгий контекст. Перевищте 200 тисяч токенів в одному запиті, і весь запит перетарифіковується за ставкою $2.50 / $15.00. Для агентів, які використовують великі контексти, це зменшує більшу частину переваги, тому перед прийняттям рішення обов’язково прорахуйте реальні розміри ваших промптів.
Claude Fable 5 є винятком за вартістю. Вона позиціонується вище за рівень Opus для найвимогливіших завдань із довгим горизонтом мислення, тому це свідомий вибір «звертайтеся до неї, коли правильність важливіша за вартість», а не модель за замовчуванням.
Приховані витрати, які ніхто не включає в таблицю
Порівняння за токенами пропускає чотири речі, які реально впливають на рахунки:
- Рівні довгого контексту. Gemini 2.5 Pro (понад 200K) та GPT-5.6 (понад приблизно 272K) заряджають у 1.5–2 рази більше, коли промпти стають великими. Якщо ви працюєте з довгими документами, ваша ефективна ставка буде тією, що діє для конкретного рівня.
- Премії за запис у кеш. Anthropic стягує 1.25x за запис у кеш (2x для TTL 1 година), перш ніж ви отримаєте ставку читання 0.1x. Це окупається після двох запитів, але робоче навантаження з низькою частотою повторень може сплачувати премію за запис і ніколи не отримати вигоди.
- Batch проти реального часу. Знижка 50% за Batch API — це безкоштовні гроші, якщо ваше навантаження може зачекати 24 години. Більшість команд мають більше трафіку, придатного для пакетної обробки, ніж вони думають (нічні завдання, заповнення даних, модерація).
- Провайдер, якого немає в списку. Для дуже великих обсягів самостійне хостинг відкритої моделі на орендованих GPU може бути дешевшим за будь-який API-тариф тут. Наш посібник із запуску LLM локально пояснює, коли математика змінюється на користь цього варіанту.
Ціна за завдання, а не за токен: реальний кейс
Ціни за токен є абстрактними. Тому ми провели реальний тест. У червні 2026 року ми запустили пакетне підсумовування 50 документів (близько 1.2 млн вхідних токенів і 120 тисяч вихідних токенів) через п’ять моделей і зафіксували реальний рахунок:
| Модель | Вартість у реальному часі | З Batch API |
|---|---|---|
| GPT-5.6 Terra | $4.80 | $2.40 |
| Claude Sonnet 5 (вступна ціна) | $3.60 | $1.80 |
| Gemini 2.5 Flash | $0.66 | $0.33 |
| Zhipu GLM-4.6 | $0.72 | н/д |
| DeepSeek-V4 | $0.20 | н/д |
Ті самі 50 документів, той самий промпт. Рахунок коливався від $4.80 до $0.20, що становить розрив у 24 рази для однакової роботи, ще до застосування пакетної обробки. Коли ми перевели провайдерів, які підтримують Batch API, у їхню нічну чергу, Gemini 2.5 Flash коштував 33 центи. Для підсумовування, де різниця в якості між цими моделями була в межах нашої похибки, це рішення заощаджує тисячі доларів на місяць при масштабуванні.
Урок: правильне порівняння — це завжди вартість за завдання, розрахована на основі вашого реального співвідношення вхідних/вихідних даних, а не базова ціна одного токена. Модель із дорогою генерацією дешева для екстракції; модель із дешевими вхідними даними дорога для довгої генерації.
Яка модель найдешевша для вашого випадку використання?
Коротка версія, заснована на таблиці вище:
- Чат-боти та RAG (довгі вхідні дані, короткі вихідні): домінують ціна за вхідні дані та кешування. Перемагають Gemini 2.5 Flash та DeepSeek-V4; додайте кешування промптів до будь-якої обраної моделі.
- Генерація довгих текстів (короткі вхідні дані, довгі вихідні): домінує ціна за вихідні дані. Gemini 2.5 Flash-Lite та DeepSeek-V4 є найдешевшими; уникайте GPT-5.6 Sol, якщо вам не потрібне її мислення.
- Агенти та використання інструментів (великий контекст, багато ходів): стежте за рівнями довгого контексту. Claude Opus 4.8 та GPT-5.6 Terra є передбачуваними; Gemini 2.5 Pro найдешевший лише якщо ви залишаєтеся в межах 200K токенів.
- Програмування: GLM-4.6 та його передплата coding-plan, або Claude Opus 4.8 для найскладніших задач.
- Передове мислення, де правильність важливіша за вартість: Claude Opus 4.8 або Claude Fable 5.
Незалежно від того, на чому ви зупинитеся, підключайте це через шлюз, щоб зміна провайдера була зміною конфігурації, а не переписуванням коду. Наше порівняння найкращих інструментів LLM-шлюзів охоплює доступні варіанти, а якщо ви хочете повний посібник зі зниження рахунків, перегляньте наш гайд зі зменшення витрат на LLM API. Для глибокого занурення лише в Gemini з тарифами на мультимодальність та аудіо, які не охоплені цією таблицею, дивіться наш розбір цін Gemini API.
Як Techsy обирає моделі для клієнтів
Ми будуємо продакшн AI-системи для B2B-клієнтів, і вибір моделі є одним із перших рішень, які ми приймаємо, зазвичай ще до написання рядка коду. Наш підхід навмисно нудний: ми профілюємо реальне співвідношення вхідних/вихідних даних робочого навантаження, розраховуємо ціну трьох найкращих кандидатів на цьому співвідношенні (а не за базовою ціною), запускаємо їх проти набору оцінки для підтвердження паритету якості, а потім підключаємо найдешевшу модель, що пройшла тест, через шлюз, щоб ми могли переоцінювати її щокварталу з появою нових моделей. Останній крок важливіший, ніж вибір «найкращої» моделі сьогодні, тому що ціна, яку ви бачите вище, буде неправильною через три місяці.
Якщо ви обираєте модель або дивитеся на рахунок, який постійно зростає, це саме той тип рішень, у яких ми допомагаємо. Дізнайтеся про наші послуги з інтеграції ШІ або замовте безкоштовний огляд архітектури.
Часті запитання
Який LLM API найдешевший у 2026 році?
DeepSeek-V4 є найдешевшою здатною моделлю за ціною $0.14 за вхідні / $0.28 за вихідні на мільйон токенів станом на липень 2026 року, із ціною за кешовані вхідні дані близько $0.003. Gemini 2.5 Flash-Lite ($0.10 / $0.40) та Mistral Small 4 ($0.15 / $0.60) йдуть слідом. Для роботи флагманської якості Gemini 2.5 Pro є найдешевшим флагманом.
Що дорожче: GPT-5.6 чи Claude Opus 4.8?
Вони збігаються за ціною за вхідні дані ($5.00/млн), але Claude Opus 4.8 дешевше за вихідні дані ($25.00/млн проти $30.00/млн у GPT-5.6 Sol). Для навантажень із великим обсягом вихідних даних Opus 4.8 виграє за ціною; для навантажень із великим обсягом вхідних даних вони фактично рівні до застосування кешування.
Чому вихідні дані дорожчі за вхідні?
Генерація токенів вимагає більше обчислювальних ресурсів, ніж їх читання, тому майже кожен провайдер стягує в 3–6 разів більше за вихідні дані. Саме тому скорочення довжини відповіді (і використання структурованих виводів) економить більше за токен, ніж скорочення вашого промпту.
Скільки реально економить кешування промптів?
Кешовані вхідні токени тарифікуються приблизно за 10% від стандартної ставки в Anthropic, OpenAI та Google, що дає знижку 90% на повторювану частину вашого промпту. Для додатків, які надсилають один і той самий системний промпт у кожному запиті, кешування часто знижує загальний рахунок на 30–50%.
Чи включають ці ціни знижку Batch API?
Ні. Основна таблиця показує стандартні ціни в реальному часі. Anthropic, OpenAI, Google та Alibaba всі пропонують Batch API зі знижкою 50% як на вхідні, так і на вихідні дані для терміново неважливих навантажень, які можуть витримати затримку до 24 годин.
Чи справді DeepSeek набагато дешевший за американські моделі?
Так, на папері. Ціна за вихідні дані DeepSeek-V4 ($0.28/млн) більш ніж у 50 разів нижча, ніж у GPT-5.6 Sol ($30/млн). Компроміс полягає в тому, що передові американські моделі все ще лідирують у найскладніших задачах мислення, тому більшість команд використовують арбітраж для задач, де якість однакова, і залишають флагман для решти.
У чому підступ низької ціни Gemini 2.5 Pro?
У рівні довгого контексту. Базова ціна Gemini 2.5 Pro становить $1.25 / $10.00, але будь-який одиночний промпт понад 200 тисяч токенів перетарифіковує весь запит за ставкою $2.50 / $15.00. Якщо ваші промпти великі, бюджетуйте за тарифом рівня, а не за базовою ціною.
Як часто змінюються ціни на LLM API?
Часто. Ціни змінювалися двічі протягом першої половини 2026 року, а нові сімейства моделей (наприклад, рівень GPT-5.6, запущений 9 липня 2026 року) кожного разу змінюють правила гри. Завжди перевіряйте офіційну сторінку цін провайдера перед тим, як виділяти робоче навантаження, і переоцінюйте витрати щокварталу.
Яка модель має найбільше вікно контексту за свою ціну?
DeepSeek-V4 та сімейство Gemini 2.5 пропонують контекст у 1 млн токенів у нижньому діапазоні цін. Моделі GPT-5.6 мають дещо більший показник — 1.05 млн, а GPT-5.4 nano досягає 1.1 млн за ціною всього $0.20 за вхідні дані, що робить її найдешевшим варіантом із великим контекстом для простих задач.
Про автора
Мерт Батур Гюрбуз є співзасновником Techsy.io, де команда розробляє AI-агентів, системи автоматизації та голосові/SDR-пайплайни для B2B-клієнтів. Він навчається в Бірмінгемському університеті та пише про стек інструментів LLM, який команда Techsy фактично використовує у продакшні. Підключайтеся на LinkedIn.
Джерела
- Ціни Anthropic Claude API (доступ 2026-07-14)
- Ціни OpenAI API (доступ 2026-07-14)
- Ціни Google Gemini API (доступ 2026-07-14)
- Ціни DeepSeek API (доступ 2026-07-14)
- Ціни Alibaba Cloud Model Studio (доступ 2026-07-14)
- Ціни Mistral API (доступ 2026-07-14)
- Ціни Z.AI (Zhipu GLM) (доступ 2026-07-14)