Калькулятор вартості API OpenAI, Claude & Gemini
Порівнюйте щомісячні витрати між постачальниками з урахуванням знижок за кешування та пакетну обробку.
Вартість API для GPT, Claude та Gemini коливається від $0,15 до $75 за мільйон вхідних токенів, причому вихідні токени зазвичай у 3–5 разів дорожчі. За обсягу 10 мільйонів токенів на місяць GPT-4o обійдеться приблизно в $775, Claude Sonnet 4 — близько $1 140, а Gemini 2.5 Pro — близько $825. Кешування промптів зменшує витрати в 10 разів на кешованих токенах; Batch API знижує вартість на 50% для задач без вимог реального часу. Цей калькулятор дає змогу точно змоделювати використання для всіх трьох провайдерів.
Ваші дані
05 fieldsКому підходить цей інструмент
Засновникам, які оцінюють масштаб проєкту з openai api перед переговорами з підрядниками. CTO та керівникам інженерних команд, що формують річний бюджет на нові продукти. Продуктовим менеджерам, яким потрібно перетворити одне речення ідеї на обґрунтований діапазон витрат для фінансового відділу. Відділам закупівель, які перевіряють коммерційні пропозиції агентств та фрилансерів на адекватність.
Як ми рахуємо
Ціни базуються на опублікованих тарифах OpenAI, Anthropic і Google станом на 2026 рік. Кешування промптів застосовується лише до кешованих вхідних токенів (зазвичай системний промпт + стабільний контекст). Batch API застосовується як до вхідних, так і до вихідних токенів для роботи, що не потребує реального часу, з SLA 24 години.
Джерела даних
Що впливає на фінальну цифру
Вибір рівня моделі
Передові моделі, як-от GPT-4.5, Claude Opus 4 та Gemini 2.5 Pro, коштують у 5–10 разів дорожче за токен, ніж їхні аналоги середнього рівня. Використовуйте передові моделі лише для складних міркувань, де середній рівень справді не справляється: складна багатокрокова логіка, математика, неоднозначна генерація коду або завдання, що потребують глибоких знань про світ. Усе інше скеровуйте на Claude Sonnet 4, GPT-4o або Gemini Flash. Різниця у вартості настільки велика, що розумна маршрутизація зазвичай скорочує витрати на 60–80% на змішаних навантаженнях.
Кешування промптів
Anthropic кешує вхідні токени на 5 хвилин безкоштовно або на 1 годину з доплатою 25%, зменшуючи вартість кешованих токенів приблизно на 90%. OpenAI кешує автоматично на 5–10 хвилин на певних ендпоінтах без жодного налаштування. Кешування найкраще працює, коли ваш системний промпт перевищує 2 тисячі токенів і є стабільним між запитами, що описує більшість продакшн-чатботів і RAG-систем. Найбільша економія досягається на навантаженнях із довгим стабільним контекстом і багатьма запитами на хвилину.
Batch API
І OpenAI, і Anthropic пропонують batch-ендпоінти зі знижкою рівно 50% від стандартної ціни в обмін на SLA 24 години. Batch ідеально підходить для класифікації, генерації ембедінгів, підсумовування, запусків оцінювання та будь-якого фонового оброблення. Інтеграція тривіальна: та сама модель, той самий промпт, інший ендпоінт, плюс черга для очікування результатів. Більшість команд нехтують batch і платять повну ціну за навантаження, які не потребують реального часу, а це одна з найлегших витрат на ШІ, яких можна уникнути.
Токени виведення
Вихідні токени коштують у 3–5 разів дорожче за вхідні в усіх провайдерів, і більшості відповідей не потрібен буфер у 4 тисячі токенів, який API дозволяє за замовчуванням. Якщо ви отримуєте відповідь «так» чи «ні», обмежте вивід 10 токенами. Якщо генеруєте коротке резюме, обмежте його 200. Модель часто хоче пояснити свої міркування, навіть коли ви не просили, і ви платите за ці пояснення. Зменшення max_tokens часто скорочує вартість виводу на 30–50% без втрати якості.
Розмір контекстного вікна не визначає ціну
Усі великі провайдери стягують плату за кожен використаний токен, а не за розмір контекстного вікна. Контекстне вікно на 200K для промпту на 5K токенів коштує рівно стільки ж, скільки вікно на 5K для того самого промпту на 5K токенів. З цього випливає, що моделі з довгим контекстом не є «дорожчими у використанні», якщо ви насправді не заповнюєте контекст. Обирайте модель за можливостями та ціною за токен, а не за тим, у кого найбільше контекстне вікно.
Як зменшити витрати
Увімкніть кешування промптів — це перша оптимізація, яку варто зробити ще до будь-яких інших кроків. В Anthropic позначте свій стабільний системний промпт заголовками cache_control, і кешовані токени коштуватимуть приблизно 10% від стандартної ціни вхідних токенів. В OpenAI кешування відбувається автоматично на певних ендпоінтах, коли префікс вашого промпту однаковий у всіх запитах. Найбільший виграш — на навантаженнях із довгим стабільним контекстом і великою кількістю запитів: чат-боти з детальними персонами, RAG-системи з повторюваним контекстом пошуку та будь-які агентні цикли, що повторно надсилають довгий набір інструкцій. Більшість команд забувають увімкнути кешування і переплачують у 5–10 разів.
Перенесіть усі навантаження, що не потребують реального часу, на Batch API. І Anthropic, і OpenAI пропонують батч-ендпоінти за рівно 50% від стандартної ціни в обмін на SLA з відповіддю протягом 24 годин. Класифікація, модерація контенту, генерація ембедінгів, пайплайни підсумовування та прогони оцінювання — усе це чудові кандидати. Інтеграція тривіальна, бо промпт і модель не змінюються. Команди регулярно женуть цілий пайплайн тегування контенту за стандартною ціною, хоча батч міг би вдвічі скоротити рахунок без жодної різниці в якості.
Маршрутизуйте запити за складністю. Прості запити (привітання, форматування, базовий пошук) належать GPT-4o mini, Claude Haiku або Gemini Flash за $0.15–$0.80 за мільйон вхідних токенів. Складне міркування — Claude Opus, GPT-4.5 або Gemini Pro за $1.25–$75 за мільйон. Невеликий класифікатор перед вашим маршрутизатором моделей зазвичай скорочує витрати на 60–80% на змішаних навантаженнях. Надсилати все на флагманську модель — найпоширеніша помилка у вартості AI, яку ми бачимо в продакшені.
Жорстко обмежуйте max_tokens. Вихідні токени коштують у 3–5 разів дорожче за вхідні, а дефолтний буфер у 4K на виході значно більший, ніж потрібно більшості відповідей. Обмежуйте відповіді «так/ні» до 10 токенів, короткі підсумки — до 200, структурований JSON — до того, що вимагає ваша схема, плюс невеликий запас. Модель іноді хоче розписати докладніше, навіть якщо ви не просили, і ви платите за ці розлогі відповіді. Зменшення max_tokens у більшості випадків дає скорочення вартості вихідних токенів на 30–50%.
Скорочуйте отриманий контекст лише до того, що потрібно для кожного запиту. RAG-системи часто отримують 10–20 фрагментів і запихають їх усі у промпт «про всяк випадок». У результаті ви платите за тисячі нерелевантних токенів на кожен запит. Додавання ранжувальника, що відфільтровує 3–5 найрелевантніших фрагментів, зазвичай скорочує використання вхідних токенів на 50–70% без втрати якості, а часто й із її покращенням, бо модель не відволікається на нерелевантний контекст.
Логуйте кожен запит із кількістю токенів, моделлю та статусом — кешовані токени чи ні. Ви не зможете оптимізувати те, чого не бачите, а витрати на AI можуть змінитися за одну ніч, коли виходить нова функція або хтось підправляє промпт. Налаштуйте щоденні сповіщення про витрати. Побудуйте дашборд, що розбиває витрати за функцією, моделлю та ендпоінтом. Більшість перевитрат у продакшені, з якими ми стикаємося, трапляються тому, що патерн використання змінився за два тижні до того, як хтось зазирнув у рахунок.
Вартість за мільйон токенів (тарифи 2026 року)
| Модель | Вхідні дані | Вихідні дані | Кешовані вхідні дані |
|---|---|---|---|
| GPT-4.5 | $75.00 | $150.00 | $37.50 |
| GPT-4o | $2.50 | $10.00 | $1.25 |
| GPT-4o mini | $0.15 | $0.60 | $0.075 |
| Claude Opus 4 | $15.00 | $75.00 | $1.50 |
| Claude Sonnet 4 | $3.00 | $15.00 | $0.30 |
| Claude Haiku 4 | $0.80 | $4.00 | $0.08 |
| Gemini 2.5 Pro | $1.25 | $10.00 | Н/Д |
| Gemini 2.5 Flash | $0,075 | $0,30 | Н/Д |
FAQ
Питання, які нам задають щотижня
Короткі відповіді простою мовою. Якщо вашого запитання тут немає,
GPT-4o: $2,50 за мільйон вхідних токенів, $10 за вихідні. GPT-4o mini: $0,15/М вхідні, $0,60 вихідні. GPT-4.5: $75/М вхідні, $150 вихідні. За 10 млн токенів на місяць із розподілом 30/70 (вхідні/вихідні) розраховуйте на $25–13 тис. залежно від моделі.
Для більшості задач: GPT-4o mini, Gemini 2.5 Flash або Claude Haiku 4 — усі дешевше $1 за мільйон вхідних токенів. Для оптимального співвідношення ціна/якість: Claude Sonnet 4 або Gemini 2.5 Pro.
Anthropic та OpenAI кешують великі вхідні промпти між запитами. Кешовані токени коштують приблизно на 90% дешевше за некешовані. Найкраще підходить для чат-ботів зі стабільними системними промптами або RAG зі сталим контекстом.
Рівно 50% як на вхідних, так і на вихідних токенах. Потрібно прийняти SLA на 24 години. Підходить для класифікації, підсумовування, створення ембедінгів та оцінювання. Не підходить для чатів у реальному часі чи інтерактивного UX.
На порівнянних рівнях якості — схожа вартість. Claude Sonnet 4 проти GPT-4o — приблизно на одному рівні. Claude Opus 4 із кешуванням промптів обходиться приблизно на 30% дешевше за GPT-4o на задачах зі стабільними промптами.
(1) Увімкніть кешування промптів. (2) Використовуйте Batch API де можливо. (3) Спрямовуйте прості запити на міні-моделі. (4) Жорстко обмежуйте max_tokens. (5) Скорочуйте контекст пошуку до найнеобхіднішого.
Точка беззбитковості — приблизно $5 тис. на місяць витрат на API. Нижче цієї межі: продовжуйте користуватися API. Вище: самостійний хостинг Llama 3.1 або Mistral зменшує витрати на 50–70%, якщо у вас є відповідна інфраструктурна експертиза.
Візьміть репрезентативну вибірку зі 100 запитів. Виміряйте середню кількість вхідних і вихідних токенів. Помножте на місячний обсяг запитів. Помножте на вартість за мільйон токенів. Додайте 30% запасу надійності.
Лише для складних міркувань, де моделі середнього рівня не справляються. Для 80% робочих навантажень у продакшені Sonnet 4, GPT-4o або Gemini 2.5 Pro чудово працюють за в 10 разів нижчу ціну.
У межах ±15% для типових навантажень. Реальні розбіжності виникають через різну довжину промптів, різну довжину відповідей, цикли помилок і повторів, а також логіку маршрутизації. Використовуйте калькулятор як інструмент планування, а не як остаточний рахунок.
Подібні інструменти
Інші калькулятори, які найчастіше відкривають одразу після цього; оберіть той, що підходить для вашого наступного кроку.
Витрати на розробку плюс щомісячні експлуатаційні витрати; повна картина.
Отримайте точну оцінку від нашої команди
Калькулятор дає діапазон цін. 30-хвилинний дзвінок — фіксований обсяг робіт, терміни та бюджет. Безкоштовна консультація без зобов’язань.
Розпочати розмову