
Розгортання LLM на серверлес GPU: 5 платформ, реальні ціни, чесні холодні старти
RunPod бере $2,72/год за A100 80GB. Ваш ендпоінт отримує дванадцять запитів до обіду. Решту 23 години GPU простоює, а рахунок капає весь цей час. Розгорніть LLM на серверлес GPU, і платите лише поки виконується запит. Так роблять п'ять платформ. І кожна тарифікує у власних одиницях. Ніхто їх не уніфікує.
Простій GPU коштує рівно стільки ж, скільки завантажений.
Ключові висновки
- Серверлес GPU тарифікується лише під час виконання запиту й масштабується до нуля між ними.
- Cloud Run дає один GPU на інстанс; моделі на 70B потребують кількох GPU, тож серверлес зазвичай їх не потягне.
- Ваги моделі лежать в образі, на мережевому томі або завантажуються заново з кожним холодним стартом.
- Холодний старт — це три етапи: запуск контейнера, завантаження ваг, ініціалізація рушія. Швидкий лише перший.
- До приблизно 47 000 запитів на день масштабування до нуля вигідніше за орендований GPU 24/7.
Що насправді означає «серверлес GPU» для LLM?
Платформа серверлес GPU запускає ваш інференс-контейнер на спільному GPU-залізті, піднімає його, коли приходить запит, і масштабується до нуля, коли трафік зупиняється. Ви платите посекундно (або похвилинно чи погодинно, залежно від вендора) лише поки контейнер живий. Жодних рахунків за простій. Жодних зарезервованих інстансів.
Одиниці тарифікації різняться у кожного вендора, тому в наступному розділі все зведено до $/GPU-год.
Два обмеження дивують. По-перше, Google Cloud Run дозволяє щонайбільше один GPU на інстанс. Це обмежує стелю VRAM однією карткою. По-друге, «серверлес» не означає постійний стан. Немає жодного довгоживучого процесу, який тримав би ваші ваги в RAM між запитами. Коли контейнер помирає, все в пам'яті помирає разом з ним. Саме цей факт визначає рішення про сховище в розділі про ваги моделі нижче.
Серверлес не означає «без сервера». Це означає «без сервера між вашими запитами», і саме туди зникають ваші ваги моделі.
Яку платформу серверлес GPU обрати? (ціни 2026, пліч-о-пліч)
Ми не продаємо жодну з цих платформ і не отримуємо афілійного доходу від жодної. З семи статей, що змагаються за цим запитом і його варіаціями, чотири опубліковані компанією, яка продає серверлес GPU. Ця таблиця — ні.
Усі тарифи взяті з власних сторінок цін вендорів станом на 30.07.2026. Тарифи змінюються; перевірте ще раз, перш ніж приймати рішення.
| Платформа | Оприлюднена одиниця (їхніми словами) | $/GPU-год (A100 80GB) | $/GPU-год (H100) | Безкоштовні кредити | Обирайте, якщо... |
|---|---|---|---|---|---|
| Modal | $0,000694/с | $2,50 | $3,95 | $30/міс (Starter) | потрібна посекундна тарифікація, швидкі збірки та GPU-снапшоти |
| RunPod | $2,72/год | $2,72 | $4,55 | не оприлюднено | потрібен найширший вибір GPU за фіксованими погодинними ставками |
| Beam | $0,000625/с | $2,25 | $3,55 | $30/міс | не хочете платити за запуск і завантаження образу |
| Baseten | $0,06667/хв | $4,00 | $6,50 | так, суму не оприлюднено | потрібен керований інференс із тарифікацією активних обчислень |
| Cloud Run | посекундно (L4 та RTX PRO 6000 Blackwell; без A100/H100) | не оприлюднено (без A100) | не оприлюднено (без H100) | кредит GCP $300 | ви вже на GCP і потрібен контроль регіонів ЄС/США |
Арифметика нормалізації, показуємо раз, щоб ви могли перевірити: A100 80GB у Modal за $0,000694/с, помножити на 3600 секунд, дорівнює $2,4984/год. Beam: $0,000625 × 3600 = $2,25/год. Baseten: $0,06667/хв × 60 = $4,00/год. Ця різниця у 1,8× між Beam і Baseten за той самий A100 реальна, і вона ховається на видноті, бо ніхто не публікує однакові одиниці.
Три застереження. Сторінка цін Beam прямо зазначає, що запуск сервера та завантаження образу контейнера не тарифікуються. FAQ Baseten про ціни на питання «Чи плачу я за час простою на Baseten?» відповідає: «Ні, за час простою ви не платите», а потім додає, що оплачуваний час — це «час, протягом якого ваша модель активно розгортається, масштабується вгору чи вниз або робить передбачення», тож лічильник охоплює більше, ніж час передбачень, і саме це варто закладати в бюджет. RunPod публікує погодинні ставки, але жодної цифри холодного старту на сторінці цін немає.
Якщо ваш вибір Modal, ми написали окремий детальний розбір Modal.
Чи взагалі вміститься ваша модель? VRAM, ліміт одного GPU та квоти
Чи можна запустити модель на 70B на серверлес GPU? Зазвичай ні. У FP16 70B потребує ~140 GB VRAM. Cloud Run обмежений одним GPU на інстанс (максимум 96 GB на RTX PRO 6000). Без квантування (FP8/GGUF) або мульти-GPU-платформи математика не сходиться.
| GPU | VRAM | Мін. CPU / пам'ять | Типова стеля моделей |
|---|---|---|---|
| L4 | 24 GB | 4 CPU / 16 GiB | 7B-13B (FP16), до 30B у квантуванні |
| A100 80GB | 80 GB | залежить від платформи | 30B-70B у квантуванні |
| H100 80GB | 80 GB | залежить від платформи | 30B-70B у квантуванні |
| RTX PRO 6000 Blackwell | 96 GB | 20 CPU / 80 GiB | 70B у FP8 |
Квота Cloud Run за замовчуванням — 3 GPU L4 на регіон на проєкт (RTX PRO 6000 видається окремо, як 3 000 milliGPU), у шести регіонах L4: asia-southeast1, asia-south1, europe-west1, europe-west4, us-central1, us-east4. Це половина Cloud Run у відповіді про резидентність даних для всіх, хто питає про серверлес GPU в Європі; Modal і RunPod документують власні регіони ЄС, а решта — у FAQ.
У розборі Cloud Run від Ismaili Simba на dev.to (квітень 2025) йдеться про те, що запит на квоту «може тривати деякий час (до 5 робочих днів) до схвалення», і що «GPU L4, доступні на Cloud Run, мають ліміт 16 GB RAM». Закладайте цю затримку.
Щоб підібрати VRAM під конкретну модель, дивіться наш гід з вимог до VRAM.
Де живуть ваші ваги моделі (і скільки це коштує)?
Тред на Reddit з листопада 2024, який і досі тримався на 5-му місці в Google за цим самим запитом, коли ми перевірили 30.07.2026, містить дослівне питання:
«Я не зміг знайти тариф на зберігання моделі на 80 GB… Яка альтернатива, якщо я не хочу завантажувати модель під час кожного виклику API (под створюється на виклик і потім закривається)? … Чому ці платформи не вказують вартість зберігання моделі?»
Три відповіді з низьким рейтингом, і жодна не є відповіддю. Коли ми виконали цей пошук 30.07.2026, у топ-10 результатів досі був той двохрічний тред із питанням про вартість зберігання моделі. У треді на нього ніхто не відповів. Обидві платформи публікують тариф. У Modal це $0,09 за ГіБ на місяць, перший ТіБ безкоштовно, тож чекпоінт на 80 GB коштує $0,00. На RunPod це $0,07 за GB на місяць для мережевого сховища до 1 TB, тобто той самий чекпоінт обходиться приблизно у $5,60 на місяць.
| Розміщення | Вплив на холодний старт | Вартість | Перебудова для зміни моделі? | Найкраще для |
|---|---|---|---|---|
| Впечено в образ контейнера | Найшвидший запуск | Роздування образу (27B FP8 = десятки GB) | Так, повна перебудова | Ендпоінти з однією моделлю |
| Постійний мережевий том | Швидко (кешується на хості) | Modal: $0,09/ГіБ/міс, 1 ТіБ безкоштовно; RunPod: $0,07/GB/міс до 1 TB | Ні, достатньо змінити шлях | Кілька моделей або часті заміни |
| Завантаження з Hugging Face під час старту | Найповільніше: 26+ с для 130 GB на 5 GB/s | Безкоштовно (канал HF) | Ні | Лише прототипування |
Третій рядок — це режим збою. Огляд ServerlessLLM від TU München 2024 року (arXiv 2411.15664) повідомляє, що LLaMA-2-70B (130 GB) потребує 26+ секунд на завантаження при 5 GB/s, плюс ~84 секунди на завантаження у 8 GPU, проти ~100 мс генерації токена. Ці цифри наведені в тому огляді, а не виміряні ним.
На сторінці цін RunPod є розділ Storage: диск контейнера $0,10/GB/міс, диск тому $0,10/GB/міс у роботі та $0,20/GB/міс у простої, мережеве сховище $0,07/GB/міс до 1 TB і $0,05/GB/міс понад це, високопродуктивне мережеве сховище $0,14/GB/міс. Цифра існує. Просто вона не стоїть поруч із серверлес-тарифами за GPU, які читач порівнює, коли виникає питання, і немає її у потоці налаштування ендпоінта. Це проблема помітності, а не таємності, і її достатньо, щоб питання жило ще два роки.
# Point the Hugging Face cache at a mounted network volume
# so weights persist across cold starts (RunPod / Modal pattern)
export HF_HOME=/workspace/hf-cache
export TRANSFORMERS_CACHE=/workspace/hf-cache
export HF_HUB_ENABLE_HF_TRANSFER=1# Alternative: bake weights into the image at build time
FROM vllm/vllm-openai:latest
COPY ./model-weights /models/qwen3-27b-fp8
ENV MODEL_NAME=/models/qwen3-27b-fp8
# Downside: 30+ GB image, full rebuild to change modelsЯкщо ви ще не обрали модель, наш огляд відкритих моделей 2026 оцінює кожен варіант для розгортання.
Розгортання: vLLM на RunPod Serverless від і до
Шість кроків від нуля до робочого ендпоінта. Звіряйте кожен із процедурою vLLM від RunPod (оновлено 22.06.2026), яка цін не публікує.
-
Оберіть модель. Візьміть модель з відкритими вагами під розмір вашого GPU (див. таблицю VRAM вище). Якщо вона з обмеженим доступом на Hugging Face, спершу згенеруйте токен доступу.
-
Створіть серверлес-ендпоінт. У консолі RunPod виберіть Serverless, візьміть шаблон воркера vLLM і оберіть рівень GPU.
-
Задайте змінні середовища, які мають значення.
MODEL_NAME=Qwen/Qwen3.6-27B-FP8
MAX_MODEL_LEN=32768
GPU_MEMORY_UTILIZATION=0.90
DTYPE=autoНеправильний MODEL_NAME означає 404 під час старту. MAX_MODEL_LEN, зависокий для вашого VRAM, означає OOM до першого токена. GPU_MEMORY_UTILIZATION понад 0,95 не лишає запасу для сплесків KV-кешу.
-
Встановіть мін./макс. кількість воркерів та тайм-аут простою. Мін. воркери = 0 дає масштабування до нуля (і холодні старти). Мін. воркери = 1 прибирає холодні старти, але тарифікує безперервно. Розділ про холодний старт нижче розбирає цей компроміс.
-
Підключіть мережевий том, який ви обрали в розділі про ваги моделі, або погодьтеся на впікання в образ. Якщо пропустите цей крок, кожен холодний старт завантажуватиме чекпоінт заново.
-
Надішліть перший запит. Прочитайте ID ендпоінта з консолі та переконайтеся, що токени повертаються.
curl -X POST "https://api.runpod.ai/v2/${ENDPOINT_ID}/runsync" \
-H "Authorization: Bearer ${RUNPOD_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"input": {
"messages": [{"role": "user", "content": "Explain cold starts in one sentence."}],
"max_tokens": 60
}
}'Якщо обираєте сам рушій обслуговування, ми порівняли vLLM і SGLang за пропускною здатністю та затримкою.
Як викликати ендпоінт із вашого застосунку?
Кожна платформа з короткого списку підтримує OpenAI-сумісний API. Один сніпет Python працює всюди. Щоб змінити постачальника, достатньо поміняти base_url, а не переписувати код. Це перетворює питання «який постачальник» з рішення про прив'язку на рішення конфігурації.
import os
from openai import OpenAI
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
client = OpenAI(
base_url=f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
api_key=os.environ["RUNPOD_API_KEY"],
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-27B-FP8",
messages=[{"role": "user", "content": "What is scale to zero?"}],
max_tokens=120,
)
print(response.choices[0].message.content)# Same code, different provider. One line changes.
ENDPOINT_ID = os.environ["RUNPOD_ENDPOINT_ID"]
PROVIDERS = {
"runpod": f"https://api.runpod.ai/v2/{ENDPOINT_ID}/openai/v1",
"modal": "https://your-app--your-func.modal.run/v1",
"beam": "https://your-beam-endpoint/v1",
}
client = OpenAI(base_url=PROVIDERS["modal"], api_key="your-key")Якщо всі постачальники розмовляють діалектом OpenAI, питання «який постачальник серверлес GPU» перестає бути архітектурним рішенням і стає одним рядком конфігурації.
Коли ендпоінтів стане кілька, наше порівняння LLM-шлюзів покриває маршрутизацію та фейловер. Для легшого сетапу проксі LiteLLM додасть повтори та логування.
Який холодний старт ви побачите насправді?
Для моделі 7B на серверлес GPU очікуйте від 10 до 30 секунд на справжній холодний старт (запуск контейнера плюс завантаження ваг плюс ініціалізація рушія), згідно зі звітами практиків. Документація вендорів обіцяє 1–5 секунд лише на запуск контейнера. Різниця між цими числами — це ваш чекпоінт, що перетинає мережу.
Продуктова сторінка RunPod заявляє про холодні старти FlashBoot до 200 мс (заява вендора, а не вимірювання). Практик у r/LLMDevs повідомляє: «холодні старти, з мого досвіду, не дуже… я б сказав ~10–30 с», додаючи: «щоправда, більшість мого досвіду стосується дифузійних моделей». І те, і інше правда. Вони вимірюють різне.
Число холодного старту — це три числа, складені одне на одне:
-
Запуск контейнера. Документація Modal: «Контейнери запускаються приблизно за секунду». Cloud Run: інстанси з попередньо встановленими драйверами «стартують приблизно за 5 секунд».
-
Завантаження ваг. Частина, про яку ніхто не рекламує. Огляд ServerlessLLM від TU München 2024 року (arXiv 2411.15664) наводить для LLaMA-2-70B 26+ секунд на завантаження з мережі плюс ~84 секунди на завантаження у 8 GPU.
-
Ініціалізація рушія. Захоплення графа та розігрів vLLM. Logesh Umapathi виміряв для Qwen3.6-27B-FP8 на A100-80GB шлях від базових 460 с до 219 с в eager mode і до ~70 с зі sleep mode vLLM плюс GPU-снапшоти Modal. Це у 6,5 разів, опубліковано 17.05.2026.
| Джерело | Що виміряно | Число | Дата | Тип |
|---|---|---|---|---|
| Документація Modal | Запуск контейнера | ~1 с | поточна | Документація вендора |
| Документація Cloud Run | Старт інстанса (драйвери попередньо встановлені) | ~5 с | поточна | Документація вендора |
| Umapathi | Qwen3.6-27B-FP8, A100-80GB, повний холодний старт | 460 с → 219 с → ~70 с | травень 2026 | Незалежне вимірювання |
| Огляд TU München про ServerlessLLM (arXiv 2411.15664) | LLaMA-2-70B, завантаження з мережі + у GPU, цифри наведені, не виміряні | 26 с + 84 с | 2024 | Препринт arXiv (огляд) |
| Практик із r/LLMDevs | 7B на RunPod, повний запит | ~10–30 с | грудень 2024 | Анекдотичний (застереження: дифузійні моделі) |
Наша інтерпретація опублікованих даних: цифри вендорів вимірюють контейнер. Цифри практиків вимірюють увесь запит. Між цими двома секундомірами лежать 80 GB ваг, що перетинають мережу. Саме колонка «Тип» тут головна.
Що робити: sleep mode vLLM, GPU-снапшоти та налаштування вікна згортання. Типовий простій у Modal — 60 секунд (налаштовується від 2 с до 20 хв). Теплий воркер прибирає холодні старти, але тарифікується як постійно увімкнений.
# Modal scaledown config (illustrative)
# A 60s window means you pay for 60 idle seconds per burst.
# A warm worker (min_containers=1) costs ~$2.50/hr on A100 80GB, 24/7.
@app.function(
gpu="A100",
scaledown_window=60, # seconds idle before shutdown
# min_containers=1, # uncomment to kill cold starts; costs $60/day
)Чи серверлес GPU дешевший за постійно увімкнений GPU?
Серверлес GPU дешевший, коли ваш GPU простоює більшу частину дня. При 3 000 запитів на день із середнім 2 секунди кожен на A100 80GB серверлес коштує приблизно $4,17 на день проти $65,28 на день за орендований GPU, що працює 24/7. Точка перетину — це питання коефіцієнта використання, а не обсягу.
Припущення (наші, зазначені, щоб ви могли перерахувати): A100 80GB за тарифом Modal $2,50/год, у середньому 2 секунди GPU-часу на запит, орендований GPU за тарифом RunPod $2,72/год цілодобово, hosted token API за $0,40/1 млн токенів (середній оприлюднений тариф) і ~1 000 токенів на запит.
| Запитів на день | Серверлес (оцінка) | Орендований GPU 24/7 | Hosted token API | Найдешевше |
|---|---|---|---|---|
| 500 | $0,69 | $65,28 | $0,20 | Токен API |
| 3 000 | $4,17 | $65,28 | $1,20 | Токен API |
| 10 000 | $13,89 | $65,28 | $4,00 | Токен API |
| 50 000 | $69,44 | $65,28 | $20,00 | Токен API |
| 200 000 | $277,78 | $65,28 | $80,00 | Орендований GPU |
Перетин виходить приблизно на 47 000 запитів на день. Нижче — перемагає серверлес. Hosted token API б'є обидва варіанти на малих обсягах із масовою моделлю. Точка беззбитковості залежить не від кількості запитів. Вона залежить від того, скільки годин ваш GPU нічого не робить.
Аналіз BentoML від серпня 2024 добре окреслює цей компроміс, хоча його приклади цін — епохи GPT-3.5-turbo, і вони застаріли на два роки.
Скільки коштуватиме hosted token API на вашому обсязі, дивіться в нашому порівнянні цін на LLM API. Щоб знизити вартість запиту на боці інференсу, кешування промптів зазвичай економить 30–60% на повторюваному контексті.
# Break-even calculator: adjust these and re-run
REQUESTS_PER_DAY = 3000
SECONDS_PER_REQUEST = 2
SERVERLESS_RATE_HR = 2.50 # Modal A100 80GB
RENTED_RATE_HR = 2.72 # RunPod A100 80GB, 24/7
serverless_daily = REQUESTS_PER_DAY * SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR
rented_daily = RENTED_RATE_HR * 24
print(f"Serverless: ${serverless_daily:.2f}/day")
print(f"Rented 24/7: ${rented_daily:.2f}/day")
print(f"Crossover: {int(RENTED_RATE_HR * 24 / (SECONDS_PER_REQUEST / 3600 * SERVERLESS_RATE_HR))} req/day")Коли серверлес GPU — неправильний вибір
- Стабільно високий трафік. Понад ~47 000 запитів на день за цих тарифів коефіцієнт використання перевертається, і орендований GPU стає дешевшим за запит.
- Жорсткі SLO на долі секунди на холодному шляху. Жоден трюк зі снапшотами не зробить перший запит миттєвим. Тримайте теплий воркер або орендуйте машину.
- Моделі 70B+, яким потрібні кілька GPU. Один GPU на інстанс у Cloud Run закриває цю розмову.
- Сувора резидентність даних. Шість регіонів L4 — це все меню в Cloud Run.
- Економіка на запит, яка програє слоту воркера, за який ви вже платите. Якщо у вас є вільний запас GPU, додавання інференсу не коштує нічого додатково.
Якщо ваш GPU зайнятий шістнадцять годин на день, серверлес стає дорогим варіантом, і будь-хто, хто каже інакше, продає серверлес.
Для локального шляху дивіться наш гід з інструментів для локальних LLM.
Про автора
Mert Batur — співзасновник Techsy.io, де команда постачає AI-агентів, системи автоматизації та голосові/SDR-конвеєри для B2B-клієнтів. Він пише про стек інструментів для LLM, який команда Techsy реально використовує у продакшені. Зв'яжіться у LinkedIn.
Часті запитання
Що таке серверлес GPU?
Платформа серверлес GPU запускає контейнер вашої моделі на спільному залізті, масштабується до нуля між запитами й тарифікує лише активні обчислення. Ви отримуєте інференс-ендпоінт без керування постійним GPU-інстансом. Розплата — затримка холодного старту під час запуску.
Скільки коштує запуск LLM на серверлес GPU?
A100 80GB коштує $2,25/год на Beam, $2,50/год на Modal, $2,72/год на RunPod (перевірено 30.07.2026). Ваш рахунок залежить від коефіцієнта використання: 3 000 запитів на день по 2 с кожен обходяться приблизно у $4 на день на Modal. Сховище додає $0,09/ГіБ на місяць, 1 ТіБ безкоштовно.
Чи плачу я за зберігання ваг моделі?
Так, але це дешево. Modal бере $0,09/ГіБ на місяць, 1 ТіБ на місяць безкоштовно, тож чекпоінт на 80 GB не коштує нічого. На сторінці цін RunPod мережеве сховище коштує $0,07/GB на місяць до 1 TB, приблизно $5,60 на місяць за ті самі 80 GB.
Чи завантажується моя модель заново на кожен запит?
Лише якщо нічого не кешується. Ваги на постійному томі або впечені в образ переживають холодні старти. Спрямуйте кеш Hugging Face на ефемерне сховище, і модель на 130 GB завантажуватиметься заново на кожен запуск. Саме цього режиму збою слід уникати.
Наскільки довгий холодний старт для моделі 7B?
Очікуйте 10–30 секунд на справжній холодний старт, згідно зі звітами практиків (r/LLMDevs, грудень 2024). Контейнер запускається за 1–5 с (документація Modal, Cloud Run). Решта — завантаження ваг та ініціалізація рушія. Зі снапшотами та sleep mode Umapathi виміряв ~70 с для моделі 27B, проти 460 с.
Чи можна запустити модель 70B на серверлес GPU?
Зазвичай ні. Модель 70B у FP16 потребує ~140 GB VRAM. Cloud Run дозволяє один GPU на інстанс (максимум 96 GB). Щоб вміститися на одну картку 80 GB, потрібне квантування FP8, або мульти-GPU-платформа. Більшість серверлес-поверхонь обмежені одним GPU.
Чи серверлес GPU дешевший за оренду GPU 24/7?
Нижче ~47 000 запитів на день (при 2 с на запит на A100 80GB) — так. Серверлес тарифікує лише активні секунди; орендований GPU тарифікує 24 години попри все. Вище — перемагає орендований GPU. Hosted token API б'є обидва варіанти на малих обсягах. Див. таблицю беззбитковості вище.
Чи можна розгорнути LLM на серверлес GPU безкоштовно?
Modal дає $30 на місяць безкоштовних кредитів (Starter). Beam дає $30 на місяць. Кредит GCP $300 для нових акаунтів покриває використання GPU на Cloud Run. Достатньо для прототипу, недостатньо для продакшн-трафіку. Жодна платформа не пропонує постійного безкоштовного тарифу для GPU-інференсу.
Які постачальники серверлес GPU доступні в Європі?
Cloud Run надає GPU L4 у europe-west1 (Бельгія) та europe-west4 (Нідерланди). Modal документує вибір регіону ЄС (eu-west, eu-north, eu-south) за ціною 1,5–1,75× від базових тарифів. RunPod називає європейські дата-центри, зокрема EU-NL-1 та EU-FR-1. Закріплюйте регіон явно; жоден із них не обирає ЄС за замовчуванням.
Чи потрібен Docker, щоб розгорнути LLM на серверлес GPU?
Не завжди. RunPod пропонує готові шаблони воркерів vLLM, що обходяться без Docker. Modal будує контейнери з Python-визначення образу в коді. Для кастомних залежностей ви напишете Dockerfile. Для стандартного сервінгу vLLM готовий шлях працює за хвилини.
Висновки
П'ять платформ, п'ять одиниць тарифікації, одна нормалізована таблиця. Рішення простіше, ніж його показують сторінки вендорів:
- Обирайте GPU за VRAM, а не за брендом.
- Кладіть ваги на том, а не в образ, якщо тільки ніколи не міняєте моделі.
- Очікуйте холодні старти у 10–30 секунд і плануйте з урахуванням цього.
- Нижче ~47 000 запитів на день масштабування до нуля виграє за вартістю.
- Рушій обслуговування за ендпоінтом можна замінити;
base_url— це один рядок.
У вас є робочий ендпоінт. Далі: що стоїть перед ним, коли потрібні маршрутизація та фейловер? Наше порівняння LLM-шлюзів відповідає на це. Або обговоріть ваш сетап з нами.