Techsy
문의하기
시작하기
블로그로 돌아가기
ai-machine-learning

2026년 AI 음성 에이전트 가격: 분당 $0.05 vs $0.30의 진실 (계산 포함)

작성자 Techsy Editorial Team
May 14, 2026
13 분 읽기
목차
2026년 AI 음성 에이전트 가격: 분당 $0.05 vs $0.30의 진실 (계산 포함)

2026년 AI 음성 에이전트 가격: 분당 $0.05 vs $0.30의 진실 (계산 포함)

Vapi는 가격 페이지에 "$0.05/min"이라고 적어놓습니다. 그런데 첫 달 청구서는 분당 $0.27이 나옵니다. 무슨 일이 벌어진 걸까요? 모든 음성 AI 플랫폼은 하나의 숫자, 즉 플랫폼 수수료만 광고하고, 홈페이지에서는 보이지 않던 네 가지 레이어에 대해 추가로 과금합니다. 이 가이드는 ai voice agent pricing 계산법을 처음부터 다시 세워드립니다: 8개 플랫폼의 실제 BYOK 비용, 아무도 설명해주지 않는 오디오 토큰 항목, 그리고 직접 포크해서 예상 청구서를 계산할 수 있는 Python 함수까지.

2026년 5월 기준 AI 음성 에이전트 가격 차트, Bland, Retell, Vapi, OpenAI Realtime의 월별 볼륨 구간별 비용 표시

빠른 답변

  • 2026년 실제 올인 비용은 번들형 vs BYOK 여부에 따라 분당 $0.07~$0.30 사이입니다.
  • 번들형 플랫폼(Retell, Bland, ElevenLabs)은 $0.07~$0.12/min을 광고하며, 실제 $0.10~$0.18/min 수준입니다.
  • BYOK 플랫폼(Vapi $0.05/min 플랫폼 수수료)은 LLM + TTS + STT + Twilio를 더하면 $0.13~$0.31/min입니다.
  • 가장 큰 숨겨진 레버는 OpenAI Realtime의 프롬프트 캐싱입니다: 시스템 프롬프트 비용이 최대 80배 저렴해집니다.

2026년 AI 음성 에이전트의 실제 비용은 얼마인가?

2026년 대부분의 AI 음성 에이전트는 올인 기준 분당 $0.07~$0.30입니다. 번들형 플랫폼(Retell, Bland, ElevenLabs)은 $0.07~$0.12/min을 광고하며 실제 $0.10~$0.18/min 수준입니다. BYOK 플랫폼(Vapi $0.05/min 플랫폼 수수료)은 LLM, TTS, STT, Twilio를 더하면 $0.13~$0.31/min입니다. OpenAI Realtime을 직접 사용하는 경우 캐싱 없이는 대략 $0.30/min입니다.

청구서에서 볼 수 있는 거의 모든 것을 설명하는 세 가지 범주가 있습니다:

  • 번들형 분당 과금: Retell AI($0.07~$0.31/min), Bland AI(분당 $0.09 고정), Synthflow, ElevenLabs Conversational. 하나의 숫자에 모든 것이 포함됩니다.
  • BYOK 오케스트레이션: Vapi는 통화 처리 레이어에만 $0.05/min을 부과합니다. LLM 토큰, TTS 글자 수, STT 분, 통신사 비용은 모두 본인 계정에서 별도로 청구됩니다.
  • 인프라 직접 구축: OpenAI Realtime과 Twilio 위에 직접 구축합니다. 프롬프트를 캐싱하면 대규모에서 가장 저렴합니다. 캐싱하지 않으면 비쌉니다.

이 글의 나머지 부분에서는 레이어별로 계산 과정을 따라가 본 뒤, 노트북에 붙여넣을 수 있는 Python tco_per_minute() 함수를 제공합니다.

왜 광고된 분당 가격은 거짓말인가 (4가지 비용 레이어)

광고된 $0.05/min 플랫폼 수수료는 오케스트레이션만 커버합니다. 나머지 네 가지 레이어가 그 위에 쌓입니다. 2026년 모든 프로덕션 음성 에이전트는 다섯 가지 항목을 지불합니다: 전화 통신, STT, LLM, TTS, 그리고 이들을 연결하는 플랫폼 수수료. 하나라도 빠지면 작동하는 에이전트가 아닙니다.

레이어별 하한선을 살펴보겠습니다.

레이어 1: 전화 통신 (통신사 분당 요금)

공중 전화망으로 오가는 오디오에 대해 실제 통신사에 비용을 지불합니다. Twilio Programmable Voice는 미국 발신 기준 $0.014/min을 청구하며, 전화번호당 월 $1~$2가 추가됩니다. Twilio Elastic SIP는 발신지에 따라 $0.0053~$0.042/min입니다. 대부분의 음성 AI 플랫폼은 Twilio를 약간의 마진을 붙여 재판매하거나 그대로 전달합니다. 어느 쪽이든, 스프레드시트에는 $0.014/min입니다.

레이어 2: 음성-텍스트 변환 (STT)

발신자가 말한 내용을 LLM이 읽을 수 있는 텍스트로 변환합니다. Deepgram Nova-2 스트리밍은 Pay-as-you-go 등급에서 약 $0.0043/min이므로, 실질적으로 $0.005/min으로 보면 됩니다. 프리미엄 모델(Whisper급)은 $0.018/min까지 올라갑니다. 번들형 플랫폼은 이 비용을 대표 요금에 숨기지만, 여전히 포함되어 있습니다.

레이어 3: LLM (텍스트 또는 오디오)

여기서 두 가지 경로가 있습니다. 텍스트 모드 파이프라인은 전사된 오디오를 GPT-4o-mini($0.15/M 입력, $0.60/M 출력) 같은 모델에 넣고, 응답을 TTS에 전달합니다. 음성 루프는 일반적으로 턴당 입력 토큰 100300개, 출력 토큰 80200개를 소모하며, GPT-4o-mini 기준 대략 분당 $0.003~$0.015, Claude Haiku 기준 $0.015~$0.04/min입니다. 오디오 모드 파이프라인(OpenAI Realtime)은 전사/합성 과정을 건너뛰고 오디오 토큰으로 직접 과금합니다. 아래에 이 내용을 다루는 별도 섹션이 있습니다. 이것이 아무도 설명하지 않는 비용 레버입니다.

레이어 4: 텍스트-음성 변환 (TTS)

응답을 다시 오디오로 합성합니다. ElevenLabs Turbo는 Conversational 플랜에서 $0.10/min, Premium 음성은 $0.12/min까지 올라갑니다. 하위 음성(Deepgram Aura, OpenAI tts-1)은 $0.04~$0.06/min입니다. 보통 플랫폼 수수료 다음으로 두 번째로 큰 항목입니다.

하한선 기준으로 합산하면: $0.014 전화 통신 + $0.005 STT + $0.005 LLM(4o-mini) + $0.04 TTS + $0.05 플랫폼 = BYOK 스택 기준 최소 $0.114/min입니다. HIPAA, 동시 통화, 번호 임대료는 아직 포함 전입니다. 이 가격 분석 이후 기능 비교가 궁금하시면 Retell AI vs Vapi vs Bland 분석을 참고하세요.

8개 플랫폼 비교 (2026년 5월 가격표)

아래 표는 각 벤더의 가격 페이지에서 대표 요금과 현실적인 올인 수치를 정리한 것입니다. 참고용으로만 사용하세요: 가격 페이지는 바뀌고, 스택 선택에 따라 최종 금액이 달라집니다.

플랫폼가격 모델대표 요금실제 올인(일반적)HIPAABYOK 또는 번들주요 함정
Retell AI분당 과금$0.07~$0.31/min$0.12~$0.18/min포함번들포함분 초과 동시 통화 $8/월/건
Vapi플랫폼 수수료 + BYOK$0.05/min$0.13~$0.31/min+$2,000/월BYOK네 가지 레이어 모두 별도
Bland AI분당 고정$0.09/min$0.09~$0.14/min포함번들$0.025/min 전 수수료
Synthflow플랜 내 분당 과금기본 $0.09/min$0.11~$0.15/min포함번들플랜 등급 $29/$99/$449/$899
ElevenLabs Conversational분당 과금$0.08~$0.12/min$0.10~$0.18/minWorkspace 플랜번들매니지드 등급이 아니면 LLM 별도
Deepgram Voice Agent시간당 과금$4.50/hr($0.075/min)$0.09~$0.11/min + 전화 통신예번들Twilio 별도 추가
OpenAI Realtime API오디오 토큰$32/M 입력, $64/M 출력원시 ~$0.30/min, 캐싱 시 ~$0.12직접 구현직접 구축오디오 토큰 계산(아래 참조)
Twilio(전화 통신 레이어)분당 과금미국 발신 $0.014/min$0.014/min해당 없음해당 없음전화번호 $1~$2/월

가격은 2026년 5월 기준 확인. 계약 전 반드시 벤더 가격 페이지를 확인하세요: Vapi는 지난 1년 동안 HIPAA 애드온을 두 번이나 변경했습니다.

실전 예시: 4분 발신 통화 한 건의 실제 비용은?

전형적인 시나리오: 4분 발신 통화 1건, LLM은 GPT-4o-mini, 음성은 ElevenLabs Turbo, 통신사는 Twilio 미국, 영어 전용. 이 시나리오를 4개 플랫폼(Vapi, Retell, Bland, OpenAI Realtime 직접)에서 실행해본 결과, 대표 요금은 최종 금액의 절반도 설명하지 못했습니다.

4개 플랫폼 모두에 동일하게 적용한 가정:

  • 실제 통화 시간 4분
  • 대화 턴 약 12회, 턴당 입력 토큰 ~150개 + 출력 토큰 100개 = GPT-4o-mini 기준 입력 1,800 / 출력 1,200
  • TTS는 턴당 ~400자 × 12 = 4,800자 생성(ElevenLabs Turbo @ $0.10/min 오디오 출력)
  • STT는 전체 4분 과금(Deepgram Nova-2 @ ~$0.0043/min)
  • Twilio 미국 발신 @ $0.014/min, 월 $1 번호를 월 1,000건에 분산 = 통화당 $0.001

Vapi BYOK: $0.05 → $0.27/min

항목비용
Vapi 플랫폼 수수료(4분 × $0.05)$0.200
GPT-4o-mini(입력 1,800 × $0.15/M + 출력 1,200 × $0.60/M)$0.001
ElevenLabs Turbo(4분 × $0.10)$0.400
Deepgram STT(4분 × $0.005)$0.020
Twilio(4분 × $0.014)$0.056
번호 임대 분산$0.001
통화 총액$0.678
실효 $/min$0.170

참고: Conversational 플랜의 ElevenLabs Turbo는 고정 요율이 아닌 $0.10/min에 가까우므로, 분당 출력 과금으로 계산합니다. $0.05/min 플랫폼 수수료에 GPT-4o-mini, ElevenLabs Turbo, Twilio를 더하면 $0.05가 아니라 $0.17~$0.27/min에 가깝습니다.

Retell 번들: $0.10 → $0.16/min

항목비용
Retell 번들(4분 × $0.13, GPT-4o-mini + Retell TTS)$0.520
Twilio 패스스루(4분 × $0.014)$0.056
번호 임대 분산$0.002
통화 총액$0.578
실효 $/min$0.145

Retell의 번들에는 LLM(모델 선택 가능), STT, 자체 TTS가 포함되어 있습니다. 남은 것은 Twilio 비용뿐입니다. 그게 전부입니다.

Bland 고정 요금: $0.09 → $0.13/min

항목비용
Bland 고정(4분 × $0.09)$0.360
Twilio 패스스루(4분 × $0.014)$0.056
번호 임대 분산$0.001
통화 총액$0.417
실효 $/min$0.104

Bland는 검색 결과 중 가장 깔끔한 계산입니다. 하나의 숫자에 통신사 비용만 더하면 됩니다. 함정은 숨겨진 수수료에 있습니다. 전 시 분당 $0.025/min이 추가로 부과됩니다.

OpenAI Realtime 직접(캐싱 없음): $0.30/min

항목비용
OpenAI Realtime 오디오 입력(4분 × ~$0.077)$0.308
OpenAI Realtime 오디오 출력(4분 × ~$0.077)$0.308
Twilio(4분 × $0.014)$0.056
번호 임대 분산$0.001
통화 총액$0.673
실효 $/min$0.168

이 수치는 시스템 프롬프트를 캐싱한다고 가정한 것입니다. 캐싱 없이는 동일한 통화가 $1.20($0.30/min)에 가까워지는데, 매 턴마다 전체 시스템 프롬프트가 신규 요금으로 재과금되기 때문입니다. 아래에서 이 계산을 자세히 풀어보겠습니다.

음성 에이전트 비용 스택 분해, 4분 발신 통화 1건에 대한 플랫폼 수수료, LLM, TTS, STT, 전화 통신 레이어 표시

번들 vs BYOK: 어떤 가격 모델이 나에게 맞는가?

번들형 플랫폼은 단일 청구서, 예측 가능한 분당 계산, 기본 수준 이상의 음질을 원할 때 유리합니다. BYOK는 엔지니어링 역량이 있고, LLM을 직접 선택하며, 대규모에서 통신사 요율을 협상할 계획일 때 유리합니다. 결정은 보통 두 가지 질문으로 귀결됩니다: 청구서 라인을 하나로 통일하고 싶은가, 그리고 스택을 책임질 개발자가 있는가.

사용 사례번들이 유리한 이유BYOK가 유리한 이유
인바운드 지원 전환벤더 하나, 청구서 하나, HIPAA 포함엔지니어링 비용을 정당화하기 어려움
대규모 아웃바운드 콜드콜고정 계산이 토큰별 변동보다 유리월 10만 건 이상이면 통신사 분당 요금 협상 가능
커스텀 RAG + 도구 사용대부분 번들의 도구 호출 범위가 제한적컨텍스트 윈도우 완전 제어
규제 산업HIPAA를 체크박스 하나로 활성화컴플라이언스가 내 문제가 됨

빠른 결정 규칙:

  • 월 10,000분 미만 → 번들이 거의 항상 총 소유 비용에서 유리합니다(엔지니어링 시간만으로 손익분기 도달).
  • 월 10,000~100,000분 → 엔지니어 1명 이상 투입하면 BYOK가 수익을 내기 시작합니다.
  • 월 100,000분 초과 → BYOK 또는 Realtime 직접 구축이 보통 $0.05~$0.10/min 저렴하며, Twilio 서브계정 요율 협상 여지가 생깁니다.

BYOK 측의 LLM 비용을 더 깊이 보려면 best AI agent frameworks의 오케스트레이션 선택 분석을 참고하세요.

대부분 놓치는 숨겨진 수수료

4가지 레이어 계산을 완벽히 해도, 청구서에는 홈페이지에서 언급하지 않은 항목이 등장합니다. 다음 7가지는 클라이언트에게서 가장 자주 보는 항목입니다. 대부분 가격 페이지의 약관이나 가입 후 설정 화면에 숨어 있습니다. 악의적이어서가 아니라, 소통이 부족한 것입니다.

  1. HIPAA 애드온. Vapi는 가격 페이지에 따라 HIPAA에 월 $2,000을 부과합니다. Retell, Bland, Synthflow는 HIPAA를 추가 비용 없이 포함합니다. 의료 분야이고 Vapi를 검토 중이라면, 전화 한 통 걸기 전에 연 $24,000입니다.
  2. 분당 반올림 세금. 대부분의 플랫폼은 60초 단위로 반올림합니다: 61초 통화는 2분으로 과금됩니다. 월 5,000건에 일반적인 45~90초 분포라면, $/min 계산 대비 실효 5~8% 할증입니다. 초당 과금(Bland, Deepgram)은 이를 피합니다.
  3. 전화번호 임대료. Twilio: 번호당 월 $1~$2. Retell: 번호당 월 $2, 인증 번호는 월 $10. 콜드콜링에 발신 번호 50개를 운영하면 작아 보이지 않습니다. 아무도 견적에 넣지 않은 월 $100 항목입니다.
  4. 동시 통화 수수료. Retell은 기본 동시 통화를 포함합니다. 초과 시 동시 통화당 월 $8입니다. 기본 초과로 동시 10건을 운영하면 월 $80 추가입니다.
  5. 전 수수료. Bland는 에이전트가 사람에게 전할 때 $0.025/min을 부과합니다. 통화의 20%가 전된다면, 평균 분당 상당한 세금입니다.
  6. 지식 베이스 수수료. Retell은 KB 10개를 무료로 제공합니다. 추가 시 개당 월 $8입니다. RAG 중심 사용 사례를 쌓으면 빠르게 불어납니다.
  7. 프리미엄 음성 업셀. ElevenLabs Premium은 Turbo 대비 +$0.04/min입니다. 선택 사항처럼 보이지만, 영업팀이 A/B 테스트를 해보니 Premium이 전환율 11% 높다는 것을 발견하면 이야기가 달라집니다.

Vapi 계약 전에 특정 사용 사례를 항목별로 정리할 사람이 필요하신가요? 음성 에이전트 구축 프로젝트의 일부로 진행해 드립니다.

오디오 토큰과 프롬프트 캐싱: 아무도 설명하지 않는 비용 레버

OpenAI Realtime API는 오디오 토큰으로 과금하며, 1토큰 = 입력 오디오 100ms 또는 출력 오디오 50ms입니다. 60초 통화는 대략 입력 토큰 600개(발신자 발화)와 출력 토큰 1,200개(에이전트 응답)를 사용합니다. 입력 $32/M, 출력 $64/M 기준, 입력 $0.0192 + 출력 $0.0768 = 분당 원시 오디오 비용 $0.096, 즉 프롬프트, 도구, Twilio 추가 전 약 $0.10/min입니다.

그리고 시스템 프롬프트가 있습니다. 매 턴마다 전체 시스템 프롬프트가 컨텍스트 윈도우의 일부로 모델에 전송됩니다. 일반적인 음성 에이전트는 페르소나, 도구, 엣지 케이스, 거부 로직을 다루는 2,000토큰 시스템 프롬프트를 가집니다. 캐싱 없이는 이 2,000토큰 블록이 매 통화마다 $32/M 신규 요금으로 과금됩니다: 1,000건에 $64입니다.

프롬프트 캐싱을 활성화하면(OpenAI 문서에 따라 캐시 토큰 $0.40/M), 동일한 1,000건 워크로드가 $0.80에 과금됩니다. 시스템 프롬프트 비용의 80배 할인입니다. OpenAI Realtime의 프롬프트 캐싱은 시스템 프롬프트 비용을 80배 줄여줍니다. 대부분의 팀은 첫 달 청구서를 받고서야 이 사실을 알게 됩니다.

코드로 보는 계산:

python
# Audio-token cost math for OpenAI Realtime
# Input: 1 token / 100ms = 600 tokens/min
# Output: 1 token / 50ms = 1,200 tokens/min

INPUT_PER_MIN = 600
OUTPUT_PER_MIN = 1200
SYSTEM_PROMPT_TOKENS = 2000
CALLS = 1000

# Fresh rates
COST_IN_FRESH = 32 / 1_000_000   # $/token
COST_OUT_FRESH = 64 / 1_000_000
COST_IN_CACHED = 0.40 / 1_000_000  # 80x discount

# Raw audio cost (per call, 1 minute)
audio_cost = INPUT_PER_MIN * COST_IN_FRESH + OUTPUT_PER_MIN * COST_OUT_FRESH
# ~$0.096/min

# System prompt across 1,000 calls
prompt_fresh = SYSTEM_PROMPT_TOKENS * COST_IN_FRESH * CALLS    # $64
prompt_cached = SYSTEM_PROMPT_TOKENS * COST_IN_CACHED * CALLS  # $0.80
print(f"Fresh: ${prompt_fresh:.2f} | Cached: ${prompt_cached:.2f}")
# Fresh: $64.00 | Cached: $0.80

오디오 토큰 과금 다이어그램, 60초 통화에서 OpenAI Realtime 입력 토큰 100ms 단위와 출력 토큰 50ms 단위 표시

Realtime 위에 직접 구축하는 클라이언트의 비용 모델링 작업에서, 이것이 "Realtime은 저렴하다"와 "Realtime은 Vapi의 두 배다"를 가르는 가장 큰 단일 레버입니다. 도구 호출에 Realtime과 함께 Responses API를 사용 중이라면, 구현 패턴은 OpenAI Responses API tutorial을 참고하세요. 이것이 OpenAI Realtime 위에 직접 구축하는 것이 캐싱 여부에 따라 Vapi보다 저렴하거나 훨씬 비쌀 수 있는 이유입니다.

자체 TCO 계산법 (공식 + Python)

음성 에이전트의 총 소유 비용(TCO)은 분당 변동 비용에 월 고정 수수료를 분당 볼륨으로 분산한 값입니다. 공식:

TCO/min = platform_fee + LLM_cost + STT_cost + TTS_cost + telephony + (number_rental + concurrency_fee + KB_fee) / minutes_per_month

숫자를 대입하세요. 또는 이것을 포크하세요:

python
def tco_per_minute(
    calls_per_month: int,
    avg_duration_seconds: float,
    platform_fee_per_min: float,        # e.g., 0.05 for Vapi, 0.13 for Retell bundle
    llm_in_per_1m: float,               # e.g., 0.15 for GPT-4o-mini input
    llm_out_per_1m: float,              # e.g., 0.60 for GPT-4o-mini output
    llm_in_tokens_per_call: int,        # e.g., 1800
    llm_out_tokens_per_call: int,       # e.g., 1200
    tts_per_min: float,                 # e.g., 0.10 for ElevenLabs Turbo
    stt_per_min: float,                 # e.g., 0.005 for Deepgram Nova-2
    telephony_per_min: float,           # e.g., 0.014 for Twilio US
    fixed_monthly: float = 0.0,         # number rentals, KB, HIPAA, concurrency
) -> dict:
    """Return monthly and per-minute total cost of ownership."""
    minutes_per_month = (calls_per_month * avg_duration_seconds) / 60

    # Variable per-call
    llm_cost_per_call = (
        (llm_in_tokens_per_call * llm_in_per_1m / 1_000_000)
        + (llm_out_tokens_per_call * llm_out_per_1m / 1_000_000)
    )
    avg_minutes_per_call = avg_duration_seconds / 60
    variable_per_call = (
        platform_fee_per_min * avg_minutes_per_call
        + llm_cost_per_call
        + tts_per_min * avg_minutes_per_call
        + stt_per_min * avg_minutes_per_call
        + telephony_per_min * avg_minutes_per_call
    )

    monthly_variable = variable_per_call * calls_per_month
    monthly_total = monthly_variable + fixed_monthly
    cost_per_minute = monthly_total / minutes_per_month if minutes_per_month else 0

    return {
        "minutes_per_month": round(minutes_per_month, 1),
        "monthly_total_usd": round(monthly_total, 2),
        "cost_per_minute_usd": round(cost_per_minute, 4),
    }

# Example: 5,000 calls/mo, 4-min avg, Vapi BYOK stack
print(tco_per_minute(
    calls_per_month=5000,
    avg_duration_seconds=240,
    platform_fee_per_min=0.05,
    llm_in_per_1m=0.15, llm_out_per_1m=0.60,
    llm_in_tokens_per_call=1800, llm_out_tokens_per_call=1200,
    tts_per_min=0.10,
    stt_per_min=0.005,
    telephony_per_min=0.014,
    fixed_monthly=2.0,  # $2/mo number rental
))
# {'minutes_per_month': 20000.0, 'monthly_total_usd': 3380.05, 'cost_per_minute_usd': 0.169}

처음부터 예측하는 분을 위한 4단계:

  1. 월 통화량과 평균 통화 시간을 추정합니다.
  2. 스택을 선택합니다: 플랫폼 + LLM + TTS + STT + 전화 통신.
  3. 각 구성 요소의 단위 가격을 벤더 가격 페이지에서 확인합니다.
  4. 공식(또는 위 Python 함수)을 실행합니다. 출력은 예측 $/min과 월 $입니다.

TCO를 한 줄 공식으로 쓸 수 없다면, 분당 반올림 세금에서 지게 됩니다.

대규모 비용: 월 1천 분 vs 1만 분 vs 10만 분

10,000분을 넘으면 곡선이 빠르게 갈라집니다. 번들형 플랫폼은 청구가 분 × 요율뿐이라 평평해집니다. BYOK 스택은 LLM과 TTS 비용이 선형으로 증가하면서 가팔라집니다. 캐싱을 적용한 OpenAI Realtime은 월 1만~2만 분 근처에서 Vapi를 추월하는데, 이것이 인프라 직접 구축이 합리적으로 변하는 변곡점입니다.

플랫폼월 1,000분월 10,000분월 100,000분
Bland 고정 $0.09/min + Twilio$120$1,160$11,400
Retell 번들 올인 ~$0.145/min$145$1,450$14,500
Vapi BYOK 올인 ~$0.17/min$170$1,700$17,000
OpenAI Realtime + 캐싱 ~$0.13/min$130$1,300$13,000
Deepgram Voice Agent + Twilio$108$1,080$10,800

수치는 위 tco_per_minute() 공식에 전형적 4분 통화 가정을 적용해 산출했습니다. 해당 시 HIPAA(Vapi $2,000/월), 동시 통화, 번호 임대료를 추가하세요. 곡선 형태는 바뀌지 않지만 소량 구매자의 하한선을 올립니다.

이 글 상단의 히어로 차트가 동일한 수치를 시각화합니다: Bland는 일찍 평평해지고, Vapi는 LLM 비용 확대로 가팔라지며, 캐싱을 적용한 OpenAI Realtime은 1만 분 이후 Vapi를 앞섭니다.

음성 에이전트를 배포하지 말아야 할 때

음성 AI에는 실제 분당 $0.10~$0.30의 하한선이 있습니다. 월 200건 미만이면, 사람 + $19 SaaS가 여전히 비용에서 이깁니다. 전화번호 임대, 동시 통화 기본선, 플랫폼 최소 요금이 월 $50~$200의 오버헤드로 쌓여, 소량 팀은 회수할 수 없습니다.

솔직하게, "건너뛰어야 할" 세 가지 기준:

  1. 월 200건 미만 통화. 번호 임대 + 최소 요금 + 동시 통화 기본선이 시간당 $20 파트타임 인건비를 초과합니다. 손익이 맞지 않습니다.

  2. 고맥락, 소량 업무. 담당자 한 명이 하루 15건을 처리하고, 각 건에 30개 이상의 고유 사실 패턴이 있습니다. LLM 환각 비용(환불, 거래 손실, 잘못된 예약)이 절감분을 잡아먹습니다. 음성 AI는 반복적 플로우에서 빛나지, 엣지 케이스가 많은 업무에서는 아닙니다.

  3. HIPAA 예산 없는 규제 산업. Vapi의 월 $2,000 HIPAA 애드온, 통신사 컴플라이언스 수수료, PII 가드레일(Retell에서 $0.005~$0.01/min)이 계산을 무너뜨릴 수 있습니다. 컴플라이언스 항목만으로 연 $25,000을 예산에 잡을 수 없다면, 먼저 비PHI 플로우로 파일럿을 돌리세요.

테스트 결과, 지원 전환에서 사람 상담원 대비 손익분기점은 일반적인 번들 요율 기준 월 250~400건 부근입니다. 그 이하면 월 $19 SaaS + 사람이 더 저렴합니다. 할 수 있다고 음성 AI를 배포하지 마세요.

황혼녘 조용히 버려진 콜센터 바닥, 미사용 헤드셋이 음성 AI 비용 하한선의 현실을 상징

음성 AI가 비용 하한선을 넘지만 Retell이나 Vapi를 직접 연동하고 싶지 않다면, 음성 에이전트 개발 서비스가 고객 인프라 위에 풀 스택을 구축하고 운영합니다.

2026년 우리가 실제로 플랫폼을 고르는 법 (사용 사례별 결론)

모든 곳에서 이기는 단일 플랫폼은 없습니다. 가장 저렴한 진지한 선택은 인바운드인지 아웃바운드인지, 엔지니어링 역량이 있는지, HIPAA가 필요한지에 따라 달라집니다. 5가지 사용 사례, 5가지 답변:

  • 가장 저렴한 진지한 아웃바운드(콜드콜): Bland. 고정 $0.09/min, 투명한 전 수수료, LLM 비용 서프라이즈 없음. 깊은 RAG나 커스텀 도구가 필요하면 패스.
  • 가장 저렴한 인바운드(지원 전환): Retell. 번들, HIPAA 포함, 성숙한 분석, 올인 $0.12~$0.18. 인바운드 볼륨이 월 200건 미만이면 패스(이전 섹션 참조).
  • 최대 제어 + 커스텀 RAG: Vapi BYOK. LLM, TTS, STT 키를 책임질 엔지니어링 역량이 있을 때만. 볼륨으로 통신사와 LLM을 협상할 수 있을 때만 $0.27/min의 제어가 가치 있습니다.
  • 대규모 번들 단순성: Deepgram Voice Agent. $4.50/hr($0.075/min) 고정, 검색 결과에서 가장 저평가된 옵션. ElevenLabs가 제공하는 넓은 음성 라이브러리가 필요하면 패스.
  • 대화 품질 기준(영업 데모, 브랜드 민감 플로우): ElevenLabs Conversational. Turbo 또는 Premium 음성 $0.10~$0.12/min. 음질이 전환 레버일 때 추가 비용을 지불하세요.

엔터프라이즈 측면의 더 깊은 산업 분석은 AI voice agents for enterprise call centers를 참고하세요: 동일한 계산법에 레스토랑·클리닉 특화 볼륨 가정을 적용했습니다.

Techsy의 음성 에이전트 비용 모델링 접근법

우리는 음성 플랫폼을 팔지 않습니다. Retell, Vapi, Deepgram, OpenAI Realtime 위에 클라이언트용 프로덕션 음성 에이전트를 구축합니다. 즉, 새 프로젝트의 비용을 모델링할 때 스택을 추천하기 전에 세 가지 볼륨 구간(월 1천, 1만, 10만 분)에서 tco_per_minute() 공식을 실행합니다. 1천 분에서 이기는 플랫폼이 10만 분에서 지는 경우가 많습니다.

월 10만 분 초과 클라이언트를 위해 Twilio 서브계정 가격을 협상하고(서브계정은 대부분의 팀이 존재를 모르는 볼륨 등급을 열어줍니다), Realtime 구축에서는 직접 인프라 설계에 사인하기 전에 항상 프롬프트 캐싱 절감분을 모델링합니다. 클라이언트 비용 모델링 작업의 절반은 누군가 벤더 블로그 글에서 만든 가정을 바로잡는 것입니다.

실제 볼륨에서 이기는 플랫폼 위에 음성 에이전트를 엔드투엔드로 구축하고 싶으신가요? 음성 에이전트 구축 방법 보기 →

FAQ

2026년 AI 음성 에이전트의 분당 비용은 얼마인가? 올인 비용은 분당 $0.07~$0.30입니다. 번들형 플랫폼(Retell, Bland, ElevenLabs Conversational)은 전화 통신 포함 시 $0.10~$0.18/min입니다. Vapi 같은 BYOK 플랫폼은 LLM, TTS, STT, Twilio 비용을 더하면 $0.13~$0.31/min입니다. OpenAI Realtime 직접 사용은 원시 약 $0.30/min, 시스템 프롬프트에 프롬프트 캐싱을 적용하면 약 $0.12/min입니다.

가장 저렴한 AI 음성 에이전트 플랫폼은? 아웃바운드는 Bland AI 고정 $0.09/min이 시장에서 가장 깔끔한 계산입니다. 인바운드 지원은 Retell 올인 $0.10~$0.16이 번들 HIPAA와 동시 통화 기본선 덕분에 보통 이깁니다. 캐싱을 적용한 순수 인프라 플레이는 OpenAI Realtime이 $0.15/min 아래로 내려갈 수 있습니다. Deepgram Voice Agent 고정 $0.075/min은 가장 간과되는 옵션입니다.

왜 Vapi 청구서가 $0.05/min보다 높은가? Vapi 가격 페이지의 $0.05/min 수치는 플랫폼 수수료만입니다. Vapi는 BYOK입니다: LLM(GPT-4o-mini, Claude 등), TTS(ElevenLabs, PlayHT), STT(Deepgram), 전화 통신(Twilio)에 본인 키를 가져와야 합니다. 실제 올인 비용은 선택한 음성과 모델에 따라 $0.13~$0.31/min입니다.

BYOK와 번들 가격의 차이점은? 번들형 플랫폼(Retell, Bland, Synthflow, ElevenLabs Conversational)은 LLM, STT, TTS를 하나의 분당 요율에 포함합니다. BYOK 플랫폼(Vapi)은 오케스트레이션만 과금하며, 나머지는 본인 API 키를 가져와 각 벤더에서 별도로 청구받습니다. 번들은 더 단순하고, BYOK는 제어권과 대규모 협상 여지를 줍니다.

AI 음성 에이전트 가격에 숨겨진 수수료가 있는가? 예, 일반적인 것이 7가지입니다. HIPAA 애드온(Vapi 월 $2,000), 분당 반올림(대규모에서 실효 58% 할증), 전화번호 임대($1$2/월), 동시 통화 수수료(Retell 동시 통화당 $8/월), 전 수수료(Bland $0.025/min), 지식 베이스 수수료(Retell KB당 $8/월), 프리미엄 음성 업셀(ElevenLabs Premium, Turbo 대비 +$0.04/min).

OpenAI Realtime API가 Vapi보다 저렴한가? 프롬프트 캐싱 없이는 아닙니다: OpenAI Realtime은 원시 오디오 비용 약 $0.30/min입니다. 프롬프트 캐싱을 활성화하면(캐시된 시스템 프롬프트 토큰 $0.40/M vs 신규 $32/M, 80배 할인), 시스템 프롬프트 항목이 급감하고 총 비용이 약 $0.12~$0.15/min으로 떨어집니다. 월 1만 분 이상이면 번들형 플랫폼과 경쟁력이 생깁니다.

음성 에이전트 월 비용을 어떻게 예측하는가? 월 통화 건수에 평균 통화 시간(분)을 곱합니다. 플랫폼의 올인 $/min을 곱합니다. 월 고정 비용을 더합니다: 전화번호 임대, 지식 베이스 수수료, 동시 통화 기본선, 해당 시 HIPAA 애드온. 위 tco_per_minute() Python 함수가 이를 자동화하며, Jupyter 노트북에 붙여넣을 수 있는 함수 호출 하나면 됩니다.

분당 과금 vs 초당 과금: 어느 쪽이 저렴한가? 초당 과금이 짧은 아웃바운드 통화에서 의미 있게 저렴합니다. 61초 통화를 60초 단위로 과금하면 2분이 청구되며, 월 5,000건에 일반적인 짧은 통화 분포라면 실효 5~8% 세금입니다. Bland와 Deepgram은 초당 과금; 대부분의 BYOK 플랫폼은 기본적으로 Twilio의 60초 반올림을 상속합니다.

무료 AI 음성 에이전트가 있는가? 무료 체험은 있습니다: 대부분 벤더가 테스트용 무료 10~60분(Retell, Vapi, Bland)을 제공합니다. 진정한 무료 프로덕션급 음성 에이전트는 존재하지 않습니다. 최소한 통신사 분당 비용(Twilio 미국 발신 $0.014/min)은 항상 지불해야 하기 때문입니다. 자체 호스팅 오픈소스 스택(Pipecat, LiveKit Agents)조차 통신사와 LLM 비용은 지불합니다.

음성 AI vs 사람 상담원의 ROI는? 사람 상담원은 완전 부담 기준 시간당 $15~$30이며, 분당 $0.25~$0.50입니다. 분당 $0.10~$0.20의 음성 AI는 동등한 해결률을 가정할 때 월 약 200건 이상에서 인건비를 이깁니다. 그 이하 볼륨에서는 플랫폼 최소 요금과 번호 임대 오버헤드로 인해 사람 + 월 $19 SaaS가 더 저렴한 답입니다.


이 가이드는 Techsy 편집팀이 관리합니다. 우리는 Retell, Vapi, OpenAI Realtime 위에 클라이언트용 프로덕션 AI 음성 에이전트를 구축하며, 이 수치들은 벤더 브로셔가 아닌 매주 수행하는 비용 모델링 작업에서 나온 것입니다. 가격은 2026년 5월 기준 확인; 계약 전 반드시 벤더 가격 페이지에서 확인하세요.

태그

AI 음성 에이전트 가격음성 AIRetell AIVapiBland AILLM 비용OpenAI Realtime

이 기사 공유하기

관련 글

더 많은 글 보기 ai-machine-learning

ai-machine-learning
Jul 20, 2026

2026년 최고의 AI 웹 스크래핑 API 8선 (자체 에이전트 스택으로 직접 테스트)

자체 에이전트 스택으로 실제 2026년 요금을 확인하며 AI 웹 스크래핑 API 8종을 테스트했습니다. Firecrawl, Bright Data, ScrapingBee 외 5종을 LLM 최적화 출력, 안티봇, MCP 지원 기준으로 순위를 매겼습니다.

9 min read 분 읽기
읽어보기
ai-machine-learning
Jul 20, 2026

코딩을 위한 프롬프트 엔지니어링: Claude Code와 Cursor에서 매일 사용하는 7가지 패턴 (2026)

대부분의 'AI 코딩 프롬프트' 글은 복사해서 쓸 수 있는 템플릿 50개를 제시합니다. 이 글은 우리가 16개 에이전트 Claude Code 파이프라인을 운영하는 데 매일 사용하는 7가지 패턴을 가르쳐주며, 각 패턴별 실제 Before/After 예시와 2026년 기준 Claude Code, Cursor, Copilot에서 각 패턴이 어떻게 적용되는지 설명합니다.

11 min read 분 읽기
읽어보기
ai-machine-learning
Jul 19, 2026

AI PoC에서 프로덕션까지: 출시 전 12가지 체크리스트

작동하는 AI 데모는 프로덕션 시스템이 아닙니다. 이 12가지 체크리스트는 모든 AI 기능이 출시 전에 거쳐야 하는 세 단계인 강화, 안정화, 배포를 안내하며, 비용 상한, 속도 제한, 폴백, 롤백 트리거에 대한 구체적인 기준을 제시합니다.

10 min read 분 읽기
읽어보기
모든 글 보기
프로젝트 시작하기

새로운 것을 만들 준비가 되었다면 특별함은?

여러분의 비전을 현실로 만들어 보세요. 차이를 만드는 소프트웨어, 우리 팀이 함께 만들겠습니다.

30분 스코핑 미팅 예약프로젝트 보기

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

라이브러리에서 인기 있는 도구

Claude 스킬

전체 보기
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI 자동화

전체 보기
  • Security Auditor

    Weekly SCA + IaC scan with prioritized fix PRs.

  • Cold Email Writer

    Generates first-touch emails grounded in one specific public detail.

  • Lead Research Agent

    Enrich an email into a profile, score fit, alert in Slack.

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기

법적 고지사항

  • 개인정보 처리방침
  • 서비스 약관
  • 쿠키 정책

서비스

  • 엔터프라이즈 솔루션
  • 모바일 앱
  • 웹 애플리케이션

솔루션

  • CRM 시스템
  • AI 통합
  • ERP 솔루션
  • 음성 에이전트
  • 프로세스 자동화
  • 사이버 보안

라이브러리

  • 블로그
  • 포트폴리오

커뮤니티

  • AI 자동화
  • Claude 스킬

도구

  • 모바일 앱 비용 계산기
  • OpenAI / LLM API 비용 계산기
  • MVP 비용 계산기
  • 음성 AI 에이전트 비용 계산기

회사 소개

  • 소개
  • 파트너
  • 문의하기
법적 고지사항개인정보 처리방침서비스 약관쿠키 정책
TECHSY
© 2026 Techsy. 무단전재 및 재배포 금지.