
AI音声エージェント 内製 vs 購入:2026年の意思決定フレームワーク(隠れた第3の選択肢つき)
内製 vs 購入ガイドのほとんどは、二者択一しか提示しません。しかし2026年の正直な答えは三択のマトリクスであり、誰も語らない選択肢(プラットフォーム上にカスタムフローを構築するエージェンシーへの委託)が、私たちが監査したチームの約4分の1で最適解となっています。
2026年にAI音声エージェントをスクラッチから内製する場合、初年度に$250K〜$2Mのコストと4〜9ヶ月の期間がかかります。SaaSの購入(Vapi、Retell、Bland)なら**$5K〜$100Kで、5〜14日で本番稼働できます。第3の選択肢である、プラットフォーム上にカスタムフローを構築するエージェンシーへの委託は、$30K〜$150Kで4〜10週間**でのリリースが可能です。
クイックアンサー(3つの選択肢の正直な判定):
- SaaS購入(Vapi/Retell/Bland)が約65%のチームで最適解。初年度:$5K〜$100K、5〜14日で本番稼働。
- **エージェンシー構築型(プラットフォーム活用)**が約25%で最適解。初年度:$30K〜$150K、4〜10週間で本番稼働、完全カスタムフロー。
- 純粋なスクラッチ開発が最適なのは約5%。初年度:$250K〜$2M、4〜9ヶ月で本番稼働、月間50万分以上でのみ合理的。
- ハイブリッド(プラットフォーム購入+社内カスタム層)が残りの約5%をカバー。通常はF500企業と規制業界。
内製、購入、それともブレンド?3つのパスを並べて比較
既存のAI音声エージェント 内製 vs 購入ガイドは、どれも2つの選択肢しか提示していません。実際の導入現場では、3つのパスが主流です。ホスティング型プラットフォームを購入する、自社エンジニアでスクラッチから内製する、あるいはVapi・Retell・Blandの上にエージェンシーを起用してカスタムフローを載せるブレンド型。コスト曲線、タイムライン、リスクプロファイルは大きく異なり、正直にコスト計算すれば、結論はたいてい明白です。
| パス | 初年度コスト | 本番稼働まで | カスタマイズ性 | 最適な対象 |
|---|---|---|---|---|
| SaaS購入 | $5K〜$100K | 5〜14日 | テンプレート+プロンプト+ツール | SMB〜ミッドマーケット、標準フロー |
| エージェンシー構築型(プラットフォーム活用) | $30K〜$150K | 4〜10週間 | ホスティングランタイム上の完全カスタムフロー | 独自ワークフローを持つミッドマーケット |
| 純粋なスクラッチ開発 | $250K〜$2M | 4〜9ヶ月 | 完全自由:全層が自社所有 | F500、月間50万分以上、音声がコアプロダクト |

表について2点補足。第1に、購入の「初年度コスト」は月間5万〜20万分を前提としています。それ以下なら下限に、それ以上ならエージェンシー構築型の価格帯に近づきます。第2に、エージェンシー構築型の数字は、プラットフォームのパススルー(通過費用)を含む総額であり、エージェンシー報酬だけではありません。計算の詳細はH2 #5で示します。
「AIの内製か購入か」という調達チーム的なフレーミングは、第3のパスを完全に見落としています。McKinseyが「build, buy, or blend(内製・購入・ブレンド)」と呼ぶのには理由があります。私たちが実際のワークロードでRetell vs Vapi vs Blandをエンドツーエンドで測定したところ、2025年に私たちが手がけた成功事例はすべてブレンド型に分類され、二者択一にはなりませんでした。(プラットフォーム側の数値はRetell vs Vapi vs Blandの比較を参照。表のコスト範囲はMaster of Codeの「AI音声エージェントの真のコスト」分析に基づいています。)
内製 vs 購入ガイドのほとんどは二者択一しか提示しない。2026年の正直な答えは三択のマトリクスだ。
AI音声エージェントの「購入」には実際いくらかかるのか?
SaaS音声AIを購入する際の実コストは1分あたり$0.15〜$0.33で、ASR(自動音声認識)、TTS(テキスト読み上げ)、LLM、テレフォニー、プラットフォーム手数料が積み重なると、広告表示価格の2〜4倍になります。月間10万分の場合の初年度コストは、ベンダーや音声の選択によりおおよそ**$20K〜$50K**。見出しの価格は正直ですが、実際に支払う金額とは異なります。
以下が、既製品のAI音声エージェントを購入する際の2026年5月時点の実証済み計算です。
| ベンダー | 広告価格 | 実質総額/分 | 出典(2026年5月17日取得) |
|---|---|---|---|
| Vapi | $0.05 | $0.18〜$0.33 | vapi.ai/pricing |
| Retell AI | $0.07 | $0.13〜$0.31 | retellai.com/pricing |
| Bland | $0.09〜$0.11 | $0.15〜$0.30 | bland.ai/pricing |
| Synthflow | $0.08〜$0.13(バンドル) | $0.10〜$0.18 | Synthflow価格ページ |
なぜ差額が生まれるのか:広告価格はプラットフォームの取り分です。それに加えて、STTプロバイダー(Deepgramが代表的で、約$0.0043/分)、LLM(GPT-4o-miniは1Mトークンあたり$0.15/$0.60、Claude Haikuも同程度)、TTSエンジン(ElevenLabs Turboはプレミアム音声で約$0.06/分、ベンダーバンドルなら低品質でより安価)、SIPトランク(Twilio経由で約$0.014/分)、番号ごとのレンタル料(各$1〜$5/月)がかかります。さらに通話後アナリティクス、ナレッジベースストレージ、専用サポートティアを追加すると、表の数字に到達します。
多くのチームが直面するAI音声エージェントコストの段階別、初年度の実例:
- 月間1万分(初期パイロット): 総額おおよそ$2,000〜$4,000。SaaSがあらゆる内製に対して圧倒的に有利。
- 月間10万分(ミッドマーケット導入): 総額$20K〜$50K。よほど特殊なユースケースでない限りSaaSの領域。
- 月間50万分(コールセンター規模): $90K〜$180K。ここで初めて、チームが内製の試算シートを開き始める理由が見えてきます。
ベンダー・機能別の完全な内訳は、音声エージェント価格の詳細内訳を参照してください。
1分$0.05という見出し価格は実在する。月末の請求書に1分$0.28と書かれているのもまた事実だ。
AI音声エージェントをスクラッチから内製する実際のコストは?
本番環境のAI音声エージェントをスクラッチから内製する場合、初年度に$250K〜$2M、期間は4〜9ヶ月、ASR・LLM・テレフォニーの経験を持つシニアエンジニア3〜5名のチームが必要です。TCO(総所有コスト)の内訳はおおよそ**エンジニア人件費60%、インフラ・API 15%、コンプライアンス10%、機会損失15%**で、社内開発のほとんどは当初の見積もりを2倍に膨らませます。
エンジニアは「8週間、$80Kで構築できる」と引用したがるものです。以下が、ベンダーのブログが決して書かないTCOの全項目です(米国のフルロード人件費を前提。インド/EUの調整は後述)。
| 項目 | 初年度コスト(米国) | 備考 |
|---|---|---|
| エンジニアリングチーム(シニア3名×$180K) | $540,000 | インドチーム:約$180K。EUミッド:約$360K。 |
| インフラ(compute、ストレージ、オブザーバビリティ) | $24,000 | AWS/GCP、ログ、トレース、オンコールアラート |
| ASR APIパススルー(DeepgramまたはWhisper) | $15,000〜$60,000 | 量に依存 |
| TTS APIパススルー(ElevenLabs) | $15,000〜$60,000 | プレミアム音声なら2倍 |
| テレフォニー(Twilio Programmable Voice) | $0.014/分×利用量 | 月間10万分で$17K |
| コンプライアンス監査(HIPAA / SOC 2 / PCIスコープ) | $20,000〜$80,000 | 加えて毎年の更新料 |
| 機会損失(6ヶ月のロードマップ放棄) | 変動、通常$200K以上 | そのエンジニアが他に作れたもの |
| 初年度合計(典型的な中間シナリオ) | $650K〜$850K | 遅延が発生すると$1Mを軽く超える |
「2倍ルール」は実在します。私たちが監査した社内音声AI開発はすべて、当初見積もりの約2倍に着地しました。原因はほぼ例外なく、コンプライアンス関連の配管作業とターンテーキングのエッジケースの過小見積もりです。Master of Codeも同様の倍率を分析で記録しており、Caller.DigitalのTCOモデルも同じ帯域に収まっています。これを前提に計画するか、早めに内製を諦めるかです。
LLMオーケストレーション層も忘れないでください。STT、検索、ツール呼び出し、TTSをターンテーキングループにまとめるフレームワークです。LangGraph、OpenAI Agents SDK、カスタム有限状態マシンのどれかを評価することになります。(主要候補のベンチマークはビルダー向けAIエージェントフレームワークで、デプロイ側はエージェンティックAIデプロイメントプラットフォームで扱っています。)どれもロケット科学ではありませんが、すべての層がもう1つの統合テスト、もう1つの不安定な障害モード、もう1つの午前2時のオンコールページを意味します。
状態管理は独立した項目に値します。2ターン前に発信者の名前を忘れるエージェントは、ユーザーにとって壊れているのと同じです。トレードオフはAIエージェント向けメモリで詳しく扱いました。要約すると、Redisにカスタムシリアライゼーションを載せるか、マネージドメモリ層を月$200〜$2,000で借りるかの二択です。
以下が、3つのパスを3年間の累積コスト曲線で比較したものです:
"Cumulative Cost (Year 1–3): Build vs Buy vs Agency-Built"
データテーブル
| "Months from kickoff" | "Pure Build" | "Buy SaaS" | "Agency-Built on Platform" |
|---|---|---|---|
| "Month 6" | 350000 | 15000 | 45000 |
| "Month 12" | 650000 | 45000 | 90000 |
| "Month 18" | 800000 | 75000 | 135000 |
| "Month 24" | 950000 | 105000 | 180000 |
| "Month 30" | 1100000 | 135000 | 225000 |
| "Month 36" | 1250000 | 165000 | 270000 |
前提条件:月間10万分のワークロード、米国のフルロードエンジニア人件費、ベンダー価格は2026年5月取得時点。スクラッチ開発とエージェンシー構築型のクロスオーバーは、通話量が月間50万分を超えた場合のみ、約32ヶ月目に発生(H2 #6参照)。
社内音声AI開発はすべて当初見積もりの2倍になる。前提として計画するか、早めに諦めるかだ。
隠れた第3のパス:プラットフォーム上へのエージェンシー構築
すべてのベンダーブログが飛ばしている選択肢があります。既存のプラットフォーム(Vapi、Retell、Bland)の上に、カスタムAI音声エージェントのフローを構築するエージェンシーを雇うことです。エンジニア採用の罠を回避し、4〜10週間でリリースでき、スクラッチ開発と同じビジネスロジックを所有できます。それを維持するために5人のASR-LLM-TTSチームを雇い続ける必要はありません。
定義: 外部のエンジニアリングチームが、ホスティング型音声プラットフォームの上にフロー、プロンプト、インテグレーション、評価(eval)、CRMフックを構築します。構築にはプロジェクト費用を支払い、ランタイムには分単位のプラットフォームパススルーを支払います。コードの所有権はエージェンシーに、エージェントの所有権はあなたにあります。
コストの計算:
- プロジェクト費用:フローの複雑さ(インテグレーション数、規制スコープ、評価の厳密さ)により**$30K〜$80K**
- プラットフォームパススルー:H2 #3の実質総額レートで1分あたり$0.15〜$0.30
- 初年度の着地:総額$50K〜$150K、初回本番通話までおおよそ4〜10週間
誰に向いているか(約25%):
- Vapiのテンプレートに合わない独自ワークフローを持つミッドマーケット
- 監査対応可能な評価+コンプライアンス文書が必要な規制業界(医療、金融、法律)
- 社内に音声AIエンジニアがゼロで、単一プロジェクトのためにスペシャリストチームを雇う気がないチーム
- 5つ以上の異なるフローを並行して出荷する必要があるマルチバーティカルエージェンシーやフランチャイザー
誰に向いていないか(正直な関門。検討中なら必ず読んでください):
- MVPを構築するソロファウンダー: VapiかRetellで直接DIYしてください。MVPの通話量ではエージェンシー費用は回収できません。(コード不要のオーケストレーションが欲しい場合はn8nによるローコードエージェントワークフローと組み合わせるとよいでしょう。)
- 50人の音声AIチームを持つF500企業: 内製してください。チームも、通話量も、IPの根拠もあります。
- 300ms未満のレイテンシ要件: コロケートされたカスタムビルドでしか達成できません。誰がフローを書こうと、プラットフォームでは不可能です。
- モデルの完全な所有権が必要なユースケース(通話記録で独自LLMを学習させている場合):MLアクセスには内製のパスが必要です。プラットフォームはその層を抽象化しています。
チームがエージェンシー構築型に該当する場合、カスタム音声エージェント開発パートナーにスコープの相談ができます。急かすことはありません。強引なセールスもありません。問い合わせるチームのほとんどは、契約の話を始める前に2〜4週間かけてコールフローをマッピングするだけで、それが正しいペースです。
ミッドマーケットのチームのほとんどは、カスタム音声エージェントを求めている。しかし、それを作るために5人のASR-LLM-TTSチームを雇いたいと思っているチームは少ない。
内製が本当に勝つのはいつか?損益分岐の計算
カスタムAI音声エージェントの内製がペイするのは、月間の通話量がおよそ50万分を超え、かつユースケースに必要なインテグレーションが5つ未満で、かつ音声AIがコモディティ機能ではなくコアプロダクトの差別化要因である場合のみです。この閾値を下回ると、SaaSの購入やプラットフォーム上のエージェンシー委託が、3年間のTCOで内製を2〜4倍上回ります。この計算式は、多くのチームが認めたがるよりもシビアです。
平易な言葉で言えば:
内製が勝つ条件: 月間通話分数 > 50万 かつ ユースケースのインテグレーション < 5つ かつ 音声AIがコアな差別化要因(コモディティではない)。
実例 #1:月間5万分のSMBクリニックチェーン。 3年間で購入が約4倍有利。SaaS購入:初年度約$15K、3年累計約$45K。純粋な内製:初年度約$650K、3年累計約$1.25M。このクリニックチェーンには音声AIエンジニアもおらず、通話量もなく、プラットフォームで対応できない規制上のエッジケースもない。SaaSは安いだけではない。唯一の正解だ。(フードバーティカルの同等の計算はレストラン向け音声エージェントを参照。同じ結論に着地します。)
実例 #2:月間200万分のエンタープライズコンタクトセンター。 内製はエージェンシー構築型とおおよそ28ヶ月目で損益分岐に達し、3年目には約1.6倍有利になります。ただし、ユースケースがコンタクトセンターの各バーティカルで再利用可能な場合のみ。純粋な内製:初年度約$650K、3年累計約$3.5M(大部分はエンジニアリングの継続コスト)。SaaS購入を平均$0.20/分とすると:3年目約$4.8M。ここでは内製が計算上勝ちますが、それは通話量がエンジニアリングチームのコストを償却できるからです。
ハイブリッドのエッジケースが残りの約5%をカバーします。月間500万分以上を運用するF500企業、独自のML層を持つ規制業界、あるいは差別化要因がまさにモデルそのものであるチームです。テレフォニー+STT+TTSのコモディティ層はプラットフォームを購入し、LLMと通話後MLは社内で構築します。これはCaller.Digitalが「月間50万分以上かつインテグレーション5つ未満」の閾値として特定しているもので、再利用可能性がすべてを決めます。
月間50万分を下回ると、Vapiがすでに出荷しているものを再構築するためにエンジニアに給料を払っていることになります。
内製は月間50万分で計算上勝つ。それを下回ると、Vapiがすでに出荷したものを再構築するためにエンジニアに払っていることになる。
見えないインテグレーション作業が内製見積もりをどう破壊するか?
カスタム音声エージェント開発における見えないインテグレーション作業には、A2P 10DLC(アプリケーション対個人間10桁ロングコード)登録、STIR/SHAKEN通話認証、TCPA(電話消費者保護法)同意取得、管轄区域ごとの録音開示ロジック、CRM Webhook認証、PIIマスキングが含まれます。Vapi、Retell、Blandのようなプラットフォームは、これらすべてを初日から解決しています。あなたの「8週間見積もり」は、6週間分のテレフォニーコンプライアンス配管作業を忘れていました。
以下が、元の仕様書に誰も載せないAI電話エージェントの足場組みです:
- A2P 10DLC登録: 2〜6週間、手数料$50〜$1,000。米国のSMS関連フロー(予約リマインダー、折り返し確認)に必須。登録マトリクスはTwilioのA2P 10DLCドキュメントを参照。
- STIR/SHAKEN認証: キャリア依存の発信者ID署名。これがないと、発信通話の30〜60%(モバイルの場合)で「スパムの可能性あり」とフラグが立ちます。一度きりではなく継続的なメンテナンスが必要。
- TCPA同意取得: 録音開示、Do-Not-Callリスト統合、書面によるオプトイン保存。FCCの2024年AIロボコール裁定によりTCPAはAI音声にも適用拡大。違反は1通話あたり$500〜$1,500。
- 州ごとの録音開示: 米国の12州は双方同意を要求(カリフォルニア、フロリダ、イリノイなど)。加えてEUの発信者にはGDPRが適用。エージェントは2文目に入る前に発信者の所在地を把握する必要があります。
- CRM Webhook認証+リトライロジック: OAuthリフレッシュ、指数バックオフ、デッドレターキュー。簡単そうに見えて、簡単ではありません。
- PIIマスキング+通話後サマリー保存: クレジットカード番号、SSN、医療情報を保存前にスクラブ。HIPAAがこれを要求し、SOC 2の監査人も同様に要求します。
これらを合計すると、元の「8週間で構築できる」見積もりには登場しない4〜8週間分の作業が追加されます。プラットフォームはこれらすべてを配線済みで出荷しています。
あなたの8週間見積もりは、6週間分のテレフォニーコンプライアンス配管作業を忘れていた。
なぜカスタム音声開発はプラットフォームより遅く聞こえるのか?
自然に感じる音声AIのレイテンシ予算は、エンドツーエンドで700ms未満です:STT(150〜250ms)+LLMファーストトークン(200〜400ms)+TTSファーストバイト(100〜200ms)+ネットワーク/ジッター(100〜250ms)。プラットフォームはこの中央値を達成していますが、カスタムビルドはチームがネットワークとコールドスタートのレイテンシを過小見積もりするため、しばしば1.2〜2.0秒に着地します。発信者は400msの沈黙でエージェントに被せて話し始めるため、この差は聞こえるレベルです。
多くの内製見積もりが無視する計算:
| ステージ | レイテンシ(典型値) | ずれる要因 |
|---|---|---|
| STTファーストチャンク | 150〜250ms | ストリーミング vs バッチ。コールドモデル=+200ms |
| LLMファーストトークン | 200〜400ms | コールドスタートで+400ms以上。長いシステムプロンプトで+100ms |
| TTSファーストバイト | 100〜200ms | プレミアム音声は遅い。非ストリーミング=+500ms |
| ネットワークRTT | 50〜150ms | AWSリージョンが発信者のキャリアに隣接していないと悪化 |
| ジッターバッファ | 50〜100ms | チームが忘れる部分 |
| 合計予算 | 550〜1,100ms | 1.2秒を超えると通話に違和感 |

プラットフォームが700〜900msの中央値を達成できる理由:パイプライン最適化(STT/LLMストリーミングのインターリーブ)、テレフォニーキャリアとのネットワーク隣接性、コールドスタートしないウォームモデルプール。社内ビルドが日常的に1.2〜2.0秒に着地する理由:チームがネットワーク/ジッターの時間を予算化しない、コールドスタートのLLM呼び出しが毎通話の最初のターンで400msを追加する、自作TTS実装のほとんどがレスポンス全体を待つ前にファーストバイト音频をストリーミングしない。Closeの0.4秒発信者トークオーバー閾値のデータが音声AIで最も引用される数字であるのには理由があります。自然なターンテーキングが壊れる境界線です。Deepgramのレイテンシベンチマークは、STTファーストチャンクの下限が約150msであることを確認しています。
Vapiが700msを達成できるのは、ネットワーク隣接性を所有しているから。あなたのAWSリージョンビルドではそうはいかない。
本当に15行のコードで音声エージェントを構築できるのか?
VapiやRetellのような最新の音声AIプラットフォームは、本番環境対応の音声エージェントを作成する10〜20行のSDK呼び出しを公開しています。同じ機能をスクラッチから(STT、LLMオーケストレーション、TTS、テレフォニー、ターンテーキング)構築すると、通常4〜9ヶ月のエンジニアリング作業が必要です。逆説的ですが、コードを見せることで購入の論拠は弱まるのではなく、むしろ強まります。
以下が、15行で動くVapi Web SDK音声エージェントです(docs.vapi.ai/quickstart/webで検証済み、2026年5月17日取得):
import Vapi from "@vapi-ai/web";
const vapi = new Vapi(process.env.VAPI_PUBLIC_KEY);
await vapi.start({
model: {
provider: "openai",
model: "gpt-4o-mini",
systemPrompt: "You are a friendly clinic receptionist. Book appointments, answer FAQs, escalate emergencies.",
},
voice: { provider: "11labs", voiceId: "rachel" },
transcriber: { provider: "deepgram", model: "nova-2" },
firstMessage: "Hi, this is the clinic. How can I help today?",
});
vapi.on("call-end", (data) => console.log("Call ended:", data.summary));このスニペットの1行1行が、数ヶ月分の社内作業を置き換えています。transcriberフィールドはSTTインテグレーションです。voiceフィールドは、ストリーミングのファーストバイト処理を含むTTSパイプライン全体です。systemPromptはターンテーキングとツール呼び出しの層全体です(Vapiがバーグイン、エンドポインティング、ツールルーティングを内部で処理します)。call-endは、Whisper+GPT-4パイプラインを別途構築しなければ得られない通話後サマリーを提供します。
これが、あなたの4〜9ヶ月のカスタムビルドが再現しようとしているものです。SDKを詳しく読めば読むほど、内製を正当化するのは難しくなります。
逆説的だが、コードを理解すればするほど、購入の論拠は強くなる。
音声エージェントの内製が間違った答えになるのはいつか?
音声エージェントの内製が間違った答えになるのは、チームに音声AIの出荷経験がない場合、見積もりが初年度$150K未満の場合、タイムラインが8週間未満の場合、ユースケースが既存のプラットフォームテンプレートにきれいにマッピングできる場合、または通話量が月間50万分未満の場合です。このうち2つに該当すれば、内製のパスはエンジニアリングではなく医療過誤です。
エンジニアリングチームは内製を提案するでしょう。嘘はついていません。できるのは事実です。問題は、すべきかどうかです。以下の5つのアンチパターンシグナルに注意してください:
- 「WhisperとGPT-4を繋ぐだけだ。」 本番で音声を出荷したことがある人間は誰もこう言いません。難しいのはターンテーキング、バーグイン検出、TTSストリーミングであり、この文にはそのどれもが含まれていません。
- 初年度見積もり$150K未満。 チームがコンプライアンスのスコープを理解していないか、テレフォニー層の価格を調べていないか、オブザーバビリティが不要と仮定したかのいずれかです。3つすべてがレッドフラグです。
- チームに音声を出荷したエンジニアが1人もいない。 音声AIの障害モードはチャットとは異なります。エコーキャンセル、ジッターバッファリング、バーグイン:これらはWeb開発の問題ではありません。
- タイムライン8週間未満。 既製のプリミティブを出荷しているプラットフォームでさえ、インテグレーション+CRM+評価の配線に2〜4週間かかります。スクラッチで8週間は、コンプライアンスを切るか、評価を切るか、あるいは両方を切ることを意味します。
- 「TTSは社内で作る。」 いいえ、作りません。ElevenLabsもCartesiaも数百人のエンジニアと専任のオーディオモデル研究者を抱えています。コモディティ化したものは購入してください。
エンジニアがそれでも内製を提案する理由:キャリア資本、NIH(「ここで発明していない」)バイアス、人員数の正当化、グリーンフィールドエンジニアリングの純粋な喜び。どれも内製をしたい理由としては悪くありません。ただ、実際に内製する理由としては悪いのです。
意思決定を再フレーミングしてください:差別化するものを内製し、コモディティ化したものを購入する。LLM、ASR、TTSの層は2025〜2026年にコモディティ化しました。あなたの差別化はフロー、プロンプト、評価、CRMインテグレーションにあります。Vapi、Retell、OpenAI、Deepgramがすでに出荷した層を再構築しないでください。
差別化するものを内製せよ。2025年にコモディティ化したものを購入せよ。
正直な意思決定マトリクス
コンタクトセンター向け音声AIを両方のやり方で構築してきた経験から、私たちの合理的な内訳は次の通りです。チームの約65%はSaaSを購入すべき(Vapi、Retell、Bland)、約25%はプラットフォーム上にエージェンシーを起用して構築すべき、約5%はハイブリッド(プラットフォーム+社内カスタム層)が必要、約5%はスクラッチから内製すべき。純粋なスクラッチ開発がペイするのは、専任の音声AIチームを持ち、月間50万分を超える場合のみ。これらは2025〜2026年に4件のクライアント意思決定の計算を監査した後の私たちの推奨であり、業界統計ではありません。
| 割合 | パス | 最適な対象 | 初年度コスト |
|---|---|---|---|
| 約65% | SaaS購入 | SMB〜ミッドマーケット、標準フロー、月間50万分未満 | $5K〜$100K |
| 約25% | エージェンシー構築型(プラットフォーム活用) | 独自フロー、規制業界、音声AIチームなし | $30K〜$150K |
| 約5% | ハイブリッド(プラットフォーム+社内ML) | F500、規制、独自モデル層 | $200K〜$600K |
| 約5% | 純粋なスクラッチ開発 | 音声AIがコアプロダクト、月間50万分以上、チームあり | $250K〜$2M |

クライアントと一緒にたどる4ノードの意思決定ツリー:
- 月間50万分以上を処理しますか? No → 購入またはエージェンシー構築型。Yes → 次へ。
- 音声AIはコアプロダクトの差別化要因ですか(機能ではなく)? No → 購入またはエージェンシー構築型。Yes → 次へ。
- 社内に音声AIエンジニアリングチームがいますか(3つ以上の音声プロダクトを出荷済み)? No → エージェンシー構築型またはハイブリッド。Yes → 次へ。
- 総レイテンシ300ms未満、または独自モデルの学習が必要ですか? No → ハイブリッド。Yes → 純粋な内製。
ほとんどのチームはノード1かノード2で止まるため、マトリクスの90%は購入またはエージェンシー構築型に着地します。
25%のバケットに該当する場合、クライアント向けにRetellまたはVapi上に構築する方法はこちら。契約書ではなく、コールフローから始めてください。
差別化するものを内製せよ。コモディティ化したものを購入せよ。2026年のほとんどのチームにとって、それはプラットフォームを購入し、フローをカスタマイズすることを意味する。
結論
- パスは2つではなく3つ。チームの約65%はSaaS購入。約25%はエージェンシー構築型(プラットフォーム活用)。純粋な内製は、本物のチームを持つ月間50万分以上のみ。
- 損益分岐の計算式はシンプル:月間分数 > 50万 かつ インテグレーション < 5 かつ 音声AIがコア。3つのうち1つでも欠ければ、内製の計算は成立しない。
- 意思決定のルール:差別化するものを内製し、コモディティ化したものを購入する。2026年、それはほぼ毎回プラットフォーム層を購入することを意味する。
エージェンシー構築型が理にかなう25%のバケットにいるなら、ホワイトボードにコールフローをマッピングすることから始め、RetellまたはVapiでの出荷経験があるパートナーに相談してください。急ぐ必要はありません。正しい動きは、契約の前にスコープを定めることです。
よくある質問
AI音声エージェントは内製と購入のどちらが良いですか?
チームの約65%にとって、SaaS音声プラットフォーム(Vapi、Retell、Bland)の購入がより良い選択です。本番稼働まで5〜14日、初年度$5K〜$100Kで、カスタムビルドの4〜9ヶ月、$250K〜$2Mと対照的です。内製が勝つのは、音声AIがコアプロダクトの差別化要因であり、社内に3名以上の音声AIエンジニアチームを持ち、月間50万分を超える場合のみです。
AI音声エージェントをスクラッチから内製するコストは?
スクラッチ開発は、米国のフルロードチームで初年度$250K〜$2Mです。内訳はおおよそエンジニアリング$540K(シニアエンジニア3名)、インフラ$24K、ASR・TTS APIパススルー$30K〜$120K、テレフォニー$0.014/分、HIPAA/SOC 2コンプライアンス監査$20K〜$80Kです。ほとんどの開発は、過小見積もりされたコンプライアンスとエッジケース作業により、当初見積もりの2倍に着地します。
本番環境の音声AIエージェントの構築にはどのくらいの期間がかかりますか?
スクラッチから適切なコンプライアンス、評価、オブザーバビリティを備えた本番対応エージェントを構築するには4〜9ヶ月かかります。VapiやRetellのようなSaaSプラットフォームの購入なら5〜14日です。隠れた第3のパス(既存プラットフォーム上にカスタムフローを構築するエージェンシーへの委託)は4〜10週間です。この差の大部分は、プラットフォームが初日から解決しているテレフォニーとコンプライアンスの足場組み(A2P 10DLC、STIR/SHAKEN、TCPA)です。
スクラッチではなくVapiやRetell上に音声エージェントを構築できますか?
はい、これがエージェンシー構築型(プラットフォーム活用)のパスです。あなた(または外部エージェンシー)がVapi、Retell、Blandのホスティングランタイム上にカスタムフロー、プロンプト、インテグレーション、評価を構築します。初年度コストは総額$30K〜$150K(プロジェクト費用$30K〜$80K+1分あたり$0.15〜$0.30のパススルー)で、4〜9ヶ月ではなく4〜10週間で出荷できます。ビジネスロジックの所有権はあなたにあり、プラットフォームがSTT、TTS、テレフォニー、ターンテーキングを処理します。
音声AI内製の損益分岐通話量は?
損益分岐の閾値は月間約50万分で、かつユースケースのインテグレーションが5つ未満、音声AIがコアプロダクトの差別化要因である場合のみです。月間50万分未満では、SaaSまたはエージェンシー構築型が3年間のTCOで内製を2〜4倍上回ります。月間50万分以上で適切なチームとユースケースがあれば、純粋な内製はエージェンシー構築型と約28ヶ月目で損益分岐に達し、3年目には有利になります。
SaaS音声プラットフォームの使用と自社開発、どちらが安いですか?
月間50万分未満のほぼすべてのチームにとって、SaaSが圧倒的に安く、通常3年間のTCOで4〜10倍安くなります。SaaSの実質レートは1分あたり$0.15〜$0.33(ASR、TTS、LLM、テレフォニーが積み重なると広告価格の2〜4倍)ですが、それでも自社開発で抱えることになる$650K〜$1.25Mのエンジニアリング、インフラ、コンプライアンスコストより安くなります。
音声エージェントの構築にはどのようなエンジニアリングスキルが必要ですか?
リアルタイムオーディオストリーミング、ASRインテグレーション(DeepgramまたはWhisper)、LLMオーケストレーション(LangGraph、OpenAI Agents SDK、またはカスタムステートマシン)、TTSストリーミング(ElevenLabsまたはCartesia)、SIPテレフォニー(Twilio Programmable VoiceまたはTelnyx)、ターンテーキングとバーグイン検出、コンプライアンス作業(TCPA、HIPAA、SOC 2)の複合経験を持つシニアエンジニアが最低3名必要です。チームが本番で音声を出荷した経験がない場合、学習曲線がタイムラインに2〜4ヶ月を追加します。
カスタムビルドとプラットフォームでレイテンシはどう異なりますか?
プラットフォームはエンドツーエンド中央値700〜900msを達成します(Vapi、Retell、Bland)。社内カスタムビルドは、チームがネットワークとジッターの時間を予算化せず、コールドスタートのLLM呼び出しが毎通話の最初のターンで400msを追加するため、日常的に1.2〜2.0秒に着地します。1.2秒を超えると、発信者がエージェントに被せて話し始め、ターンテーキングが壊れます。700msの上限が重要なのは、プラットフォームがテレフォニーキャリアとのネットワーク隣接性を所有しているからです。あなたのAWSリージョンビルドではそうはいきません。
音声AIの内製が財務的に合理的になるのはいつですか?
内製が財務的に合理的になるのは、月間通話量が50万分を超え、ユースケースのインテグレーションが5つ未満で、音声AIが(機能ではなく)コアプロダクトの差別化要因であり、3名以上の社内音声AIチームがある場合です。このうち1つでも欠ければ、内製の計算は成立しません。これは私たちが監査するチームの約5%に該当し、通常はF500のコンタクトセンターか、音声がプロダクトそのものであるAIネイティブ企業です。
音声AIを社内開発する際の隠れたコストは?
隠れたコストは、A2P 10DLC登録(2〜6週間、$50〜$1,000)、STIR/SHAKEN認証、TCPA同意取得、州ごとの録音開示ロジック、CRM Webhook認証、PIIマスキング、通話後サマリー保存、オブザーバビリティとオンコールインフラ、そして放棄したプロダクトロードマップの6ヶ月分の機会損失です。プラットフォームはこれらすべてを初日から解決しています。「内製見積もり2倍ルール」が存在するのは、チームがこれらの項目を忘れるからです。