
Devin vs Claude Code vs Codex 2026:コーディングエージェント8製品を実際に試した
バックグラウンドコーディングエージェントは、わずか12か月のあいだに研究デモからコモディティへと変わった。Cognitionは今年4月にDevinの最低価格を500ドルから月額20ドルへ引き下げ、OpenAIは4月2日にCodexの課金体系を再構築し、Factoryは2週間前に1億5,000万ドルのシリーズCをクローズした。今月、私たちは社内Techsyツールの開発ですべての8製品を本番環境で試し、以下に示す数字は実際に支払った金額だ。私たちはこれらのツールを一切販売しておらず、アフィリエイトリンクもない。このクエリの検索上位10件中、リスト内のエージェントのベンダーが公開していない記事は他に存在しない。
| ツール | 最低価格 | 最適モデル | サンドボックス/クラウド | GitHubネイティブ | 最適な用途 | 注目指標 |
|---|---|---|---|---|---|---|
| Devin | 月額20ドル+2.25ドル/ACU | Cognition独自スタック | フルVM(自社IDE+ブラウザ) | GH App経由でPR | エンドツーエンドのバックログ委任 | バグ修正1件あたり約5ドル |
| Cursor BG Agents | 月額20ドル(Pro) | 好みのフロンティアモデル | エフェメラルなクラウドVM | 連携経由でPR | 非同期処理を求めるCursorユーザー | 最大8エージェントの並列実行 |
| Codex Cloud | 月額20ドル(Plus)→200ドル(Pro) | OpenAI gpt-5-codex | OpenAIクラウドサンドボックス | Codex CLI/Web経由でPR | ChatGPT Proのヘビーユーザー | Terminal-Bench 2.0で77.3% |
| Claude Code Remote | 月額20ドル(Pro)→200ドル(Max 20x) | Claude Opus 4.7 | Anthropicクラウド | GH App経由でPR | Claude Codeヘビーユーザー+cron | SWE-bench Verifiedで87.6% |
| Copilot Coding Agent | 月額10ドル(Pro)→39ドル(Enterprise) | GPT/Claude(ティア制限あり) | GitHub管理ランナー | ネイティブ(イシュー→PR) | GH Enterprise/Businessチーム | 最も深いGH連携 |
| Google Jules | 無料(1日15件)→19.99ドル~ | Gemini | GoogleクラウドVM | 連携経由でPR | 個人開発者/小規模チーム | カテゴリ最高の無料枠 |
| Factory Droids | 月額20ドル(2シート) | マルチモデルルーティング | クラウド+ローカル選択可 | 連携経由でPR | 規制業界 | NVIDIA、Adobe、Bayerで採用 |
| 次点 | さまざま | さまざま | さまざま | さまざま | OSS/DIYパイプライン | OpenHands、Antigravity、Aider |
価格は2026年4月26日時点。トークン課金およびACU課金のプランは基本料金に加算される。購入前に必ず確認してほしい。各ツールセクションのベンダーリンクを参照。既存リポジトリでの作業ではなくゼロからの生成については、lovable-vs-bolt-vs-v0の比較記事を参照してほしい。
バックグラウンドコーディングエージェントとは?
バックグラウンドコーディングエージェントとは、サンドボックス化されたクラウド環境で非同期に動作するAIソフトウェアエンジニアだ。タスク、GitHubイシュー、Linearチケット、Slackメッセージを割り当てると、数分から数時間かけて単独で作業し、レビュー用のプルリクエストを返してくる。タイピングを見守る必要はない。
これが最大の特徴だ。CursorやCopilotのようなインラインツールは入力中に提案を行うが、バックグラウンドAIエージェントはキューに積まれ、実行され、結果を報告する。ライフサイクルはリスト内のすべてのツールで同じだ:チケット→クラウドサンドボックス→自律編集→PR→人間によるレビュー。
このカテゴリが存在するのは、2024年後半にDevinの登場で長期ホライズンのエージェント機能が成熟したからだ。2025年にはCodex Cloud、Cursor Background Agents、Julesが加わった。AnthropicのClaude Code Remote Tasksは2026年3月20日にリリースされ、「セット&フォーゲット」の需要は今やメインストリームになっている。
なぜセット&フォーゲットが重要なのか?並列処理だ。金曜の午後にスコープの明確なチケットを5件キューに積めば、月曜の朝にはレビュー待ちのPRが5件できている。これはモデルとのペアプログラミングとは異なるワークフローであり、隣でタイプする相手というよりジュニアエンジニアをマネジメントするのに近い。また、*「claude code background agent support」*と具体的に検索する人も多い。だからこそ、ここではDevinだけでなくClaude Code Remote Tasksも扱っている。インライン側についてはClaude Code、Cursor、Copilotのインラインコーディングエージェント比較記事で別途解説した。カテゴリ全体のアーキテクチャ解説としては、Temboの入門記事が手堅い出発点だ。
バックグラウンド型とインライン型、非同期が同期を上回るのはいつか?
非同期バックグラウンドエージェントが勝つのは、タスクが15分以上かかり、編集中の軌道修正が不要な場合だ。スコープの明確なバグ修正、依存関係のアップグレード、反復的なリファクタリング、複数ファイルにまたがる移行がこれに該当する。CursorやCopilotのようなインラインエージェントが勝つのは、探索中、プロトタイピング中、モデルとペアプログラミング中で、リアルタイムの反応が必要な場合だ。
これが結論だ。以下の判断マトリクスが、Techsyのプロジェクトで実際に使っている選び方だ:
| 非同期(バックグラウンド)を使う場面… | インライン(Cursor/Copilot)を使う場面… |
|---|---|
| タスクのスコープが明確(受け入れ基準付きイシュー) | 探索・プロトタイピング中 |
| 推定作業時間が15分超 | 編集中に軌道修正が必要 |
| 3件以上のタスクを並列化したい | 集中した1セッションにしたい |
| 事後にPRをレビューすればよい | 入力中に提案を見たい |
| タスクが反復的(依存関係、移行、lint) | タスクが新規で創造的 |
具体的に言えば、「47パッケージをバージョンアップし、破壊的変更を修正した」は非同期コーディングエージェントの典型的な仕事だ。定義が明確で、機械的で、並列化できる。「新しいダッシュボードのルートを作った」はインライン向きで、レイアウト、コピー、エッジケースをその場で反復することになる。
同期と非同期のハンドオフ
私たちが関わるチームの多くは、結局両方を併用している。新しいコードにはCursorインライン、アップグレードにはCursor Background Agents。アーキテクチャ作業にはClaude Codeインタラクティブ、毎週の依存関係更新cronにはClaude Code Remote Tasks。このハンドオフこそがワークフローであり、どちらかが他方を置き換えることはない。エディタにとどまるなら、Windsurf vs Cursorの比較記事が同期側を詳しくカバーしている。
タスクが15分以上かかり、見守る必要がなければ、非同期が勝つ。
Devin(Cognition)、自律性のリーダー
Devinは市場で最も自律性の高いバックグラウンドエージェントだ。Cognitionは完全なサンドボックスVMを提供し、独自のIDE、ブラウザ、ターミナルを備えている。価格は2026年4月に月額500ドルのエンタープライズ最低ラインから月額20ドル+Agent Compute Unit(ACU)あたり2.25ドルに引き下げられ、自律型コーディングエージェント分野で今月最大の話題となった。
価格。 Coreは月額20ドル+2.25ドル/ACU。Teamは月額500ドルで250 ACU込み、追加ACUは1つ2ドル。1 ACUは約15分の作業に相当する。典型的なバグ修正は2〜3 ACU、つまり4.50〜6.75ドル。複数ファイルの移行は30 ACU以上に達することもあり、67.50ドル以上かかる。(devin.ai/pricing、2026年4月26日時点。)
強み。 リスト中で最も高い自律性。VMにブラウザが含まれるため、Devinはコンテキストを手渡ししなくてもドキュメントやStack Overflowを自分で読める。成熟した製品で、Cognitionは2024年3月に出荷開始し、Devinを実用的にするプロンプトを2年かけて磨いてきた。
弱み。 新規性の高い作業ではACUコストが読みにくい。CodexやCursorよりタスク中の制御が効きにくい。タスクをセットして離れる方式なので、Devinがタイプミス1つのデバッグに8 ACUを費やすまでは問題ない。正確な受け入れ基準が必要で、曖昧なチケットからは曖昧なPRが返ってくる。
こんな人向け: スコープの明確なバックログ項目をエンドツーエンドで委任したいチームで、明確な受け入れ基準を書ける場合。
Cursor Background Agents
CursorのBackground AgentsはCursorエディタ内で非同期に動作し、最大8件まで並列実行可能。Slack、Linear、GitHub、またはエディタ内からトリガーできる。選択したフロンティアモデルを使うため、コストはフラットなACUレートではなくトークン消費量に依存する。Proは月額20ドルで20ドル分の使用量込み。
価格。 Hobbyは0ドル、Proは月額20ドル(20ドル分の使用量込み)、Pro+は月額60ドル(70ドル分)、Ultraは月額200ドル(400ドル分)、Teamsは1ユーザーあたり月額40ドル。バックグラウンドエージェントは使用量ベースで追加課金され、モデル+コンテキスト長+出力長で決まる。(cursor.com/pricing、2026年4月26日時点。Background Agents機能はCursor 0.50でリリース。)
強み。 リスト中で最も tight なエディタ連携。インラインセッション、バックグラウンドエージェント、ルールがすべて1つのツールに収まる。最大8エージェントの並列実行により、リファクタリングをモジュール単位で分散し、数分で収束できる。Slack、Linear、GitHubトリガーが*「LinearとSlackで動くバックグラウンドエージェントはどれか」*という問いに答える。Cursorはネイティブに対応している。
弱み。 フロンティアモデルの使用量は、含まれる20ドルの予算を想像以上に早く消費する。Opusを多用するセッション1回で使い切ることもある。タスクごとのコストは使用量ダッシュボードを確認しないと不透明で、多くのチームは請求が来るまで確認しない。
こんな人向け: すでにCursorを使っていて、ツールを変えずに非同期処理がほしい場合。使用量ダッシュボードを週1回確認する手間は許容できること。既存のCursor Rulesはインラインとバックグラウンドの両セッションに反映されるため、すでにCursorユーザーならセットアップコストはほぼゼロだ。
Codex Cloud(OpenAI)
Codex CloudはOpenAIの非同期コーディングエージェントだ。タスクを記述すると、CodexがサンドボックスVMを起動し、リポジトリをクローンし、PRを返す。Terminal-Bench 2.0で**77.3%**とトップを走り、約240トークン/秒(Opusの約2.5倍の速度)で処理し、2026年4月2日にトークンベース課金へ移行した。
価格。 ChatGPT Plus(月額20ドル)に含まれる。新しいProティアは月額100ドル(Plusの5倍の使用量、2026年5月31日までプロモーションで2倍=10倍)。Proは月額200ドル。2026年4月2日からトークンベース。Codex CLIはオープンソースで、BYOKなら無料。実際のところ、アクティブユーザーの実費は1開発者あたり月額約100〜200ドルに落ち着く。(developers.openai.com/codex/pricing、TechCrunchの月額100ドルProティア報道、2026年4月26日時点。)
強み。 約240 tpsのスループット王者。複数ファイルにまたがる依存関係アップグレードのようなトークン集約型タスクでは、Claudeがまだ考えている間にCodexは完了している。CLIはオープンソースで自分のAPIキーで動くため、ChatGPT Proを払わずにCodexをCIに組み込める。配布力も圧倒的で、ChatGPT Plusユーザーは全員すでに持っている。
弱み。 トークン課金はタスクごとの予測が本当に難しい。4月2日の改定で過去の比較記事は無効になっており、それ以前の日付の情報は価格について誤っている。CLIはWeb版Codexとは別製品のようで、連携が緩い。
こんな人向け: 深く統合されたクラウドエージェントを求めるChatGPT Proユーザー、または自分のキーを持ち込みたいCLI愛好家。
# Dispatch a task to Codex Cloud from the CLI
codex task create \
--repo "techsy-io/example-app" \
--branch "main" \
--prompt "Bump all dependencies to latest and fix breaking changes" \
--watchClaude Code Remote Tasks(Anthropic)
Claude Code Remote Tasksでは、GitHubリポジトリ、プロンプト、スケジュールを定義すると、ClaudeがAnthropicのクラウド上で自律的に実行し、完了時にPRを作成する。2026年3月20日リリース。Opus 4.7のSWE-bench Verified 87.6%というカテゴリ最高スコアと、SWE-bench Proの64.3%に支えられている。これがオートコンプリート検索**「claude code background agent support」**への答えだ。実在する、出荷済みプロダクトである。
価格。 Claude Code Pro/Maxプランにバンドル。Proは月額20ドル、Max 5xは月額100ドル、Max 20xは月額200ドル。ヘビーユーザーの実費は月額100〜200ドルに落ち着く。(claude.com/code、platform.claude.com/docs/en/managed-agents/overview、2026年4月26日時点。)
強み。 リスト中で最高のSWE-bench Verifiedスコア(87.6%)。永続的なステートフルエージェントセッションにより、Remote Taskは毎回コールドスタートするのではなく、前回の続きから再開できる。フックやClaude Codeの既存ツールエコシステムと統合されており、既存のスキル、スラッシュコマンド、サブエージェントはインタラクティブセッションと同じように動作する。
弱み。 リスト中で最も新しい参入者で、DevinやCodexより連携パターンが少なく、コピーできるコミュニティ事例も少ない。CLIファーストでGUIがなく、チーム内の非CLIエンジニアにはハードルが上がる。
こんな人向け: Claude Codeのヘビーユーザーで、定期的なスケジュールタスク(毎週の依存関係更新、cron形式のリファクタリング、オンデマンドのQAパス)を求めている場合。Claude CodeフックをRemote Tasksに組み込む方法はインタラクティブセッションと同じで、Remote Tasksは3月に報じた「リーク後に正式リリースされた機能」の1つだった。
# Schedule a recurring Remote Task in Claude Code
claude-code remote create \
--repo "techsy-io/example-app" \
--schedule "weekly" \
--prompt "Bump deps, run tests, open PR if green"Copilot Coding Agent(GitHub)
Copilot Coding AgentはGitHubイシューをプルリクエストに変換する。チームメイトをアサインするのと同じようにエージェントをアサインするだけだ。このリストの中で最もGitHubネイティブなワークフローを持つ。注意:2026年4月20日時点で、GitHubはProおよびPro+の新規登録を一時停止している。既存のサブスクライバーとBusiness/Enterpriseティアは影響を受けない。
価格。 Freeは0ドル、Proは月額10ドル、Pro+は月額39ドル、Businessは1ユーザーあたり月額19ドル、Enterpriseは1ユーザーあたり月額39ドル。プレミアムリクエストベース:Freeは月50件、Proは月300件、Pro+は月1,500件、Enterpriseは1ユーザーあたり月1,000件。Pro/Pro+/学生の新規登録は2026年4月20日から一時停止、Business/Enterpriseは引き続き利用可能。(github.com/features/copilot/plans、2026年4月26日時点。)
強み。 カテゴリ内で最も深いGitHub連携。イシューからPRへの変換は検索結果の中で最もネイティブなワークフローで、追加アプリも追加ダッシュボードも不要。エージェントは普段使っている同じUIにアサイン担当者として表示される。2026年3月のCode Reviewアップデートにより、レビューコメントをコーディングエージェントに自動的に引き継げるようになり、GitHubを離れることなくループが閉じる。
弱み。 下位ティアではモデル選択が制限される。たとえばProではOpusを選べない。Proの月300リクエストというプレミアムリクエスト予算は、毎日リリースしていればすぐに尽きる。新規登録の一時停止は、個人の新しいサブスクライバーにとって摩擦になる。
こんな人向け: チームがすでにGitHub BusinessまたはEnterpriseを使っていて、セットアップゼロの非同期コーディングを求める場合。既存シートは今日からエージェントを使える。一時停止は個人の新規登録だけをブロックしている。
Google Jules
JulesはGoogleの非同期コーディングエージェントで、Gemini搭載VMを備え、カテゴリ最高の無料枠(1日15タスク、同時実行3件)を提供する。リポジトリ内の#TODOコメントを能動的にスキャンし、修正を提案する。有料プランは月額19.99ドルから始まるが、2026年中に価格が数回変動している。
価格。 Freeは1日15タスク/同時実行3件。Proは月額19.99ドルから。Ultraは月額124.99ドルから。2026年中に価格が数回変更されている。購入前にjules.googleで最新の数字を確認してほしい。(jules.google、TechCrunchの2025年8月GA報道、2026年4月26日時点。)
強み。 カテゴリ最高の無料枠、文句なし。1日15タスク、同時実行3件は個人作業に実用的で、お試しではない。パワーユーザー以外にとって最もクリーンなUXで、「TODOスキャン」ループは新規性があり、プロンプトなしで実際のクリーンアップ作業を掘り起こしてくれる。
弱み。 価格変動が最大のリスクだ。今年だけでProティアの価格が2回変わるのを見てきた。DevinやCodexより連携エコシステムが未成熟で、Slack/Linear/Jiraフックが少なく、コミュニティツールも少ない。
こんな人向け: 個人開発者、または有料プランに最初からコミットせず非同期処理を試したい小規模チーム。Julesの無料枠は本物で、お試しではない。
Factory Droids(Factory.ai)
Factoryの「Droids」は、コード作成、テスト、レビュー、デプロイを行う専門化された自律エージェントで、クラウドとローカルの実行オプションを持つ。Factoryは2026年4月16日に1億5,000万ドルのシリーズCをクローズし、顧客としてNVIDIA、Adobe、Bayer、EY、MongoDB、Zapierを挙げている。価格は2シートで月額20ドルから。
価格。 有料プランは月額20ドルから(2チームシート込み)、追加シートは1つ5ドル。マルチDroidモデルルーティングにより、コード、テスト、レビュー、デプロイで異なるDroidを使用。(factory.ai/pricing、docs.factory.ai/pricing、SiliconANGLE経由のFactory資金調達報道、2026年4月26日時点。)
強み。 顧客ロゴが規制業界への適合を示している。医療、銀行、半導体。クラウドまたはローカル実行は、カテゴリ内で唯一のオンプレミス対応オプションであり、サードパーティのクラウドにコードを送れないチームにとって重要だ。コード/テスト/レビュー/デプロイにまたがるマルチエージェント協調は、他社が使うシングルエージェントモデルとは本質的に異なる。
弱み。 DevinやCodexより知名度が低く、社内の合意形成に時間がかかる。個人開発者には過剰で、マルチDroidオーケストレーションはサイドプロジェクトには不要な税だ。
こんな人向け: ガバナンス、コンプライアンス、エアギャップ環境でのデプロイ要件を持つ中〜大規模エンジニアリング組織。
次点:OpenHands、Antigravity、Aider
知っておく価値のある3つの次点:OpenHandsはオープンソースのセルフホスト型バックグラウンドエージェントのリーダーで、完全な制御やエアギャップ運用が必要ならこれを選ぶ。Google AntigravityはGoogleのもう1つの、あまり宣伝されていない参入者。Aiderは技術的には同期CLIだが、シェルスクリプトやCIフック経由で非同期パイプラインに組み込まれるケースが増えている。いずれもDevin級の自律性にはまだ達していない。
OpenHandsはオープンソースで、MIT系ライセンス、自社インフラにセルフホストする。トレードオフはサンドボックスの維持管理が自己責任になることで、セキュリティポリシー、シークレット管理、ランナーの稼働率、すべて自チームの負担だ。実際の導入は、クラウドエージェントが選択肢にならない規制環境や学術環境で最も進んでいる。
**Antigravity(Google)**はJulesの静かな兄弟分で、同じVMモデル、マーケティングは控えめ、主にまとめ記事で言及される程度。2026年4月時点で本番環境での実績は薄い。
Aiderは本質的にCLI同期エージェントだが、CI内でチェーンしてバックグラウンド動作を模倣するチームが増えている。GitHub Actionがプロンプト付きでAiderをトリガーし、Aiderがコミットし、ワークフローがPRを作成する。API経由で任意のモデルと連携でき、デフォルトでBYOKのため、CIインフラが余っているなら最安の「バックグラウンド風」オプションだ。
さらに注目すべき2つ:ManusとGenie。どちらも新しい参入者で、2026年4月時点で実際の導入シグナルは低い。注目に値するが、まだコミットするほどではない。
どのバックグラウンドコーディングエージェントを選ぶべきか?
最大の制約1つで選ぶ。予算なら、Julesの無料枠が勝つ。GitHubネイティブなワークフローなら、Copilot Coding Agentが勝つ。スコープの明確なチケットに対する自律性なら、Devinが勝つ。生のベンチマークスコアなら、Claude Code RemoteがSWE-bench Verified 87.6%で勝つ。コンプライアンスなら、Factory Droids。エディタ連携なら、Cursor。
| 優先事項 | 選択 | 理由 |
|---|---|---|
| 最安で始めたい | Google Jules | 1日15タスクの無料枠 |
| GitHubネイティブ、セットアップゼロ | Copilot Coding Agent | イシュー→PRがアサインワークフロー |
| 最高自律性 | Devin | フルVM、ブラウザ、成熟した委任パターン |
| 最高ベンチマークスコア | Claude Code Remote | SWE-bench Verified 87.6%(Opus 4.7) |
| 速度/スループット | Codex Cloud | 約240 tps、Terminal-Bench 2.0リーダー |
| すでにCursorユーザー | Cursor BG Agents | 8並列、Slack/Linearトリガー |
| 規制業界 | Factory Droids | コンプライアンス+ローカル実行 |
| セルフホスト/OSS | OpenHands | 完全制御、エアギャップ対応 |
チーム規模と予算別のおすすめ構成
個人開発者:まずJulesの無料枠で明白なメリットを取り、1日15タスクを超えたら月額20ドルのCursor Proにアップグレード。合計:月額0〜20ドル。
小規模チーム(開発者2〜10人):インライン用にCursor Pro+Background Agents、スケジュールcron形式タスク用にClaude Code Pro。合計:1開発者あたり月額40ドル。
エンタープライズ(開発者50人以上):チケットの大半にGitHubネイティブワークフローとしてCopilot Enterprise、ガバナンス重視のワークロードにFactory Droids。合計:Factoryのシート数に応じて1開発者あたり月額39ドル+20〜50ドル。
各バックグラウンドコーディングエージェントのタスクあたりコストは?
実際のタスクあたりコストは、ベンダーごとに課金方式が異なるため大きくばらつく。Devinは典型的なバグ修正(2〜3 ACU)で4.50〜6.75ドル。CursorとCodexはトークン消費ベースで、モデルとコンテキストにより1タスクあたり0.30〜3ドル程度。Julesは1日15タスクまで無料。Copilotはプレミアムリクエスト方式で、Proティアでは1件あたり約0.04ドル。
| ツール | 課金モデル | 典型的なバグ修正 | 複数ファイルのリファクタリング | 無料枠あり? |
|---|---|---|---|---|
| Devin | 2.25ドル/ACU(1 ACU ≒ 15分) | 4.50〜6.75ドル(2〜3 ACU) | 67.50ドル~(30 ACU) | なし |
| Cursor BG | トークンベース、ドル予算込み | 約0.30〜1.50ドル | 3〜15ドル | Hobbyティア |
| Codex Cloud | 2026年4月2日からトークンベース | 約0.20〜1ドル | 2〜10ドル | なし(Plusに含まれる) |
| Claude Code Remote | Pro/Maxプランにバンドル | 約0.50〜2ドル(クォータから消費) | 5〜20ドル(クォータから消費) | なし |
| Copilot Coding Agent | プレミアムリクエストベース(Proで1件約0.04ドル) | 1〜3リクエスト | 5〜20リクエスト | Freeで月50件 |
| Jules | 無料枠または定額プラン | 0ドル | 日次枠から消費 | 1日15件無料 |
| Factory Droids | シートベース | 込み | 込み | なし |
価格は2026年4月26日時点。トークン推定値はフロンティアモデルで平均的なタスクコンテキストを想定。必ず自分の使用量ダッシュボードで確認してほしい。
"Typical bug fix cost per background coding agent (April 2026)"
データテーブル
| "USD per task" | "Typical bug fix" |
|---|---|
| "Jules (free tier)" | 0 |
| "Codex Cloud" | 0.6 |
| "Cursor BG" | 0.9 |
| "Claude Code Remote" | 1.2 |
| "Copilot CA (Pro premium req)" | 0.12 |
| "Devin" | 5.6 |
| "Factory Droids" | 0 |
典型的な2〜3 ACU/トークン換算のバグ修正タスクの推定値。実際のコストはモデル選択とコンテキスト長により変動する。無料枠およびシートベースのツールは限界費用0ドル。
この数字を回して得た教訓:Devinはトークン課金の競合よりタスクあたり5〜10倍高い。そのプレミアムで自律性を買っている。書くプロンプトは少なく、タスク中の見守りも少ない。しかし定型的なバグ修正では、生のコストでCodexやCursorが勝つ。
どのバックグラウンドコーディングエージェントのベンチマークスコアが最高か?
AnthropicのClaude Opus 4.7がSWE-bench Verifiedで87.6%とトップを走り、Codexのgpt-5-codexは約77〜80%。CodexはTerminal-Bench 2.0で77.3%とリードしている。ただしベンチマークが測るのは基盤モデルの能力であり、実際の成功率はエージェントの使い方、サンドボックス、プロンプトに同じくらい依存する。
| ツール | 基盤モデル | SWE-bench Verified | Terminal-Bench 2.0 | 備考 |
|---|---|---|---|---|
| Claude Code Remote | Claude Opus 4.7 | 87.6% | 該当なし(変動) | Verified最高スコア |
| Codex Cloud | gpt-5-codex | 約77〜80% | 77.3% | Terminal-Benchリーダー |
| Devin | Cognitionスタック(混合) | Junior-SWEで自己申告の高スコア | 該当なし | Junior-SWEの合格率を報告、Verifiedは直接報告せず |
| Cursor BG | ユーザー選択のフロンティア | モデルのスコアを継承 | 継承 | スコアは選んだモデルに依存 |
| Copilot CA | GPT/Claude(ティア制限) | 継承 | 継承 | ティアでモデル選択が固定 |
| Jules | Gemini 2.5/3 | 公式報告なし | 公式報告なし | ベンチマークの透明性が低い |
| Factory Droids | マルチモデルルーティング | Droidごとに継承 | 継承 | Droidごとに異なるモデルを使用 |
アグリゲーター視点では、artificialanalysis.aiのコーディングエージェントマトリクスがプロバイダー横断のローリングベンチマーク数値を追跡している。
ベンチマークは天井ではなく床だ。Opus 4.7搭載のCursor BGが同じチケットでDevinを上回るのを見てきた。使い方が重要なのだ。購入するのではなく自前のエージェントを構築するなら、LangGraph vs CrewAI vs OpenAI Agents SDKの比較記事で、モデルスコアと実世界の成功率の差を生むフレームワーク選択を解説している。
バックグラウンドコーディングエージェントにリポジトリ全体へのアクセスを渡して安全か?
各ツールの分離方法は異なる。Devinは完全なサンドボックスVMを実行する。CodexはOpenAI管理のクラウドサンドボックスを使う。Cursorはエフェメラルなリモートマシンを起動する。CopilotはGitHub管理ランナーを使う(既存のGitHub Actionsセキュリティモデルが適用される)。Claude Code RemoteはAnthropicのクラウドで実行する。Factoryはクラウドまたはエアギャップのローカルを提供する。いずれも「本番環境にrootを渡す」ものではない。
| ツール | 実行環境 | ネットワーク送信 | 永続状態 | エアギャップ対応 |
|---|---|---|---|---|
| Devin | フルサンドボックスVM(自社IDE+ブラウザ) | あり、スコープ制限 | セッション単位 | なし |
| Cursor BG | エフェメラルなクラウドVM | あり | なし | なし |
| Codex Cloud | OpenAIクラウドサンドボックス | あり、スコープ制限 | なし | なし |
| Claude Code Remote | Anthropicクラウド | あり、スコープ制限 | 永続エージェントセッション | なし |
| Copilot CA | GitHub管理ランナー | Actions設定を継承 | 実行単位 | Enterpriseのみ |
| Jules | GoogleクラウドVM | あり | タスク単位 | なし |
| Factory Droids | クラウドまたはローカル | 設定可能 | 設定可能 | あり |
導入前にCTOレベルで問うべき質問
これらのエージェントにリポジトリアクセスを許可する前に、4つの質問がポリシーを決める:
- リポジトリ権限:エージェントにmainへの書き込み権限を与えるか、フィーチャーブランチにロックするか?常にフィーチャーブランチにロックし、PRレビューを必須にすること。
- シークレットアクセス:エージェントは
.envファイルの読み取りやシークレットマネージャーの呼び出しが可能か?デフォルト拒否にし、スコープ付きトークンを使うこと。 - ネットワーク送信:サンドボックスはどこにアウトバウンド通信できるか?パッケージレジストリとプライベートミラーの許可リスト付きで、デフォルト拒否にすること。
- 監査ログの保持:エージェントセッションはどのくらい保持され、セキュリティチームがクエリできるか?許可前に書面で確定すること。
バックグラウンドコーディングエージェントは自分のコードで学習するか?
デフォルトのオプトイン/オプトアウトはさまざまだ。OpenAI Codexのエンタープライズプランはデフォルトでコードを学習しない。Anthropic Claude Codeはコードを学習しない。GitHub Copilot BusinessおよびEnterpriseはデータ除外がある。Cursorはプライバシーモードを提供する。Devinはコードが顧客管理下にとどまると明記している。リポジトリアクセスを許可する前に、必ずベンダーのドキュメントで現在のデータ利用ポリシーを確認してほしい。
ツールごとの一行まとめ、現在のデフォルト動作:
- Devin:Cognitionのポリシーによりコードは顧客管理下にとどまる
- Cursor:プライバシーモードのトグル、学習にはオプトインが必要
- Codex Cloud:エンタープライズはデフォルトで学習なし。ChatGPT Plusは消費者向け規約の対象
- Claude Code Remote:Anthropicの商用規約によりコードの学習なし
- Copilot Business/Enterprise:デフォルトでデータ除外がオン。Pro/Pro+には別のトグルあり
- Jules:Googleの標準エンタープライズデータ規約が適用。現在のポリシーを確認すること
- Factory Droids:ドキュメント上は顧客管理下。エアギャップのローカルなら問題自体がなくなる
ポリシーは2025〜26年に数回変更されている。アクセスを許可する前に再確認してほしい。ベンダーはブログ記事より頻繁に規約を更新する。バックグラウンドエージェントのPRがマージされたら、マージ前に構造化されたAIコードレビューパスを通すべきだ。エージェントベンダーが処理したからといって、IPの問題が消えるわけではない。
Techsyがクライアントプロジェクトでバックグラウンドエージェントを選ぶ方法
Techsyのクライアントプロジェクトでは、1つのツールを選ぶのではなく、レイヤードスタックで運用している。Cursor Background AgentsがIDE内の非同期処理を担う(エンジニアはどうせCursorにいる)。Claude Code Remote Tasksがスケジュールcron形式のタスク、毎週の依存関係更新、毎夜のQAパスを実行する。自動化すべき退屈な仕事だ。Codex Cloudは、速度がベンチマークスコアより重要なlintや依存関係更新でトークン安のスループットを担う。完全な委任自律性が必要で、スコープの明確なバックログを持つクライアントにはDevinを選ぶ。
あまり使わないもの:Copilot Coding Agent。私たちの使用量では、Proのプレミアムリクエスト予算が代替手段より早く尽きる。まだEnterpriseクライアントがアップグレードを正当化するほど多くない。エンタープライズ展開で単一ベンダーにロックインする前に、LangGraphやOpenAI Agents SDKでカスタムエージェントを構築するだろう。ただし、グリーフィールドのクライアントワークの80%については、上記の既製ツールが自前構築より速い。私たちが使っているエージェントAIデプロイプラットフォームは、これらのツールが本番環境で生み出すエージェントを処理する。
どのバックグラウンドコーディングエージェントがスタックに合うか、またはカスタムエージェントの構築について無料相談を希望されるなら、喜んでスコープ設定をお手伝いする。
FAQ:バックグラウンドコーディングエージェント比較
バックグラウンドコーディングエージェントとは?
バックグラウンドコーディングエージェントとは、サンドボックス化されたクラウド環境で非同期に動作するAIソフトウェアエンジニアだ。タスク、GitHubイシュー、Linearチケット、Slackメッセージを割り当てると、数分から数時間かけて単独で作業し、レビュー用のプルリクエストを返す。決定的な特徴は、タイピングを見守る必要がないこと。自分が別の場所にいる間に作業が進む。
バックグラウンドコーディングエージェントとCursorやCopilotのインラインの違いは?
バックグラウンドエージェントはクラウドサンドボックスで非同期に動作し、プルリクエストを返す。CursorやCopilotのようなインラインツールは、エディタ内で入力中にコードを提案し、各キーストロークは自分が操作する。バックグラウンドエージェントは並列処理(5タスクをキューに積んで5つのPRを得る)を可能にし、インラインエージェントは集中している1つのタスクの高速反復を可能にする。
バックグラウンドコーディングエージェントのタスクあたりコストは?
Devinは典型的なバグ修正(2〜3 ACU)で4.50〜6.75ドル。CursorとCodex Cloudはトークン消費ベースで、モデルとコンテキスト長により1タスクあたり通常0.30〜3ドル。Julesは1日15タスクまで無料。Copilot Coding Agentはプレミアムリクエスト方式で、Proティアでは1件あたり約0.04ドルと、有料プランの中で最もタスクあたりコストが安い。
個人開発者に最も安いバックグラウンドコーディングエージェントは?
Google Julesの無料枠は圧倒的だ。1日15タスク、同時実行3エージェント、月額0ドル。超えたら、月額20ドルで20ドル分の使用量込みのCursor Proが次のステップで、エディタ連携もボーナスとして付いてくる。ほとんどの個人開発者にとって、Julesは一度も支払わずに日々のニーズをカバーする。
バックグラウンドコーディングエージェントにリポジトリ全体へのアクセスを渡して安全か?
条件付きでイエス。スコープ付きトークンを使い(個人のアクセストークンは使わない)、ネットワーク送信は許可リスト付きでデフォルト拒否にし、エージェントをフィーチャーブランチにロックしてPRレビューを必須にし、監査ログを毎週確認すること。これらのエージェントに本番環境への書き込み権限を絶対に与えないこと。エージェントをコントラクターのように扱う。信頼するが、すべてのPRを検証する。
バックグラウンドコーディングエージェントは自分のコードで学習するか?
Anthropic Claude Code、OpenAI Codexエンタープライズプラン、GitHub Copilot Business/Enterpriseはデフォルトでコードを学習しない。Cursorはプライバシーモードを提供する。Devinはコードが顧客管理下にとどまると明記している。リポジトリアクセスを許可する前に、必ずベンダーのドキュメントで現在のデータ利用ポリシーを確認してほしい。ポリシーは2025〜26年に数回変更されている。
バックグラウンドコーディングエージェントは自分のプルリクエストをマージできるか?
権限を与えればほとんど可能だが、私たちが知るすべてのチームはマージ前に人間によるレビューを必須にしている。技術的な機能は存在し、Copilot、Devin、Cursorはブランチ保護が許可すれば自動マージできる。しかし自動マージは自爆装置だ。PRレビューのゲートは、エージェントのミスが本番環境に到達する前の最後の安価な安全網である。
エンタープライズチームに最適なバックグラウンドコーディングエージェントは?
環境によって答えは2つ。すでにGitHub Enterpriseを深く使っているなら、Copilot Coding Agentが最も摩擦の少ない選択だ。イシューのアサインがワークフローで、追加ツールは不要。ガバナンス、コンプライアンス、エアギャップの要件があるなら、Factory Droidsがローカル実行とコード/テスト/レビュー/デプロイにまたがるマルチエージェント協調を持つ唯一のオプションだ。
どのバックグラウンドコーディングエージェントの無料枠が最高か?
Google Julesが圧勝だ。1日15タスク、同時実行3エージェント、Geminiフルアクセス、月額0ドルで期間制限なし。CopilotのFreeティア(月50プレミアムリクエスト)は遠い2位。CursorのHobbyティアは技術的には無料だが、バックグラウンドエージェントの利用を有意にカバーしない。Julesは、個人作業で有料プランを置き換えられた唯一の無料枠だ。
バックグラウンドエージェントとCursorのようなインラインAI、いつ使い分けるべきか?
タスクのスコープが明確で、15分以上かかり、編集中の軌道修正が不要な場合はバックグラウンドエージェントを使う。依存関係のアップグレード、反復的なリファクタリング、複数ファイルの移行、明確なチケットで記述できるものが該当する。プロトタイピング、探索、モデルとのペアプログラミングで新規性の高い作業をしている場合はインラインを使う。
まとめ
- 委任するならDevin、CursorにいるならCursor BG、ChatGPT ProユーザーならCodex Cloud、ベンチマークならClaude Code Remote、GitHubネイティブならCopilot、無料枠ならJules、コンプライアンスならFactory。
- 価格変動は現実だ。2026年4月のDevin値下げ、Codexトークン課金改定、Copilot新規登録停止はすべて今月起きた。購入前に確認してほしい。
- 非同期カテゴリはまだ1年で、急速に進化している。夏までにこのマトリクスはまた変わるだろう。
バックグラウンドエージェントの選定やスタックへの組み込みを手伝ってほしいですか?無料相談はこちら。