
Devin vs Claude Code vs Codex 2026: 코딩 에이전트 8종 실전 테스트
백그라운드 코딩 에이전트는 12개월 만에 연구 데모에서 범용 도구로 자리 잡았다. Cognition은 올해 4월 Devin의 최저 가격을 $500에서 $20/월로 대폭 인하했고, OpenAI는 4월 2일에 Codex 과금 체계를 개편했으며, Factory는 2주 전에 $150M 규모의 Series C를 마무리했다. 우리는 이번 달 내부 Techsy 툴링 작업에 이 8개를 모두 프로덕션에서 테스트했고, 아래 수치는 실제로 지불한 금액이다. 우리는 이 도구들을 판매하지 않으며 제휴 링크도 없다. 이 검색어의 상위 10개 결과 중 나머지는 모두 목록에 있는 에이전트 중 하나의 벤더가 발행한 것이다.
| 도구 | 시작 가격 | 최적 모델 | 샌드박스 / 클라우드 | GitHub 네이티브 | 최적 용도 | 핵심 지표 |
|---|---|---|---|---|---|---|
| Devin | $20/월 + $2.25/ACU | Cognition 자체 스택 | 풀 VM (자체 IDE+브라우저) | GH App으로 PR | 엔드투엔드 백로그 위임 | 버그 수정 건당 ~$5 |
| Cursor BG Agents | $20/월 (Pro) | 선택한 프론티어 모델 | 임시 클라우드 VM | 통합으로 PR | 비동기를 원하는 Cursor 사용자 | 최대 8개 병렬 에이전트 |
| Codex Cloud | $20/월 (Plus) → $200 (Pro) | OpenAI gpt-5-codex | OpenAI 클라우드 샌드박스 | Codex CLI / 웹으로 PR | ChatGPT Pro 헤비 유저 | Terminal-Bench 2.0 77.3% |
| Claude Code Remote | $20/월 (Pro) → $200 (Max 20x) | Claude Opus 4.7 | Anthropic 클라우드 | GH App으로 PR | Claude Code 헤비 유저 + 크론 | SWE-bench Verified 87.6% |
| Copilot Coding Agent | $10/월 (Pro) → $39 (Enterprise) | GPT/Claude (티어 제한) | GitHub 관리 러너 | 네이티브 (이슈 → PR) | GH Enterprise/Business 팀 | 가장 깊은 GH 통합 |
| Google Jules | 무료 (하루 15회) → $19.99+ | Gemini | Google 클라우드 VM | 통합으로 PR | 개인 개발자 / 소규모 팀 | 카테고리 최고 무료 티어 |
| Factory Droids | $20/월 (2시트) | 멀티 모델 라우팅 | 클라우드 + 로컬 옵션 | 통합으로 PR | 규제 산업 | NVIDIA, Adobe, Bayer에서 사용 |
| 아쉽게 탈락 | 다양 | 다양 | 다양 | 다양 | OSS / DIY 파이프라인 | OpenHands, Antigravity, Aider |
2026-04-26 기준 가격. 토큰 기반 및 ACU 기반 플랜은 기본료 위에 추가 과금된다. 구매 전 반드시 확인하며, 각 도구 섹션의 벤더 링크를 참조하라. 기존 저장소 작업이 아닌 신규 생성의 경우 lovable-vs-bolt-vs-v0 비교를 참고하라.
백그라운드 코딩 에이전트란?
백그라운드 코딩 에이전트는 샌드박스된 클라우드 환경에서 비동기로 실행되는 AI 소프트웨어 엔지니어다. 작업을 할당하면—GitHub 이슈, Linear 티켓, Slack 메시지—혼자 수 분에서 수 시간 동안 작업한 뒤 리뷰용 풀 리퀘스트를 반환한다. 타이핑을 지켜볼 필요가 없다.
이것이 핵심 구분점이다. Cursor나 Copilot 같은 인라인 도구는 타이핑 중에 제안하지만, 백그라운드 AI 에이전트는 큐에 넣고 실행한 뒤 결과를 보고한다. 이 목록의 모든 도구에서 라이프사이클은 동일하다: 티켓 → 클라우드 샌드박스 → 자율 편집 → PR → 사람 리뷰.
이 카테고리가 존재하는 이유는 2024년 말 Devin 출시와 함께 장기간 에이전트 기능이 성숙했기 때문이며, 2025년에는 Codex Cloud, Cursor Background Agents, Jules가 합류했다. Anthropic의 Claude Code Remote Tasks는 2026년 3월 20일에 출시되었고, "설정 후 방치" 열풍은 이제 주류가 되었다.
설정 후 방치가 왜 중요한가? 병렬성 때문이다. 금요일 오후에 범위 명확한 티켓 5개를 큐에 넣으면 월요일 아침에 리뷰할 PR 5개가 준비되어 있다. 이것은 모델과 페어 프로그래밍하는 것과는 다른 워크플로우로, 옆에서 함께 타이핑하는 것보다 주니어 엔지니어를 관리하는 것에 가깝다. 사람들이 *"claude code background agent support"*를 구체적으로 검색하는 이유도 이것이며, 그래서 여기서 Devin뿐 아니라 Claude Code Remote Tasks도 다룬다. 인라인 쪽은 Claude Code, Cursor, Copilot의 인라인 코딩 에이전트 비교 분석에서 별도로 다루었다. 카테고리 수준의 아키텍처 설명은 Tembo의 입문서가 괜찮은 출발점이다.
백그라운드 vs 인라인 코딩 에이전트, 비동기가 동기를 이기는 순간
비동기 백그라운드 에이전트는 작업이 15분 이상 걸리고 편집 중간에 방향 수정이 필요 없을 때 유리하다—범위 명확한 버그 수정, 의존성 업그레이드, 반복적 리팩터링, 다중 파일 마이그레이션. Cursor나 Copilot 같은 인라인 에이전트는 탐색, 프로토타이핑, 모델과의 페어 프로그래밍처럼 실시간 반응이 필요할 때 유리하다.
이것이 핵심이다. 아래 의사결정 매트릭스는 우리가 Techsy 프로젝트에서 실제로 선택하는 방식이다:
| 비동기(백그라운드)를 쓸 때… | 인라인(Cursor/Copilot)을 쓸 때… |
|---|---|
| 작업 범위가 명확할 때 (수락 기준이 있는 이슈) | 탐색 또는 프로토타이핑 중일 때 |
| 예상 작업 시간 > 15분 | 편집 중간에 방향 수정이 필요할 때 |
| 3개 이상 작업을 병렬화하고 싶을 때 | 하나의 집중 세션을 원할 때 |
| 사후에 PR을 리뷰해도 될 때 | 타이핑 중 제안을 보고 싶을 때 |
| 반복적 작업 (의존성, 마이그레이션, lint) | 새롭고 창의적인 작업 |
구체적으로: "패키지 47개 버전 올리고 브레이킹 체인지 수정"은 전형적인 비동기 코딩 에이전트 작업이다—명확하고, 기계적이고, 병렬화 가능하다. "새 대시보드 라우트 구축"은 인라인 작업이다—진행하면서 레이아웃, 카피, 엣지 케이스를 반복하게 된다.
동기에서 비동기로의 핸드오프
우리가 함께하는 대부분의 팀은 결국 둘 다 사용한다. 새 코드에는 Cursor 인라인, 업그레이드에는 Cursor Background Agents. 아키텍처 작업에는 Claude Code 인터랙티브, 주간 의존성 업데이트 크론에는 Claude Code Remote Tasks. 핸드오프 자체가 워크플로우이며, 어느 쪽도 다른 쪽을 대체하지 않는다. 에디터에 머무른다면 Windsurf vs Cursor 비교 분석에서 동기 쪽을 자세히 다룬다.
작업이 15분 이상 걸리고 지켜볼 필요가 없다면, 비동기가 이긴다.
Devin (Cognition), 자율성의 선두주자
Devin은 시장에서 가장 자율적인 백그라운드 에이전트다—Cognition은 자체 IDE, 브라우저, 터미널을 갖춘 완전한 샌드박스 VM을 제공한다. 가격은 2026년 4월에 월 $500 엔터프라이즈 최저가에서 $20/월 + Agent Compute Unit(ACU)당 $2.25로 인하되어, 자율 코딩 에이전트 분야에서 이달의 자율성 선두 헤드라인을 장식했다.
가격. Core $20/월 + $2.25/ACU. Team $500/월(250 ACU 포함, 추가 ACU당 $2). 1 ACU는 약 15분 작업에 해당한다. 일반적인 버그 수정은 2-3 ACU, 즉 $4.50-6.75. 다중 파일 마이그레이션은 30+ ACU까지 갈 수 있어 $67.50 이상. (devin.ai/pricing, 2026-04-26 기준.)
장점. 목록 중 최고 자율성. VM에 브라우저가 포함되어 있어 Devin이 문서나 Stack Overflow를 직접 읽을 수 있고, 컨텍스트를 일일이 넣어줄 필요가 없다. 성숙한 제품—Cognition은 2024년 3월에 출시하여 Devin을 실제로 유용하게 만드는 프롬프트를 2년간 다듬어왔다.
단점. 새로운 작업에서는 ACU 비용이 예측 불가능해진다. Codex나 Cursor보다 작업 중 제어가 제한적—작업을 설정하고 자리를 떠나며, Devin이 오타 하나 디버깅에 8 ACU를 쓸 때까지는 괜찮다. 정확한 수락 기준이 필요하며, 모호한 티켓은 모호한 PR을 만든다.
이걸 선택할 때: 범위 명확한 백로그 항목을 엔드투엔드로 위임하고 싶고, 팀이 명확한 수락 기준을 작성할 수 있을 때.
Cursor Background Agents
Cursor의 Background Agents는 Cursor 에디터 내에서 비동기로 실행되며, 최대 8개까지 병렬로, Slack, Linear, GitHub 또는 에디터 내에서 트리거할 수 있다. 선택한 프론티어 모델을 사용하므로 비용은 고정 ACU 요율이 아닌 토큰 소모량에 따라 달라진다. Pro는 $20/월에 $20 사용량이 포함된다.
가격. Hobby $0, Pro $20/월($20 사용량 포함), Pro+ $60/월($70 사용량), Ultra $200/월($400 사용량), Teams $40/유저/월. 백그라운드 에이전트는 그 위에 사용량 기반 과금—모델 + 컨텍스트 길이 + 출력 길이. (cursor.com/pricing, 2026-04-26 기준. Background Agents 기능은 Cursor 0.50에서 출시.)
장점. 목록 중 가장 긴밀한 에디터 통합—인라인 세션, 백그라운드 에이전트, 규칙이 모두 하나의 도구에 있다. 최대 8개 병렬 에이전트로 모듈 간 리팩터링을 분산한 뒤 몇 분 안에 수렴할 수 있다. Slack, Linear, GitHub 트리거는 *"Linear와 Slack에서 작동하는 백그라운드 에이전트는?"*이라는 질문에 답한다—Cursor는 네이티브로 지원한다.
단점. 프론티어 모델 사용량은 포함된 $20 예산을 생각보다 빠르게 소진한다. Opus 중심 세션 한 번이면 예산을 다 쓸 수 있다. 사용량 대시보드를 확인하지 않으면 작업당 비용이 불투명하며, 대부분의 팀은 청구서가 나올 때까지 확인하지 않는다.
이걸 선택할 때: 이미 Cursor에서 작업하고 있고 도구 변경 없이 비동기를 원하며, 주 1회 사용량 대시보드 확인이 괜찮을 때. 기존 Cursor Rules가 인라인과 백그라운드 세션 모두에 적용되므로, 이미 Cursor 사용자라면 설정 비용은 거의 제로다.
Codex Cloud (OpenAI)
Codex Cloud는 OpenAI의 비동기 코딩 에이전트다. 작업을 설명하면 Codex가 샌드박스 VM을 띄우고, 저장소를 클론하고, PR을 반환한다. Terminal-Bench 2.0에서 **77.3%**로 선두이며, ~240 토큰/초(Opus보다 약 2.5배 빠름)로 실행되고, 2026년 4월 2일에 토큰 기반 과금으로 전환했다.
가격. ChatGPT Plus($20/월)에 포함. 새 Pro 티어 $100/월(Plus의 5배 사용량; 2026년 5월 31일까지 프로모션 2배 = 10배). Pro $200/월. 2026-04-02부터 토큰 기반. Codex CLI는 오픈소스이며 BYOK로 무료. 실제 비용은 활성 사용자 기준 개발자당 ~$100-200/월. (developers.openai.com/codex/pricing, $100 Pro 티어에 대한 TechCrunch 보도, 2026-04-26 기준.)
장점. ~240 tps의 처리량 챔피언—다중 파일 의존성 업그레이드처럼 토큰 집약적 작업에서 Claude가 아직 생각하는 동안 Codex는 완료한다. CLI는 오픈소스이고 자체 API 키로 작동하므로 ChatGPT Pro를 결제하지 않고도 CI에 Codex를 연결할 수 있다. 배포력이 압도적: 모든 ChatGPT Plus 사용자가 이미 가지고 있다.
단점. 토큰 과금은 작업마다 예측이 정말 어렵다. 4월 2일 개편으로 이전 비교는 무효화되었으며, 그 날짜 이전에 읽은 것은 가격 정보가 틀리다. CLI는 웹 Codex와 별개 제품처럼 느껴지며, 통합이 느슨하다.
이걸 선택할 때: 깊이 통합된 클라우드 에이전트를 원하는 ChatGPT Pro 사용자이거나, 자체 키를 가져오고 싶은 CLI 애호가일 때.
# Dispatch a task to Codex Cloud from the CLI
codex task create \
--repo "techsy-io/example-app" \
--branch "main" \
--prompt "Bump all dependencies to latest and fix breaking changes" \
--watchClaude Code Remote Tasks (Anthropic)
Claude Code Remote Tasks는 GitHub 저장소, 프롬프트, 스케줄을 정의하면 Claude가 Anthropic 클라우드에서 자율적으로 실행하고 완료 시 PR을 연다. 2026년 3월 20일 출시. **SWE-bench Verified에서 카테고리 최고인 87.6%**와 SWE-bench Pro 64.3%를 기록한 Opus 4.7이 뒷받침한다. 자동완성 검색어 **"claude code background agent support"**에 대한 답이다—실제로 출시된 제품이다.
가격. Claude Code Pro/Max 플랜에 번들. Pro $20/월, Max 5x $100/월, Max 20x $200/월. 헤비 유저는 실제 $100-200/월. (claude.com/code, platform.claude.com/docs/en/managed-agents/overview, 2026-04-26 기준.)
장점. 목록 중 최고 SWE-bench Verified 점수(87.6%). 영구적 상태 유지 에이전트 세션—Remote Task가 매번 처음부터 시작하지 않고 이전 중단점에서 이어갈 수 있다. 훅 및 Claude Code의 기존 도구 생태계와 통합되어, 기존 스킬, 슬래시 명령, 서브 에이전트가 인터랙티브 세션과 동일하게 작동한다.
단점. 목록 중 가장 최신 항목으로, Devin이나 Codex보다 문서화된 통합 패턴이 적고, 참고할 커뮤니티 예제도 적다. CLI 우선; GUI가 없어 팀 내 비 CLI 엔지니어에게 진입 장벽이 높다.
이걸 선택할 때: Claude Code 헤비 유저이고 반복 스케줄 작업—주간 의존성 업데이트, 크론 스타일 리팩터링, 온디맨드 QA 패스—을 원할 때. Claude Code 훅을 Remote Tasks에 인터랙티브 세션과 동일한 방식으로 연결할 수 있으며, Remote Tasks는 3월에 우리가 다룬 유출 후 출시 기능 중 하나였다.
# Schedule a recurring Remote Task in Claude Code
claude-code remote create \
--repo "techsy-io/example-app" \
--schedule "weekly" \
--prompt "Bump deps, run tests, open PR if green"Copilot Coding Agent (GitHub)
Copilot Coding Agent는 GitHub 이슈를 풀 리퀘스트로 전환한다—팀원을 할당하듯 에이전트를 할당하면 된다. 이 목록에서 가장 네이티브한 GitHub 워크플로우다. 참고: 2026년 4월 20일부로 GitHub는 신규 Pro 및 Pro+ 가입을 일시 중단했으며, 기존 구독자와 Business/Enterprise 티어는 영향이 없다.
가격. Free $0, Pro $10/월, Pro+ $39/월, Business $19/유저/월, Enterprise $39/유저/월. 프리미엄 요청 기반: Free 50/월, Pro 300/월, Pro+ 1500/월, Enterprise 1000/유저/월. 2026-04-20부터 Pro/Pro+/학생 신규 가입 일시 중단, Business/Enterprise는 계속 가능. (github.com/features/copilot/plans, 2026-04-26 기준.)
장점. 카테고리에서 가장 깊은 GitHub 통합. 이슈에서 PR로 가는 것은 검색 결과상 가장 네이티브한 워크플로우로—추가 앱도, 추가 대시보드도 없으며, 에이전트는 이미 사용하는 동일한 UI에 담당자로 표시된다. 2026년 3월 Code Review 업데이트로 리뷰 코멘트를 코딩 에이전트에 자동으로 전달할 수 있어, GitHub를 떠나지 않고 루프를 닫을 수 있다.
단점. 하위 티어에서는 모델 선택이 제한적—예를 들어 Pro에서는 Opus를 선택할 수 없다. Pro의 월 300회 프리미엄 요청 예산은 매일 배포하면 빠르게 소진된다. 신규 가입 중단으로 새 개인 구독자에게 마찰이 생긴다.
이걸 선택할 때: 팀이 이미 GitHub Business 또는 Enterprise를 사용 중이고 제로 설정 비동기 코딩을 원할 때. 기존 시트는 지금 바로 에이전트를 사용할 수 있으며, 중단은 신규 개인 가입만 차단한다.
Google Jules
Jules는 Google의 비동기 코딩 에이전트로, 카테고리 최고 무료 티어(일일 15개 작업, 3개 동시 실행)를 갖춘 Gemini 기반 VM이다. 저장소에서 #TODO 주석을 능동적으로 스캔하여 수정을 제안한다. 유료 플랜은 $19.99/월부터 시작하지만, 2026년에 가격이 여러 번 변동되었다.
가격. Free 일일 15개 작업 / 3개 동시 실행. Pro $19.99/월부터. Ultra $124.99/월부터. 2026년에 가격이 여러 번 변경됨—구매 전 jules.google에서 현재 가격을 확인하라. (jules.google, 2025년 8월 TechCrunch GA 보도, 2026-04-26 기준.)
장점. 카테고리 최고 무료 티어, 이견 없음. 일일 15개 작업에 3개 동시 실행은 개인 작업에 실제로 유용하며, 미끼가 아니다. 비 헤비 유저에게 가장 깔끔한 UX—"TODO 스캔" 루프는 참신하며, 프롬프트 없이도 실제 정리 작업을 발견해준다.
단점. 가격 변동성이 최대 리스크. 올해 Pro 티어 가격이 두 번 바뀌는 것을 지켜봤다. Devin이나 Codex보다 통합 생태계가 덜 성숙하며, Slack/Linear/Jira 훅이 적고 커뮤니티 툴링이 부족하다.
이걸 선택할 때: 개인 개발자이거나 유료 플랜 약정 없이 비동기를 원하는 소규모 팀일 때—Jules의 무료 티어는 미끼가 아니라 실제로 유용하다.
Factory Droids (Factory.ai)
Factory의 "Droids"는 코딩, 테스트, 리뷰, 배포를 수행하는 전문화된 자율 에이전트로, 클라우드와 로컬 실행 옵션을 제공한다. Factory는 2026년 4월 16일에 $150M Series C를 마감했으며, 고객으로 NVIDIA, Adobe, Bayer, EY, MongoDB, Zapier를 내세운다. 가격은 2시트 기준 $20/월부터.
가격. 유료 플랜 $20/월부터(팀 시트 2개 포함), 추가 시트당 $5. 멀티 Droid 모델 라우팅—코드, 테스트, 리뷰, 배포에 각각 다른 Droid. (factory.ai/pricing, docs.factory.ai/pricing, SiliconANGLE을 통한 Factory 투자 보도, 2026-04-26 기준.)
장점. 고객 로고가 규제 산업 적합성을 보여준다—헬스케어, 뱅킹, 반도체. 클라우드 또는 로컬 실행은 카테고리에서 유일한 온프레미스 가능 옵션으로, 서드파티 클라우드에 코드를 보낼 수 없는 팀에게 중요하다. 코드/테스트/리뷰/배포 간 멀티 에이전트 조정은 다른 도구들의 단일 에이전트 모델과 확실히 다르다.
단점. Devin이나 Codex보다 인지도가 낮아 내부 설득에 시간이 더 걸린다. 개인 개발자에게는 과하며, 멀티 Droid 오케스트레이션은 사이드 프로젝트에 불필요한 비용이다.
이걸 선택할 때: 거버넌스, 컴플라이언스, 또는 에어갭 배포 요구사항이 있는 중대형 엔지니어링 조직일 때.
아쉽게 탈락한 도구들, OpenHands, Antigravity, Aider
알아둘 만한 3개의 차순위 주자: OpenHands는 선두 오픈소스 자체 호스팅 백그라운드 에이전트로, 완전한 제어나 에어갭 운영을 원할 때 선택하라. Google Antigravity는 Google의 또 다른, 덜 알려진 참가자다. Aider는 기술적으로 동기 CLI이지만 셸 스크립트와 CI 훅을 통해 비동기 파이프라인에서 점점 더 많이 사용된다. 아직 Devin급 자율성을 갖춘 것은 없다.
OpenHands는 오픈소스, MIT 스타일 라이선스로, 자체 인프라에 셀프 호스팅한다. 트레이드오프는 샌드박스를 직접 유지관리해야 한다는 것—보안 정책, 시크릿 관리, 러너 가동 시간 모두 팀 몫이다. 실제 도입은 클라우드 에이전트가 불가능한 규제 및 학술 환경에서 가장 강하다.
**Antigravity (Google)**는 Jules의 조용한 형제다—동일한 VM 모델, 적은 마케팅, 주로 라운드업에서 언급된다. 2026년 4월 기준 프로덕션 활용은 미미하다.
Aider는 본질적으로 CLI 동기 에이전트이지만, 팀들이 CI 내에서 체이닝하여 백그라운드 동작을 모방하는 경우가 늘고 있다—GitHub Action이 프롬프트로 Aider를 트리거하고, Aider가 커밋하면, 워크플로우가 PR을 연다. API를 통해 모든 모델과 작동하며 기본적으로 BYOK이므로, CI 인프라가 여유 있다면 가장 저렴한 "백그라운드 스타일" 옵션이다.
주시할 2개 더: Manus와 Genie. 둘 다 2026년 4월 기준 실제 도입 신호가 낮은 신규 참가자다. 주시할 가치는 있지만, 아직 약정할 가치는 없다.
어떤 백그라운드 코딩 에이전트를 선택해야 할까?
가장 큰 제약 하나 기준으로 선택하라. 예산이라면 Jules 무료 티어가 이긴다. GitHub 네이티브 워크플로우라면 Copilot Coding Agent가 이긴다. 범위 명확한 티켓의 자율성이라면 Devin이 이긴다. 원시 벤치마크 점수라면 Claude Code Remote가 SWE-bench Verified 87.6%로 이긴다. 컴플라이언스라면 Factory Droids. 에디터 통합이라면 Cursor.
| 우선순위 | 선택 | 이유 |
|---|---|---|
| 가장 저렴한 시작 | Google Jules | 일일 15개 작업 무료 티어 |
| GitHub 네이티브 제로 설정 | Copilot Coding Agent | 이슈 → PR이 할당 워크플로우 |
| 최고 자율성 | Devin | 풀 VM, 브라우저, 성숙한 위임 패턴 |
| 최고 벤치마크 점수 | Claude Code Remote | SWE-bench Verified 87.6% (Opus 4.7) |
| 속도 / 처리량 | Codex Cloud | ~240 tps, Terminal-Bench 2.0 선두 |
| 이미 Cursor 사용자 | Cursor BG Agents | 8개 병렬, Slack/Linear 트리거 |
| 규제 산업 | Factory Droids | 컴플라이언스 + 로컬 실행 |
| 셀프 호스트 / OSS | OpenHands | 완전한 제어, 에어갭 옵션 |
팀 규모 & 예산별 스택 추천
개인 개발자, 명확한 성과에는 Jules 무료 티어로 시작하고, 일일 15개를 넘어서면 Cursor Pro $20/월로 업그레이드. 총: $0-20/월.
소규모 팀 (개발자 2-10명), 인라인용 Cursor Pro와 Background Agents, 스케줄 크론 스타일 작업용 Claude Code Pro. 총: 개발자당 $40/월.
엔터프라이즈 (개발자 50명+), 대다수 티켓의 GitHub 네이티브 워크플로우용 Copilot Enterprise, 거버넌스 민감 워크로드용 Factory Droids. 총: $39 + Factory 시트 수에 따라 개발자당 $20-50/월.
백그라운드 코딩 에이전트의 작업당 비용은?
실제 작업당 비용은 벤더마다 과금 방식이 달라 크게 차이 난다. Devin은 일반적 버그 수정에 $4.50-6.75(2-3 ACU)를 청구한다. Cursor와 Codex는 토큰 소모량 기준 과금으로, 모델과 컨텍스트에 따라 작업당 $0.30-3을 예상하라. Jules는 일일 15개 작업까지 무료다. Copilot은 Pro 티어 기준 약 $0.04의 프리미엄 요청을 사용한다.
| 도구 | 과금 모델 | 일반 버그 수정 | 다중 파일 리팩터링 | 무료 티어? |
|---|---|---|---|---|
| Devin | $2.25/ACU (1 ACU ≈ 15분) | $4.50-6.75 (2-3 ACU) | $67.50+ (30 ACU) | 없음 |
| Cursor BG | 토큰 기반, $ 예산 포함 | ~$0.30-1.50 | $3-15 | Hobby 티어 |
| Codex Cloud | 2026년 4월 2일부터 토큰 기반 | ~$0.20-1 | $2-10 | 없음 (Plus에 포함) |
| Claude Code Remote | Pro/Max 플랜에 번들 | ~$0.50-2 (쿼터 차감) | $5-20 (쿼터 차감) | 없음 |
| Copilot Coding Agent | 프리미엄 요청 기반 (Pro 기준 ~$0.04) | 1-3 요청 | 5-20 요청 | Free 50/월 |
| Jules | 무료 티어 또는 정액 플랜 | $0 | 일일 한도 차감 | 일일 15개 무료 |
| Factory Droids | 시트 기반 | 포함 | 포함 | 없음 |
2026-04-26 기준 가격. 토큰 추정치는 프론티어 모델에 평균 작업 컨텍스트 기준. 항상 자체 사용량 대시보드로 확인하라.
"Typical bug fix cost per background coding agent (April 2026)"
데이터 테이블
| "USD per task" | "Typical bug fix" |
|---|---|
| "Jules (free tier)" | 0 |
| "Codex Cloud" | 0.6 |
| "Cursor BG" | 0.9 |
| "Claude Code Remote" | 1.2 |
| "Copilot CA (Pro premium req)" | 0.12 |
| "Devin" | 5.6 |
| "Factory Droids" | 0 |
일반적 2-3 ACU / 토큰 동등 버그 수정 작업 기준 추정치. 실제 비용은 모델 선택과 컨텍스트 길이에 따라 달라진다. 무료 티어 및 시트 기반 도구는 한계 비용 $0으로 표시.
이 수치를 돌린 교훈: Devin은 토큰 과금 경쟁사보다 작업당 5-10배 비싸다. 그 프리미엄은 자율성을 사주는 것—적을 프롬프트, 적은 작업 중 개입—하지만 일상적 버그 수정에서는 원시 비용에서 Codex나 Cursor가 이긴다.
벤치마크 점수가 가장 높은 백그라운드 코딩 에이전트는?
Anthropic의 Claude Opus 4.7이 SWE-bench Verified 87.6%로 선두이며, Codex의 gpt-5-codex는 약 77-80%다. Codex는 Terminal-Bench 2.0에서 77.3%로 선두다. 하지만 벤치마크는 기반 모델의 능력을 측정하는 것이며, 실제 성공률은 에이전트 활용, 샌드박스, 프롬프트에 모델만큼 좌우된다.
| 도구 | 기반 모델 | SWE-bench Verified | Terminal-Bench 2.0 | 비고 |
|---|---|---|---|---|
| Claude Code Remote | Claude Opus 4.7 | 87.6% | 해당 없음 (가변) | 최고 Verified 점수 |
| Codex Cloud | gpt-5-codex | ~77-80% | 77.3% | Terminal-Bench 선두 |
| Devin | Cognition 스택 (혼합) | Junior-SWE 자체 보고 우수 | 해당 없음 | Verified가 아닌 Junior-SWE 통과율 보고 |
| Cursor BG | 사용자 선택 프론티어 | 모델 점수 상속 | 상속 | 점수는 선택한 모델에 따라 다름 |
| Copilot CA | GPT/Claude (티어 제한) | 상속 | 상속 | 티어 고정 모델 선택 |
| Jules | Gemini 2.5/3 | 공식 보고 없음 | 공식 보고 없음 | 벤치마크 투명성 낮음 |
| Factory Droids | 멀티 모델 라우팅 | Droid별 상속 | 상속 | Droid마다 다른 모델 사용 |
집계 뷰는 artificialanalysis.ai의 코딩 에이전트 매트릭스가 프로바이더 간 롤링 벤치마크 수치를 추적한다.
벤치마크는 바닥이지 천장이 아니다. Cursor BG에 Opus 4.7을 올려 같은 티켓에서 Devin을 능가하는 것을 본 적이 있다—활용이 중요하다. 구매하지 않고 자체 에이전트 활용을 구축한다면, LangGraph vs CrewAI vs OpenAI Agents SDK 비교에서 모델 점수와 실제 성공률 간 격차를 만드는 프레임워크 선택을 안내한다.
백그라운드 코딩 에이전트에 저장소 전체 접근 권한을 줘도 안전한가?
각 도구마다 격리 방식이 다르다. Devin은 완전한 샌드박스 VM을 실행한다. Codex는 OpenAI 관리 클라우드 샌드박스를 사용한다. Cursor는 임시 원격 머신을 띄운다. Copilot은 GitHub 관리 러너를 사용한다(기존 GitHub Actions 보안 모델이 적용된다). Claude Code Remote는 Anthropic 클라우드에서 실행된다. Factory는 클라우드 또는 에어갭 로컬을 제공한다. 어느 것도 "프로덕션에 루트 권한을 주는 것"은 아니다.
| 도구 | 실행 환경 | 네트워크 이그레스 | 영구 상태 | 에어갭 옵션 |
|---|---|---|---|---|
| Devin | 완전한 샌드박스 VM (자체 IDE+브라우저) | 있음, 범위 제한 | 세션별 | 없음 |
| Cursor BG | 임시 클라우드 VM | 있음 | 없음 | 없음 |
| Codex Cloud | OpenAI 클라우드 샌드박스 | 있음, 범위 제한 | 없음 | 없음 |
| Claude Code Remote | Anthropic 클라우드 | 있음, 범위 제한 | 영구 에이전트 세션 | 없음 |
| Copilot CA | GitHub 관리 러너 | Actions 설정 상속 | 실행별 | Enterprise 전용 |
| Jules | Google 클라우드 VM | 있음 | 작업별 | 없음 |
| Factory Droids | 클라우드 또는 로컬 | 설정 가능 | 설정 가능 | 있음 |
도입 전 CTO 수준에서 물어볼 질문
이 에이전트들에게 저장소 접근 권한을 부여하기 전에, 네 가지 질문이 정책을 결정한다:
- 저장소 권한, 에이전트가 main에 쓰기 권한을 갖는가, 아니면 기능 브랜치로 제한되는가? 항상 기능 브랜치 + 강제 PR 리뷰로 제한하라.
- 시크릿 접근, 에이전트가
.env파일을 읽거나 시크릿 관리자를 호출할 수 있는가? 기본 거부하고 범위 제한 토큰을 사용하라. - 네트워크 이그레스, 샌드박스가 어디로 아웃바운드 호출할 수 있는가? 패키지 레지스트리와 프라이빗 미러에 대한 허용 목록이 있는 기본 거부 네트워크를 사용하라.
- 감사 로그 보존, 에이전트 세션이 얼마나 보존되며, 보안팀이 쿼리할 수 있는가? 권한 부여 전에 서면으로 확정하라.
백그라운드 코딩 에이전트가 내 코드로 학습하는가?
기본 옵트인/옵트아웃은 다양하다. OpenAI Codex 엔터프라이즈 플랜은 기본적으로 코드로 학습하지 않는다. Anthropic Claude Code는 코드로 학습하지 않는다. GitHub Copilot Business 및 Enterprise는 데이터 제외가 있다. Cursor는 프라이버시 모드를 제공한다. Devin은 코드가 고객 통제 하에 유지된다고 명시한다. 저장소 접근 권한을 부여하기 전에 항상 벤더 문서에서 현재 데이터 사용 정책을 확인하라.
도구별 한 줄 요약, 현재 기본 동작:
- Devin, Cognition 정책에 따라 코드는 고객 통제 하에 유지
- Cursor, 프라이버시 모드 토글, 학습은 옵트인
- Codex Cloud, 엔터프라이즈는 기본 미학습; ChatGPT Plus는 소비자 약관 적용
- Claude Code Remote, Anthropic 상용 약관에 따라 코드로 학습하지 않음
- Copilot Business/Enterprise, 데이터 제외 기본 활성화; Pro/Pro+는 별도 토글
- Jules, Google 표준 엔터프라이즈 데이터 약관 적용; 현재 정책 확인 필요
- Factory Droids, 문서에 따라 고객 통제; 에어갭 로컬은 질문 자체를 제거
2025-26년에 정책이 여러 번 바뀌었다. 접근 권한 부여 전에 재확인하라—벤더는 블로그 포스트보다 약관을 더 자주 업데이트한다. 백그라운드 에이전트의 PR이 머지되면, 머지 전에 구조화된 AI 코드 리뷰 패스가 필요하다—에이전트 벤더가 처리했다고 IP 문제가 사라지지 않는다.
Techsy가 클라이언트 프로젝트에서 백그라운드 에이전트를 선택하는 방법
Techsy 클라이언트 프로젝트에서는 하나의 도구를 고르지 않고 레이어 스택을 운영한다. Cursor Background Agents가 IDE 내 비동기 작업을 처리한다(엔지니어들은 어차피 Cursor에서 산다). Claude Code Remote Tasks가 스케줄 크론 스타일 작업을 실행한다—주간 의존성 업데이트, 야간 QA 패스—자동화해야 할 지루한 작업. Codex Cloud가 lint와 의존성 업데이트에서 속도 처리량을 담당하며, 벤치마크 점수보다 속도가 중요한 곳이다. 완전한 위임 자율성이 필요하고 범위 명확한 백로그가 있는 클라이언트에는 Devin을 선택한다.
많이 사용하지 않는 것: Copilot Coding Agent. 우리 사용량 수준에서는 Pro의 프리미엄 요청 예산이 대안보다 빠르게 소진되며, 아직 업그레이드를 정당화할 만큼 Enterprise 클라이언트가 충분하지 않다. 엔터프라이즈 롤아웃에서 단일 벤더에 고정하기 전에 LangGraph나 OpenAI Agents SDK로 커스텀 활용을 구축하겠지만, 신규 클라이언트 작업의 80%에는 위의 기성 도구가 직접 만드는 것보다 빠르다. 우리가 사용하는 에이전트 AI 배포 플랫폼은 이 도구들이 프로덕션에서 만들어내는 에이전트를 처리한다.
어떤 백그라운드 코딩 에이전트가 스택에 맞는지, 또는 커스텀 에이전트 활용에 대해 무료 상담을 원하시면 기꺼이 범위를 잡아드리겠다.
FAQ, 백그라운드 코딩 에이전트 비교
백그라운드 코딩 에이전트란?
백그라운드 코딩 에이전트는 샌드박스된 클라우드 환경에서 비동기로 실행되는 AI 소프트웨어 엔지니어다. 작업을 할당하면—GitHub 이슈, Linear 티켓, Slack 메시지—혼자 수 분에서 수 시간 동안 작업한 뒤 리뷰용 풀 리퀘스트를 반환한다. 핵심 특징은 타이핑을 지켜보지 않는다는 것, 다른 곳에 있는 동안 작업한다.
백그라운드 코딩 에이전트와 Cursor나 Copilot 인라인의 차이는?
백그라운드 에이전트는 클라우드 샌드박스에서 비동기로 실행되어 풀 리퀘스트를 반환한다. Cursor나 Copilot 같은 인라인 도구는 에디터에서 타이핑 중에 코드를 제안하며, 각 키스트로크를 사용자가 주도한다. 백그라운드 에이전트는 병렬성(5개 작업 큐, 5개 PR 수신)을 가능하게 하고, 인라인 에이전트는 집중 중인 단일 작업의 빠른 반복을 가능하게 한다.
백그라운드 코딩 에이전트의 작업당 비용은?
Devin은 일반적 버그 수정에 2-3 ACU 기준 $4.50-6.75다. Cursor와 Codex Cloud는 토큰 소모량 기준 과금으로, 모델과 컨텍스트 길이에 따라 일반적으로 작업당 $0.30-3이다. Jules는 일일 15개 작업까지 무료다. Copilot Coding Agent는 Pro 티어 기준 약 $0.04의 프리미엄 요청을 사용하며, 유료 플랜 중 작업당 가장 저렴하다.
개인 개발자에게 가장 저렴한 백그라운드 코딩 에이전트는?
Google Jules의 무료 티어는 독보적이다: 일일 15개 작업, 3개 동시 에이전트, $0/월. 이를 넘어서면 $20 사용량이 포함된 Cursor Pro $20/월이 다음 단계이며, 에디터 통합을 보너스로 제공한다. 대부분의 개인 개발자에게 Jules는 결제 없이 일일 필요를 충족한다.
백그라운드 코딩 에이전트에 저장소 전체 접근 권한을 줘도 안전한가?
조건부로 그렇다. 범위 제한 토큰을 사용하고(개인 액세스 토큰 아님), 허용 목록이 있는 기본 거부 네트워크 이그레스를 설정하고, 에이전트를 필수 PR 리뷰가 있는 기능 브랜치로 제한하고, 감사 로그를 주간으로 검토하라. 이 에이전트들에게 프로덕션 쓰기 권한을 절대 부여하지 마라. 에이전트를 외주 개발자처럼 대하라: 신뢰하되, 모든 PR을 검증하라.
백그라운드 코딩 에이전트가 내 코드로 학습하는가?
Anthropic Claude Code, OpenAI Codex 엔터프라이즈 플랜, GitHub Copilot Business/Enterprise는 기본적으로 코드로 학습하지 않는다. Cursor는 프라이버시 모드를 제공한다. Devin은 코드가 고객 통제 하에 유지된다고 명시한다. 저장소 접근 권한을 부여하기 전에 항상 벤더 문서에서 현재 데이터 사용 정책을 확인하라—2025-26년에 정책이 여러 번 바뀌었다.
백그라운드 코딩 에이전트가 자체 풀 리퀘스트를 머지할 수 있는가?
권한을 부여하면 대부분 가능하지만, 우리가 아는 모든 팀은 머지 전 사람 리뷰를 요구한다. 기술적 능력은 존재한다—Copilot, Devin, Cursor 모두 브랜치 보호가 허용하면 자동 머지할 수 있다—하지만 자동 머지는 자충수다. PR 리뷰 게이트는 에이전트의 실수가 프로덕션에 도달하기 전 마지막 저렴한 안전망이다.
엔터프라이즈 팀에 가장 좋은 백그라운드 코딩 에이전트는?
환경에 따라 두 가지 답이 있다. 이미 GitHub Enterprise에 깊이 들어가 있다면, Copilot Coding Agent가 가장 마찰이 적은 선택이다—이슈 할당이 워크플로우이며 추가 툴링이 없다. 거버넌스, 컴플라이언스, 에어갭 요구사항이 있다면, Factory Droids가 코드, 테스트, 리뷰, 배포 간 로컬 실행과 멀티 에이전트 조정을 갖춘 유일한 옵션이다.
무료 티어가 가장 좋은 백그라운드 코딩 에이전트는?
Google Jules가 압승이다. 일일 15개 작업, 3개 동시 에이전트, 전체 Gemini 액세스, $0/월에 시간 제한 없음. Copilot의 Free 티어(월 50회 프리미엄 요청)는 먼 2위; Cursor의 Hobby 티어는 기술적으로 무료지만 백그라운드 에이전트 사용을 의미 있게 커버하지 못한다. Jules는 우리가 본 중 개인 작업에서 유료 플랜을 대체한 유일한 무료 티어다.
백그라운드 에이전트와 Cursor 같은 인라인 AI를 언제 사용해야 하나?
작업 범위가 명확하고, 15분 이상 걸리며, 편집 중간에 방향 수정이 필요 없으면 백그라운드 에이전트를 사용하라—의존성 업그레이드, 반복적 리팩터링, 다중 파일 마이그레이션, 또는 명확한 티켓으로 설명할 수 있는 모든 것. 프로토타이핑, 탐색, 또는 새로운 작업에서 모델과 페어 프로그래밍할 때는 인라인을 사용하라.
핵심 요약
- Devin은 위임할 때, Cursor BG는 Cursor에서 살 때, Codex Cloud는 ChatGPT Pro 사용자일 때, Claude Code Remote는 벤치마크, Copilot은 GitHub 네이티브, Jules는 무료 티어, Factory는 컴플라이언스.
- 가격 변동성은 현실이다—2026년 4월 Devin 인하, Codex 토큰 개편, Copilot 가입 중단이 모두 이번 달에 일어났다. 구매 전 확인하라.
- 비동기 카테고리는 1년밖에 안 되었고 빠르게 발전 중이다. 여름 전에 이 매트릭스가 다시 바뀔 것으로 예상하라.
백그라운드 에이전트 선택이나 스택 연동에 도움이 필요하신가요? 무료 상담받기.