
Devin vs Claude Code vs Codex 2026: 8 agentes de programação testados
Os agentes de programação em segundo plano passaram de demonstração de investigação a produto banalizado em doze meses. A Cognition acabou de cortar o preço mínimo do Devin de $500 para $20/mês este abril, a OpenAI reconstruiu a faturação do Codex a 2 de abril, e a Factory fechou uma Série C de $150M há duas semanas. Testámos os oito em produção este mês em trabalho interno de ferramentas da Techsy, e os números abaixo são os que efetivamente pagámos. Não vendemos nenhuma destas ferramentas nem temos links de afiliados; todos os outros resultados no top-10 para esta pesquisa são publicados por um fornecedor de um dos agentes da lista.
| Ferramenta | Preço inicial | Melhor modelo para | Sandbox / cloud | Nativo do GitHub | Ideal para | Dado-chave |
|---|---|---|---|---|---|---|
| Devin | $20/mês + $2,25/ACU | Stack da Cognition | VM completa (IDE+browser próprios) | PR via GH App | Delegar backlog de ponta a ponta | ~$5 por tarefa de correção de bug |
| Cursor BG Agents | $20/mês (Pro) | Modelo frontier à escolha | VM cloud efémera | PR via integração | Utilizadores de Cursor que querem async | Até 8 agentes em paralelo |
| Codex Cloud | $20/mês (Plus) → $200 (Pro) | OpenAI gpt-5-codex | Sandbox cloud da OpenAI | PR via Codex CLI / web | Utilizadores avançados de ChatGPT-Pro | 77,3% no Terminal-Bench 2.0 |
| Claude Code Remote | $20/mês (Pro) → $200 (Max 20x) | Claude Opus 4.7 | Cloud da Anthropic | PR via GH App | Utilizadores avançados de Claude Code + cron | 87,6% no SWE-bench Verified |
| Copilot Coding Agent | $10/mês (Pro) → $39 (Enterprise) | GPT/Claude (limitado por tier) | Runner gerido pelo GitHub | Nativo (issue → PR) | Equipas GH Enterprise/Business | Integração GH mais profunda |
| Google Jules | Grátis (15/dia) → $19,99+ | Gemini | VM cloud da Google | PR via integração | Devs a solo / equipas pequenas | Melhor tier gratuito da categoria |
| Factory Droids | $20/mês (2 lugares) | Roteamento multi-modelo | Cloud + opção local | PR via integração | Indústrias reguladas | Usado na NVIDIA, Adobe, Bayer |
| Menções honrosas | varia | varia | varia | varia | OSS / pipelines DIY | OpenHands, Antigravity, Aider |
Preços a 2026-04-26. Os planos baseados em tokens e em ACU faturam por cima da base. Verifique antes de comprar; veja os links dos fornecedores em cada secção de ferramenta. Para geração greenfield em vez de trabalho num repositório existente, veja a nossa comparação lovable-vs-bolt-vs-v0.
O que é um agente de programação em segundo plano?
Um agente de programação em segundo plano é um engenheiro de software de IA que corre de forma assíncrona num ambiente cloud com sandbox. Atribui-lhe uma tarefa, um issue do GitHub, um ticket do Linear, uma mensagem no Slack, e ele trabalha sozinho durante minutos ou horas, devolvendo depois um pull request para revisão. Não o vê a escrever.
Esse é o traço distintivo. Ferramentas inline como o Cursor e o Copilot sugerem à medida que escreve; os agentes de IA em segundo plano entram em fila, executam e reportam de volta. O ciclo de vida é o mesmo em todas as ferramentas desta lista: ticket → sandbox cloud → edição autónoma → PR → revisão humana.
A categoria existe porque a capacidade agêntica de horizonte mais longo amadureceu no final de 2024 com o lançamento do Devin, e 2025 trouxe o Codex Cloud, os Cursor Background Agents e o Jules. As Claude Code Remote Tasks da Anthropic foram lançadas a 20 de março de 2026, e a corrida ao "configurar e esquecer" é agora mainstream.
Porque é que o configurar-e-esquecer importa? Paralelismo. Pode colocar em fila cinco tickets bem delimitados numa sexta-feira à tarde e ter cinco PRs para rever na segunda de manhã. É um fluxo de trabalho diferente de fazer pair-programming com um modelo, mais próximo de gerir um engenheiro júnior do que de escrever ao lado de um. As pessoas também pesquisam especificamente por "claude code background agent support", e é por isso que cobrimos aqui as Claude Code Remote Tasks, não apenas o Devin. Cobrimos o lado inline separadamente na nossa análise da divisão de agentes de programação inline entre Claude Code, Cursor e Copilot. Para uma explicação de arquitetura ao nível da categoria, o guia introdutório da Tembo é um ponto de partida razoável.
Segundo plano vs inline, quando é que o async ganha ao síncrono?
Os agentes async em segundo plano ganham quando uma tarefa demora mais de 15 minutos e não precisa de corrigir o rumo a meio da edição: correções de bugs bem delimitadas, upgrades de dependências, refactors repetitivos, migrações multi-ficheiro. Os agentes inline como o Cursor ou o Copilot ganham quando está a explorar, a prototipar ou a fazer pair-programming com o modelo e precisa de reagir em tempo real.
Esse é o título. A matriz de decisão abaixo é como escolhemos de facto nos projetos da Techsy:
| Use async (segundo plano) quando… | Use inline (Cursor/Copilot) quando… |
|---|---|
| A tarefa é bem delimitada (issue com critérios de aceitação) | Está a explorar ou a prototipar |
| Trabalho estimado > 15 min | Precisa de corrigir o rumo a meio da edição |
| Quer paralelizar 3+ tarefas | Quer uma sessão focada |
| Não se importa de rever um PR depois | Quer ver sugestões à medida que escreve |
| A tarefa é repetitiva (deps, migrações, lint) | A tarefa é nova e criativa |
Em concreto: "Atualizei 47 pacotes e corrigi as breaking changes" é um trabalho clássico de agentes de programação async, bem definido, mecânico, paralelizável. "Construí uma nova rota de dashboard" é inline, vai iterar sobre o layout, o copy e os casos-limite à medida que avança.
A passagem entre síncrono e assíncrono
A maioria das equipas com quem trabalhamos acaba por usar ambos. Cursor inline para código novo, Cursor Background Agents para upgrades. Claude Code interativo para trabalho de arquitetura, Claude Code Remote Tasks para o cron semanal de atualização de dependências. A passagem é o fluxo de trabalho, nenhuma ferramenta substitui a outra. Se vai ficar no seu editor, a análise Windsurf vs Cursor cobre o lado síncrono em detalhe.
Se a sua tarefa demora mais de 15 minutos e não precisa de a acompanhar, o async ganha.
Devin (Cognition), o líder em autonomia
O Devin é o agente em segundo plano mais autónomo do mercado; a Cognition dá-lhe uma VM com sandbox completa, com o seu próprio IDE, browser e terminal. O preço caiu de um mínimo empresarial de $500/mês para $20/mês + $2,25 por Agent Compute Unit (ACU) em abril de 2026, o que fez dele o título de líder de autonomia do mês para agentes de programação autónomos.
Preços. Core $20/mês + $2,25/ACU. Team $500/mês com 250 ACUs incluídos mais ACUs extra a $2 cada. 1 ACU equivale aproximadamente a 15 minutos de trabalho. Uma correção de bug típica usa 2-3 ACU, ou seja, $4,50-6,75. Uma migração multi-ficheiro pode atingir 30+ ACU, ou seja, $67,50 ou mais. (devin.ai/pricing, a 2026-04-26.)
Pontos fortes. A autonomia mais alta da lista. A VM inclui um browser, por isso o Devin consegue ler documentação e o Stack Overflow sem que tenha de lhe dar contexto à colher. Produto maduro; a Cognition lançou em março de 2024 e teve dois anos para refinar os prompts que tornam o Devin realmente útil.
Pontos fracos. Os custos de ACU tornam-se imprevisíveis em trabalho novo. Menos controlo a meio da tarefa do que o Codex ou o Cursor; define a tarefa e afasta-se, o que é bom até o Devin gastar 8 ACU a depurar um erro de escrita. Precisa de critérios de aceitação precisos; tickets vagos produzem PRs vagos.
Escolha isto se: quer delegar itens de backlog bem delimitados de ponta a ponta e a sua equipa consegue escrever critérios de aceitação claros.
Cursor Background Agents
Os Background Agents do Cursor correm em async dentro do editor Cursor, até 8 em paralelo, acionáveis a partir do Slack, Linear, GitHub ou no editor. Usam o modelo frontier que selecionar, por isso o custo depende do consumo de tokens, não de uma taxa fixa de ACU. O Pro custa $20/mês com $20 de utilização incluída.
Preços. Hobby $0, Pro $20/mês (inclui $20 de utilização), Pro+ $60/mês ($70 de utilização), Ultra $200/mês ($400 de utilização), Teams $40/utilizador/mês. Os agentes em segundo plano faturam por cima com base na utilização: modelo + comprimento do contexto + comprimento do output. (cursor.com/pricing, a 2026-04-26. A funcionalidade Background Agents foi lançada no Cursor 0.50.)
Pontos fortes. A integração de editor mais apertada da lista: a sua sessão inline, o seu agente em segundo plano e as suas regras vivem todos numa ferramenta. Até 8 agentes em paralelo significa que pode distribuir um refactor por vários módulos e reconvergir em minutos. Os triggers de Slack, Linear e GitHub respondem à pergunta "qual o agente em segundo plano que funciona com Linear e Slack": o Cursor funciona, nativamente.
Pontos fracos. A utilização de modelos frontier queima o orçamento incluído de $20 mais depressa do que pensa; uma sessão pesada de Opus pode esgotá-lo. O custo por tarefa é opaco a menos que consulte o dashboard de utilização, o que a maioria das equipas não faz até chegar a fatura.
Escolha isto se: já vive no Cursor e quer async sem mudar de ferramentas, e não se importa de ler o dashboard de utilização uma vez por semana. As suas Cursor Rules existentes alimentam tanto as sessões inline como as de segundo plano, por isso o custo de configuração é quase nulo se já for utilizador do Cursor.
Codex Cloud (OpenAI)
O Codex Cloud é o agente de programação async da OpenAI. Descreve uma tarefa, o Codex arranca uma VM sandbox, clona o seu repositório e devolve um PR. Lidera o Terminal-Bench 2.0 com 77,3%, corre a ~240 tokens/seg (cerca de 2,5x mais rápido que o Opus) e mudou para faturação baseada em tokens a 2 de abril de 2026.
Preços. Incluído no ChatGPT Plus ($20/mês). Novo tier Pro $100/mês (5x a utilização do Plus; promocional 2x = 10x até 31 de maio de 2026). Pro $200/mês. Baseado em tokens desde 2026-04-02. O Codex CLI é open-source e grátis com BYOK. O custo real situa-se em ~$100-200/dev/mês para utilizadores ativos. (developers.openai.com/codex/pricing, cobertura da TechCrunch do tier Pro de $100, a 2026-04-26.)
Pontos fortes. Campeão de throughput a ~240 tps; para tarefas pesadas em tokens como upgrades de dependências em muitos ficheiros, o Codex termina enquanto o Claude ainda está a pensar. O CLI é open-source e funciona com a sua própria chave de API, por isso pode ligar o Codex ao CI sem pagar o ChatGPT Pro. A distribuição é enorme: todos os utilizadores do ChatGPT Plus já o têm.
Pontos fracos. A faturação por tokens é genuinamente difícil de prever de tarefa para tarefa. A reforma de 2 de abril invalida comparações mais antigas; tudo o que ler antes dessa data está errado no preço. O CLI parece um produto separado do Codex web; a integração é frouxa.
Escolha isto se: é um utilizador do ChatGPT Pro que quer um agente cloud profundamente integrado, ou um amante do CLI que quer trazer a sua própria chave.
# Dispatch a task to Codex Cloud from the CLI
codex task create \
--repo "techsy-io/example-app" \
--branch "main" \
--prompt "Bump all dependencies to latest and fix breaking changes" \
--watchClaude Code Remote Tasks (Anthropic)
As Claude Code Remote Tasks permitem definir um repositório do GitHub, um prompt e um agendamento; o Claude corre de forma autónoma na cloud da Anthropic e abre um PR quando termina. Lançadas a 20 de março de 2026. Apoiadas nos 87,6% líderes da categoria do Opus 4.7 no SWE-bench Verified e nos 64,3% no SWE-bench Pro. Esta é a resposta à pesquisa de autocomplete "claude code background agent support": é um produto real e lançado.
Preços. Incluído nos planos Claude Code Pro/Max. Pro $20/mês, Max 5x $100/mês, Max 20x $200/mês. Utilizadores intensivos ficam em $100-200/mês na prática. (claude.com/code, platform.claude.com/docs/en/managed-agents/overview, a 2026-04-26.)
Pontos fortes. A pontuação mais alta de SWE-bench Verified da lista (87,6%). Sessões de agente persistentes e com estado; uma Remote Task pode retomar onde ficou em vez de começar do zero a cada execução. Integra-se com hooks e com o ecossistema de ferramentas existente do Claude Code, por isso skills, slash commands e sub-agentes existentes funcionam da mesma forma que nas sessões interativas.
Pontos fracos. A entrada mais recente da lista, com menos padrões de integração documentados do que o Devin ou o Codex, e menos exemplos da comunidade para copiar. CLI-first; sem GUI, o que eleva o patamar para engenheiros não-CLI na equipa.
Escolha isto se: é um utilizador avançado do Claude Code e quer tarefas recorrentes agendadas: atualizações semanais de dependências, refactors estilo cron, passagens de QA on-demand. Pode ligar os hooks do Claude Code às Remote Tasks da mesma forma que nas sessões interativas, e as Remote Tasks foram uma das funcionalidades divulgadas-e-depois-lançadas que cobrimos em março.
# Schedule a recurring Remote Task in Claude Code
claude-code remote create \
--repo "techsy-io/example-app" \
--schedule "weekly" \
--prompt "Bump deps, run tests, open PR if green"Copilot Coding Agent (GitHub)
O Copilot Coding Agent transforma um issue do GitHub num pull request; atribui o agente como atribuiria um colega de equipa. É o fluxo de trabalho mais nativo do GitHub nesta lista. Nota: a 20 de abril de 2026 o GitHub pausou novas subscrições Pro e Pro+; subscritores existentes e tiers Business/Enterprise não são afetados.
Preços. Free $0, Pro $10/mês, Pro+ $39/mês, Business $19/utilizador/mês, Enterprise $39/utilizador/mês. Baseado em premium-requests: Free 50/mês, Pro 300/mês, Pro+ 1500/mês, Enterprise 1000/utilizador/mês. Novas subscrições Pro/Pro+/estudante pausadas a partir de 2026-04-20; Business/Enterprise continuam abertos. (github.com/features/copilot/plans, a 2026-04-26.)
Pontos fortes. A integração GitHub mais profunda da categoria. Issue-para-PR é o fluxo de trabalho mais nativo na SERP: sem app extra, sem dashboard extra; o agente aparece como assignee na mesma UI que já usa. A atualização de Code Review de março de 2026 pode entregar automaticamente comentários de revisão ao agente de programação, fechando o ciclo sem sair do GitHub.
Pontos fracos. Seleção de modelos limitada nos tiers mais baixos; não pode escolher Opus no Pro, por exemplo. O orçamento de premium-requests esgota-se depressa no Pro com 300 pedidos/mês se lançar diariamente. A pausa de novas subscrições acrescenta fricção para novos subscritores individuais.
Escolha isto se: a sua equipa já está no GitHub Business ou Enterprise e quer programação async sem configuração. Os lugares existentes podem usar o agente hoje; a pausa apenas bloqueia novas subscrições individuais.
Google Jules
O Jules é o agente de programação async da Google, uma VM alimentada por Gemini com o melhor tier gratuito da categoria (15 tarefas diárias, 3 em simultâneo). Faz scan proativo ao seu repositório à procura de comentários #TODO e oferece correções. Os planos pagos começam em $19,99/mês, mas os preços mudaram várias vezes em 2026.
Preços. Free 15 tarefas diárias / 3 em simultâneo. Pro a partir de $19,99/mês. Ultra a partir de $124,99/mês. Os preços mudaram várias vezes em 2026 — verifique os números atuais em jules.google antes de comprar. (jules.google, cobertura do GA pela TechCrunch de agosto de 2025, a 2026-04-26.)
Pontos fortes. O melhor tier gratuito da categoria, ponto final. 15 tarefas/dia com 3 em simultâneo é genuinamente útil para trabalho a solo, não é um chamariz. A UX mais limpa do conjunto para utilizadores não-avançados; o ciclo de "scan por TODOs" é novo e faz surgir trabalho real de limpeza sem que tenha de pedir.
Pontos fracos. A volatilidade de preços é o risco principal; vimos o preço do tier Pro mudar duas vezes este ano. Ecossistema de integração menos maduro do que o Devin ou o Codex, menos hooks de Slack/Linear/Jira, menos ferramentas da comunidade.
Escolha isto se: é um dev a solo ou uma equipa pequena que quer async sem se comprometer à partida com um plano pago; o tier gratuito do Jules é genuinamente útil, não um chamariz.
Factory Droids (Factory.ai)
Os "Droids" da Factory são agentes autónomos especializados que programam, testam, revêm e fazem deploy, com opções de execução cloud e local. A Factory fechou uma Série C de $150M a 16 de abril de 2026 e lista NVIDIA, Adobe, Bayer, EY, MongoDB e Zapier como clientes. Os preços começam em $20/mês para dois lugares.
Preços. Planos pagos a partir de $20/mês (inclui 2 lugares de equipa), $5 por lugar adicional. Roteamento multi-Droid, Droids diferentes para programar, testar, rever e fazer deploy. (factory.ai/pricing, docs.factory.ai/pricing, cobertura do financiamento da Factory via SiliconANGLE, a 2026-04-26.)
Pontos fortes. Os logótipos de clientes sinalizam adequação a indústrias reguladas: saúde, banca, semicondutores. Execução cloud OU local é a única opção com capacidade on-prem na categoria, o que importa para equipas que não podem enviar código para uma cloud de terceiros. A coordenação multi-agente entre programar/testar/rever/deploy é genuinamente diferente do modelo de agente único que os outros usam.
Pontos fracos. Menos reconhecimento de marca do que o Devin ou o Codex, por isso a adesão interna demora mais. Excessivo para devs a solo; a orquestração multi-Droid é um imposto de que não precisa num projeto paralelo.
Escolha isto se: é uma organização de engenharia média a grande com requisitos de governação, conformidade ou deployment air-gapped.
Menções honrosas, OpenHands, Antigravity, Aider
Três finalistas que vale a pena conhecer: o OpenHands é o principal agente em segundo plano open-source self-hosted; escolha-o se quer controlo total ou operação air-gapped. O Google Antigravity é a outra entrada da Google, menos divulgada. O Aider é tecnicamente um CLI síncrono, mas é cada vez mais usado em pipelines async via scripts de shell e hooks de CI. Nenhum tem ainda autonomia ao nível do Devin.
O OpenHands é open-source, licença estilo MIT, self-host na sua própria infraestrutura. A contrapartida é que é você a manter a sandbox: políticas de segurança, gestão de segredos, uptime do runner, tudo a cargo da sua equipa. A adoção real é mais forte em ambientes regulados e académicos onde os agentes cloud são impensáveis.
O Antigravity (Google) é o irmão mais discreto do Jules, mesmo modelo de VM, menos esforço de marketing, mencionado sobretudo em roundups. A tração em produção é ligeira a abril de 2026.
O Aider é no fundo um agente CLI síncrono, mas as equipas encadeiam-no cada vez mais dentro do CI para imitar comportamento em segundo plano: uma GitHub Action aciona o Aider com um prompt, o Aider faz commit, o workflow abre um PR. Funciona com qualquer modelo via API e é BYOK por defeito, por isso é a opção "estilo segundo plano" mais barata se tiver infra de CI disponível.
Mais dois a acompanhar: Manus e Genie. Ambos são entradas recentes com baixo sinal de adoção real a abril de 2026. Vale a pena acompanhar, ainda não vale a pena comprometer-se.
Que agente de programação em segundo plano deve escolher?
Escolha pela sua maior limitação. Se for o orçamento, o tier gratuito do Jules ganha. Se for o fluxo de trabalho nativo do GitHub, o Copilot Coding Agent ganha. Se for autonomia em tickets bem delimitados, o Devin ganha. Se forem pontuações brutas de benchmarks, o Claude Code Remote ganha o SWE-bench Verified com 87,6%. Se for conformidade, Factory Droids. Se for integração de editor, Cursor.
| A sua prioridade | Escolha | Porquê |
|---|---|---|
| Início mais barato | Google Jules | Tier gratuito com 15 tarefas/dia |
| Zero-configuração nativo do GitHub | Copilot Coding Agent | Issue → PR é o fluxo de atribuição |
| Autonomia mais alta | Devin | VM completa, browser, padrões de delegação maduros |
| Pontuações de benchmark mais altas | Claude Code Remote | 87,6% SWE-bench Verified (Opus 4.7) |
| Velocidade / throughput | Codex Cloud | ~240 tps, líder do Terminal-Bench 2.0 |
| Utilizadores já no Cursor | Cursor BG Agents | 8 em paralelo, triggers Slack/Linear |
| Indústria regulada | Factory Droids | Conformidade + execução local |
| Self-host / OSS | OpenHands | Controlo total, opção air-gapped |
Recomendação de stack por dimensão de equipa e orçamento
Dev a solo, comece com o tier gratuito do Jules para as vitórias óbvias, faça upgrade para Cursor Pro a $20/mês quando ultrapassar as 15 tarefas/dia. Total: $0-20/mês.
Equipa pequena (2-10 devs), Cursor Pro para inline mais Background Agents, mais Claude Code Pro para tarefas agendadas estilo cron. Total: $40/dev/mês.
Enterprise (50+ devs), Copilot Enterprise para o fluxo de trabalho nativo do GitHub na maioria dos tickets, mais Factory Droids para cargas de trabalho sensíveis a governação. Total: $39 + $20-50/dev/mês dependendo do número de lugares da Factory.
Quanto custa cada agente de programação em segundo plano por tarefa?
O custo real por tarefa varia enormemente porque cada fornecedor fatura de forma diferente. O Devin cobra $4,50-6,75 por uma correção de bug típica (2-3 ACUs). O Cursor e o Codex faturam pelo consumo de tokens; conte com $0,30-3 por tarefa dependendo do modelo e do contexto. O Jules é grátis até 15 tarefas/dia. O Copilot usa premium requests a cerca de $0,04 cada no tier Pro.
| Ferramenta | Modelo de faturação | Correção de bug típica | Refactor multi-ficheiro | Tier gratuito? |
|---|---|---|---|---|
| Devin | $2,25/ACU (1 ACU ≈ 15 min) | $4,50-6,75 (2-3 ACU) | $67,50+ (30 ACU) | Não |
| Cursor BG | Baseado em tokens, orçamento $ incluído | ~$0,30-1,50 | $3-15 | Tier Hobby |
| Codex Cloud | Baseado em tokens desde 2 abr 2026 | ~$0,20-1 | $2-10 | Não (no Plus) |
| Claude Code Remote | Incluído nos planos Pro/Max | ~$0,50-2 (contra quota) | $5-20 (contra quota) | Não |
| Copilot Coding Agent | Baseado em premium-requests (~$0,04 cada no Pro) | 1-3 requests | 5-20 requests | Free 50/mês |
| Jules | Tier gratuito ou plano fixo | $0 | Conta para o diário | 15/dia grátis |
| Factory Droids | Baseado em lugares | Incluído | Incluído | Não |
Preços a 2026-04-26. As estimativas de tokens assumem modelos frontier com contexto de tarefa médio. Verifique sempre contra o seu próprio dashboard de utilização.
"Typical bug fix cost per background coding agent (April 2026)"
Tabela de dados
| "USD per task" | "Typical bug fix" |
|---|---|
| "Jules (free tier)" | 0 |
| "Codex Cloud" | 0.6 |
| "Cursor BG" | 0.9 |
| "Claude Code Remote" | 1.2 |
| "Copilot CA (Pro premium req)" | 0.12 |
| "Devin" | 5.6 |
| "Factory Droids" | 0 |
Estimativas para uma tarefa típica de correção de bug de 2-3 ACU / equivalente em tokens. O custo real varia com a seleção do modelo e o comprimento do contexto. Ferramentas com tier gratuito e baseadas em lugares mostram custo marginal de $0.
A lição de fazer estas contas: o Devin é 5-10x mais caro por tarefa do que a concorrência faturada por tokens. Esse prémio compra-lhe autonomia, menos prompts para escrever, menos babysitting a meio da tarefa, mas em correções de bug rotineiras, o Codex ou o Cursor ganham no custo puro.
Que agente de programação em segundo plano tem as melhores pontuações de benchmark?
O Claude Opus 4.7 da Anthropic lidera o SWE-bench Verified com 87,6%, com o gpt-5-codex do Codex à volta de 77-80%. O Codex lidera o Terminal-Bench 2.0 com 77,3%. Mas os benchmarks medem o que o modelo subjacente consegue fazer; a sua taxa de sucesso real depende tanto do caso de uso do agente, da sandbox e do prompt como do modelo.
| Ferramenta | Modelo subjacente | SWE-bench Verified | Terminal-Bench 2.0 | Notas |
|---|---|---|---|---|
| Claude Code Remote | Claude Opus 4.7 | 87,6% | n/d (varia) | Pontuação Verified mais alta |
| Codex Cloud | gpt-5-codex | ~77-80% | 77,3% | Líder do Terminal-Bench |
| Devin | Stack Cognition (misto) | forte auto-reportado no Junior-SWE | n/d | Reporta taxa de aprovação no Junior-SWE, não Verified diretamente |
| Cursor BG | Frontier escolhido pelo utilizador | herda a pontuação do modelo | herda | A pontuação depende do modelo que escolher |
| Copilot CA | GPT/Claude (limitado por tier) | herda | herda | Seleção de modelos bloqueada por tier |
| Jules | Gemini 2.5/3 | não reportado oficialmente | não reportado oficialmente | Menos transparência de benchmarks |
| Factory Droids | Roteamento multi-modelo | herda por Droid | herda | Droids diferentes usam modelos diferentes |
Para uma vista agregadora, a matriz de agentes de programação da artificialanalysis.ai acompanha os números de benchmarks contínuos entre fornecedores.
Os benchmarks são o chão, não o teto. Vimos o Cursor BG com Opus 4.7 superar o Devin no mesmo ticket; o caso de uso importa. Se está a construir o seu próprio caso de uso de agente em vez de comprar, a nossa comparação LangGraph vs CrewAI vs OpenAI Agents SDK percorre as escolhas de framework que determinam a distância entre a pontuação do modelo e a taxa de sucesso real.
É seguro dar acesso total ao repositório a agentes de programação em segundo plano?
Cada ferramenta isola de forma diferente. O Devin corre uma VM com sandbox completa. O Codex usa uma sandbox cloud gerida pela OpenAI. O Cursor arranca máquinas remotas efémeras. O Copilot usa runners geridos pelo GitHub (aplica-se o seu modelo de segurança existente do GitHub Actions). O Claude Code Remote corre na cloud da Anthropic. A Factory oferece cloud ou local air-gapped. Nenhuma é "dar-lhe root em produção".
| Ferramenta | Ambiente de execução | Egress de rede | Estado persistente | Opção air-gapped |
|---|---|---|---|---|
| Devin | VM com sandbox completa (IDE+browser próprios) | Sim, limitado | Por sessão | Não |
| Cursor BG | VM cloud efémera | Sim | Não | Não |
| Codex Cloud | Sandbox cloud da OpenAI | Sim, limitado | Não | Não |
| Claude Code Remote | Cloud da Anthropic | Sim, limitado | Sessões de agente persistentes | Não |
| Copilot CA | Runner gerido pelo GitHub | Herda a config do Actions | Por execução | Só Enterprise |
| Jules | VM cloud da Google | Sim | Por tarefa | Não |
| Factory Droids | Cloud OU local | Configurável | Configurável | Sim |
Que perguntas de nível CTO fazer antes da adoção
Antes de conceder acesso ao repositório a qualquer um destes agentes, quatro perguntas decidem a política:
- Permissões de repositório, o agente tem acesso de escrita à main, ou está limitado a feature branches? Limite sempre a feature branches mais uma revisão de PR obrigatória.
- Acesso a segredos, o agente consegue ler ficheiros
.envou chamar o seu gestor de segredos? Negação por defeito e tokens com âmbito limitado. - Egress de rede, para onde pode a sandbox ligar? Rede com negação por defeito e uma allowlist para registos de pacotes e o seu mirror privado.
- Retenção de audit log, durante quanto tempo são retidas as sessões do agente, e pode a sua equipa de segurança consultá-las? Fixe isto por escrito antes de conceder.
Os agentes de programação em segundo plano treinam com o meu código?
O opt-in/opt-out por defeito varia. Os planos enterprise do OpenAI Codex não treinam com o seu código por defeito. O Anthropic Claude Code não treina com o seu código. O GitHub Copilot Business e Enterprise têm exclusão de dados. O Cursor oferece modo de privacidade. O Devin afirma que o código permanece sob controlo do cliente. Verifique sempre a política de uso de dados atual na documentação do fornecedor antes de conceder acesso ao repositório.
A linha única por ferramenta, com o comportamento por defeito atual:
- Devin, o código permanece sob controlo do cliente, segundo a política da Cognition
- Cursor, interruptor de modo de privacidade, opt-in para qualquer treino
- Codex Cloud, sem treino por defeito no enterprise; o ChatGPT Plus está sujeito aos termos de consumidor
- Claude Code Remote, sem treino com o seu código segundo os termos comerciais da Anthropic
- Copilot Business/Enterprise, exclusão de dados ativa por defeito; Pro/Pro+ têm um interruptor separado
- Jules, aplicam-se os termos de dados enterprise padrão da Google; verifique a política atual
- Factory Droids, sob controlo do cliente segundo a sua documentação; o local air-gapped elimina a questão
As políticas mudaram várias vezes em 2025-26. Reconfirme antes de conceder acesso; os fornecedores atualam os termos mais vezes do que os posts de blog são atualizados. Quando o PR de um agente em segundo plano aterrar, vai querer uma passagem estruturada de revisão de código por IA antes do merge; a questão de IP não desaparece porque o fornecedor do agente a tratou.
Como a Techsy escolhe agentes em segundo plano para projetos de clientes
Em projetos de clientes da Techsy usamos um stack em camadas em vez de escolher uma ferramenta. Os Cursor Background Agents tratam do trabalho async no IDE (os engenheiros já vivem no Cursor de qualquer forma). As Claude Code Remote Tasks correm tarefas agendadas estilo cron: atualizações semanais de dependências, passagens noturnas de QA, o trabalho aborrecido que deve ser automatizado. O Codex Cloud trata do throughput barato em tokens em lint e atualizações de deps onde a velocidade bate as pontuações de benchmark. Escolhemos o Devin para clientes que precisam de autonomia total de delegação e têm backlogs bem delimitados.
O que não usamos muito: o Copilot Coding Agent. O orçamento de premium-requests no Pro esgota-se mais depressa do que as alternativas ao nosso nível de utilização, e ainda não temos clientes Enterprise suficientes para justificar o upgrade. Construiríamos um caso de uso personalizado com LangGraph ou o OpenAI Agents SDK antes de nos prendermos a um único fornecedor para um rollout enterprise, mas para 80% do trabalho greenfield de clientes, as ferramentas prontas acima são mais rápidas do que fazer o nosso próprio. A plataforma de deployment de IA agêntica que usamos trata dos agentes que estas ferramentas produzem em produção.
Se quiser uma consulta gratuita sobre qual o agente de programação em segundo plano que se adequa ao seu stack, ou um caso de uso de agente personalizado, teremos todo o gosto em delimitá-lo.
FAQ, Agentes de Programação em Segundo Plano Comparados
O que é um agente de programação em segundo plano?
Um agente de programação em segundo plano é um engenheiro de software de IA que corre de forma assíncrona num ambiente cloud com sandbox. Atribui-lhe uma tarefa, um issue do GitHub, um ticket do Linear ou uma mensagem no Slack, e ele trabalha sozinho durante minutos ou horas, devolvendo depois um pull request para revisão. O traço definidor é que não o vê a escrever; trabalha enquanto você está noutro lugar.
Qual é a diferença entre um agente de programação em segundo plano e o Cursor ou Copilot inline?
Os agentes em segundo plano correm em async numa sandbox cloud e devolvem pull requests. Ferramentas inline como o Cursor e o Copilot sugerem código à medida que escreve, no seu editor, com você a controlar cada tecla. Os agentes em segundo plano permitem paralelismo (5 tarefas em fila, 5 PRs) enquanto os agentes inline permitem iteração rápida numa única tarefa em que está focado.
Quanto custam os agentes de programação em segundo plano por tarefa?
O Devin custa $4,50-6,75 por uma correção de bug típica a 2-3 ACUs. O Cursor e o Codex Cloud faturam pelo consumo de tokens, tipicamente $0,30-3 por tarefa dependendo do modelo e do comprimento do contexto. O Jules é grátis até 15 tarefas por dia. O Copilot Coding Agent usa premium requests a cerca de $0,04 cada no tier Pro, a opção mais barata por tarefa entre os planos pagos.
Qual o agente de programação em segundo plano mais barato para devs a solo?
O tier gratuito do Google Jules não tem rival: 15 tarefas por dia com 3 agentes em simultâneo a $0/mês. Se o ultrapassar, o Cursor Pro a $20/mês com $20 de utilização incluída é o passo seguinte e dá-lhe integração de editor como bónus. Para a maioria dos devs a solo, o Jules cobre as necessidades diárias sem nunca pagar.
É seguro dar acesso total ao repositório a agentes de programação em segundo plano?
Sim, com ressalvas. Use tokens com âmbito limitado (não o seu personal access token), negação por defeito de egress de rede com uma allowlist, limite o agente a feature branches com revisão de PR obrigatória, e reveja os audit logs semanalmente. Nunca conceda permissões de escrita em produção a nenhum destes agentes. Trate o agente como um contratado: confie, mas verifique cada PR.
Os agentes de programação em segundo plano treinam com o meu código?
O Anthropic Claude Code, os planos enterprise do OpenAI Codex e o GitHub Copilot Business/Enterprise não treinam com o seu código por defeito. O Cursor oferece modo de privacidade. O Devin afirma que o código permanece sob controlo do cliente. Verifique sempre a política de uso de dados atual na documentação do fornecedor antes de conceder acesso ao repositório; as políticas mudaram várias vezes em 2025-26.
Um agente de programação em segundo plano pode fazer merge dos seus próprios pull requests?
A maioria pode se conceder a permissão, mas todas as equipas que conhecemos exigem revisão humana antes do merge. A capacidade técnica existe; o Copilot, o Devin e o Cursor conseguem todos fazer auto-merge se a proteção de branches o permitir, mas o auto-merge é uma armadilha. A porta de revisão de PR é a última rede de segurança barata antes de um erro do agente chegar a produção.
Qual o melhor agente de programação em segundo plano para equipas enterprise?
Duas respostas dependendo do seu ambiente. Se já está profundamente no GitHub Enterprise, o Copilot Coding Agent é a escolha de menor fricção; a atribuição de issues é o fluxo de trabalho, sem ferramentas extra. Se tem requisitos de governação, conformidade ou air-gapped, o Factory Droids é a única opção com execução local e coordenação multi-agente entre programar, testar, rever e fazer deploy.
Qual o agente de programação em segundo plano com o melhor tier gratuito?
O Google Jules ganha isto sem contestação. 15 tarefas por dia, 3 agentes em simultâneo, acesso total ao Gemini, a $0/mês sem limite de tempo. O tier Free do Copilot (50 premium requests/mês) é um distante segundo; o tier Hobby do Cursor é tecnicamente grátis mas não cobre de forma significativa o uso de agentes em segundo plano. O Jules é o único tier gratuito que vimos substituir um plano pago para trabalho a solo.
Quando devo usar um agente em segundo plano vs uma IA inline como o Cursor?
Use um agente em segundo plano quando a tarefa é bem delimitada, demora mais de 15 minutos e não precisa de corrigir o rumo a meio da edição: upgrades de dependências, refactors repetitivos, migrações multi-ficheiro, ou qualquer coisa que consiga descrever num ticket claro. Use inline quando está a prototipar, a explorar ou a fazer pair-programming com o modelo em trabalho novo.
As conclusões
- Devin se delega, Cursor BG se vive no Cursor, Codex Cloud se é utilizador do ChatGPT Pro, Claude Code Remote para benchmarks, Copilot para nativo do GitHub, Jules para tier gratuito, Factory para conformidade.
- A volatilidade de preços é real; o corte do Devin em abril de 2026, a reforma de tokens do Codex e a pausa de subscrições do Copilot aconteceram todos este mês. Verifique antes de comprar.
- A categoria async tem um ano e lança depressa. Espere que esta matriz volte a mudar antes do verão.
Quer ajuda para escolher ou ligar um agente em segundo plano ao seu stack? Obtenha uma consulta gratuita.