
8 Agentes de Código en Segundo Plano Comparados: Precios, Benchmarks y Para Quién (Abril 2026)
Los agentes de código en segundo plano pasaron de demo de investigación a producto masivo en doce meses. Cognition acaba de recortar el precio mínimo de Devin de 500 a 20 $/mes este abril, OpenAI reformó la facturación de Codex el 2 de abril, y Factory cerró una Serie C de 150 millones de dólares hace dos semanas. Probamos los ocho en producción este mes con trabajo interno de Techsy, y los números a continuación son los que realmente pagamos. No vendemos ninguna de estas herramientas y no tenemos enlaces de afiliados — todos los demás resultados en el top 10 para esta búsqueda los publica algún proveedor de los agentes de la lista.
| Herramienta | Precio inicial | Modelo base | Sandbox / nube | Nativo en GitHub | Ideal para | Dato clave |
|---|---|---|---|---|---|---|
| Devin | 20 $/mes + 2,25 $/ACU | Stack de Cognition | VM completa (IDE+navegador propios) | PR vía GH App | Delegar backlog completo | ~5 $ por tarea de corrección de bugs |
| Cursor BG Agents | 20 $/mes (Pro) | Modelo frontier a elección | VM efímera en la nube | PR vía integración | Usuarios de Cursor que quieren async | Hasta 8 agentes en paralelo |
| Codex Cloud | 20 $/mes (Plus) → 200 $ (Pro) | OpenAI gpt-5-codex | Sandbox en la nube de OpenAI | PR vía Codex CLI / web | Power users de ChatGPT Pro | 77,3 % en Terminal-Bench 2.0 |
| Claude Code Remote | 20 $/mes (Pro) → 200 $ (Max 20x) | Claude Opus 4.7 | Nube de Anthropic | PR vía GH App | Power users de Claude Code + cron | 87,6 % en SWE-bench Verified |
| Copilot Coding Agent | 10 $/mes (Pro) → 39 $ (Enterprise) | GPT/Claude (según nivel) | Runner gestionado por GitHub | Nativo (issue → PR) | Equipos en GH Enterprise/Business | Integración más profunda con GitHub |
| Google Jules | Gratis (15/día) → 19,99 $+ | Gemini | VM en la nube de Google | PR vía integración | Devs solos / equipos pequeños | Mejor nivel gratuito de la categoría |
| Factory Droids | 20 $/mes (2 puestos) | Enrutamiento multi-modelo | Nube + opción local | PR vía integración | Industrias reguladas | Clientes: NVIDIA, Adobe, Bayer |
| Menciones honoríficas | variable | variable | variable | variable | OSS / pipelines propios | OpenHands, Antigravity, Aider |
Precios a 26/04/2026. Los planes por tokens y ACUs se facturan sobre la tarifa base. Verifica antes de comprar — consulta los enlaces de proveedor en la sección de cada herramienta. Para generación en proyectos nuevos en lugar de trabajar en un repositorio existente, consulta nuestra comparación de lovable vs bolt vs v0.
¿Qué es un agente de código en segundo plano?
Un agente de código en segundo plano es un ingeniero de software basado en IA que trabaja de forma asíncrona dentro de un entorno sandbox en la nube. Le asignas una tarea — un issue de GitHub, un ticket de Linear, un mensaje de Slack — y trabaja solo durante minutos u horas, para luego devolverte un pull request para revisar. Tú no lo ves escribir.
Eso es lo que los distingue. Las herramientas inline como Cursor y Copilot sugieren mientras tú escribes; los agentes de IA en segundo plano se ponen en cola, ejecutan y reportan resultados. El ciclo de vida es el mismo en todas las herramientas de esta lista: ticket → sandbox en la nube → edición autónoma → PR → revisión humana.
La categoría existe porque la capacidad agéntica de largo alcance maduró a finales de 2024 con el lanzamiento de Devin, y en 2025 llegaron Codex Cloud, Cursor Background Agents y Jules. Las Claude Code Remote Tasks de Anthropic se lanzaron el 20 de marzo de 2026, y la modalidad "ponlo y olvídalo" ya es corriente principal.
¿Por qué importa el "ponlo y olvídalo"? Por el paralelismo. Puedes poner en cola cinco tickets bien definidos el viernes por la tarde y tener cinco PRs listos para revisar el lunes por la mañana. Eso es un flujo de trabajo distinto al de programar en pareja con un modelo — más parecido a gestionar un ingeniero junior que a escribir código a su lado. La gente también busca específicamente "soporte de agente en segundo plano de claude code", por eso cubrimos Claude Code Remote Tasks aquí y no solo Devin. El lado inline lo cubrimos por separado en nuestro análisis de la división entre agentes inline y en segundo plano entre Claude Code, Cursor y Copilot. Para una explicación de arquitectura a nivel de categoría, el artículo introductorio de Tembo es un buen punto de partida.
Agentes en segundo plano vs. inline — ¿cuándo gana lo asíncrono?
Los agentes async en segundo plano ganan cuando una tarea dura más de 15 minutos y no necesitas corregir el rumbo a mitad de camino — correcciones de bugs bien definidas, actualizaciones de dependencias, refactorizaciones repetitivas, migraciones de múltiples archivos. Los agentes inline como Cursor o Copilot ganan cuando estás explorando, haciendo prototipos o programando en pareja con el modelo y necesitas reaccionar en tiempo real.
Esa es la idea central. La matriz de decisión de abajo es cómo elegimos en los proyectos de Techsy:
| Usa async (segundo plano) cuando… | Usa inline (Cursor/Copilot) cuando… |
|---|---|
| La tarea está bien definida (issue con criterios de aceptación) | Estás explorando o haciendo prototipos |
| El trabajo estimado supera los 15 min | Necesitas corregir el rumbo a mitad |
| Quieres paralelizar 3 o más tareas | Quieres una sesión enfocada |
| Estás bien con revisar el PR después | Quieres ver sugerencias mientras escribes |
| La tarea es repetitiva (deps, migraciones, lint) | La tarea es novedosa y creativa |
En concreto: "Actualicé 47 paquetes y corregí los cambios incompatibles" es un trabajo típico para agentes de código async — bien definido, mecánico, paralelizable. "Construí una nueva ruta de dashboard" es inline — iterarás sobre el layout, los textos y los casos borde sobre la marcha.
El traspaso entre sync y async
La mayoría de los equipos con los que trabajamos acaban usando ambos. Cursor inline para código nuevo, Cursor Background Agents para actualizaciones. Claude Code interactivo para trabajo de arquitectura, Claude Code Remote Tasks para el cron semanal de bumps de dependencias. El traspaso es el flujo de trabajo — ninguna herramienta reemplaza a la otra. Si te quedas en tu editor, el análisis de Windsurf vs Cursor cubre el lado sync con detalle.
Si tu tarea dura más de 15 minutos y no necesitas observar — async gana.
Devin (Cognition) — el líder en autonomía
Devin es el agente en segundo plano más autónomo del mercado — Cognition le da una VM completa con su propio IDE, navegador y terminal. El precio bajó de un mínimo de 500 $/mes a 20 $/mes + 2,25 $ por Agent Compute Unit (ACU) en abril de 2026, lo que lo convirtió en el gran titular del mes en cuanto a agentes de código autónomos.
Precios. Core 20 $/mes + 2,25 $/ACU. Team 500 $/mes con 250 ACUs incluidas más ACUs adicionales a 2 $ cada una. 1 ACU equivale aproximadamente a 15 minutos de trabajo. Una corrección de bug típica consume 2-3 ACU, es decir, entre 4,50 y 6,75 $. Una migración de múltiples archivos puede llegar a más de 30 ACU, es decir, 67,50 $ o más. (devin.ai/pricing, a 26/04/2026.)
Puntos fuertes. La mayor autonomía de la lista. La VM incluye un navegador, así que Devin puede leer documentación y Stack Overflow sin que tú le alimentes el contexto. Producto maduro — Cognition lanzó en marzo de 2024 y lleva dos años refinando los prompts que hacen que Devin sea realmente útil.
Puntos débiles. Los costes de ACU se vuelven impredecibles en trabajos novedosos. Menos control a mitad de tarea que Codex o Cursor — defines la tarea y te vas, lo cual está bien hasta que Devin gasta 8 ACU depurando un error tipográfico. Necesita criterios de aceptación precisos; los tickets vagos producen PRs vagos.
Elige esto si: quieres delegar items del backlog bien definidos de principio a fin y tu equipo sabe escribir criterios de aceptación claros.
Cursor Background Agents
Los Background Agents de Cursor se ejecutan de forma asíncrona dentro del editor Cursor — hasta 8 en paralelo, activables desde Slack, Linear, GitHub o desde el propio editor. Usan el modelo frontier que tú selecciones, así que el coste depende del consumo de tokens, no de una tarifa ACU fija. Pro es 20 $/mes con 20 $ de uso incluido.
Precios. Hobby 0 $, Pro 20 $/mes (incluye 20 $ de uso), Pro+ 60 $/mes (70 $ de uso), Ultra 200 $/mes (400 $ de uso), Teams 40 $/usuario/mes. Los agentes en segundo plano facturan el uso por encima — modelo + longitud de contexto + longitud de salida. (cursor.com/pricing, a 26/04/2026. La funcionalidad de Background Agents se lanzó en Cursor 0.50.)
Puntos fuertes. La integración con el editor más estrecha de la lista — tu sesión inline, tu agente en segundo plano y tus reglas viven en una sola herramienta. Hasta 8 agentes en paralelo significa que puedes distribuir una refactorización entre módulos y reconverger en minutos. Los disparadores de Slack, Linear y GitHub responden a la pregunta "qué agente en segundo plano funciona con Linear y Slack" — Cursor, de forma nativa.
Puntos débiles. El consumo de tokens con modelos frontier agota los 20 $ incluidos más rápido de lo que piensas; una sesión intensiva con Opus puede acabar con el presupuesto. El coste por tarea es opaco a menos que revises el dashboard de uso, lo que la mayoría de los equipos no hace hasta que llega la factura.
Elige esto si: ya vives en Cursor y quieres async sin cambiar de herramienta — y estás dispuesto a revisar el dashboard de uso una vez por semana. Tus Cursor Rules alimentan tanto las sesiones inline como las de background, así que el coste de configuración es casi nulo si ya eres usuario de Cursor.
Codex Cloud (OpenAI)
Codex Cloud es el agente de código async de OpenAI. Describes una tarea, Codex levanta una VM sandbox, clona tu repositorio y devuelve un PR. Lidera Terminal-Bench 2.0 con 77,3 %, funciona a ~240 tokens/seg (unas 2,5 veces más rápido que Opus) y cambió a facturación por tokens el 2 de abril de 2026.
Precios. Incluido en ChatGPT Plus (20 $/mes). Nuevo nivel Pro 100 $/mes (5x uso Plus; promocional 2x = 10x hasta el 31 de mayo de 2026). Pro 200 $/mes. Facturación por tokens desde 2026-04-02. Codex CLI es open source y gratuito con BYOK. El coste real se sitúa entre 100 y 200 $/dev/mes para usuarios activos. (developers.openai.com/codex/pricing, cobertura de TechCrunch sobre el nivel Pro de 100 $, a 26/04/2026.)
Puntos fuertes. Campeón en rendimiento a ~240 tps — en tareas intensivas en tokens como actualizaciones de dependencias en muchos archivos, Codex termina mientras Claude todavía está procesando. La CLI es open source y funciona con tu propia API key, así que puedes integrar Codex en CI sin pagar ChatGPT Pro. La distribución es enorme: todo usuario de ChatGPT Plus ya lo tiene.
Puntos débiles. La facturación por tokens es genuinamente difícil de predecir de una tarea a otra. La reforma del 2 de abril invalida las comparaciones anteriores — cualquier cosa que hayas leído antes de esa fecha está equivocada en cuanto al precio. La CLI se siente como un producto separado de Codex web; la integración es suelta.
Elige esto si: eres usuario de ChatGPT Pro que quiere un agente en la nube profundamente integrado — o un fanático de la CLI que quiere traer su propia key.
# Enviar una tarea a Codex Cloud desde la CLI
codex task create \
--repo "techsy-io/example-app" \
--branch "main" \
--prompt "Bump all dependencies to latest and fix breaking changes" \
--watchClaude Code Remote Tasks (Anthropic)
Las Claude Code Remote Tasks te permiten definir un repositorio de GitHub, un prompt y un horario — Claude se ejecuta de forma autónoma en la nube de Anthropic y abre un PR cuando termina. Se lanzó el 20 de marzo de 2026. Está respaldado por el 87,6 % de Opus 4.7 en SWE-bench Verified, el líder de categoría, y el 64,3 % en SWE-bench Pro. Esta es la respuesta a la búsqueda "soporte de agente en segundo plano de claude code" — es un producto real ya disponible.
Precios. Incluido en los planes Claude Code Pro/Max. Pro 20 $/mes, Max 5x 100 $/mes, Max 20x 200 $/mes. Los usuarios intensivos pagan entre 100 y 200 $/mes en la práctica. (claude.com/code, platform.claude.com/docs/en/managed-agents/overview, a 26/04/2026.)
Puntos fuertes. La puntuación más alta de SWE-bench Verified de la lista (87,6 %). Sesiones de agente con estado persistente — una Remote Task puede retomar donde lo dejó en lugar de empezar en frío en cada ejecución. Se integra con hooks y el ecosistema de herramientas de Claude Code, así que skills, slash commands y sub-agentes existentes funcionan igual que en sesiones interactivas.
Puntos débiles. La entrada más reciente de la lista — menos patrones de integración documentados que Devin o Codex, menos ejemplos de la comunidad que copiar. Orientado a la CLI; sin interfaz gráfica, lo que eleva la barrera de entrada para los ingenieros del equipo que no usan CLI.
Elige esto si: eres un power user de Claude Code y quieres tareas programadas recurrentes — actualizaciones semanales de dependencias, refactorizaciones al estilo cron, pasadas de QA bajo demanda. Puedes conectar Claude Code hooks a las Remote Tasks de la misma forma que en sesiones interactivas, y las Remote Tasks fueron una de las funcionalidades filtradas-luego-lanzadas que cubrimos en marzo.
# Programar una Remote Task recurrente en Claude Code
claude-code remote create \
--repo "techsy-io/example-app" \
--schedule "weekly" \
--prompt "Bump deps, run tests, open PR if green"Copilot Coding Agent (GitHub)
Copilot Coding Agent convierte un issue de GitHub en un pull request — asignas el agente como asignarías a un compañero de equipo. Es el flujo de trabajo más nativo de GitHub en esta lista. Nota: a partir del 20 de abril de 2026, GitHub pausó los nuevos registros en Pro y Pro+; los suscriptores existentes y los niveles Business/Enterprise no se ven afectados.
Precios. Free 0 $, Pro 10 $/mes, Pro+ 39 $/mes, Business 19 $/usuario/mes, Enterprise 39 $/usuario/mes. Basado en solicitudes premium: Free 50/mes, Pro 300/mes, Pro+ 1500/mes, Enterprise 1000/usuario/mes. Nuevos registros en Pro/Pro+/estudiantes pausados desde el 20/04/2026 — Business/Enterprise siguen abiertos. (github.com/features/copilot/plans, a 26/04/2026.)
Puntos fuertes. La integración más profunda con GitHub de la categoría. Issue a PR es el flujo más nativo — sin app adicional, sin dashboard adicional, el agente aparece como un asignado en la misma interfaz que ya usas. La actualización de Code Review de marzo de 2026 puede transferir automáticamente los comentarios de revisión al agente de código, cerrando el bucle sin salir de GitHub.
Puntos débiles. Selección de modelos limitada en los niveles más bajos — no puedes elegir Opus en Pro, por ejemplo. El presupuesto de solicitudes premium en Pro (300 solicitudes/mes) se agota rápido si estás enviando código a diario. La pausa en los nuevos registros añade fricción para nuevos suscriptores individuales.
Elige esto si: tu equipo ya está en GitHub Business o Enterprise y quieres código async sin configuración. Los puestos existentes pueden usar el agente hoy; la pausa solo bloquea nuevos registros individuales.
Google Jules
Jules es el agente de código async de Google — una VM impulsada por Gemini con el mejor nivel gratuito de la categoría (15 tareas diarias, 3 simultáneas). Escanea proactivamente tu repositorio en busca de comentarios #TODO y ofrece correcciones. Los planes de pago empiezan en 19,99 $/mes, pero los precios han cambiado varias veces en 2026.
Precios. Gratuito: 15 tareas diarias / 3 simultáneas. Pro desde 19,99 $/mes. Ultra desde 124,99 $/mes. Los precios han cambiado varias veces en 2026 — verifica los números actuales en jules.google antes de comprar. (jules.google, cobertura de TechCrunch sobre la GA de agosto de 2025, a 26/04/2026.)
Puntos fuertes. El mejor nivel gratuito de la categoría, sin discusión. 15 tareas al día con 3 simultáneas es genuinamente útil para trabajo individual, no un gancho publicitario. La mejor UX de la lista para usuarios no avanzados — el bucle de "escaneo de TODOs" es novedoso y aflora trabajo de limpieza real sin que tú lo solicites.
Puntos débiles. La volatilidad de precios es el riesgo principal; hemos visto el precio del nivel Pro cambiar dos veces este año. Ecosistema de integración menos maduro que Devin o Codex — menos hooks para Slack/Linear/Jira, menos herramientas de la comunidad.
Elige esto si: eres un dev en solitario o un equipo pequeño que quiere async sin comprometerse con un plan de pago desde el primer día — el nivel gratuito de Jules es genuinamente útil, no un cebo.
Factory Droids (Factory.ai)
Los "Droids" de Factory son agentes autónomos especializados que codifican, prueban, revisan y despliegan — con opciones de ejecución en la nube y local. Factory cerró una Serie C de 150 millones de dólares el 16 de abril de 2026, y lista como clientes a NVIDIA, Adobe, Bayer, EY, MongoDB y Zapier. Los precios empiezan en 20 $/mes para dos puestos.
Precios. Los planes de pago empiezan en 20 $/mes (incluye 2 puestos de equipo), 5 $ por puesto adicional. Enrutamiento multi-Droid — distintos Droids para código, pruebas, revisión, despliegue. (factory.ai/pricing, docs.factory.ai/pricing, cobertura de la financiación via SiliconANGLE, a 26/04/2026.)
Puntos fuertes. Los logos de clientes apuntan a sectores regulados — sanidad, banca, semiconductores. La opción de ejecución en la nube O local es la única alternativa con capacidad on-premise de la categoría, algo crítico para equipos que no pueden enviar código a una nube de terceros. La coordinación multi-agente entre código/pruebas/revisión/despliegue es genuinamente distinta del modelo de agente único que usan los demás.
Puntos débiles. Menos reconocimiento de marca que Devin o Codex, así que el buy-in interno lleva más tiempo. Excesivo para devs en solitario — la orquestación multi-Droid es una carga que no necesitas en un proyecto personal.
Elige esto si: eres una organización de ingeniería mediana o grande con requisitos de gobernanza, cumplimiento o despliegue aislado de la red.
Menciones honoríficas — OpenHands, Antigravity, Aider
Tres opciones dignas de conocer: OpenHands es el agente en segundo plano open source más popular y con alojamiento propio — elige esto si quieres control total o funcionamiento aislado de la red. Google Antigravity es la otra propuesta de Google, menos publicitada. Aider es técnicamente un agente CLI síncrono, pero cada vez más se usa en pipelines asíncronos mediante scripts de shell y hooks de CI. Ninguno tiene la autonomía de Devin aún.
OpenHands es open source con licencia tipo MIT, alojado en tu propia infraestructura. La contrapartida es que mantienes el sandbox tú mismo — políticas de seguridad, gestión de secretos, tiempo de actividad del runner, todo corre por cuenta de tu equipo. La adopción real es más fuerte en entornos regulados y académicos donde los agentes en la nube son inviables.
Antigravity (Google) es el hermano más discreto de Jules — mismo modelo de VM, menos empuje de marketing, aparece principalmente en recopilaciones. La tracción en producción es escasa a abril de 2026.
Aider es esencialmente un agente CLI síncrono, pero los equipos lo encadenan cada vez más dentro de CI para imitar el comportamiento en segundo plano — una GitHub Action dispara Aider con un prompt, Aider hace el commit, el workflow abre un PR. Funciona con cualquier modelo vía API y es BYOK por defecto, así que es la opción de "estilo background" más barata si tienes infraestructura de CI disponible.
Dos más que vigilar: Manus y Genie. Ambos son entradas más recientes con poca señal de adopción real a abril de 2026. Vale la pena seguirlos, pero no comprometerse aún.
¿Qué agente de código en segundo plano deberías elegir?
Elige según tu restricción más importante. Si es el presupuesto, gana el nivel gratuito de Jules. Si es el flujo nativo de GitHub, gana Copilot Coding Agent. Si es la autonomía en tickets bien definidos, gana Devin. Si son los benchmarks brutos, Claude Code Remote lidera SWE-bench Verified con un 87,6 %. Si es el cumplimiento normativo, Factory Droids. Si es la integración con el editor, Cursor.
| Tu prioridad | Elige | Por qué |
|---|---|---|
| Inicio más barato | Google Jules | Nivel gratuito con 15 tareas/día |
| GitHub-nativo sin configuración | Copilot Coding Agent | Issue → PR es el flujo de asignación |
| Mayor autonomía | Devin | VM completa, navegador, patrones de delegación maduros |
| Mejores puntuaciones en benchmarks | Claude Code Remote | 87,6 % en SWE-bench Verified (Opus 4.7) |
| Velocidad / rendimiento | Codex Cloud | ~240 tps, líder en Terminal-Bench 2.0 |
| Usuarios que ya están en Cursor | Cursor BG Agents | 8 en paralelo, disparadores de Slack/Linear |
| Industria regulada | Factory Droids | Cumplimiento + ejecución local |
| Self-host / OSS | OpenHands | Control total, opción aislada de la red |
Recomendación de stack por tamaño de equipo y presupuesto
Dev en solitario — empieza con el nivel gratuito de Jules para los casos obvios, pasa a Cursor Pro por 20 $/mes cuando superes las 15 tareas/día. Total: 0-20 $/mes.
Equipo pequeño (2-10 devs) — Cursor Pro para inline más Background Agents, más Claude Code Pro para tareas programadas al estilo cron. Total: 40 $/dev/mes.
Enterprise (50+ devs) — Copilot Enterprise para el flujo nativo de GitHub en la mayoría de los tickets, más Factory Droids para cargas de trabajo con requisitos de gobernanza. Total: 39 $ + 20-50 $/dev/mes según el número de puestos en Factory.
¿Cuánto cuesta cada agente de código en segundo plano por tarea?
El coste real por tarea varía mucho porque cada proveedor factura de forma distinta. Devin cobra entre 4,50 y 6,75 $ por una corrección de bug típica (2-3 ACUs). Cursor y Codex facturan por consumo de tokens — espera entre 0,30 y 3 $ por tarea según el modelo y el contexto. Jules es gratuito hasta 15 tareas/día. Copilot usa solicitudes premium a aproximadamente 0,04 $ cada una en el nivel Pro.
| Herramienta | Modelo de facturación | Corrección de bug típica | Refactorización multi-archivo | ¿Nivel gratuito? |
|---|---|---|---|---|
| Devin | 2,25 $/ACU (1 ACU ≈ 15 min) | 4,50-6,75 $ (2-3 ACU) | 67,50 $+ (30 ACU) | No |
| Cursor BG | Por tokens, con presupuesto incluido | ~0,30-1,50 $ | 3-15 $ | Nivel Hobby |
| Codex Cloud | Por tokens desde el 2 abr 2026 | ~0,20-1 $ | 2-10 $ | No (en Plus) |
| Claude Code Remote | Incluido en planes Pro/Max | ~0,50-2 $ (contra cuota) | 5-20 $ (contra cuota) | No |
| Copilot Coding Agent | Por solicitudes premium (~0,04 $ c/u en Pro) | 1-3 solicitudes | 5-20 solicitudes | Gratis 50/mes |
| Jules | Nivel gratuito o plan plano | 0 $ | Cuenta contra el diario | 15/día gratis |
| Factory Droids | Por puesto | Incluido | Incluido | No |
Precios a 26/04/2026. Las estimaciones de tokens asumen modelos frontier con contexto de tarea promedio. Verifica siempre contra tu dashboard de uso.
"Coste típico de corrección de bug por agente de código en segundo plano (abril 2026)"
Tabla de datos
| "USD por tarea" | "Corrección de bug típica" |
|---|---|
| "Jules (nivel gratuito)" | 0 |
| "Codex Cloud" | 0.6 |
| "Cursor BG" | 0.9 |
| "Claude Code Remote" | 1.2 |
| "Copilot CA (solicitudes premium Pro)" | 0.12 |
| "Devin" | 5.6 |
| "Factory Droids" | 0 |
Estimaciones para una tarea típica de corrección de bug equivalente a 2-3 ACU / tokens. El coste real varía según la selección del modelo y la longitud del contexto. Las herramientas con nivel gratuito o facturación por puesto muestran un coste marginal de 0 $.
La lección de estos números: Devin cuesta entre 5 y 10 veces más por tarea que la competencia facturada por tokens. Esa prima te compra autonomía — menos prompts que escribir, menos supervisión a mitad de tarea — pero en correcciones de bugs rutinarias, Codex o Cursor gana en coste puro.
¿Qué agente de código en segundo plano tiene las mejores puntuaciones en benchmarks?
El Claude Opus 4.7 de Anthropic lidera SWE-bench Verified con un 87,6 %, con el gpt-5-codex de Codex en torno al 77-80 %. Codex lidera Terminal-Bench 2.0 con un 77,3 %. Pero los benchmarks miden lo que el modelo subyacente puede hacer — tu tasa de éxito real depende tanto del harness del agente, el sandbox y el prompt como del modelo.
| Herramienta | Modelo subyacente | SWE-bench Verified | Terminal-Bench 2.0 | Notas |
|---|---|---|---|---|
| Claude Code Remote | Claude Opus 4.7 | 87,6 % | n/a (varía) | Mayor puntuación Verified |
| Codex Cloud | gpt-5-codex | ~77-80 % | 77,3 % | Líder en Terminal-Bench |
| Devin | Stack de Cognition (mixto) | Auto-reportado fuerte en Junior-SWE | n/a | Reporta tasa de paso Junior-SWE, no Verified directamente |
| Cursor BG | Frontier seleccionado por el usuario | Hereda la puntuación del modelo | Hereda | La puntuación depende del modelo que elijas |
| Copilot CA | GPT/Claude (según nivel) | Hereda | Hereda | Selección de modelo bloqueada por nivel |
| Jules | Gemini 2.5/3 | No reportado oficialmente | No reportado oficialmente | Menor transparencia en benchmarks |
| Factory Droids | Enrutamiento multi-modelo | Hereda por Droid | Hereda | Distintos Droids usan distintos modelos |
Para una vista agregada, la matriz de agentes de código de artificialanalysis.ai hace un seguimiento de las puntuaciones de benchmark actualizadas de todos los proveedores.
Los benchmarks son el suelo, no el techo. Hemos visto a Cursor BG con Opus 4.7 superar a Devin en el mismo ticket — el harness importa. Si estás construyendo tu propio harness en lugar de comprar uno, nuestra comparación de LangGraph vs CrewAI vs OpenAI Agents SDK explica las decisiones de framework que generan la brecha entre la puntuación del modelo y el rendimiento real.
¿Es seguro darle a un agente de código en segundo plano acceso completo al repositorio?
Cada herramienta aísla de forma distinta. Devin ejecuta una VM completamente aislada. Codex usa un sandbox en la nube gestionado por OpenAI. Cursor levanta máquinas remotas efímeras. Copilot usa runners gestionados por GitHub (aplica tu modelo de seguridad de GitHub Actions existente). Claude Code Remote se ejecuta en la nube de Anthropic. Factory ofrece nube o local aislado. Ninguno es "dale root en producción".
| Herramienta | Entorno de ejecución | Egreso de red | Estado persistente | Opción aislada |
|---|---|---|---|---|
| Devin | VM completamente aislada (IDE+navegador propios) | Sí, acotado | Por sesión | No |
| Cursor BG | VM efímera en la nube | Sí | No | No |
| Codex Cloud | Sandbox en la nube de OpenAI | Sí, acotado | No | No |
| Claude Code Remote | Nube de Anthropic | Sí, acotado | Sesiones de agente persistentes | No |
| Copilot CA | Runner gestionado por GitHub | Hereda config de Actions | Por ejecución | Solo Enterprise |
| Jules | VM en la nube de Google | Sí | Por tarea | No |
| Factory Droids | Nube O local | Configurable | Configurable | Sí |
Qué preguntas hacer a nivel de CTO antes de adoptar
Antes de dar acceso al repositorio a cualquiera de estos agentes, cuatro preguntas determinan la política:
- Permisos en el repositorio — ¿el agente tiene acceso de escritura a main, o está bloqueado a ramas de características? Bloquea siempre a ramas de características con revisión de PR obligatoria.
- Acceso a secretos — ¿puede el agente leer archivos
.envo llamar a tu gestor de secretos? Deniega por defecto y usa tokens con alcance limitado. - Egreso de red — ¿a qué puede llamar el sandbox desde fuera? Deniega red por defecto con una lista de permisivos para registros de paquetes y tu mirror privado.
- Retención del registro de auditoría — ¿cuánto tiempo se conservan las sesiones del agente y puede tu equipo de seguridad consultarlas? Fija esto por escrito antes de conceder acceso.
¿Los agentes de código en segundo plano entrenan con mi código?
El opt-in/opt-out predeterminado varía. Los planes enterprise de OpenAI Codex no entrenan con tu código por defecto. Anthropic Claude Code no entrena con tu código. GitHub Copilot Business y Enterprise tienen exclusión de datos. Cursor ofrece modo privacidad. Devin declara que el código permanece bajo control del cliente. Verifica siempre la política de uso de datos actual en la documentación del proveedor antes de conceder acceso al repositorio.
El resumen por herramienta, con el comportamiento predeterminado actual:
- Devin — el código permanece bajo control del cliente, según la política de Cognition
- Cursor — toggle de modo privacidad, opt-in para cualquier entrenamiento
- Codex Cloud — sin entrenamiento por defecto en enterprise; ChatGPT Plus sujeto a los términos de consumo
- Claude Code Remote — sin entrenamiento con tu código según los términos comerciales de Anthropic
- Copilot Business/Enterprise — exclusión de datos activada por defecto; Pro/Pro+ tienen un toggle separado
- Jules — aplican los términos de datos enterprise estándar de Google; verifica la política actual
- Factory Droids — bajo control del cliente según sus documentos; la ejecución local aislada elimina la pregunta
Las políticas han cambiado varias veces en 2025-26. Compruébalo de nuevo antes de conceder acceso — los proveedores actualizan sus términos con más frecuencia de la que se actualiza un post. Una vez que el PR de un agente en segundo plano esté listo, querrás hacer una revisión de código con IA antes del merge — la cuestión de la propiedad intelectual no desaparece porque el proveedor del agente la haya gestionado.
Cómo elige Techsy los agentes en segundo plano para proyectos de clientes
En los proyectos de clientes de Techsy usamos un stack por capas en lugar de elegir una sola herramienta. Cursor Background Agents para el trabajo async dentro del editor (los ingenieros viven en Cursor de todos modos). Claude Code Remote Tasks para tareas programadas al estilo cron — bumps de dependencias semanales, pasadas de QA nocturnas, el trabajo aburrido que debería estar automatizado. Codex Cloud para el rendimiento barato en lint y actualizaciones de dependencias donde la velocidad supera a los benchmarks. Elegimos Devin para clientes que necesitan autonomía total de delegación y tienen backlogs bien definidos.
Lo que no usamos mucho: Copilot Coding Agent. El presupuesto de solicitudes premium en Pro se agota más rápido que las alternativas a nuestro nivel de uso, y todavía no tenemos suficientes clientes Enterprise para justificar la actualización. Construiríamos un harness propio con LangGraph o el OpenAI Agents SDK antes de bloquearnos en un solo proveedor para un despliegue enterprise — pero para el 80 % del trabajo en proyectos nuevos con clientes, las herramientas off-the-shelf anteriores son más rápidas que construir las nuestras. La plataforma de despliegue de IA agéntica que usamos gestiona en producción los agentes que estas herramientas producen.
Si quieres una consulta gratuita sobre qué agente en segundo plano encaja mejor en tu stack — o un harness de agentes personalizado — estaremos encantados de orientarte.
FAQ — Agentes de Código en Segundo Plano Comparados
¿Qué es un agente de código en segundo plano?
Un agente de código en segundo plano es un ingeniero de software basado en IA que trabaja de forma asíncrona en un entorno sandbox en la nube. Le asignas una tarea — un issue de GitHub, un ticket de Linear o un mensaje de Slack — y trabaja solo durante minutos u horas para luego devolverte un pull request para revisar. Lo que lo define es que no lo ves escribir; trabaja mientras tú estás en otra parte.
¿Cuál es la diferencia entre un agente en segundo plano y Cursor o Copilot inline?
Los agentes en segundo plano se ejecutan de forma asíncrona en un sandbox en la nube y devuelven pull requests. Las herramientas inline como Cursor y Copilot sugieren código mientras tú escribes, en tu editor, con tú controlando cada pulsación. Los agentes en segundo plano habilitan el paralelismo (pon 5 tareas en cola, obtén 5 PRs) mientras que los agentes inline permiten la iteración rápida en una sola tarea en la que estás enfocado.
¿Cuánto cuestan los agentes de código en segundo plano por tarea?
Devin cuesta entre 4,50 y 6,75 $ por una corrección de bug típica a 2-3 ACUs. Cursor y Codex Cloud facturan por consumo de tokens, típicamente entre 0,30 y 3 $ por tarea según el modelo y la longitud del contexto. Jules es gratuito hasta 15 tareas por día. Copilot Coding Agent usa solicitudes premium a aproximadamente 0,04 $ cada una en el nivel Pro — la opción más barata por tarea entre los planes de pago.
¿Qué agente en segundo plano es el más barato para devs en solitario?
El nivel gratuito de Google Jules no tiene rival: 15 tareas por día con 3 agentes simultáneos a 0 $/mes. Si lo superas, Cursor Pro por 20 $/mes con 20 $ de uso incluido es el siguiente escalón y te da integración con el editor como bonus. Para la mayoría de los devs en solitario, Jules cubre las necesidades diarias sin pagar nunca.
¿Es seguro dar a los agentes en segundo plano acceso completo al repositorio?
Sí, con matices. Usa tokens con alcance limitado (no tu token de acceso personal), deniega el egreso de red por defecto con una lista de permitidos, bloquea el agente a ramas de características con revisión de PR obligatoria, y revisa los registros de auditoría semanalmente. Nunca concedas permisos de escritura en producción a ninguno de estos agentes. Trata al agente como a un contratista: confía, pero verifica cada PR.
¿Los agentes en segundo plano entrenan con mi código?
Anthropic Claude Code, los planes enterprise de OpenAI Codex y GitHub Copilot Business/Enterprise no entrenan con tu código por defecto. Cursor ofrece modo privacidad. Devin declara que el código permanece bajo control del cliente. Verifica siempre la política de uso de datos actual en la documentación del proveedor antes de conceder acceso al repositorio — las políticas han cambiado varias veces en 2025-26.
¿Puede un agente en segundo plano fusionar sus propios pull requests?
La mayoría puede si le concedes el permiso, pero todos los equipos que conocemos exigen revisión humana antes del merge. La capacidad técnica existe — Copilot, Devin y Cursor pueden hacer auto-merge si la protección de rama lo permite — pero el auto-merge es una trampa. La barrera de revisión del PR es la última red de seguridad barata antes de que el error de un agente llegue a producción.
¿Cuál es el mejor agente en segundo plano para equipos enterprise?
Dos respuestas según tu entorno. Si ya tienes una presencia profunda en GitHub Enterprise, Copilot Coding Agent es la opción de menor fricción — la asignación de issues es el flujo de trabajo, sin herramientas adicionales. Si tienes requisitos de gobernanza, cumplimiento o despliegue aislado de la red, Factory Droids es la única opción con ejecución local y coordinación multi-agente entre código, pruebas, revisión y despliegue.
¿Qué agente en segundo plano tiene el mejor nivel gratuito?
Google Jules gana esto sin discusión. 15 tareas por día, 3 agentes simultáneos, acceso completo a Gemini — a 0 $/mes sin límite de tiempo. El nivel Free de Copilot (50 solicitudes premium/mes) queda en un lejano segundo lugar; el nivel Hobby de Cursor es técnicamente gratuito pero no cubre de forma significativa el uso de agentes en segundo plano. Jules es el único nivel gratuito que hemos visto reemplazar un plan de pago en trabajo individual.
¿Cuándo debería usar un agente en segundo plano en lugar de un agente inline como Cursor?
Usa un agente en segundo plano cuando la tarea está bien definida, dura más de 15 minutos y no necesitas corregir el rumbo a mitad — actualizaciones de dependencias, refactorizaciones repetitivas, migraciones de múltiples archivos, o cualquier cosa que puedas describir en un ticket claro. Usa inline cuando estás haciendo prototipos, explorando o programando en pareja con el modelo en trabajo novedoso.
Conclusiones
- Devin si delegas, Cursor BG si vives en Cursor, Codex Cloud si eres usuario de ChatGPT Pro, Claude Code Remote para benchmarks, Copilot para flujo nativo de GitHub, Jules para el nivel gratuito, Factory para cumplimiento normativo.
- La volatilidad de precios es real — el recorte de Devin en abril de 2026, la reforma de tokens de Codex y la pausa en registros de Copilot ocurrieron este mismo mes. Verifica antes de comprar.
- La categoría async tiene un año de vida y avanza rápido. Espera que esta matriz cambie de nuevo antes del verano.
¿Quieres ayuda para elegir o integrar un agente en segundo plano en tu stack? Solicita una consulta gratuita.