
8 Hintergrund-Coding-Agents im Vergleich: Preise, Benchmarks & Empfehlungen (April 2026)
Hintergrund-Coding-Agents haben sich in zwölf Monaten vom Forschungsprototyp zur Standardlösung entwickelt. Cognition hat den Mindestpreis von Devin im April von 500 auf 20 US-Dollar pro Monat gesenkt, OpenAI hat die Codex-Abrechnung am 2. April umgestellt, und Factory hat vor zwei Wochen eine Series-C-Finanzierung über 150 Millionen US-Dollar abgeschlossen. Wir haben alle acht Tools diesen Monat im echten Betrieb an internen Techsy-Projekten getestet — die nachstehenden Zahlen sind die, die wir tatsächlich bezahlt haben. Wir verkaufen keines dieser Tools und haben keine Affiliate-Links. Nahezu alle anderen Ergebnisse auf der ersten Suchergebnisseite für diese Suchanfrage stammen von Anbietern eines der gelisteten Agents.
| Tool | Einstiegspreis | Modellgrundlage | Sandbox / Cloud | GitHub-nativ | Am besten geeignet für | Kennzahl |
|---|---|---|---|---|---|---|
| Devin | 20 $/Monat + 2,25 $/ACU | Cognitions Stack | Vollständige VM (eigene IDE+Browser) | PR via GH App | Vollständige Backlog-Delegation | ca. 5 $ pro Bugfix |
| Cursor BG Agents | 20 $/Monat (Pro) | Frei wählbares Frontier-Modell | Ephemere Cloud-VM | PR via Integration | Cursor-Nutzer mit Async-Bedarf | Bis zu 8 parallele Agents |
| Codex Cloud | 20 $/Monat (Plus) → 200 $ (Pro) | OpenAI gpt-5-codex | OpenAI-Cloud-Sandbox | PR via Codex CLI / Web | ChatGPT-Pro-Nutzer | 77,3 % Terminal-Bench 2.0 |
| Claude Code Remote | 20 $/Monat (Pro) → 200 $ (Max 20x) | Claude Opus 4.7 | Anthropic Cloud | PR via GH App | Claude Code Power-User + Cron | 87,6 % SWE-bench Verified |
| Copilot Coding Agent | 10 $/Monat (Pro) → 39 $ (Enterprise) | GPT/Claude (tier-abhängig) | GitHub-verwalteter Runner | Nativ (Issue → PR) | GH Enterprise/Business-Teams | Tiefste GH-Integration |
| Google Jules | Kostenlos (15/Tag) → 19,99 $+ | Gemini | Google Cloud VM | PR via Integration | Solo-Entwickler / kleine Teams | Bestes kostenloses Kontingent der Kategorie |
| Factory Droids | 20 $/Monat (2 Sitze) | Multi-Modell-Routing | Cloud + lokale Option | PR via Integration | Regulierte Branchen | Kunden: NVIDIA, Adobe, Bayer |
| Honorable Mentions | variiert | variiert | variiert | variiert | OSS / DIY-Pipelines | OpenHands, Antigravity, Aider |
Preisstand: 2026-04-26. Token-basierte und ACU-basierte Pläne werden zusätzlich zum Grundpreis berechnet. Bitte vor dem Kauf beim Anbieter nachprüfen — siehe Vendor-Links in den jeweiligen Tool-Abschnitten. Für Greenfield-Generierung statt Arbeit in einem bestehenden Repository empfehlen wir unseren Vergleich von lovable, bolt und v0.
Was ist ein Hintergrund-Coding-Agent?
Ein Hintergrund-Coding-Agent ist ein KI-Softwareentwickler, der asynchron in einer isolierten Cloud-Umgebung arbeitet. Sie weisen ihm eine Aufgabe zu — ein GitHub-Issue, ein Linear-Ticket, eine Slack-Nachricht — und er arbeitet Minuten oder Stunden selbstständig, bevor er einen Pull Request zur Überprüfung einreicht. Sie beobachten ihn dabei nicht.
Das ist das Unterscheidungsmerkmal. Inline-Tools wie Cursor und Copilot schlagen vor, während Sie tippen; KI-Hintergrund-Agents nehmen Aufgaben in die Warteschlange, führen sie aus und berichten zurück. Der Ablauf ist bei allen Tools auf dieser Liste identisch: Ticket → Cloud-Sandbox → autonome Änderungen → PR → Überprüfung durch Menschen.
Die Kategorie entstand, weil längerfristige agentische Fähigkeiten Ende 2024 mit dem Launch von Devin ausgereift waren — 2025 folgten Codex Cloud, Cursor Background Agents und Jules. Anthropics Claude Code Remote Tasks wurde am 20. März 2026 veröffentlicht, und der Wunsch nach „Aufgabe abgeben und vergessen" ist inzwischen Mainstream.
Warum ist das so wichtig? Parallelisierung. Sie können am Freitagnachmittag fünf gut umrissene Tickets einreihen und haben am Montagmorgen fünf PRs zur Prüfung — das ist ein grundlegend anderer Arbeitsablauf als Pair-Programming mit einem Modell: eher wie das Führen eines Juniorentwicklers als das Tippen an seiner Seite. Viele suchen gezielt nach „claude code background agent support", weshalb wir Claude Code Remote Tasks hier gesondert behandeln. Den Inline-Bereich haben wir im Vergleich von Claude Code, Cursor und Copilot separat abgedeckt. Für eine Erklärung der Kategorie-Architektur bietet Tembos Einführung einen soliden Einstieg.
Hintergrund- vs. Inline-Coding-Agents — wann gewinnt Async?
Asynchrone Hintergrund-Agents sind überlegen, wenn eine Aufgabe mehr als 15 Minuten dauert und Sie nicht mittendrin korrigieren müssen — gut umrissene Bugfixes, Dependency-Upgrades, repetitive Refactorings, mehrere Dateien übergreifende Migrationen. Inline-Agents wie Cursor oder Copilot sind besser, wenn Sie erkunden, prototypen oder in Echtzeit mit dem Modell zusammenarbeiten.
Das ist das Wesentliche. Die Entscheidungsmatrix unten spiegelt wider, wie wir auf Techsy-Projekten wirklich auswählen:
| Async (Hintergrund) verwenden, wenn… | Inline (Cursor/Copilot) verwenden, wenn… |
|---|---|
| Aufgabe ist klar umrissen (Issue mit Akzeptanzkriterien) | Sie erkunden oder prototypen |
| Geschätzter Aufwand > 15 min | Sie mittendrin korrigieren möchten |
| Sie 3+ Aufgaben parallelisieren wollen | Sie eine fokussierte Session wünschen |
| Sie einen PR nachträglich prüfen können | Sie Vorschläge beim Tippen sehen möchten |
| Aufgabe ist repetitiv (Deps, Migrationen, Lint) | Aufgabe ist neuartig und kreativ |
Konkret: „47 Pakete aktualisiert und Breaking Changes behoben" ist ein klassischer Job für asynchrone Coding-Agents — klar definiert, mechanisch, parallelisierbar. „Neue Dashboard-Route gebaut" ist Inline — Sie werden Layout, Texte und Grenzfälle iterativ entwickeln.
Die Übergabe zwischen Sync und Async
Die meisten Teams, mit denen wir arbeiten, nutzen beide Ansätze. Cursor Inline für neuen Code, Cursor Background Agents für Upgrades. Claude Code interaktiv für Architekturarbeit, Claude Code Remote Tasks für den wöchentlichen Dependency-Bump-Cron. Die Übergabe ist der Workflow — keines der Tools ersetzt das andere. Den Sync-Bereich beleuchtet unser Windsurf-vs.-Cursor-Vergleich ausführlich.
Wenn Ihre Aufgabe mehr als 15 Minuten dauert und Sie nicht zuschauen müssen — Async gewinnt.
Devin (Cognition) — der Autonomie-Spitzenreiter
Devin ist der autonomeste Hintergrund-Agent auf dem Markt. Cognition stattet ihn mit einer vollständig isolierten VM aus, inklusive eigener IDE, Browser und Terminal. Der Preis sank im April 2026 von einem Enterprise-Mindestpreis von 500 $/Monat auf 20 $/Monat + 2,25 $ pro Agent Compute Unit (ACU) — das war die Autonomie-Schlagzeile des Monats für autonome Coding-Agents.
Preise. Core 20 $/Monat + 2,25 $/ACU. Team 500 $/Monat mit 250 enthaltenen ACUs plus zusätzliche ACUs zu je 2 $. 1 ACU entspricht etwa 15 Minuten Arbeit. Ein typischer Bugfix erfordert 2–3 ACUs, also 4,50–6,75 $. Eine mehrdateiige Migration kann 30+ ACUs erreichen, also ab 67,50 $. (devin.ai/pricing, Stand 2026-04-26.)
Stärken. Höchste Autonomie auf der Liste. Die VM enthält einen Browser, sodass Devin Dokumentation und Stack Overflow lesen kann, ohne dass Sie ihm Kontext einflößen müssen. Ausgereiftes Produkt — Cognition hat im März 2024 geliefert und zwei Jahre Zeit gehabt, die Prompts zu verfeinern, die Devin wirklich nützlich machen.
Schwächen. ACU-Kosten werden bei neuartigem Arbeitsbereich unberechenbar. Weniger Kontrollmöglichkeiten während der Ausführung als Codex oder Cursor — Sie stellen die Aufgabe und verlassen den Raum, was gut funktioniert, bis Devin 8 ACUs damit verbringt, einen Tippfehler zu debuggen. Präzise Akzeptanzkriterien sind Pflicht; vage Tickets produzieren vage PRs.
Empfohlen, wenn: Sie klar umrissene Backlog-Aufgaben vollständig delegieren wollen und Ihr Team präzise Akzeptanzkriterien formulieren kann.
Cursor Background Agents
Cursors Background Agents laufen asynchron innerhalb des Cursor-Editors — bis zu 8 parallel, auslösbar via Slack, Linear, GitHub oder im Editor selbst. Sie nutzen das von Ihnen gewählte Frontier-Modell, daher hängen die Kosten vom Token-Verbrauch ab, nicht von einem fixen ACU-Tarif. Pro kostet 20 $/Monat inklusive 20 $ Nutzungsguthaben.
Preise. Hobby 0 $, Pro 20 $/Monat (inkl. 20 $ Nutzung), Pro+ 60 $/Monat (70 $ Nutzung), Ultra 200 $/Monat (400 $ Nutzung), Teams 40 $/Nutzer/Monat. Background Agents werden nutzungsbasiert abgerechnet — Modell + Kontextlänge + Ausgabelänge. (cursor.com/pricing, Stand 2026-04-26. Das Background-Agents-Feature wurde mit Cursor 0.50 ausgeliefert.)
Stärken. Engste Editor-Integration auf der Liste — Ihre Inline-Session, Ihr Hintergrund-Agent und Ihre Regeln leben alle in einem Tool. Bis zu 8 parallele Agents ermöglichen es, ein Refactoring über Module zu verteilen und in Minuten zusammenzuführen. Slack-, Linear- und GitHub-Trigger decken die Frage „welcher Hintergrund-Agent funktioniert mit Linear und Slack" ab — Cursor tut es, nativ.
Schwächen. Frontier-Modell-Nutzung verbrennt das enthaltene 20-$-Guthaben schneller als erwartet; eine Opus-intensive Session kann es aufbrauchen. Die Kosten pro Aufgabe sind intransparent, solange Sie das Nutzungs-Dashboard nicht aktiv prüfen — was die meisten Teams erst tun, wenn die Rechnung eintrifft.
Empfohlen, wenn: Sie bereits in Cursor arbeiten und Async ohne Toolwechsel wollen — und bereit sind, das Nutzungs-Dashboard einmal wöchentlich zu prüfen. Ihre bestehenden Cursor Rules gelten sowohl für Inline- als auch für Hintergrund-Sessions, sodass der Einrichtungsaufwand für bestehende Cursor-Nutzer nahezu null ist.
Codex Cloud (OpenAI)
Codex Cloud ist OpenAIs asynchroner Coding-Agent. Sie beschreiben eine Aufgabe, Codex startet eine Sandbox-VM, klont Ihr Repository und liefert einen PR. Er führt Terminal-Bench 2.0 mit 77,3 %, läuft mit ca. 240 Token/Sekunde (etwa 2,5-mal schneller als Opus) und wurde am 2. April 2026 auf tokenbasierte Abrechnung umgestellt.
Preise. Enthalten in ChatGPT Plus (20 $/Monat). Neuer Pro-Tarif 100 $/Monat (5-faches Plus-Nutzungslimit; Promo 2-faches = 10-faches bis 31. Mai 2026). Pro 200 $/Monat. Tokenbasiert seit 2026-04-02. Codex CLI ist Open-Source und kostenlos mit eigenem API-Key. Reale Kosten liegen bei ca. 100–200 $/Entwickler/Monat bei aktiver Nutzung. (developers.openai.com/codex/pricing, TechCrunch-Berichterstattung zum 100-$-Pro-Tarif, Stand 2026-04-26.)
Stärken. Durchsatz-Champion mit ca. 240 tps — bei token-intensiven Aufgaben wie Dependency-Upgrades über viele Dateien ist Codex fertig, während Claude noch denkt. Die CLI ist Open-Source und funktioniert mit Ihrem eigenen API-Key, sodass Sie Codex ohne ChatGPT Pro in CI einbinden können. Die Reichweite ist enorm: Jeder ChatGPT-Plus-Nutzer hat bereits Zugang.
Schwächen. Token-Abrechnung ist von Aufgabe zu Aufgabe schwer vorhersehbar. Die April-2-Reform macht ältere Vergleiche wertlos — alles, was Sie vor diesem Datum gelesen haben, stimmt bei den Preisen nicht mehr. Die CLI fühlt sich wie ein separates Produkt von der Web-Oberfläche an; die Integration ist locker.
Empfohlen, wenn: Sie ChatGPT-Pro-Nutzer sind und einen tief integrierten Cloud-Agent wollen — oder CLI-Liebhaber mit eigenem API-Key.
# Aufgabe an Codex Cloud per CLI übergeben
codex task create \
--repo "techsy-io/example-app" \
--branch "main" \
--prompt "Bump all dependencies to latest and fix breaking changes" \
--watchClaude Code Remote Tasks (Anthropic)
Claude Code Remote Tasks ermöglichen es Ihnen, ein GitHub-Repository, einen Prompt und einen Zeitplan zu definieren — Claude läuft autonom in Anthropics Cloud und öffnet einen PR nach Abschluss. Veröffentlicht am 20. März 2026. Basiert auf Opus 4.7 mit kategorieanführenden 87,6 % auf SWE-bench Verified und 64,3 % auf SWE-bench Pro. Das ist die Antwort auf die Suchanfrage „claude code background agent support" — es handelt sich um ein echtes, ausgeliefertes Produkt.
Preise. In Claude Code Pro/Max-Plänen enthalten. Pro 20 $/Monat, Max 5x 100 $/Monat, Max 20x 200 $/Monat. Intensive Nutzer zahlen realistisch 100–200 $/Monat. (claude.com/code, platform.claude.com/docs/en/managed-agents/overview, Stand 2026-04-26.)
Stärken. Höchster SWE-bench Verified-Score auf der Liste (87,6 %). Persistente zustandsbehaftete Agent-Sessions — ein Remote Task kann dort weitermachen, wo er aufgehört hat, statt jeden Lauf kalt zu starten. Integration mit Hooks und dem bestehenden Tool-Ökosystem von Claude Code, sodass vorhandene Skills, Slash-Commands und Sub-Agents genauso funktionieren wie in interaktiven Sessions.
Schwächen. Neuester Eintrag auf der Liste — weniger dokumentierte Integrationsmuster als Devin oder Codex, weniger Community-Beispiele zum Kopieren. CLI-zentriert; keine GUI, was die Einstiegshürde für Nicht-CLI-Entwickler im Team erhöht.
Empfohlen, wenn: Sie Claude Code Power-User sind und wiederkehrende geplante Aufgaben wollen — wöchentliche Dependency-Updates, Cron-ähnliche Refactorings, anlassbezogene QA-Durchläufe. Sie können Claude Code Hooks in Remote Tasks einbinden wie in interaktiven Sessions, und Remote Tasks waren eines der durchgesickerten und dann ausgelieferten Features, über die wir im März berichtet haben.
# Wiederkehrenden Remote Task in Claude Code planen
claude-code remote create \
--repo "techsy-io/example-app" \
--schedule "weekly" \
--prompt "Bump deps, run tests, open PR if green"Copilot Coding Agent (GitHub)
Copilot Coding Agent verwandelt ein GitHub-Issue in einen Pull Request — Sie weisen den Agent wie einen Teammitarbeiter zu. Das ist der nativste GitHub-Workflow auf dieser Liste. Hinweis: Ab dem 20. April 2026 hat GitHub neue Pro- und Pro+-Anmeldungen pausiert; bestehende Abonnenten und Business/Enterprise-Tarife sind nicht betroffen.
Preise. Free 0 $, Pro 10 $/Monat, Pro+ 39 $/Monat, Business 19 $/Nutzer/Monat, Enterprise 39 $/Nutzer/Monat. Premium-Request-basiert: Free 50/Monat, Pro 300/Monat, Pro+ 1500/Monat, Enterprise 1000/Nutzer/Monat. Neue Pro/Pro+/Student-Anmeldungen pausiert ab 2026-04-20 — Business/Enterprise weiterhin offen. (github.com/features/copilot/plans, Stand 2026-04-26.)
Stärken. Tiefste GitHub-Integration in der Kategorie. Issue-zu-PR ist der nativste Workflow im Bereich — keine zusätzliche App, kein extra Dashboard, der Agent erscheint als Zugewiesener in derselben Oberfläche, die Sie bereits nutzen. Das März-2026-Code-Review-Update kann Review-Kommentare automatisch an den Coding Agent weitergeben und den Kreis schließen, ohne GitHub zu verlassen.
Schwächen. Eingeschränkte Modellauswahl bei günstigeren Tarifen — auf Pro können Sie beispielsweise nicht Opus auswählen. Das Premium-Request-Budget von 300 Anfragen/Monat beim Pro-Tarif ist bei täglichem Shipping schnell aufgebraucht. Die Pause bei neuen Anmeldungen schafft Reibung für neue Einzelabonnenten.
Empfohlen, wenn: Ihr Team bereits GitHub Business oder Enterprise nutzt und Sie Async-Coding ohne Setup wollen. Bestehende Sitze können den Agent heute nutzen; die Pause betrifft nur neue Einzelanmeldungen.
Google Jules
Jules ist Googles asynchroner Coding-Agent — eine Gemini-betriebene VM mit dem besten kostenlosen Kontingent der Kategorie (15 tägliche Aufgaben, 3 gleichzeitig). Er scannt proaktiv Ihr Repository nach #TODO-Kommentaren und bietet Korrekturen an. Kostenpflichtige Pläne beginnen ab 19,99 $/Monat, obwohl sich die Preise 2026 mehrfach geändert haben.
Preise. Kostenlos: 15 tägliche Aufgaben / 3 gleichzeitig. Pro ab 19,99 $/Monat. Ultra ab 124,99 $/Monat. Die Preise haben sich 2026 mehrfach geändert — aktuelle Zahlen bitte vor dem Kauf auf jules.google prüfen. (jules.google, TechCrunch-Berichterstattung zur GA im August 2025, Stand 2026-04-26.)
Stärken. Bestes kostenloses Kontingent der Kategorie, ohne Einschränkungen. 15 Aufgaben/Tag mit 3 gleichzeitigen Agents ist für Solo-Arbeit genuiner Mehrwert, kein Lockangebot. Übersichtlichste Benutzeroberfläche für Nicht-Power-User — der „TODOs scannen"-Loop ist neuartig und bringt echte Aufräumaufgaben an die Oberfläche, ohne dass Sie extra auffordern müssen.
Schwächen. Preisvolatilität ist das Hauptrisiko; wir haben beobachtet, wie der Pro-Tarif dieses Jahr zweimal verschoben wurde. Weniger ausgereifte Integrations-Ökosystem als Devin oder Codex — weniger Slack/Linear/Jira-Hooks, weniger Community-Tooling.
Empfohlen, wenn: Sie Solo-Entwickler oder kleines Team sind und Async ohne sofortige Kostenbindung wollen — Jules' kostenloses Kontingent ist tatsächlich nützlich, kein Lockangebot.
Factory Droids (Factory.ai)
Factorys „Droids" sind spezialisierte autonome Agents, die programmieren, testen, prüfen und deployen — mit Cloud- und lokalen Ausführungsoptionen. Factory schloss am 16. April 2026 eine Series-C-Finanzierung über 150 Millionen US-Dollar ab und gibt NVIDIA, Adobe, Bayer, EY, MongoDB und Zapier als Kunden an. Die Preise beginnen bei 20 $/Monat für zwei Sitze.
Preise. Kostenpflichtige Pläne ab 20 $/Monat (inkl. 2 Team-Sitze), 5 $ pro zusätzlichem Sitz. Multi-Droid-Modell-Routing — verschiedene Droids für Code, Test, Review, Deploy. (factory.ai/pricing, docs.factory.ai/pricing, Factory-Finanzierungsbericht via SiliconANGLE, Stand 2026-04-26.)
Stärken. Kundenliste signalisiert Eignung für regulierte Branchen — Gesundheitswesen, Banken, Halbleiter. Cloud ODER lokale Ausführung ist die einzige On-Premises-fähige Option in der Kategorie, was für Teams relevant ist, die keinen Code an eine externe Cloud schicken dürfen. Multi-Agent-Koordination über Code/Test/Review/Deploy ist wirklich anders als das Einzelagenten-Modell der anderen Tools.
Schwächen. Weniger Bekanntheit als Devin oder Codex, daher dauert die interne Überzeugungsarbeit länger. Überdimensioniert für Solo-Entwickler — die Multi-Droid-Orchestrierung ist Overhead, den Sie für ein Nebenprojekt nicht brauchen.
Empfohlen, wenn: Sie ein mittelgroßes bis großes Entwicklerteam mit Governance-, Compliance- oder Air-Gap-Deployment-Anforderungen sind.
Honorable Mentions — OpenHands, Antigravity, Aider
Drei Kandidaten, die Sie kennen sollten: OpenHands ist der führende quelloffene, selbst gehostete Hintergrund-Agent — wählen Sie ihn, wenn Sie vollständige Kontrolle oder Air-Gap-Betrieb benötigen. Google Antigravity ist Googles weniger beworbener zweiter Eintrag. Aider ist technisch gesehen ein synchroner CLI-Agent, wird aber zunehmend in asynchronen Pipelines über Shell-Skripte und CI-Hooks eingesetzt. Keiner erreicht bislang Devins Autonomieniveau.
OpenHands ist quelloffen (MIT-ähnliche Lizenz), selbst auf der eigenen Infrastruktur gehostet. Der Kompromiss: Sie verwalten die Sandbox selbst — Sicherheitsrichtlinien, Secrets-Management, Runner-Verfügbarkeit, alles liegt bei Ihrem Team. Die reale Akzeptanz ist am stärksten in regulierten und akademischen Umgebungen, in denen Cloud-Agents keine Option sind.
Antigravity (Google) ist das leisere Geschwister von Jules — gleiche VM-Architektur, weniger Marketing, hauptsächlich in Übersichtsartikeln erwähnt. Produktionseinsatz ist Stand April 2026 überschaubar.
Aider ist von Herzen ein synchroner CLI-Agent, aber Teams binden ihn zunehmend in CI ein, um asynchrones Verhalten zu imitieren — ein GitHub Action löst Aider mit einem Prompt aus, Aider committet, der Workflow öffnet einen PR. Funktioniert mit beliebigen Modellen per API und ist standardmäßig BYOK, damit ist es die günstigste „Hintergrund-ähnliche" Option, wenn Sie CI-Infrastruktur übrig haben.
Zwei weitere Kandidaten im Blick zu behalten: Manus und Genie. Beide sind neuere Einträge mit geringem Echtbetrieb-Signal Stand April 2026. Beobachtenswert, aber noch nicht empfehlenswert.
Welchen Hintergrund-Coding-Agent sollten Sie wählen?
Wählen Sie nach Ihrer wichtigsten Einschränkung. Budget-Limit? Jules' kostenloses Kontingent gewinnt. GitHub-nativer Workflow? Copilot Coding Agent gewinnt. Autonomie bei klar umrissenen Tickets? Devin gewinnt. Rohe Benchmark-Werte? Claude Code Remote führt SWE-bench Verified mit 87,6 %. Compliance? Factory Droids. Editor-Integration? Cursor.
| Ihre Priorität | Wahl | Warum |
|---|---|---|
| Günstigster Einstieg | Google Jules | Kostenloses Kontingent mit 15 Aufgaben/Tag |
| GitHub-nativ ohne Setup | Copilot Coding Agent | Issue → PR ist der Zuweis-Workflow |
| Höchste Autonomie | Devin | Vollständige VM, Browser, ausgereifte Delegationsmuster |
| Beste Benchmark-Werte | Claude Code Remote | 87,6 % SWE-bench Verified (Opus 4.7) |
| Geschwindigkeit / Durchsatz | Codex Cloud | ca. 240 tps, Terminal-Bench-2.0-Führung |
| Bestehende Cursor-Nutzer | Cursor BG Agents | 8 parallel, Slack/Linear-Trigger |
| Regulierte Branche | Factory Droids | Compliance + lokale Ausführung |
| Selbst hosten / OSS | OpenHands | Vollständige Kontrolle, Air-Gap-Option |
Stack-Empfehlung nach Teamgröße und Budget
Solo-Entwickler — starten Sie mit Jules' kostenlosem Kontingent für die offensichtlichen Gewinne, wechseln Sie zu Cursor Pro für 20 $/Monat, sobald Sie 15 Aufgaben/Tag überschreiten. Gesamt: 0–20 $/Monat.
Kleines Team (2–10 Entwickler) — Cursor Pro für Inline-Arbeit plus Background Agents, dazu Claude Code Pro für geplante Cron-ähnliche Aufgaben. Gesamt: 40 $/Entwickler/Monat.
Enterprise (50+ Entwickler) — Copilot Enterprise für den GitHub-nativen Workflow beim Großteil der Tickets, plus Factory Droids für governance-sensible Arbeitslast. Gesamt: 39 $ + 20–50 $/Entwickler/Monat je nach Factory-Sitzanzahl.
Was kostet jeder Hintergrund-Coding-Agent pro Aufgabe?
Die realen Kosten pro Aufgabe variieren stark, weil jeder Anbieter anders abrechnet. Devin berechnet 4,50–6,75 $ für einen typischen Bugfix (2–3 ACUs). Cursor und Codex rechnen nach Token-Verbrauch ab — erwarten Sie 0,30–3 $ pro Aufgabe je nach Modell und Kontext. Jules ist bis zu 15 Aufgaben/Tag kostenlos. Copilot nutzt Premium Requests zu ca. 0,04 $ je Anfrage beim Pro-Tarif.
| Tool | Abrechnungsmodell | Typischer Bugfix | Mehrdateiiges Refactoring | Kostenloses Kontingent? |
|---|---|---|---|---|
| Devin | 2,25 $/ACU (1 ACU ≈ 15 Min.) | 4,50–6,75 $ (2–3 ACU) | 67,50 $+ (30 ACU) | Nein |
| Cursor BG | Token-basiert, enthaltenes $-Budget | ca. 0,30–1,50 $ | 3–15 $ | Hobby-Tarif |
| Codex Cloud | Token-basiert seit 2. Apr. 2026 | ca. 0,20–1 $ | 2–10 $ | Nein (in Plus enthalten) |
| Claude Code Remote | In Pro/Max-Plänen enthalten | ca. 0,50–2 $ (gegen Kontingent) | 5–20 $ (gegen Kontingent) | Nein |
| Copilot Coding Agent | Premium-Request-basiert (ca. 0,04 $ pro Anfrage) | 1–3 Requests | 5–20 Requests | Free: 50/Monat |
| Jules | Kostenloses Kontingent oder Pauschaltarif | 0 $ | Zählt zum Tageslimit | 15/Tag kostenlos |
| Factory Droids | Sitzbasiert | Enthalten | Enthalten | Nein |
Preisstand 2026-04-26. Token-Schätzungen gehen von Frontier-Modellen mit durchschnittlichem Aufgaben-Kontext aus. Bitte stets gegen Ihr eigenes Nutzungs-Dashboard prüfen.
"Typische Bugfix-Kosten pro Hintergrund-Coding-Agent (April 2026)"
Datentabelle
| "USD pro Aufgabe" | "Typischer Bugfix" |
|---|---|
| "Jules (kostenloses Kontingent)" | 0 |
| "Codex Cloud" | 0.6 |
| "Cursor BG" | 0.9 |
| "Claude Code Remote" | 1.2 |
| "Copilot CA (Pro Premium Req)" | 0.12 |
| "Devin" | 5.6 |
| "Factory Droids" | 0 |
Schätzungen für eine typische 2–3-ACU-/Token-äquivalente Bugfix-Aufgabe. Reale Kosten variieren je nach Modellwahl und Kontextlänge. Kostenloses Kontingent und sitzbasierte Tools zeigen 0 $ Grenzkosten.
Was diese Zahlen zeigen: Devin ist pro Aufgabe 5–10-mal teurer als die tokenbasierte Konkurrenz. Dieser Aufpreis kauft Autonomie — weniger Prompts zu schreiben, weniger Betreuung während der Ausführung — aber bei Routine-Bugfixes gewinnen Codex oder Cursor in der reinen Kostenbetrachtung.
Welcher Hintergrund-Coding-Agent hat die besten Benchmark-Werte?
Anthropics Claude Opus 4.7 führt SWE-bench Verified mit 87,6 %, Codex' gpt-5-codex liegt bei ca. 77–80 %. Codex führt Terminal-Bench 2.0 mit 77,3 %. Benchmarks messen jedoch, was das zugrundeliegende Modell kann — Ihre reale Erfolgsquote hängt ebenso stark vom Agent-Harness, der Sandbox und dem Prompting ab wie vom Modell selbst.
| Tool | Zugrundeliegendes Modell | SWE-bench Verified | Terminal-Bench 2.0 | Hinweise |
|---|---|---|---|---|
| Claude Code Remote | Claude Opus 4.7 | 87,6 % | n/a (variiert) | Höchster Verified-Score |
| Codex Cloud | gpt-5-codex | ca. 77–80 % | 77,3 % | Terminal-Bench-Führung |
| Devin | Cognitions Stack (gemischt) | selbst gemeldete Junior-SWE-Werte | n/a | Gibt Junior-SWE-Bestehensquote an, nicht Verified |
| Cursor BG | Nutzerseitig gewähltes Frontier-Modell | übernimmt Modell-Score | übernimmt | Score hängt vom gewählten Modell ab |
| Copilot CA | GPT/Claude (tier-abhängig) | übernimmt | übernimmt | Tier-gebundene Modellwahl |
| Jules | Gemini 2.5/3 | nicht offiziell gemeldet | nicht offiziell gemeldet | Weniger Benchmark-Transparenz |
| Factory Droids | Multi-Modell-Routing | übernimmt je Droid | übernimmt | Verschiedene Droids nutzen verschiedene Modelle |
Einen aggregierten Überblick bietet artificialanalysis.ais Coding-Agents-Matrix mit rollierenden Benchmark-Zahlen aller Anbieter.
Benchmarks sind die Untergrenze, nicht die Decke. Wir haben erlebt, dass Cursor BG mit Opus 4.7 Devin am gleichen Ticket übertrifft — der Harness zählt. Wenn Sie einen eigenen Agent-Harness aufbauen statt kaufen, beleuchtet unser LangGraph-vs.-CrewAI-vs.-OpenAI-Agents-SDK-Vergleich die Framework-Entscheidungen, die die Lücke zwischen Modell-Score und realem Erfolg treiben.
Ist es sicher, Hintergrund-Coding-Agents vollen Repository-Zugriff zu geben?
Jedes Tool isoliert anders. Devin betreibt eine vollständig abgeschirmte VM. Codex nutzt eine von OpenAI verwaltete Cloud-Sandbox. Cursor startet ephemere Remote-Maschinen. Copilot nutzt GitHub-verwaltete Runner (Ihr bestehendes GitHub Actions-Sicherheitsmodell gilt). Claude Code Remote läuft in Anthropics Cloud. Factory bietet Cloud oder Air-Gap-lokal. Keines der Tools bedeutet „Root-Zugang auf Produktion geben".
| Tool | Ausführungsumgebung | Netzwerk-Egress | Persistenter Zustand | Air-Gap-Option |
|---|---|---|---|---|
| Devin | Vollständige Sandbox-VM (eigene IDE+Browser) | Ja, eingeschränkt | Pro Session | Nein |
| Cursor BG | Ephemere Cloud-VM | Ja | Nein | Nein |
| Codex Cloud | OpenAI-Cloud-Sandbox | Ja, eingeschränkt | Nein | Nein |
| Claude Code Remote | Anthropic Cloud | Ja, eingeschränkt | Persistente Agent-Sessions | Nein |
| Copilot CA | GitHub-verwalteter Runner | Übernimmt Actions-Konfiguration | Pro Lauf | Nur Enterprise |
| Jules | Google Cloud VM | Ja | Pro Aufgabe | Nein |
| Factory Droids | Cloud ODER lokal | Konfigurierbar | Konfigurierbar | Ja |
Fragen auf CTO-Ebene vor der Einführung
Bevor Sie einem dieser Agents Repository-Zugriff gewähren, klären vier Fragen die Richtlinie:
- Repository-Berechtigungen — bekommt der Agent Schreibzugriff auf main, oder ist er auf Feature-Branches beschränkt? Sperren Sie ihn immer auf Feature-Branches plus erzwungenes PR-Review.
- Secret-Zugriff — kann der Agent
.env-Dateien lesen oder Ihren Secret-Manager aufrufen? Default-Deny mit eingeschränkten Tokens. - Netzwerk-Egress — was kann die Sandbox aufrufen? Default-Deny-Netzwerk mit Allowlist für Paket-Registries und Ihren privaten Mirror.
- Audit-Log-Aufbewahrung — wie lange werden Agent-Sessions gespeichert, und kann Ihr Security-Team sie abfragen? Halten Sie das schriftlich fest, bevor Sie Zugriff gewähren.
Trainieren Hintergrund-Coding-Agents mit meinem Code?
Das Standard-Opt-in/-out variiert. OpenAI Codex-Enterprise-Pläne trainieren standardmäßig nicht mit Ihrem Code. Anthropic Claude Code trainiert nicht mit Ihrem Code. GitHub Copilot Business und Enterprise schließen Daten standardmäßig aus. Cursor bietet einen Privacy-Modus. Devin gibt an, dass Code unter Kundenkontrolle bleibt. Prüfen Sie die aktuelle Datennutzungsrichtlinie des Anbieters immer vor dem Gewähren von Repository-Zugriff.
Einzeiliger Überblick pro Tool mit aktuellem Standardverhalten:
- Devin — Code bleibt unter Kundenkontrolle, laut Cognitions Richtlinie
- Cursor — Privacy-Mode-Schalter, Opt-in für Training erforderlich
- Codex Cloud — Enterprise: kein Training standardmäßig; ChatGPT Plus unterliegt Verbraucher-AGB
- Claude Code Remote — kein Training mit Ihrem Code laut Anthropics kommerziellen Bedingungen
- Copilot Business/Enterprise — Datenausschluss standardmäßig aktiviert; Pro/Pro+ haben einen separaten Schalter
- Jules — Googles Standard-Enterprise-Datenbedingungen gelten; aktuelle Richtlinie prüfen
- Factory Droids — Kundenkontrolle laut deren Dokumentation; Air-Gap-lokal macht die Frage hinfällig
Richtlinien haben sich 2025–26 mehrfach geändert. Prüfen Sie erneut, bevor Sie Zugriff gewähren — Anbieter aktualisieren Bedingungen öfter als Blogbeiträge aktualisiert werden. Sobald der PR eines Hintergrund-Agents eingeht, empfiehlt sich ein strukturierter KI-Code-Review-Durchlauf vor dem Merge — die IP-Frage verschwindet nicht, weil der Anbieter sie intern geregelt hat.
Wie Techsy Hintergrund-Agents für Kundenprojekte auswählt
Bei Techsy-Kundenprojekten setzen wir auf einen Schichten-Stack statt auf ein einzelnes Tool. Cursor Background Agents übernehmen asynchrone In-Editor-Arbeit (die Entwickler leben sowieso in Cursor). Claude Code Remote Tasks führen geplante Cron-ähnliche Aufgaben aus — wöchentliche Dependency-Bumps, nächtliche QA-Durchläufe, die langweilige Arbeit, die automatisiert sein sollte. Codex Cloud übernimmt token-günstige Aufgaben bei Lint und Dependency-Updates, wo Geschwindigkeit wichtiger ist als Benchmark-Werte. Devin wählen wir für Kunden, die vollständige Delegationsautonomie benötigen und gut umrissene Backlogs haben.
Was wir wenig nutzen: Copilot Coding Agent. Das Premium-Request-Budget bei Pro reicht bei unserem Nutzungsvolumen schneller als die Alternativen, und wir haben noch nicht genug Enterprise-Kunden, um das Upgrade zu rechtfertigen. Wir würden einen eigenen Harness mit LangGraph oder dem OpenAI Agents SDK aufbauen, bevor wir uns für ein Enterprise-Rollout an einen einzelnen Anbieter binden — aber für 80 % der Greenfield-Kundenprojekte sind die oben genannten Off-the-Shelf-Tools schneller als eine Eigenentwicklung. Die agentische KI-Deployment-Plattform, die wir verwenden, übernimmt die Agents, die diese Tools in der Produktion erzeugen.
Wenn Sie eine kostenlose Beratung wünschen, welcher Hintergrund-Coding-Agent zu Ihrem Stack passt — oder einen eigenen Agent-Harness — sprechen Sie uns gerne an.
FAQ — Hintergrund-Coding-Agents im Vergleich
Was ist ein Hintergrund-Coding-Agent?
Ein Hintergrund-Coding-Agent ist ein KI-Softwareentwickler, der asynchron in einer isolierten Cloud-Umgebung läuft. Sie weisen ihm eine Aufgabe zu — ein GitHub-Issue, ein Linear-Ticket oder eine Slack-Nachricht — und er arbeitet Minuten oder Stunden selbstständig, bevor er einen Pull Request zur Prüfung einreicht. Das entscheidende Merkmal: Sie schauen ihm nicht zu; er arbeitet, während Sie anderswo sind.
Was ist der Unterschied zwischen einem Hintergrund-Coding-Agent und Cursor oder Copilot Inline?
Hintergrund-Agents laufen asynchron in einer Cloud-Sandbox und liefern Pull Requests. Inline-Tools wie Cursor und Copilot schlagen Code vor, während Sie tippen — in Ihrem Editor, mit Ihnen am Steuer bei jedem Tastendruck. Hintergrund-Agents ermöglichen Parallelisierung (5 Aufgaben einreihen, 5 PRs erhalten), während Inline-Agents schnelle Iteration bei einer einzelnen fokussierten Aufgabe ermöglichen.
Was kosten Hintergrund-Coding-Agents pro Aufgabe?
Devin berechnet 4,50–6,75 $ für einen typischen Bugfix bei 2–3 ACUs. Cursor und Codex Cloud rechnen nach Token-Verbrauch ab, typischerweise 0,30–3 $ pro Aufgabe je nach Modell und Kontextlänge. Jules ist bis zu 15 Aufgaben täglich kostenlos. Copilot Coding Agent nutzt Premium Requests zu ca. 0,04 $ je Anfrage beim Pro-Tarif — die günstigste Kosten-pro-Aufgabe-Option unter den kostenpflichtigen Plänen.
Welcher Hintergrund-Coding-Agent ist am günstigsten für Solo-Entwickler?
Google Jules' kostenloses Kontingent ist konkurrenzlos: 15 Aufgaben täglich mit 3 gleichzeitigen Agents bei 0 $/Monat. Wenn Sie darüber hinauswachsen, ist Cursor Pro für 20 $/Monat mit 20 $ enthaltener Nutzung der nächste Schritt — inklusive Editor-Integration als Bonus. Für die meisten Solo-Entwickler deckt Jules den täglichen Bedarf ab, ohne je zu zahlen.
Ist es sicher, Hintergrund-Coding-Agents vollen Repository-Zugriff zu geben?
Ja, mit Einschränkungen. Nutzen Sie eingeschränkte Tokens (nicht Ihren persönlichen Zugangstoken), Default-Deny-Netzwerk-Egress mit Allowlist, sperren Sie den Agent auf Feature-Branches mit erforderlichem PR-Review, und prüfen Sie Audit-Logs wöchentlich. Gewähren Sie keinem dieser Agents jemals Produktions-Schreibzugriff. Behandeln Sie den Agent wie einen externen Auftragnehmer: Vertrauen, aber jeden PR prüfen.
Trainieren Hintergrund-Coding-Agents mit meinem Code?
Anthropic Claude Code, OpenAI Codex Enterprise-Pläne und GitHub Copilot Business/Enterprise trainieren standardmäßig nicht mit Ihrem Code. Cursor bietet einen Privacy-Modus. Devin gibt an, dass Code unter Kundenkontrolle bleibt. Prüfen Sie die aktuelle Datennutzungsrichtlinie des Anbieters immer vor dem Gewähren von Repository-Zugriff — Richtlinien haben sich 2025–26 mehrfach geändert.
Kann ein Hintergrund-Coding-Agent seine eigenen Pull Requests mergen?
Die meisten können es, wenn Sie die Berechtigung erteilen, aber jedes Team, das wir kennen, verlangt menschliche Prüfung vor dem Merge. Die technische Möglichkeit besteht — Copilot, Devin und Cursor können alle automatisch mergen, wenn der Branch-Schutz es erlaubt — aber Auto-Merge ist gefährlich. Das PR-Review-Gate ist das letzte günstige Sicherheitsnetz, bevor der Fehler eines Agents in Produktion gelangt.
Was ist der beste Hintergrund-Coding-Agent für Enterprise-Teams?
Zwei Antworten je nach Umgebung. Wenn Sie tief in GitHub Enterprise verwurzelt sind, ist Copilot Coding Agent die Wahl mit geringstem Aufwand — Issue-Zuweisung ist der Workflow, kein Extra-Tooling. Wenn Sie Governance-, Compliance- oder Air-Gap-Anforderungen haben, ist Factory Droids die einzige Option mit lokaler Ausführung und Multi-Agent-Koordination über Code, Test, Review und Deploy.
Welcher Hintergrund-Coding-Agent hat das beste kostenlose Kontingent?
Google Jules gewinnt dies klar. 15 Aufgaben täglich, 3 gleichzeitige Agents, voller Gemini-Zugang — bei 0 $/Monat ohne zeitliche Begrenzung. Copilots Free-Tarif (50 Premium Requests/Monat) ist ein schwacher zweiter Platz; Cursors Hobby-Tarif ist technisch kostenlos, deckt Hintergrund-Agent-Nutzung aber nicht sinnvoll ab. Jules ist das einzige kostenlose Kontingent, das wir als Ersatz für einen kostenpflichtigen Plan bei Solo-Arbeit gesehen haben.
Wann sollte ich einen Hintergrund-Agent statt einem Inline-KI-Tool wie Cursor verwenden?
Nutzen Sie einen Hintergrund-Agent, wenn die Aufgabe klar umrissen ist, mehr als 15 Minuten dauert und Sie nicht mittendrin korrigieren müssen — Dependency-Upgrades, repetitive Refactorings, mehrere Dateien übergreifende Migrationen oder alles, was sich in einem klaren Ticket beschreiben lässt. Nutzen Sie Inline, wenn Sie prototypen, erkunden oder mit dem Modell auf neuartigem Terrain zusammenarbeiten.
Fazit
- Devin für Delegation, Cursor BG für Cursor-Nutzer, Codex Cloud für ChatGPT-Pro-Nutzer, Claude Code Remote für Benchmark-Werte, Copilot für GitHub-nativen Einsatz, Jules für das kostenlose Kontingent, Factory für Compliance.
- Preisvolatilität ist real — Devins April-2026-Preissenkung, Codex' Token-Reform und Copilots Anmeldepause sind alle diesen Monat eingetreten. Vor dem Kauf prüfen.
- Die Async-Kategorie ist ein Jahr alt und entwickelt sich schnell. Rechnen Sie damit, dass sich diese Matrix vor dem Sommer erneut verschiebt.
Möchten Sie Hilfe bei der Auswahl oder beim Einbinden eines Hintergrund-Agents in Ihren Stack? Holen Sie sich eine kostenlose Beratung.