
Devin vs Claude Code vs Codex 2026: Otestovali jsme 8 coding agentů
Background coding agenti se za dvanáct měsíců proměnili z výzkumného dema v komoditu. Cognition letos v dubnu srazil vstupní cenu Devina z 500 $ na 20 $/měs., OpenAI 2. dubna přestavěl fakturaci Codexu a Factory před dvěma týdny uzavřel Series C za 150 milionů $. Všech osm nástrojů jsme tento měsíc otestovali v produkci na interním vývoji nástrojů pro Techsy a čísla níže jsou ta, která jsme skutečně zaplatili. Žádný z těchto nástrojů neprodáváme a nemáme žádné affiliate odkazy – každý další výsledek v top 10 pro tento dotaz publikuje přímo vendor některého z agentů v seznamu.
| Nástroj | Vstupní cena | Nejlepší model | Sandbox / cloud | Nativní GitHub | Nejlepší pro | Klíčový údaj |
|---|---|---|---|---|---|---|
| Devin | 20 $/měs. + 2,25 $/ACU | Vlastní stack Cognition | Plný VM (vlastní IDE + prohlížeč) | PR přes GH App | Delegování celého backlogu end-to-end | ~5 $ za úkol typu bug-fix |
| Cursor BG Agents | 20 $/měs. (Pro) | Vybraný frontier model | Dočasný cloudový VM | PR přes integraci | Uživatelé Cursoru, kteří chtějí async | Až 8 paralelních agentů |
| Codex Cloud | 20 $/měs. (Plus) → 200 $ (Pro) | OpenAI gpt-5-codex | Cloudový sandbox OpenAI | PR přes Codex CLI / web | Power users ChatGPT-Pro | 77,3 % Terminal-Bench 2.0 |
| Claude Code Remote | 20 $/měs. (Pro) → 200 $ (Max 20x) | Claude Opus 4.7 | Cloud Anthropic | PR přes GH App | Power users Claude Code + cron | 87,6 % SWE-bench Verified |
| Copilot Coding Agent | 10 $/měs. (Pro) → 39 $ (Enterprise) | GPT/Claude (dle tieru) | Runner spravovaný GitHubem | Nativní (issue → PR) | Týmy GH Enterprise/Business | Nejhlubší integrace s GH |
| Google Jules | Zdarma (15/den) → 19,99 $+ | Gemini | Cloudový VM Google | PR přes integraci | Sólisté / malé týmy | Nejlepší free tier v kategorii |
| Factory Droids | 20 $/měs. (2 seaty) | Multi-model routing | Cloud + lokální varianta | PR přes integraci | Regulovaná odvětví | Používají NVIDIA, Adobe, Bayer |
| Čestná uznání | různé | různé | různé | různé | OSS / DIY pipeline | OpenHands, Antigravity, Aider |
Ceny platné k 26. 4. 2026. Plány založené na tokenech a ACU se účtují nad rámec základní ceny. Před nákupem ověřte, odkazy na vendory najdete v sekci každého nástroje. Pro generování od nuly místo práce v existujícím repozitáři viz naše srovnání lovable vs bolt vs v0.
Co je background coding agent?
Background coding agent je AI softwarový inženýr, který běží asynchronně v sandboxovaném cloudovém prostředí. Přiřadíte mu úkol – GitHub issue, ticket v Linear, zprávu ve Slacku – a on sám pracuje minuty nebo hodiny, pak vrátí pull request k revizi. Nesledujete ho, jak píše.
To je ten zásadní rozdíl. Inline nástroje jako Cursor a Copilot navrhují kód, zatímco píšete; background AI agenti se zařadí do fronty, provedou úkol a podají hlášení. Životní cyklus je u všech nástrojů v tomto seznamu stejný: ticket → cloudový sandbox → autonomní úprava → PR → lidská revize.
Kategorie vznikla proto, že na konci roku 2024 s příchodem Devina dospěla dlouhodobější agentní schopnost a rok 2025 přidal Codex Cloud, Cursor Background Agents a Jules. Anthropic 20. března 2026 vydal Claude Code Remote Tasks a hon za přístupem „nastav a zapomeň" je teď mainstream.
Proč na tom „nastav a zapomeň" záleží? Paralelismus. V pátek odpoledne můžete do fronty zařadit pět dobře vymezených ticketů a v pondělí ráno mít pět PR k revizi. To je jiný workflow než párové programování s modelem – spíš připomíná řízení juniorního inženýra než psaní kódu po jeho boku. Lidé také cíleně hledají „claude code background agent support", proto zde pokrýváme Claude Code Remote Tasks, nejen Devina. Inline stranu jsme rozebrali zvlášť v našem přehledu rozdělení inline coding agentů mezi Claude Code, Cursor a Copilot. Pro architektonický úvod na úrovni celé kategorie je slušným výchozím bodem primer od Tembo.
Background vs inline coding agenti – kdy async poráží sync?
Asynchronní background agenti vyhrávají, když úkol trvá déle než 15 minut a nepotřebujete uprostřed úprav korigovat směr – dobře vymezené opravy chyb, upgrady závislostí, opakující se refaktory, migrace přes více souborů. Inline agenti jako Cursor nebo Copilot vyhrávají, když zkoumáte, prototypujete nebo párově programujete s modelem a potřebujete reagovat v reálném čase.
To je hlavní sdělení. Rozhodovací matice níže ukazuje, jak se skutečně rozhodujeme na projektech Techsy:
| Použijte async (background), když… | Použijte inline (Cursor/Copilot), když… |
|---|---|
| Úkol je dobře vymezený (issue s akceptačními kritérii) | Zkoumáte nebo prototypujete |
| Odhadovaná práce > 15 min | Potřebujete korigovat směr uprostřed úprav |
| Chcete paralelizovat 3+ úkolů | Chcete jednu soustředěnou session |
| Nevadí vám revidovat PR dodatečně | Chcete vidět návrhy při psaní |
| Úkol je repetitivní (závislosti, migrace, lint) | Úkol je nový a kreativní |
Konkrétně: „Aktualizoval jsem 47 balíčků a opravil breaking changes" je učebnicová úloha pro async coding agenty – dobře definovaná, mechanická, paralelizovatelná. „Postavil jsem novou dashboard routu" je inline – layout, texty a okrajové případy budete iterovat za pochodu.
Předání mezi sync a async
Většina týmů, se kterými pracujeme, skončí u kombinace obou. Cursor inline pro nový kód, Cursor Background Agents pro upgrady. Claude Code interaktivně pro architektonickou práci, Claude Code Remote Tasks pro týdenní cron na aktualizaci závislostí. Předání mezi nimi je samotný workflow – ani jeden nástroj nenahrazuje druhý. Pokud zůstáváte v editoru, srovnání Windsurf vs Cursor pokrývá sync stranu do detailu.
Pokud váš úkol trvá déle než 15 minut a nepotřebujete ho sledovat, async vyhrává.
Devin (Cognition) – lídr v autonomii
Devin je nejautonomnější background agent na trhu – Cognition mu dává plný sandboxovaný VM s vlastním IDE, prohlížečem a terminálem. Cena v dubnu 2026 klesla z podnikového minima 500 $/měs. na 20 $/měs. + 2,25 $ za Agent Compute Unit (ACU), což z něj udělalo hlavní titulek měsíce v kategorii autonomních coding agentů.
Ceny. Core 20 $/měs. + 2,25 $/ACU. Team 500 $/měs. se zahrnutými 250 ACU a dalšími ACU po 2 $ každý. 1 ACU odpovídá zhruba 15 minutám práce. Typická oprava chyby spotřebuje 2–3 ACU, tedy 4,50–6,75 $. Migrace přes více souborů může dosáhnout 30+ ACU, tedy 67,50 $ a výš. (devin.ai/pricing, platné k 26. 4. 2026.)
Silné stránky. Nejvyšší autonomie v seznamu. VM zahrnuje prohlížeč, takže Devin umí číst dokumentaci a Stack Overflow, aniž byste mu museli kontext předávat po lžičkách. Zralý produkt – Cognition vydal v březnu 2024 a měl dva roky na ladění promptů, díky kterým je Devin skutečně užitečný.
Slabé stránky. Náklady na ACU se při nové, neznámé práci stávají nepředvídatelnými. Méně kontroly během úkolu než u Codexu nebo Cursoru – úkol nastavíte a odejdete, což je v pořádku, dokud Devin nestráví 8 ACU laděním překlepu. Vyžaduje přesná akceptační kritéria; vágní tickety produkují vágní PR.
Vyberte, pokud: chcete delegovat dobře vymezené položky backlogu end-to-end a váš tým umí psát jasná akceptační kritéria.
Cursor Background Agents
Background Agents od Cursoru běží asynchronně uvnitř editoru Cursor – až 8 paralelně, spustitelné ze Slacku, Linear, GitHubu nebo přímo z editoru. Používají jakýkoli frontier model, který vyberete, takže náklady závisí na spotřebě tokenů, ne na paušální sazbě za ACU. Pro je 20 $/měs. se zahrnutým kreditem 20 $.
Ceny. Hobby 0 $, Pro 20 $/měs. (zahrnuje kredit 20 $), Pro+ 60 $/měs. (kredit 70 $), Ultra 200 $/měs. (kredit 400 $), Teams 40 $/uživatel/měs. Background agenti se účtují nad rámec na základě spotřeby – model + délka kontextu + délka výstupu. (cursor.com/pricing, platné k 26. 4. 2026. Funkce Background Agents vyšla v Cursor 0.50.)
Silné stránky. Nejtěsnější integrace s editorem v celém seznamu – vaše inline session, váš background agent i vaše pravidla žijí v jednom nástroji. Až 8 paralelních agentů znamená, že refaktor můžete rozvětvit přes moduly a během minut zase sloučit. Triggery ze Slacku, Linear a GitHubu odpovídají na otázku „který background agent funguje s Linear a Slackem" – Cursor ano, nativně.
Slabé stránky. Spotřeba frontier modelů vyčerpá zahrnutý kredit 20 $ rychleji, než byste čekali; jediná session s převahou Opusu ho dokáže spálit. Náklady na úkol jsou neprůhledné, pokud nesledujete usage dashboard – a většina týmů to nezačne dělat, dokud nedorazí faktura.
Vyberte, pokud: už žijete v Cursoru a chcete async bez změny nástroje a nevadí vám jednou týdně zkontrolovat usage dashboard. Vaše existující Cursor Rules sytí jak inline, tak background session, takže pokud už Cursor používáte, náklady na nastavení jsou téměř nulové.
Codex Cloud (OpenAI)
Codex Cloud je asynchronní coding agent od OpenAI. Popíšete úkol, Codex spustí sandbox VM, naklonuje váš repozitář a vrátí PR. Vede v Terminal-Bench 2.0 se 77,3 %, běží rychlostí ~240 tokenů/s (zhruba 2,5× rychleji než Opus) a 2. dubna 2026 přešel na fakturaci podle tokenů.
Ceny. Zahrnuto v ChatGPT Plus (20 $/měs.). Nový tier Pro 100 $/měs. (5× usage Plus; propagační 2× = 10× do 31. května 2026). Pro 200 $/měs. Od 2. 4. 2026 podle tokenů. Codex CLI je open-source a zdarma s BYOK. Reálné náklady se u aktivních uživatelů pohybují kolem 100–200 $/vývojář/měs. (developers.openai.com/codex/pricing, pokrytí tieru Pro za 100 $ od TechCrunch, platné k 26. 4. 2026.)
Silné stránky. Šampion v propustnosti při ~240 tps – u úkolů náročných na tokeny, jako jsou upgrady závislostí přes mnoho souborů, Codex dokončí práci, zatímco Claude ještě přemýšlí. CLI je open-source a funguje s vaším vlastním API klíčem, takže Codex můžete zapojit do CI bez placení ChatGPT Pro. Distribuce je obrovská: každý uživatel ChatGPT Plus ho už má.
Slabé stránky. Fakturace podle tokenů je mezi úkoly opravdu těžko předvídatelná. Reforma z 2. dubna zneplatňuje starší srovnání – cokoli jste četli před tímto datem, má špatné ceny. CLI působí jako samostatný produkt oproti webovému Codexu; integrace je volná.
Vyberte, pokud: jste uživatel ChatGPT Pro, který chce hluboce integrovaného cloudového agenta, nebo milovník CLI, který si chce přinést vlastní klíč.
# Dispatch a task to Codex Cloud from the CLI
codex task create \
--repo "techsy-io/example-app" \
--branch "main" \
--prompt "Bump all dependencies to latest and fix breaking changes" \
--watchClaude Code Remote Tasks (Anthropic)
Claude Code Remote Tasks vám umožní definovat GitHub repozitář, prompt a plán – Claude běží autonomně v cloudu Anthropic a po dokončení otevře PR. Vydáno 20. března 2026. Podloženo kategorií vedoucím skóre Opus 4.7 – 87,6 % na SWE-bench Verified a 64,3 % na SWE-bench Pro. Tohle je odpověď na našeptávaný dotaz „claude code background agent support" – je to skutečný, vydaný produkt.
Ceny. Součástí plánů Claude Code Pro/Max. Pro 20 $/měs., Max 5x 100 $/měs., Max 20x 200 $/měs. Těžcí uživatelé se v reálu pohybují na 100–200 $/měs. (claude.com/code, platform.claude.com/docs/en/managed-agents/overview, platné k 26. 4. 2026.)
Silné stránky. Nejvyšší skóre SWE-bench Verified v seznamu (87,6 %). Perzistentní stavové agentní session – Remote Task může navázat tam, kde skončil, místo aby při každém spuštění začínal od nuly. Integruje se s hooks a stávajícím ekosystémem nástrojů Claude Code, takže existující skills, slash příkazy a sub-agenti fungují stejně jako v interaktivních session.
Slabé stránky. Nejnovější položka v seznamu – zdokumentovaných integračních vzorů je méně než u Devina nebo Codexu a komunitních příkladů k okopírování je méně. CLI-first; žádné GUI, což zvedá práh pro ne-CLI inženýry v týmu.
Vyberte, pokud: jste power user Claude Code a chcete opakované plánované úkoly – týdenní aktualizace závislostí, refaktory ve stylu cronu, QA průběhy na vyžádání. Hooks Claude Code můžete zapojit do Remote Tasks stejným způsobem jako do interaktivních session a Remote Tasks byly jednou z funkcí, které unikly a pak se skutečně vydaly, o čemž jsme psali v březnu.
# Schedule a recurring Remote Task in Claude Code
claude-code remote create \
--repo "techsy-io/example-app" \
--schedule "weekly" \
--prompt "Bump deps, run tests, open PR if green"Copilot Coding Agent (GitHub)
Copilot Coding Agent promění GitHub issue v pull request – agenta přiřadíte stejně, jako byste přiřadili kolegu z týmu. Jde o nejvíc nativní GitHub workflow v tomto seznamu. Poznámka: od 20. dubna 2026 GitHub pozastavil nové registrace Pro a Pro+; stávající předplatitelé a tiery Business/Enterprise nejsou dotčeni.
Ceny. Free 0 $, Pro 10 $/měs., Pro+ 39 $/měs., Business 19 $/uživatel/měs., Enterprise 39 $/uživatel/měs. Na bázi premium requestů: Free 50/měs., Pro 300/měs., Pro+ 1500/měs., Enterprise 1000/uživatel/měs. Nové registrace Pro/Pro+/student pozastaveny od 20. 4. 2026, Business/Enterprise stále otevřené. (github.com/features/copilot/plans, platné k 26. 4. 2026.)
Silné stránky. Nejhlubší integrace s GitHubem v kategorii. Issue-to-PR je nejvíc nativní workflow na SERP – žádná další aplikace, žádný další dashboard, agent se zobrazí jako assignee ve stejném UI, které už používáte. Aktualizace Code Review z března 2026 umí automaticky předat review komentáře coding agentovi a uzavřít smyčku bez opuštění GitHubu.
Slabé stránky. Omezený výběr modelů na nižších tierech – na Pro si například nemůžete vybrat Opus. Budget premium requestů se na Pro s 300 requesty/měs. při denním nasazování rychle vyčerpá. Pozastavení nových registrací přidává tření pro nové individuální předplatitele.
Vyberte, pokud: váš tým už používá GitHub Business nebo Enterprise a chcete async coding bez jakéhokoli nastavování. Stávající seaty mohou agenta používat hned; pozastavení blokuje jen nové individuální registrace.
Google Jules
Jules je asynchronní coding agent od Google – VM poháněný Gemini s nejlepším free tierem v kategorii (15 denních úkolů, 3 souběžné). Proaktivně skenuje váš repozitář na komentáře #TODO a nabízí opravy. Placené plány začínají na 19,99 $/měs., ale ceny se v roce 2026 několikrát změnily.
Ceny. Free 15 denních úkolů / 3 souběžné. Pro od 19,99 $/měs. Ultra od 124,99 $/měs. Ceny se v roce 2026 několikrát změnily – před nákupem ověřte aktuální čísla na jules.google. (jules.google, pokrytí GA od TechCrunch ze srpna 2025, platné k 26. 4. 2026.)
Silné stránky. Nejlepší free tier v kategorii, tečka. 15 úkolů/den se 3 souběžnými je pro sólovou práci skutečně užitečné, ne jen návnada. Nejčistší UX ze všech pro uživatele, kteří nejsou power users – smyčka „skenování TODO" je novátorská a odhaluje skutečnou úklidovou práci, aniž byste museli cokoli zadávat.
Slabé stránky. Volatilita cen je hlavní riziko; letos jsme sledovali, jak se cena tieru Pro změnila dvakrát. Méně zralý integrační ekosystém než Devin nebo Codex – méně hooků na Slack/Linear/Jira, méně komunitního toolingu.
Vyberte, pokud: jste sólista nebo malý tým, který chce async bez závazku k placenému plánu – free tier Jules je skutečně užitečný, ne jen návnada.
Factory Droids (Factory.ai)
„Droids" od Factory jsou specializovaní autonomní agenti, kteří kódují, testují, revidují a nasazují, s možností cloudového i lokálního spuštění. Factory 16. dubna 2026 uzavřel Series C za 150 milionů $ a mezi zákazníky uvádí NVIDIA, Adobe, Bayer, EY, MongoDB a Zapier. Ceny začínají na 20 $/měs. pro dva seaty.
Ceny. Placené plány od 20 $/měs. (zahrnuje 2 týmové seaty), 5 $ za každý další seat. Multi-Droid model routing – různí Droids pro kód, test, revizi, nasazení. (factory.ai/pricing, docs.factory.ai/pricing, pokrytí financování Factory přes SiliconANGLE, platné k 26. 4. 2026.)
Silné stránky. Loga zákazníků signalizují vhodnost pro regulovaná odvětví – zdravotnictví, bankovnictví, polovodiče. Cloud NEBO lokální spuštění je jediná on-prem varianta v kategorii, což je zásadní pro týmy, které nemohou posílat kód do cizího cloudu. Multi-agentní koordinace napříč kódem/testem/revizí/nasazením se skutečně liší od single-agent modelu, který používají ostatní.
Slabé stránky. Menší známost značky než Devin nebo Codex, takže interní prosazení trvá déle. Pro sólisty je to overkill – multi-Droid orchestrace je daň, kterou na vedlejším projektu nepotřebujete.
Vyberte, pokud: jste střední až velká inženýrská organizace s požadavky na governance, compliance nebo air-gapped nasazení.
Čestná uznání – OpenHands, Antigravity, Aider
Tři finalisté, které stojí za to znát: OpenHands je vedoucí open-source self-hosted background agent – vyberte ho, pokud chcete plnou kontrolu nebo air-gapped provoz. Google Antigravity je druhý, méně propagovaný počin od Google. Aider je technicky sync CLI, ale stále častěji se používá v async pipeline přes shell skripty a CI hooks. Žádný z nich zatím nedosahuje autonomie Devina.
OpenHands je open-source, licence ve stylu MIT, hostujete na vlastní infrastruktuře. Daní za to je, že sandbox spravujete sami – bezpečnostní politiky, správa secrets, uptime runnerů, vše na vašem týmu. Reálná adopce je nejsilnější v regulovaných a akademických prostředích, kde jsou cloudoví agenti nepřijatelní.
Antigravity (Google) je tišší sourozenec Jules – stejný model VM, méně marketingového tlaku, zmiňovaný hlavně v přehledech. Produkční trakce je k dubnu 2026 slabá.
Aider je v jádru CLI sync agent, ale týmy ho stále častěji řetězí uvnitř CI, aby napodobily background chování – GitHub Action spustí Aider s promptem, Aider commitne, workflow otevře PR. Funguje s jakýmkoli modelem přes API a defaultně je BYOK, takže jde o nejlevnější „background-style" variantu, pokud máte CI infrastrukturu nazbyt.
Další dva ke sledování: Manus a Genie. Oba jsou novější nástroje s k dubnu 2026 nízkým signálem reálné adopce. Stojí za sledování, ale zatím ne za závazek.
Kterého background coding agenta si vybrat?
Vybírejte podle svého jednoho největšího omezení. Pokud je to rozpočet, vyhrává free tier Jules. Pokud je to nativní GitHub workflow, vyhrává Copilot Coding Agent. Pokud je to autonomie na dobře vymezených ticketech, vyhrává Devin. Pokud jsou to surová benchmarková skóre, Claude Code Remote vyhrává SWE-bench Verified s 87,6 %. Pokud je to compliance, Factory Droids. Pokud je to integrace s editorem, Cursor.
| Vaše priorita | Volba | Proč |
|---|---|---|
| Nejlevnější start | Google Jules | Free tier s 15 úkoly/den |
| Nativní GitHub bez nastavování | Copilot Coding Agent | Issue → PR je workflow přiřazení |
| Nejvyšší autonomie | Devin | Plný VM, prohlížeč, zralé delegační vzory |
| Nejvyšší benchmarková skóre | Claude Code Remote | 87,6 % SWE-bench Verified (Opus 4.7) |
| Rychlost / propustnost | Codex Cloud | ~240 tps, lídr Terminal-Bench 2.0 |
| Stávající uživatelé Cursoru | Cursor BG Agents | 8 paralelních, triggery Slack/Linear |
| Regulované odvětví | Factory Droids | Compliance + lokální spuštění |
| Self-host / OSS | OpenHands | Plná kontrola, air-gapped varianta |
Doporučení stacku podle velikosti týmu a rozpočtu
Sólista – začněte s free tierem Jules pro zřejmé výhry, až přerostete 15 úkolů/den, upgradujte na Cursor Pro za 20 $/měs. Celkem: 0–20 $/měs.
Malý tým (2–10 vývojářů) – Cursor Pro pro inline plus Background Agents, k tomu Claude Code Pro pro plánované úkoly ve stylu cronu. Celkem: 40 $/vývojář/měs.
Enterprise (50+ vývojářů) – Copilot Enterprise pro nativní GitHub workflow na většině ticketů, k tomu Factory Droids pro governance-citlivé workloady. Celkem: 39 $ + 20–50 $/vývojář/měs. podle počtu seatů Factory.
Kolik stojí každý background coding agent na úkol?
Reálné náklady na úkol se wildly liší, protože každý vendor fakturuje jinak. Devin si za typickou opravu chyby účtuje 4,50–6,75 $ (2–3 ACU). Cursor a Codex účtují podle spotřeby tokenů – počítejte s 0,30–3 $ na úkol podle modelu a kontextu. Jules je zdarma do 15 úkolů/den. Copilot používá premium requesty za zhruba 0,04 $ každý na tieru Pro.
| Nástroj | Model fakturace | Typická oprava chyby | Refaktor přes více souborů | Free tier? |
|---|---|---|---|---|
| Devin | 2,25 $/ACU (1 ACU ≈ 15 min) | 4,50–6,75 $ (2–3 ACU) | 67,50 $+ (30 ACU) | Ne |
| Cursor BG | Podle tokenů, zahrnutý $-kredit | ~0,30–1,50 $ | 3–15 $ | Hobby tier |
| Codex Cloud | Podle tokenů od 2. 4. 2026 | ~0,20–1 $ | 2–10 $ | Ne (v Plus) |
| Claude Code Remote | Součástí plánů Pro/Max | ~0,50–2 $ (z kvóty) | 5–20 $ (z kvóty) | Ne |
| Copilot Coding Agent | Premium requesty (~0,04 $ každý na Pro) | 1–3 requesty | 5–20 requestů | Free 50/měs. |
| Jules | Free tier nebo paušální plán | 0 $ | Započítává se do denního limitu | 15/den zdarma |
| Factory Droids | Podle seatů | Zahrnuto | Zahrnuto | Ne |
Ceny platné k 26. 4. 2026. Odhady tokenů počítají s frontier modely a průměrným kontextem úkolu. Vždy ověřte proti vlastnímu usage dashboardu.
"Typical bug fix cost per background coding agent (April 2026)"
Tabulka dat
| "USD per task" | "Typical bug fix" |
|---|---|
| "Jules (free tier)" | 0 |
| "Codex Cloud" | 0.6 |
| "Cursor BG" | 0.9 |
| "Claude Code Remote" | 1.2 |
| "Copilot CA (Pro premium req)" | 0.12 |
| "Devin" | 5.6 |
| "Factory Droids" | 0 |
Odhady pro typický úkol typu bug-fix o 2–3 ACU / ekvivalentu tokenů. Reálné náklady se liší podle výběru modelu a délky kontextu. Nástroje s free tierem a podle seatů vykazují nulové mezní náklady.
Poučení z těchto čísel: Devin je 5–10× dražší na úkol než konkurence fakturovaná podle tokenů. Ten příplatek vám kupuje autonomii – méně promptů k napsání, méně hlídání během úkolu – ale u rutinních oprav chyb vyhrávají Codex nebo Cursor na čistých nákladech.
Který background coding agent má nejlepší benchmarková skóre?
Claude Opus 4.7 od Anthropic vede SWE-bench Verified s 87,6 %, přičemž gpt-5-codex od Codexu se pohybuje kolem 77–80 %. Codex vede Terminal-Bench 2.0 se 77,3 %. Benchmarky ale měří, co dokáže podkladový model – vaše reálná úspěšnost závisí na použití agenta, sandboxu a promptu stejně jako na modelu.
| Nástroj | Podkladový model | SWE-bench Verified | Terminal-Bench 2.0 | Poznámky |
|---|---|---|---|---|
| Claude Code Remote | Claude Opus 4.7 | 87,6 % | n/a (různé) | Nejvyšší skóre Verified |
| Codex Cloud | gpt-5-codex | ~77–80 % | 77,3 % | Lídr Terminal-Bench |
| Devin | Stack Cognition (mix) | silné self-reported na Junior-SWE | n/a | Reportuje pass rate Junior-SWE, ne přímo Verified |
| Cursor BG | Uživatel vybere frontier | přebírá skóre modelu | přebírá | Skóre závisí na zvoleném modelu |
| Copilot CA | GPT/Claude (dle tieru) | přebírá | přebírá | Výběr modelu zamčený tierem |
| Jules | Gemini 2.5/3 | oficiálně neudáváno | oficiálně neudáváno | Menší transparentnost benchmarků |
| Factory Droids | Multi-model routing | přebírá dle Droida | přebírá | Různí Droids používají různé modely |
Pro agregátorový pohled matice coding agentů na artificialanalysis.ai sleduje průběžná benchmarková čísla napříč providery.
Benchmarky jsou podlaha, ne strop. Viděli jsme Cursor BG s Opus 4.7 překonat Devina na stejném ticketu – na použití záleží. Pokud si stavíte vlastní použití agenta místo nákupu, naše srovnání LangGraph vs CrewAI vs OpenAI Agents SDK prochází volby frameworku, které určují propast mezi skóre modelu a reálnou úspěšností.
Je bezpečné dát background coding agentům plný přístup k repozitáři?
Každý nástroj izoluje jinak. Devin běží v plném sandboxovaném VM. Codex používá cloudový sandbox spravovaný OpenAI. Cursor spouští dočasné vzdálené stroje. Copilot používá runnery spravované GitHubem (platí váš stávající bezpečnostní model GitHub Actions). Claude Code Remote běží v cloudu Anthropic. Factory nabízí cloud nebo air-gapped lokál. Žádný není „dejte mu root na produkci."
| Nástroj | Spouštěcí prostředí | Síťový egress | Perzistentní stav | Air-gapped varianta |
|---|---|---|---|---|
| Devin | Plný sandboxovaný VM (vlastní IDE + prohlížeč) | Ano, omezený | Na session | Ne |
| Cursor BG | Dočasný cloudový VM | Ano | Ne | Ne |
| Codex Cloud | Cloudový sandbox OpenAI | Ano, omezený | Ne | Ne |
| Claude Code Remote | Cloud Anthropic | Ano, omezený | Perzistentní agentní session | Ne |
| Copilot CA | Runner spravovaný GitHubem | Přebírá konfiguraci Actions | Na běh | Pouze Enterprise |
| Jules | Cloudový VM Google | Ano | Na úkol | Ne |
| Factory Droids | Cloud NEBO lokál | Konfigurovatelné | Konfigurovatelné | Ano |
Jaké otázky na úrovni CTO si položit před adopcí
Než některému z těchto agentů udělíte přístup k repozitáři, politiku rozhodnou čtyři otázky:
- Oprávnění k repozitáři – dostane agent write přístup na main, nebo je uzamčen na feature branche? Vždy uzamkněte na feature branche plus vynucená PR revize.
- Přístup k secrets – umí agent číst soubory
.envnebo volat váš secret manager? Default-deny a používejte scoped tokeny. - Síťový egress – kam může sandbox volat? Default-deny síť s allowlistem pro registry balíčků a váš privátní mirror.
- Retence audit logů – jak dlouho se agentní session uchovávají a může je váš bezpečnostní tým dotazovat? To si nechte písemně potvrdit před udělením přístupu.
Trénují background coding agenti na mém kódu?
Výchozí opt-in/opt-out se liší. OpenAI Codex enterprise plány defaultně netrénují na vašem kódu. Anthropic Claude Code na vašem kódu netrénuje. GitHub Copilot Business a Enterprise mají data exclusion. Cursor nabízí privacy mode. Devin uvádí, že kód zůstává pod kontrolou zákazníka. Před udělením přístupu k repozitáři vždy ověřte aktuální zásady využití dat v dokumentaci vendora.
Jednořádkový přehled pro každý nástroj s aktuálním výchozím chováním:
- Devin – kód zůstává pod kontrolou zákazníka dle zásad Cognition
- Cursor – přepínač privacy mode, opt-in pro jakýkoli trénink
- Codex Cloud – enterprise defaultně bez tréninku; ChatGPT Plus podléhá spotřebitelským podmínkám
- Claude Code Remote – bez tréninku na vašem kódu dle komerčních podmínek Anthropic
- Copilot Business/Enterprise – data exclusion defaultně zapnutá; Pro/Pro+ mají samostatný přepínač
- Jules – platí standardní enterprise datové podmínky Google; ověřte aktuální zásady
- Factory Droids – pod kontrolou zákazníka dle jejich dokumentace; air-gapped lokál otázku eliminuje
Zásady se v letech 2025–26 několikrát změnily. Před udělením přístupu znovu zkontrolujte – vendoři aktualizují podmínky častěji, než se aktualizují blogové příspěvky. Jakmile PR od background agenta přistane, budete před mergem chtít strukturovaný průchod AI code review – otázka IP nezmizí jen proto, že ji vendor agenta vyřešil.
Jak Techsy vybírá background agenty pro klientské projekty
Na klientských projektech Techsy provozujeme vrstvený stack, místo abychom vybírali jeden nástroj. Cursor Background Agents zvládají async práci v IDE (inženýři stejně žijí v Cursoru). Claude Code Remote Tasks běží plánované úkoly ve stylu cronu – týdenní aktualizace závislostí, noční QA průběhy – nudná práce, která by měla být automatizovaná. Codex Cloud zvládá tokenově levnou propustnost na lintu a aktualizacích závislostí, kde rychlost poráží benchmarková skóre. Devina vybíráme pro klienty, kteří potřebují plnou autonomii delegování a mají dobře vymezený backlog.
Co moc nepoužíváme: Copilot Coding Agent. Budget premium requestů na Pro se při naší úrovni využití vyčerpá rychleji než alternativy a zatím nemáme dost Enterprise klientů, abychom ospravedlnili upgrade. Než se pro enterprise rollout uzamkneme na jednoho vendora, postavili bychom vlastní použití s LangGraph nebo OpenAI Agents SDK – ale pro 80 % greenfield klientské práce jsou hotové nástroje výše rychlejší než stavět vlastní. Platforma pro nasazení agentic AI, kterou používáme, se v produkci stará o agenty, které tyto nástroje vytvářejí.
Pokud chcete bezplatnou konzultaci o tom, který background coding agent sedí vašemu stacku, nebo vlastní použití agenta, rádi to s vámi probereme.
FAQ – Srovnání background coding agentů
Co je background coding agent?
Background coding agent je AI softwarový inženýr, který běží asynchronně v sandboxovaném cloudovém prostředí. Přiřadíte mu úkol – GitHub issue, ticket v Linear nebo zprávu ve Slacku – a on sám pracuje minuty nebo hodiny, pak vrátí pull request k revizi. Definující znak je, že ho nesledujete, jak píše; pracuje, zatímco jste jinde.
Jaký je rozdíl mezi background coding agentem a inline nástroji jako Cursor nebo Copilot?
Background agenti běží asynchronně v cloudovém sandboxu a vracejí pull requesty. Inline nástroje jako Cursor a Copilot navrhují kód, zatímco píšete, přímo ve vašem editoru, přičemž každý stisk klávesy řídíte vy. Background agenti umožňují paralelismus (zařaďte 5 úkolů do fronty, dostaňte 5 PR), zatímco inline agenti umožňují rychlou iteraci na jednom úkolu, na který se soustředíte.
Kolik stojí background coding agenti na úkol?
Devin si za typickou opravu chyby při 2–3 ACU účtuje 4,50–6,75 $. Cursor a Codex Cloud fakturují podle spotřeby tokenů, typicky 0,30–3 $ na úkol podle modelu a délky kontextu. Jules je zdarma do 15 úkolů denně. Copilot Coding Agent používá premium requesty za zhruba 0,04 $ každý na tieru Pro – nejlevnější varianta na úkol mezi placenými plány.
Který background coding agent je nejlevnější pro sólisty?
Free tier Google Jules nemá konkurenci: 15 úkolů denně se 3 souběžnými agenty za 0 $/měs. Když ho přerostete, Cursor Pro za 20 $/měs. se zahrnutým kreditem 20 $ je další krok nahoru a jako bonus dostanete integraci s editorem. Pro většinu sólistů Jules pokrývá denní potřeby, aniž by kdy platili.
Je bezpečné dát background coding agentům plný přístup k repozitáři?
Ano, s výhradami. Používejte scoped tokeny (ne váš osobní access token), default-deny síťový egress s allowlistem, uzamkněte agenta na feature branche s povinnou PR revizí a týdně kontrolujte audit logy. Nikdy žádnému z těchto agentů neudělujte oprávnění k zápisu na produkci. Chovejte se k agentovi jako ke kontraktorovi: důvěřuj, ale prověřuj každý PR.
Trénují background coding agenti na mém kódu?
Anthropic Claude Code, enterprise plány OpenAI Codex a GitHub Copilot Business/Enterprise defaultně netrénují na vašem kódu. Cursor nabízí privacy mode. Devin uvádí, že kód zůstává pod kontrolou zákazníka. Před udělením přístupu k repozitáři vždy ověřte aktuální zásady využití dat v dokumentaci vendora – zásady se v letech 2025–26 několikrát změnily.
Může background coding agent mergovat vlastní pull requesty?
Většina ano, pokud udělíte oprávnění, ale každý tým, který známe, vyžaduje před mergem lidskou revizi. Technická schopnost existuje – Copilot, Devin i Cursor umí auto-merge, pokud to branch protection dovolí – ale auto-merge je past. Brána PR revize je poslední levná záchranná síť předtím, než se chyba agenta dostane na produkci.
Jaký je nejlepší background coding agent pro enterprise týmy?
Dvě odpovědi podle vašeho prostředí. Pokud už jste hluboko v GitHub Enterprise, Copilot Coding Agent je volba s nejmenším třením – přiřazení issue je samotný workflow, žádné další nástroje. Pokud máte požadavky na governance, compliance nebo air-gapped, Factory Droids je jediná varianta s lokálním spuštěním a multi-agentní koordinací napříč kódem, testem, revizí a nasazením.
Který background coding agent má nejlepší free tier?
Google Jules vyhrává bez konkurence. 15 úkolů denně, 3 souběžní agenti, plný přístup k Gemini, za 0 $/měs. bez časového omezení. Free tier Copilotu (50 premium requestů/měs.) je vzdálený druhý; Hobby tier Cursoru je technicky zdarma, ale background použití agentů smysluplně nepokryje. Jules je jediný free tier, který jsme viděli nahradit placený plán pro sólovou práci.
Kdy použít background agenta a kdy inline AI jako Cursor?
Background agenta použijte, když je úkol dobře vymezený, trvá déle než 15 minut a nepotřebujete uprostřed úprav korigovat směr – upgrady závislostí, opakující se refaktory, migrace přes více souborů nebo cokoli, co dokážete popsat v jasném ticketu. Inline použijte, když prototypujete, zkoumáte nebo párově programujete s modelem na nové práci.
Shrnutí
- Devin, pokud delegujete, Cursor BG, pokud žijete v Cursoru, Codex Cloud, pokud jste uživatel ChatGPT Pro, Claude Code Remote pro benchmarky, Copilot pro nativní GitHub, Jules pro free tier, Factory pro compliance.
- Volatilita cen je reálná – dubnové snížení ceny Devina, tokenová reforma Codexu i pozastavení registrací Copilotu se staly vše tento měsíc. Před nákupem ověřte.
- Async kategorie je rok stará a vydává rychle. Počítejte s tím, že se tato matice do léta znovu změní.
Chcete pomoct s výběrem nebo zapojením background agenta do vašeho stacku? Získejte bezplatnou konzultaci.