Att crawla en hel sajt för hand betyder missade sidor, hamrande på servern eller att tappa koll på vad du redan hämtat. Den här crawlern sköter hela svepet.
sonnet4 dagarPlaywrightPythonRedisPostgres
Claude
63ROI
73Scale
$1.4k90Saved
ROI for
README.md
Varför denna subagent
Att crawla en hel sajt för hand betyder missade sidor, hamrande på servern eller att tappa koll på vad du redan hämtat. Den här crawlern sköter hela svepet.
Från en seed-URL upptäcker den länkar, håller sig inom domänen och reglerar takten så att sajten mår bra. Misslyckanden försöker igen med backoff, besökta URL:er hålls reda på för att undvika loopar, och varje sida lagras med sin metadata. När kön töms får du en täckningsrapport.
Så kör den
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Reglera takten på förfrågningarna med en fördröjning och respektera robots-reglerna så att crawlingen förblir hövlig.
pending
Försök igen på misslyckade sidor med backoff och håll reda på vilka URL:er som är klara för att slippa besöka dem på nytt.
pending
Lagra varje hämtad sidas innehåll och metadata, och rapportera täckningen när kön töms.
pending
Exempel på output
json
// Sample output
// (generated when the pipeline finishes)
Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.