Een hele site met de hand crawlen betekent pagina's missen, de server hameren of de tel kwijtraken van wat je al hebt opgehaald. Deze crawler beheert de hele sweep.
sonnet4 dagenPlaywrightPythonRedisPostgres
Claude
63ROI
73Scale
$1.4k90Saved
ROI for
README.md
Waarom deze subagent
Een hele site met de hand crawlen betekent pagina's missen, de server hameren of de tel kwijtraken van wat je al hebt opgehaald. Deze crawler beheert de hele sweep.
Vanaf een seed-URL ontdekt hij links, blijft hij binnen het domein en doseert hij requests zodat de site het naar zijn zin houdt. Mislukkingen worden herprobeerd met backoff, bezochte URL's worden bijgehouden om loops te vermijden, en elke pagina wordt met zijn metadata opgeslagen. Als de wachtrij leeg is, krijg je een dekkingsrapport.
Hoe hij werkt
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Dompel de requests met een vertraging en respecteer de robots-regels, zodat de crawl beleefd blijft.
pending
Herprobeer mislukte pagina's met backoff en houd bij welke URL's klaar zijn om ze niet opnieuw te bezoeken.
pending
Bewaar de content en metadata van elke opgehaalde pagina en rapporteer de dekking als de wachtrij leegloopt.
pending
Voorbeelduitvoer
json
// Sample output
// (generated when the pipeline finishes)
Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.