Eine ganze Website von Hand zu crawlen, heißt Seiten zu verpassen, den Server zu überlasten oder den Überblick zu verlieren, was man schon geladen hat. Dieser Crawler steuert den gesamten Durchlauf.
sonnet4 TagePlaywrightPythonRedisPostgres
Claude
63ROI
73Scale
$1.4k90Saved
ROI for
README.md
Warum dieser Subagent
Eine ganze Website von Hand zu crawlen, heißt Seiten zu verpassen, den Server zu überlasten oder den Überblick zu verlieren, was man schon geladen hat. Dieser Crawler steuert den gesamten Durchlauf.
Von einer Seed-URL aus entdeckt er Links, bleibt innerhalb der Domain und taktet Anfragen so, dass die Seite zufrieden bleibt. Fehlschläge werden mit Backoff wiederholt, besuchte URLs werden verfolgt, um Schleifen zu vermeiden, und jede Seite wird mit ihren Metadaten gespeichert. Wenn die Queue leer ist, erhalten Sie einen Abdeckungsbericht.
So läuft er
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Die Anfragen mit einer Verzögerung takten und die robots-Regeln respektieren, damit der Crawl höflich bleibt.
pending
Fehlgeschlagene Seiten mit Backoff erneut versuchen und verfolgen, welche URLs erledigt sind, um Wiederholungen zu vermeiden.
pending
Inhalt und Metadaten jeder geladenen Seite speichern und am Ende, wenn die Queue leer ist, die Abdeckung melden.
pending
Beispiel-Output
json
// Sample output
// (generated when the pipeline finishes)
Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.