community-automations/autonomous-crawler

Research og innsikt

PublicClaude-subagent

Autonom crawler

Å crawle et helt nettsted for hånd betyr å gå glipp av sider, hamre på serveren eller miste oversikten over hva du allerede har hentet. Denne crawleren styrer hele gjennomgangen.

sonnet4 dagerPlaywrightPythonRedisPostgres
ClaudeClaude
ROI for
README.md

Hvorfor denne subagenten

Å crawle et helt nettsted for hånd betyr å gå glipp av sider, hamre på serveren eller miste oversikten over hva du allerede har hentet. Denne crawleren styrer hele gjennomgangen.

Fra en seed-URL oppdager den lenker, holder seg innenfor domenet, og doserer forespørslene så nettstedet holder seg fornøyd. Feil prøves på nytt med backoff, besøkte URL-er spores for å unngå løkker, og hver side lagres med metadataene sine. Når køen tømmes, får du en dekningsrapport.

Slik kjører den

    • Read

      Used at step 01 to kick off the pipeline.

    • Write

      Used at step 01 to kick off the pipeline.

    • WebFetch

      Used at step 01 to kick off the pipeline.

    • WebSearch

      Used at step 01 to kick off the pipeline.

Eksempel på output

json
// Sample output
// (generated when the pipeline finishes)

Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.

Unlock the rest

The full agent definition, install snippet, and starter task are gated for community members.

Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.