community-automations/autonomous-crawler

Recherche & Veille

PublicSous-agent Claude

Crawler autonome

Crawler tout un site à la main, c'est rater des pages, marteler le serveur ou perdre le fil de ce qu'on a déjà récupéré. Ce crawler gère tout le balayage.

sonnet4 joursPlaywrightPythonRedisPostgres
ClaudeClaude
ROI for
README.md

Pourquoi ce sous-agent

Crawler tout un site à la main, c'est rater des pages, marteler le serveur ou perdre le fil de ce qu'on a déjà récupéré. Ce crawler gère tout le balayage.

À partir d'une URL de seed, il découvre les liens, reste dans le domaine, et cadence les requêtes pour que le site reste tranquille. Les échecs sont réessayés avec backoff, les URLs visitées sont suivies pour éviter les boucles, et chaque page est stockée avec ses métadonnées. Quand la file se vide, vous obtenez un rapport de couverture.

Comment il s'exécute

    • Read

      Used at step 01 to kick off the pipeline.

    • Write

      Used at step 01 to kick off the pipeline.

    • WebFetch

      Used at step 01 to kick off the pipeline.

    • WebSearch

      Used at step 01 to kick off the pipeline.

Exemple de sortie

json
// Sample output
// (generated when the pipeline finishes)

Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.

Unlock the rest

The full agent definition, install snippet, and starter task are gated for community members.

Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.