Crawler tout un site à la main, c'est rater des pages, marteler le serveur ou perdre le fil de ce qu'on a déjà récupéré. Ce crawler gère tout le balayage.
sonnet4 joursPlaywrightPythonRedisPostgres
Claude
63ROI
73Scale
$1.4k90Saved
ROI for
README.md
Pourquoi ce sous-agent
Crawler tout un site à la main, c'est rater des pages, marteler le serveur ou perdre le fil de ce qu'on a déjà récupéré. Ce crawler gère tout le balayage.
À partir d'une URL de seed, il découvre les liens, reste dans le domaine, et cadence les requêtes pour que le site reste tranquille. Les échecs sont réessayés avec backoff, les URLs visitées sont suivies pour éviter les boucles, et chaque page est stockée avec ses métadonnées. Quand la file se vide, vous obtenez un rapport de couverture.
Comment il s'exécute
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Cadencement des requêtes avec un délai et respect des règles robots, pour que le crawl reste poli.
pending
Réessai des pages en échec avec backoff et suivi des URLs déjà traitées pour ne pas y revenir.
pending
Stockage du contenu et des métadonnées de chaque page récupérée, puis rapport de couverture quand la file se vide.
pending
Exemple de sortie
json
// Sample output
// (generated when the pipeline finishes)
Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.