Το crawling ενός ολόκληρου site με το χέρι σημαίνει χαμένες σελίδες, υπερφόρτωση του server ή απώλεια ελέγχου για το τι έχετε ήδη κατεβάσει. Αυτός ο crawler διαχειρίζεται ολόκληρη τη σάρωση.
sonnet4 ημέρεςPlaywrightPythonRedisPostgres
Claude
63ROI
73Scale
$1.4k90Saved
ROI for
README.md
Γιατί αυτός ο subagent
Το crawling ενός ολόκληρου site με το χέρι σημαίνει χαμένες σελίδες, υπερφόρτωση του server ή απώλεια ελέγχου για το τι έχετε ήδη κατεβάσει. Αυτός ο crawler διαχειρίζεται ολόκληρη τη σάρωση.
Ξεκινώντας από ένα seed URL, ανακαλύπτει συνδέσμους, μένει μέσα στο domain και ρυθμίζει τα requests ώστε το site να μην επιβαρύνεται. Οι αποτυχίες ξαναδοκιμάζονται με backoff, τα URL που έχουν επισκεφθεί καταγράφονται για να αποφεύγονται οι βρόχοι και κάθε σελίδα αποθηκεύεται μαζί με τα μεταδεδομένα της. Όταν η ουρά αδειάσει, παίρνετε μια αναφορά κάλυψης.
Πώς λειτουργεί
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Ρύθμιση της συχνότητας των αιτημάτων με καθυστέρηση και σεβασμός στους κανόνες robots, ώστε η σάρωση να παραμένει ευγενική.
pending
Επαναπροσπάθεια για τις αποτυχημένες σελίδες με backoff και παρακολούθηση των URLs που έχουν ολοκληρωθεί, για αποφυγή επαναλαμβανόμενης πρόσβασης.
pending
Αποθήκευση του περιεχομένου και των metadata κάθε φετσαρισμένης σελίδας, με αναφορά κάλυψης όταν αδειάσει η ουρά.
pending
Δείγμα εξόδου
json
// Sample output
// (generated when the pipeline finishes)
Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.