Ręczne przeszukiwanie całej strony kończy się pomijaniem podstron, obciążaniem serwera albo gubieniem się w tym, co już zostało pobrane. Ten crawler ogarnia całe skanowanie.
sonnet4 dniPlaywrightPythonRedisPostgres
Claude
63ROI
73Scale
$1.4k90Saved
ROI for
README.md
Dlaczego ten subagent
Ręczne przeszukiwanie całej strony kończy się pomijaniem podstron, obciążaniem serwera albo gubieniem się w tym, co już zostało pobrane. Ten crawler ogarnia całe skanowanie.
Od początkowego URL-a odkrywa linki, trzyma się wewnątrz domeny i tak dawkuje żądania, żeby strona nie odczuła obciążenia. Nieudane żądania są ponawiane z narastającym opóźnieniem, odwiedzone URL-e są śledzone, by uniknąć pętli, a każda strona jest zapisywana wraz z metadanymi. Gdy kolejka się opróżni, dostajesz raport pokrycia.
Jak działa
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Kontroluj częstotliwość żądań za pomocą opóźnień i przestrzegaj reguł robots.txt, aby skanowanie było kulturalne.
pending
Ponawiaj próby pobrania nieudanych stron z zastosowaniem backoffu i śledź ukończone URL-e, aby ich nie odwiedzać ponownie.
pending
Zapisuj zawartość każdej pobranej strony wraz z metadanymi, a następnie raportuj stopień pokrycia po opróżnieniu kolejki.
pending
Przykładowe wyjście
json
// Sample output
// (generated when the pipeline finishes)
Crawl a single domain from a seed URL with rate limiting, retries, and dedup, storing each page and reporting coverage.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.