Moderní weby se vykreslují JavaScriptem, takže obyčejný HTTP požadavek vrátí jen prázdnou skořápku. Tenhle scraper řídí skutečný prohlížeč, aby získal data, která se opravdu načtou.
Moderní weby se vykreslují JavaScriptem, takže obyčejný HTTP požadavek vrátí jen prázdnou skořápku. Tenhle scraper řídí skutečný prohlížeč, aby získal data, která se opravdu načtou.
Počká, než se single-page aplikace vykreslí, extrahuje pole do typovaného JSONu a každý záznam zvaliduje, než ho uloží. Čisté řádky putují do Postgres k dotazování a surový JSON končí v S3 jako záloha, takže změna layoutu se zachytí, místo aby vám tiše ničila dataset.
Jak běží
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Extrahovat požadovaná pole do typovaného JSON záznamu na základě struktury stránky, nikoliv křehkých textových offsetů.
pending
Ověřit každý záznam proti očekávanému tvaru a zahodit nebo označit jakékoli chybné záznamy.
pending
Zapsat JSON do S3 a parsované řádky do Postgres pro následné dotazování.
pending
Ukázkový výstup
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.