Moderna sajter renderas med JavaScript, så en vanlig HTTP-förfrågan returnerar ett tomt skal. Den här scrapern kör en riktig webbläsare för att få datan som faktiskt laddas.
Moderna sajter renderas med JavaScript, så en vanlig HTTP-förfrågan returnerar ett tomt skal. Den här scrapern kör en riktig webbläsare för att få datan som faktiskt laddas.
Den väntar på att single-page-appen ska rendera, extraherar fält till typad JSON och validerar varje post innan den lagras. Rena rader går till Postgres för frågor och rå-JSON landar i S3 som backup, så att en layoutändring fångas i stället för att tyst förstöra din datamängd.
Så kör den
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Extrahera de angivna fälten till en typad JSON-post utifrån sidans struktur, inte sköra textpositioner.
pending
Validera varje post mot den förväntade formen och kasta eller flagga allt som är felaktigt.
pending
Skriv JSON-datan till S3 och de tolkade raderna till Postgres för frågor.
pending
Exempel på output
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.