Moderne sites renderen met JavaScript, dus een gewone HTTP-request levert een lege huls op. Deze scraper bestuurt een echte browser om de data te krijgen die daadwerkelijk laadt.
Moderne sites renderen met JavaScript, dus een gewone HTTP-request levert een lege huls op. Deze scraper bestuurt een echte browser om de data te krijgen die daadwerkelijk laadt.
Hij wacht tot de single-page app rendert, haalt velden uit in getypeerde JSON en valideert elk record voordat het wordt opgeslagen. Schone rijen gaan naar Postgres om te bevragen en de ruwe JSON landt als back-up in S3, zodat een layoutwijziging wordt opgemerkt in plaats van je dataset stilletjes te bederven.
Hoe hij werkt
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Haal de opgegeven velden uit de paginastructuur in een getypeerd JSON-record, niet via fragiele tekstposities.
pending
Valideer elk record tegen de verwachte vorm en laat alles wat misvormd is vallen of markeer het.
pending
Schrijf de JSON naar S3 en de geparste rijen naar Postgres om te bevragen.
pending
Voorbeelduitvoer
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.