Moderne Websites rendern mit JavaScript, also liefert eine simple HTTP-Anfrage nur eine leere Hülle. Dieser Scraper steuert einen echten Browser, um an die Daten zu kommen, die tatsächlich laden.
Moderne Websites rendern mit JavaScript, also liefert eine simple HTTP-Anfrage nur eine leere Hülle. Dieser Scraper steuert einen echten Browser, um an die Daten zu kommen, die tatsächlich laden.
Er wartet, bis die Single-Page-App gerendert ist, extrahiert Felder in typisiertes JSON und validiert jeden Datensatz, bevor er gespeichert wird. Saubere Zeilen gehen zum Abfragen nach Postgres und das rohe JSON landet als Backup in S3, sodass eine Layout-Änderung auffällt, statt Ihren Datensatz still zu beschädigen.
So läuft er
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Die aufgeführten Felder anhand der Seitenstruktur in einen typisierten JSON-Datensatz extrahieren, nicht über brüchige Text-Offsets.
pending
Jeden Datensatz gegen die erwartete Struktur validieren und alles Fehlerhafte verwerfen oder markieren.
pending
Das JSON nach S3 und die geparsten Zeilen zum Abfragen in Postgres schreiben.
pending
Beispiel-Output
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.