Les sites modernes s'affichent en JavaScript, donc une simple requête HTTP renvoie une coquille vide. Ce scraper pilote un vrai navigateur pour récupérer les données qui se chargent réellement.
Les sites modernes s'affichent en JavaScript, donc une simple requête HTTP renvoie une coquille vide. Ce scraper pilote un vrai navigateur pour récupérer les données qui se chargent réellement.
Il attend que la single-page app s'affiche, extrait les champs en JSON typé, et valide chaque enregistrement avant de le stocker. Les lignes propres partent vers Postgres pour les requêtes et le JSON brut atterrit dans S3 comme sauvegarde, pour qu'un changement de mise en page soit repéré au lieu de corrompre silencieusement votre jeu de données.
Comment il s'exécute
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Extraction des champs listés en un enregistrement JSON typé, à partir de la structure de la page, pas de positions de texte fragiles.
pending
Validation de chaque enregistrement par rapport à la forme attendue, avec suppression ou signalement de tout ce qui est mal formé.
pending
Écriture du JSON dans S3 et des lignes analysées dans Postgres pour les requêtes.
pending
Exemple de sortie
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.