Extraire des données structurées d'une page web revient d'ordinaire à écrire un scraper jetable qui casse dès que le site change. Cet extracteur prend plutôt une URL et un schéma.
sonnet4 joursFirecrawlPlaywrightOpenAIPostgres
Claude
65ROI
72Scale
$2.2k93Saved
ROI for
README.md
Pourquoi ce sous-agent
Extraire des données structurées d'une page web revient d'ordinaire à écrire un scraper jetable qui casse dès que le site change. Cet extracteur prend plutôt une URL et un schéma.
Vous décrivez les champs voulus, et il rend la page, mappe les éléments et renvoie des enregistrements propres et validés. Changez de site en changeant de schéma ; aucun nouveau scraper à écrire, et tout champ absent de la page est signalé plutôt qu'inventé.
Comment il s'exécute
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Prendre le schéma que vous avez défini et mapper les éléments de la page sur ses champs.
pending
Extraire les données, convertir les types et valider chaque ligne face au schéma.
pending
Renvoyer des enregistrements structurés et propres, et signaler les champs que la page n'a pas fournis.
pending
Exemple de sortie
json
// Sample output
// (generated when the pipeline finishes)
Given a URL and a target schema, extract matching records as JSON conforming to the schema; set missing fields null and never invent values.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.