community-automations/data-forge-url

Recherche & Veille

PublicSous-agent Claude

Extracteur de données URL

Extraire des données structurées d'une page web revient d'ordinaire à écrire un scraper jetable qui casse dès que le site change. Cet extracteur prend plutôt une URL et un schéma.

sonnet4 joursFirecrawlPlaywrightOpenAIPostgres
ClaudeClaude
ROI for
README.md

Pourquoi ce sous-agent

Extraire des données structurées d'une page web revient d'ordinaire à écrire un scraper jetable qui casse dès que le site change. Cet extracteur prend plutôt une URL et un schéma.

Vous décrivez les champs voulus, et il rend la page, mappe les éléments et renvoie des enregistrements propres et validés. Changez de site en changeant de schéma ; aucun nouveau scraper à écrire, et tout champ absent de la page est signalé plutôt qu'inventé.

Comment il s'exécute

    • Read

      Used at step 01 to kick off the pipeline.

    • Write

      Used at step 01 to kick off the pipeline.

    • WebFetch

      Used at step 01 to kick off the pipeline.

    • WebSearch

      Used at step 01 to kick off the pipeline.

Exemple de sortie

json
// Sample output
// (generated when the pipeline finishes)

Given a URL and a target schema, extract matching records as JSON conforming to the schema; set missing fields null and never invent values.

Unlock the rest

The full agent definition, install snippet, and starter task are gated for community members.

Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.