Získávání strukturovaných dat z webové stránky obvykle znamená napsat jednorázový scraper, který se rozbije ve chvíli, kdy se web změní. Tento extraktor místo toho pracuje s URL a schématem.
sonnet4 dnyFirecrawlPlaywrightOpenAIPostgres
Claude
65ROI
72Scale
$2.2k93Saved
ROI for
README.md
Proč tento subagent
Získávání strukturovaných dat z webové stránky obvykle znamená napsat jednorázový scraper, který se rozbije ve chvíli, kdy se web změní. Tento extraktor místo toho pracuje s URL a schématem.
Popíšete pole, která chcete, a on stránku vykreslí, namapuje prvky a vrátí čisté, validované záznamy. Web změníte pouhou změnou schématu – není potřeba psát nový scraper a jakékoli pole, které na stránce chybí, se označí, místo aby se vymyslelo.
Jak běží
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Vezměte definované schéma a přiřaďte prvky stránky k jeho polím.
pending
Extrahujte data, převést typy a ověřte každý řádek proti schématu.
pending
Vraťte čistá strukturovaná data a označte pole, která stránka neposkytla.
pending
Ukázkový výstup
json
// Sample output
// (generated when the pipeline finishes)
Given a URL and a target schema, extract matching records as JSON conforming to the schema; set missing fields null and never invent values.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.