De obicei, ca să extragi date structurate dintr-o pagină web, scrii un scraper de unică folosință care se strică imediat ce site-ul se modifică. Extractorul acesta primește, în schimb, un URL și o schemă.
sonnet4 zileFirecrawlPlaywrightOpenAIPostgres
Claude
65ROI
72Scale
$2.2k93Saved
ROI for
README.md
De ce acest subagent
De obicei, ca să extragi date structurate dintr-o pagină web, scrii un scraper de unică folosință care se strică imediat ce site-ul se modifică. Extractorul acesta primește, în schimb, un URL și o schemă.
Descrii câmpurile pe care le vrei, iar el randează pagina, mapează elementele și returnează înregistrări curate, validate. Schimbi site-urile schimbând schema; nu mai scrii niciun scraper nou, iar orice câmp care lipsește din pagină este semnalat, nu inventat.
Cum funcționează
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Ia schema ta definită și maparează elementele paginii la câmpurile acesteia.
pending
Extrage datele, coercionează tipurile și validează fiecare rând conform schemei.
pending
Returnează înregistrări structurate curate și marchează câmpurile pe care pagina nu le-a furnizat.
pending
Exemplu de output
json
// Sample output
// (generated when the pipeline finishes)
Given a URL and a target schema, extract matching records as JSON conforming to the schema; set missing fields null and never invent values.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.