Biasanya, menarik data terstruktur dari halaman web berarti menulis scraper sekali pakai yang langsung rusak begitu situsnya berubah. Ekstraktor ini bekerja berbeda—cukup berikan URL dan skema.
sonnet4 hariFirecrawlPlaywrightOpenAIPostgres
Claude
65ROI
72Scale
$2.2k93Saved
ROI for
README.md
Mengapa subagent ini
Biasanya, menarik data terstruktur dari halaman web berarti menulis scraper sekali pakai yang langsung rusak begitu situsnya berubah. Ekstraktor ini bekerja berbeda—cukup berikan URL dan skema.
Anda tentukan field yang diinginkan, lalu sistem merender halaman, memetakan elemen-elemennya, dan mengembalikan data bersih yang tervalidasi. Ganti situs cukup dengan mengganti skema; tidak perlu menulis scraper baru, dan field yang tidak ada di halaman akan ditandai, bukan dikarang.
Cara kerjanya
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Gunakan skema yang telah ditentukan untuk memetakan elemen halaman ke dalam bidang data yang sesuai.
pending
Ekstrak datanya, sesuaikan tipe data, dan validasi setiap baris terhadap skema.
pending
Kembalikan catatan terstruktur yang bersih dan tandai bidang yang tidak disediakan oleh halaman.
pending
Contoh output
json
// Sample output
// (generated when the pipeline finishes)
Given a URL and a target schema, extract matching records as JSON conforming to the schema; set missing fields null and never invent values.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.