Trích xuất dữ liệu có cấu trúc từ một trang web thường đồng nghĩa với việc viết một scraper dùng một lần, rồi nó hỏng ngay khi trang thay đổi. Trình trích xuất này hoạt động khác: bạn chỉ cần đưa vào một URL và một schema.
sonnet4 ngàyFirecrawlPlaywrightOpenAIPostgres
Claude
65ROI
72Scale
$2.2k93Saved
ROI for
README.md
Tại sao chọn subagent này
Trích xuất dữ liệu có cấu trúc từ một trang web thường đồng nghĩa với việc viết một scraper dùng một lần, rồi nó hỏng ngay khi trang thay đổi. Trình trích xuất này hoạt động khác: bạn chỉ cần đưa vào một URL và một schema.
Bạn mô tả các trường dữ liệu cần lấy, nó sẽ render trang, ánh xạ các phần tử, và trả về bản ghi sạch đã được xác thực. Muốn đổi trang? Chỉ cần đổi schema — không cần viết scraper mới, và bất kỳ trường nào trang không có sẽ được đánh dấu thay vì bịa ra.
Cách vận hành
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Áp dụng schema đã định nghĩa để ánh xạ các phần tử trên trang vào các trường tương ứng.
pending
Trích xuất dữ liệu, chuẩn hóa kiểu dữ liệu và xác thực từng dòng theo schema.
pending
Trả về các bản ghi có cấu trúc sạch sẽ và cảnh báo các trường mà trang web không cung cấp.
pending
Ví dụ đầu ra
json
// Sample output
// (generated when the pipeline finishes)
Given a URL and a target schema, extract matching records as JSON conforming to the schema; set missing fields null and never invent values.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.