Các trang web hiện đại render bằng JavaScript, nên một request HTTP thông thường chỉ nhận về cái vỏ rỗng. Scraper này điều khiển trình duyệt thật để lấy dữ liệu thực sự được tải.
Các trang web hiện đại render bằng JavaScript, nên một request HTTP thông thường chỉ nhận về cái vỏ rỗng. Scraper này điều khiển trình duyệt thật để lấy dữ liệu thực sự được tải.
Nó chờ single-page app render xong, trích xuất các trường thành JSON có kiểu dữ liệu, và kiểm tra từng bản ghi trước khi lưu. Dữ liệu sạch đưa vào Postgres để truy vấn, JSON gốc lưu vào S3 làm bản dự phòng, nhờ đó thay đổi layout sẽ bị phát hiện thay vì âm thầm làm hỏng dataset của bạn.
Cách vận hành
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Trích xuất các trường thông tin vào bản ghi JSON có kiểu xác định dựa trên cấu trúc trang, thay vì dựa vào vị trí văn bản dễ gãy.
pending
Kiểm tra tính hợp lệ của từng bản ghi theo định dạng dự kiến và loại bỏ hoặc cảnh báo những mục bị lỗi.
pending
Ghi dữ liệu JSON vào S3 và lưu các hàng đã phân tích cú pháp vào Postgres để truy vấn.
pending
Ví dụ đầu ra
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.