Τα σύγχρονα sites κάνουν render με JavaScript, οπότε ένα απλό HTTP request επιστρέφει ένα άδειο κέλυφος. Αυτό το scraper οδηγεί έναν πραγματικό browser για να πάρει τα δεδομένα που όντως φορτώνουν.
Τα σύγχρονα sites κάνουν render με JavaScript, οπότε ένα απλό HTTP request επιστρέφει ένα άδειο κέλυφος. Αυτό το scraper οδηγεί έναν πραγματικό browser για να πάρει τα δεδομένα που όντως φορτώνουν.
Περιμένει να ολοκληρωθεί το render της single-page εφαρμογής, εξάγει τα πεδία σε typed JSON και επικυρώνει κάθε εγγραφή πριν αποθηκευτεί. Οι καθαρές γραμμές πηγαίνουν στην Postgres για queries και το ακατέργαστο JSON καταλήγει στο S3 ως backup, ώστε μια αλλαγή στο layout να εντοπίζεται αντί να αλλοιώνει σιωπηλά το dataset σας.
Πώς λειτουργεί
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Εξαγωγή των καθορισμένων πεδίων σε ένα typed JSON record, βασισμένο στη δομή της σελίδας και όχι σε ευαίσθητες μετατοπίσεις κειμένου.
pending
Έγκυρη επαλήθευση κάθε εγγραφής σύμφωνα με την αναμενόμενη μορφή και απόρριψη ή επισήμανση οποιουδήποτε μη έγκυρου στοιχείου.
pending
Εγγραφή του JSON στο S3 και των parsed rows στο Postgres για επεξεργασία.
pending
Δείγμα εξόδου
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.