Site-urile moderne se randează cu JavaScript, deci un simplu request HTTP returnează doar un schelet gol. Scraper-ul acesta pilotează un browser real ca să obțină datele care chiar se încarcă.
Site-urile moderne se randează cu JavaScript, deci un simplu request HTTP returnează doar un schelet gol. Scraper-ul acesta pilotează un browser real ca să obțină datele care chiar se încarcă.
Așteaptă ca aplicația single-page să se randeze, extrage câmpurile în JSON tipizat și validează fiecare înregistrare înainte să fie stocată. Rândurile curate ajung în Postgres pentru interogări, iar JSON-ul brut ajunge în S3 ca backup — așa o schimbare de layout e detectată, nu corupe dataset-ul în tăcere.
Cum funcționează
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Extrage câmpurile specificate într-o înregistrare JSON tipizată, bazându-te pe structura paginii, nu pe poziții text fragile.
pending
Validează fiecare înregistrare conform formei așteptate și elimină sau marchează orice element corupt.
pending
Scrie JSON-ul în S3 și rândurile analizate în Postgres pentru interogări.
pending
Exemplu de output
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.