Nowoczesne strony renderują się w JavaScripcie, więc zwykłe żądanie HTTP zwraca pustą skorupę. Ten scraper steruje prawdziwą przeglądarką, żeby pobierać dane, które faktycznie się ładują.
Nowoczesne strony renderują się w JavaScripcie, więc zwykłe żądanie HTTP zwraca pustą skorupę. Ten scraper steruje prawdziwą przeglądarką, żeby pobierać dane, które faktycznie się ładują.
Czeka, aż aplikacja jednostronicowa się wyrenderuje, wydobywa pola do typowanego JSON-a i waliduje każdy rekord przed zapisem. Czyste wiersze trafiają do Postgresa do odpytywania, a surowy JSON ląduje w S3 jako kopia zapasowa — dzięki temu zmiana układu strony zostaje wychwycona, zamiast po cichu psuć Twój zbiór danych.
Jak działa
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Wyodrębnij wskazane pola do sformatowanego rekordu JSON, opierając się na strukturze strony, a nie na niezawodnych przesunięciach tekstu.
pending
Zweryfikuj każdy rekord pod kątem oczekiwanego kształtu danych i odrzuć lub oznacz wszystkie błędne wpisy.
pending
Zapisz dane JSON w S3, a sparsowane wiersze przenieś do Postgres w celu późniejszych zapytań.
pending
Przykładowe wyjście
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.