Las webs modernas se renderizan con JavaScript, así que una petición HTTP simple devuelve una cáscara vacía. Este scraper maneja un navegador real para obtener los datos que de verdad se cargan.
Las webs modernas se renderizan con JavaScript, así que una petición HTTP simple devuelve una cáscara vacía. Este scraper maneja un navegador real para obtener los datos que de verdad se cargan.
Espera a que la single-page app renderice, extrae los campos en JSON tipado y valida cada registro antes de guardarlo. Las filas limpias van a Postgres para consultarlas y el JSON en bruto aterriza en S3 como copia de seguridad, así un cambio de maquetación se detecta en vez de corromper tu dataset en silencio.
Cómo se ejecuta
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Extrae los campos indicados en un registro JSON tipado usando la estructura de la página, no posiciones de texto frágiles.
pending
Valida cada registro contra la forma esperada y descarta o marca cualquier cosa malformada.
pending
Escribe el JSON en S3 y las filas procesadas en Postgres para poder consultarlas.
pending
Salida de ejemplo
json
// Sample output
// (generated when the pipeline finishes)
Render a single-page app, extract fields into validated JSON, and write to S3 and Postgres, flagging malformed records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.