Složka naskenovaných PDF je k ničemu, dokud ji někdo nepřepíše do tabulky. Tohle provede celou dávku přes OCR a strukturovanou extrakci do jednoho CSV.
Složka naskenovaných PDF je k ničemu, dokud ji někdo nepřepíše do tabulky. Tohle provede celou dávku přes OCR a strukturovanou extrakci do jednoho CSV.
Přečte každý soubor, namapuje ho na vaši šablonu sloupců, ověří formáty a poskládá výsledky do jednoho čistého CSV. Neúspěšné soubory jsou uvedeny zvlášť, aby nic nezmizelo.
Jak běží
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Aplikujte svou šablonu polí, aby každý dokument odpovídal stejnému sadě sloupců.
pending
Ověřte typy a formáty, jako jsou data a měna, před přijetím řádku.
pending
Připojte strukturované řádky do jednoho CSV souboru a vypište soubory, které selhaly při extrakci.
pending
Ukázkový výstup
json
// Sample output
// (generated when the pipeline finishes)
Extract the template fields from each document into a consistent CSV row; output null where a field is absent.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.