Naivní dělení na chunky roztrhne větu v půlce a vyhledávání pak vrací nesmysly. Tento pipeline dělí dokumenty z Drive podle významu, takže každý úryvek dává smysl i sám o sobě.
Naivní dělení na chunky roztrhne větu v půlce a vyhledávání pak vrací nesmysly. Tento pipeline dělí dokumenty z Drive podle významu, takže každý úryvek dává smysl i sám o sobě.
Ke každému chunku před vložením do Pinecone přidá kontext sekce a v pravidelných intervalech vše přeindexuje. Výsledek? Vyhledávání, které skutečně odpovídá – ne fragmenty slepené odprostřed odstavce.
Jak běží
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Do každé části zahrňte krátký souhrmat nadřazené sekce, aby izolovaný text zachoval svůj význam.
pending
Vytvořte vektorové reprezentace obohacených částí a nahrajte je do Pinecone s metadaty o souboru a sekci.
pending
Pravidelně znovu indexujte změněné soubory, aby bylo vyhledávání přesné i při aktualizacích dokumentů.
pending
Ukázkový výstup
json
// Sample output
// (generated when the pipeline finishes)
Chunk the document by semantic section, prepend a one-line section summary to each chunk, then return embed-ready records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.