Fragmentarea naivă taie o propoziție în două, iar recuperarea returnează nonsens. Acest pipeline fragmentează documentele din Drive pe baza sensului, astfel încât fiecare bucată rămâne inteligibilă de sine stătătoare.
Fragmentarea naivă taie o propoziție în două, iar recuperarea returnează nonsens. Acest pipeline fragmentează documentele din Drive pe baza sensului, astfel încât fiecare bucată rămâne inteligibilă de sine stătătoare.
Adaugă contextul secțiunii în fața fiecărui fragment înainte de generarea embeddingurilor în Pinecone, apoi reindexează conform unui program. Rezultatul este o recuperare care chiar răspunde, nu fragmente cârpite din mijlocul unui paragraf.
Cum funcționează
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Includem un rezumat scurt al secțiunii parentale în fiecare fragment, astfel încât textul izolat să își păstreze sensul.
pending
Generăm vectori de embed pentru fragmentele îmbogățite și le inserăm sau actualizăm în Pinecone, împreună cu metadatele despre fișier și secțiune.
pending
Re-indexăm fișierele modificate la intervale regulate, menținând acuratețea recuperării pe măsură ce documentele evoluează.
pending
Exemplu de output
json
// Sample output
// (generated when the pipeline finishes)
Chunk the document by semantic section, prepend a one-line section summary to each chunk, then return embed-ready records.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.