Parfois, le moyen le plus rapide de poser une question sur quelque chose est d'en prendre une photo. Envoyez une photo à ce bot Telegram : il fait tourner un modèle de vision, puis répond avec une décomposition structurée de ce qu'il voit.
Parfois, le moyen le plus rapide de poser une question sur quelque chose est d'en prendre une photo. Envoyez une photo à ce bot Telegram : il fait tourner un modèle de vision, puis répond avec une décomposition structurée de ce qu'il voit.
Vous récupérez les objets détectés, le texte lisible et une légende au lieu d'une vague supposition. L'image et son analyse sont enregistrées, si bien que vous pouvez rechercher parmi les photos passées au lieu de faire défiler le chat pour retrouver telle capture d'écran.
Comment il s'exécute
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Passer l'image à un modèle de vision avec une consigne sur le type d'analyse dont vous avez besoin.
pending
Renvoyer des champs structurés tels que les objets détectés, le texte et une courte description.
pending
Stocker la référence de l'image et son analyse pour que les résultats puissent être consultés plus tard.
pending
Exemple de sortie
json
// Sample output
// (generated when the pipeline finishes)
Analyze the attached image and return JSON with objects, any readable text, and a one-line caption.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.