Les grands groupes de discussion virent vite au toxique, et des modérateurs humains ne peuvent pas lire chaque message à 2 h du matin. Ce détecteur note chaque publication pour le harcèlement, la haine et les menaces dès qu'elle arrive, puis signale celles qui franchissent votre ligne.
Les grands groupes de discussion virent vite au toxique, et des modérateurs humains ne peuvent pas lire chaque message à 2 h du matin. Ce détecteur note chaque publication pour le harcèlement, la haine et les menaces dès qu'elle arrive, puis signale celles qui franchissent votre ligne.
Les modérateurs reçoivent une alerte avec le contexte du message et une action suggérée, au lieu d'un flot brut. Les récidivistes sont consignés, si bien qu'un enchaînement de messages limites devient visible au lieu de passer un par un.
Comment il s'exécute
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Noter chaque message pour la toxicité, le harcèlement et les menaces au regard de vos seuils.
pending
Signaler les messages qui franchissent la ligne et prévenir les modérateurs avec le contexte et une action suggérée.
pending
Consigner les fautifs et les schémas récurrents pour que les modérateurs repèrent les comptes posant problème.
pending
Exemple de sortie
json
// Sample output
// (generated when the pipeline finishes)
Score this message for toxicity from 0 to 1 across harassment, hate, and threats; return JSON with reasons.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.