Grupurile mari de chat devin toxice rapid, iar moderatorii umani nu pot citi fiecare mesaj la 2 noaptea. Acest detector evaluează fiecare postare pentru hărțuire, ură și amenințări în clipa în care apare, apoi le semnalează pe cele care trec linia.
Grupurile mari de chat devin toxice rapid, iar moderatorii umani nu pot citi fiecare mesaj la 2 noaptea. Acest detector evaluează fiecare postare pentru hărțuire, ură și amenințări în clipa în care apare, apoi le semnalează pe cele care trec linia.
Moderatorii primesc o alertă cu contextul mesajului și o acțiune sugerată, în loc de un flux brut copleșitor. Recidiviștii sunt înregistrați, așa că un tipar de mesaje de limită devine vizibil, în loc să treacă neobservat, câte unul pe rând.
Cum funcționează
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Evaluează nivelul de toxicitate, hărțuire și amenințări al fiecărui mesaj în raport cu pragurile stabilite.
pending
Semnalează mesajele care depășesc limita și notifică moderatorii cu contextul și o acțiune sugerată.
pending
Înregistrează infractorii și tiparele recurente, astfel încât moderatorii să poată identifica conturile problematice repetate.
pending
Exemplu de output
json
// Sample output
// (generated when the pipeline finishes)
Score this message for toxicity from 0 to 1 across harassment, hate, and threats; return JSON with reasons.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.