Große Chat-Gruppen kippen schnell ins Toxische, und menschliche Moderatoren können nicht um 2 Uhr nachts jede Nachricht lesen. Dieser Detektor bewertet jeden Beitrag auf Belästigung, Hass und Drohungen in dem Moment, in dem er eintrifft, und markiert dann die, die Ihre Grenze überschreiten.
Große Chat-Gruppen kippen schnell ins Toxische, und menschliche Moderatoren können nicht um 2 Uhr nachts jede Nachricht lesen. Dieser Detektor bewertet jeden Beitrag auf Belästigung, Hass und Drohungen in dem Moment, in dem er eintrifft, und markiert dann die, die Ihre Grenze überschreiten.
Moderatoren bekommen einen Alarm mit dem Nachrichtenkontext und einer empfohlenen Maßnahme statt eines rohen Schwalls. Wiederholungstäter werden protokolliert, sodass ein Muster grenzwertiger Nachrichten sichtbar wird, statt einzeln durchzurutschen.
So läuft er
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Jede Nachricht auf Toxizität, Belästigung und Drohungen gegen Ihre Schwellenwerte bewerten.
pending
Nachrichten über der Grenze markieren und Moderatoren mit dem Kontext und einer empfohlenen Maßnahme benachrichtigen.
pending
Auffällige und wiederkehrende Muster protokollieren, sodass Moderatoren immer wiederkehrende Problemkonten erkennen.
pending
Beispiel-Output
json
// Sample output
// (generated when the pipeline finishes)
Score this message for toxicity from 0 to 1 across harassment, hate, and threats; return JSON with reasons.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.