Великі чат-групи швидко стають токсичними, а живі модератори не в змозі прочитати кожне повідомлення о другій ночі. Цей детектор оцінює кожне повідомлення на цькування, мову ненависті та погрози щойно воно з'являється, а потім позначає ті, що перетинають вашу межу.
Великі чат-групи швидко стають токсичними, а живі модератори не в змозі прочитати кожне повідомлення о другій ночі. Цей детектор оцінює кожне повідомлення на цькування, мову ненависті та погрози щойно воно з'являється, а потім позначає ті, що перетинають вашу межу.
Модератори отримують сповіщення з контекстом повідомлення та рекомендованою дією — замість нескінченного потоку. Повторних порушників фіксують у журналі, тож закономірність повідомлень на межі дозволеного стає помітною, а не прослизає по одному непомітно.
Як він працює
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Оцінює рівень токсичності, образ та погроз кожного повідомлення порівняно із заданими порогами.
pending
Позначає повідомлення, що перевищують норму, та сповіщає модераторів із контекстом і пропозицією дій.
pending
Ведеться журнал порушників та повторюваних шаблонів, щоб модератори могли виявляти проблемних користувачів.
pending
Приклад результату
json
// Sample output
// (generated when the pipeline finishes)
Score this message for toxicity from 0 to 1 across harassment, hate, and threats; return JSON with reasons.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.