Duże grupy czatowe szybko stają się toksyczne, a ludzcy moderatorzy nie są w stanie przeczytać każdej wiadomości o drugiej w nocy. Ten detektor ocenia każdy wpis pod kątem nękania, mowy nienawiści i gróźb w chwili, gdy się pojawi, a potem oznacza te, które przekraczają Twoją granicę.
Duże grupy czatowe szybko stają się toksyczne, a ludzcy moderatorzy nie są w stanie przeczytać każdej wiadomości o drugiej w nocy. Ten detektor ocenia każdy wpis pod kątem nękania, mowy nienawiści i gróźb w chwili, gdy się pojawi, a potem oznacza te, które przekraczają Twoją granicę.
Moderatorzy dostają alert z kontekstem wiadomości i sugerowanym działaniem zamiast surowego zalewu treści. Recydywiści są rejestrowani, więc schemat wiadomości balansujących na granicy staje się widoczny, zamiast umykać po jednej naraz.
Jak działa
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Przypisuje każdemu komunikatowi wynik toksyczności, nękania i zagrożeń względem ustawionych progów.
pending
Oznacza wiadomości przekraczające próg i powiadamia moderatorów, dostarczając kontekst oraz sugerowane działania.
pending
Rejestruje sprawców i powtarzające się wzorce, aby moderatorzy mogli wyłapywać problemowych użytkowników.
pending
Przykładowe wyjście
json
// Sample output
// (generated when the pipeline finishes)
Score this message for toxicity from 0 to 1 across harassment, hate, and threats; return JSON with reasons.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.