Các nhóm chat đông người rất dễ trở nên độc hại, và người kiểm duyệt không thể đọc hết mọi tin nhắn lúc 2 giờ sáng. Công cụ này chấm điểm từng tin nhắn về mức độ quấy rối, thù ghét và đe doạ ngay khi vừa gửi lên, rồi đánh dấu những tin vượt quá giới hạn bạn đặt ra.
Các nhóm chat đông người rất dễ trở nên độc hại, và người kiểm duyệt không thể đọc hết mọi tin nhắn lúc 2 giờ sáng. Công cụ này chấm điểm từng tin nhắn về mức độ quấy rối, thù ghét và đe doạ ngay khi vừa gửi lên, rồi đánh dấu những tin vượt quá giới hạn bạn đặt ra.
Người kiểm duyệt nhận cảnh báo kèm ngữ cảnh tin nhắn và hành động đề xuất thay vì một luồng tin thô hỗn loạn. Những người vi phạm nhiều lần được ghi nhận, để chuỗi tin nhắn nằm ở ranh giới trở nên rõ ràng thay vì lọt qua từng tin một.
Cách vận hành
Used at step 01 to kick off the pipeline.
Write
Used at step 01 to kick off the pipeline.
WebFetch
Used at step 01 to kick off the pipeline.
WebSearch
Used at step 01 to kick off the pipeline.
Đánh giá mức độ độc hại, quấy rối và đe dọa của từng tin nhắn dựa trên ngưỡng quy định.
pending
Cảnh báo các tin nhắn vượt quá ngưỡng an toàn, gửi thông báo cho quản trị viên kèm ngữ cảnh và hành động gợi ý.
pending
Ghi nhận tài khoản vi phạm và các mẫu hành vi lặp lại để quản trị viên dễ dàng phát hiện các tài khoản gây vấn đề thường xuyên.
pending
Ví dụ đầu ra
json
// Sample output
// (generated when the pipeline finishes)
Score this message for toxicity from 0 to 1 across harassment, hate, and threats; return JSON with reasons.
Unlock the rest
The full agent definition, install snippet, and starter task are gated for community members.
Members get the full `.md` agent file, the npm / pnpm install one-liners, a starter prompt that we've tuned against real runs, and the open-source repo when this automation ships there. One email, magic link, done.