Cómo moderar comentarios y publicaciones en tiempo real
Llama a la API antes de publicar una publicación, un comentario o un mensaje y actúa según una de tres respuestas: publicarlo, retenerlo para que lo vea una persona o rechazarlo. Casi todo el tráfico de una comunidad es alguien diciéndole algo normal a otra persona, y eso lo resuelven las comprobaciones gratuitas en torno a un milisegundo, así que moderar no añade una espera que se note al publicar. El modelo solo lee lo que ellas dejan abierto. Lo que llega como review espera en una cola, en tu panel o por la API, y un webhook firmado avisa a tu web cuando alguien lo aprueba.
Cómo detectar el acoso, también en grupo
El acoso son dos problemas distintos. Una persona insultando a otra se ve en un solo mensaje, y ToxicFilter lo puntúa como harassment cuando el insulto va dirigido a quien lee y no a una situación ("este juego es una mierda" no es "eres idiota"). El acoso en grupo no se ve en ningún mensaje suelto: son muchas personas distintas haciéndole lo mismo a una. Manda el hilo a /v1/conversation con el autor de cada mensaje y el número de personas hostiles distintas pasa a formar parte del veredicto, con un motivo que dice cuántas eran.
Insultos camuflados: por qué no basta con una lista de palabras
Una lista de palabras prohibidas pilla a los que no lo intentaban. Todos los demás escriben put*, p u t o, una letra griega en lugar de una latina o un espacio invisible en medio. ToxicFilter convierte todo eso otra vez en letras normales antes de buscar, e informa de cuánto del mensaje iba camuflado como un hallazgo propio, en evasion. Una lista de palabras permitidas las tapa antes de que nada las busque, así que Scunthorpe, cockpit o shiitake no caen nunca.
Amenazas, odio y violencia
Una amenaza dirigida a quien lee ("sé dónde vives") se rechaza como violence. Los ataques a colectivos van a hate, sobre todo a través del modelo: las listas de palabras públicas no llevan insultos de odio a propósito, porque una lista completa de ellos solo tiene otro uso, y puedes apuntar ToxicFilter a tu propia lista. Un buen historial en tu plataforma nunca rebaja el umbral de ninguna de las dos.
Autolesiones y suicidio: retener, nunca borrar
Una publicación de alguien que dice que quiere morir puede ser alguien pidiendo ayuda, y retirarla es apartarle. self_harm retiene para revisión y nunca bloquea salvo que tú lo decidas, la respuesta explica el motivo con palabras, y el webhook moderation.review puede avisar a quien en tu equipo esté preparado para responder. Es la única categoría en la que lo correcto por defecto es lo más suave.
Cómo elegir los umbrales de tu comunidad
Empieza por la plantilla de comunidad, que retiene antes las palabrotas para que alguien las mire y aun así nunca rechaza un mensaje solo por eso, y que rechaza antes que los umbrales por defecto el acoso, el odio, las amenazas y los acercamientos a menores. Después, prueba cualquier cambio como una segunda política que funciona en paralelo con la que está activa: se calculan los dos veredictos sobre tu propio tráfico, solo uno decide, y el panel te enseña en qué no coinciden antes de que cambies.