Comunidades de videojuegos: detectar la toxicidad en el chat en tiempo real
El chat de los jugadores es rápido, está lleno de jerga y depende del contexto. Y apenas hay margen de latencia. Lo que de verdad funciona en producción.
El chat de los videojuegos es una pesadilla para la moderación y, a la vez, una oportunidad. El margen de latencia se mide en milisegundos. El lenguaje está lleno de jerga, depende del contexto y abunda el "fuego amigo" que a un modelo poco preparado le parecería tóxico. Y aun así es el entorno en el que una buena moderación mejora el producto de forma más visible, porque los compañeros de equipo tóxicos son uno de los principales motivos por los que los jugadores abandonan.
Por qué el chat de los videojuegos es distinto
Casi todos los consejos de moderación están pensados para secciones de comentarios y redes sociales. En el chat de un juego hay cuatro cosas que tiran por tierra esos supuestos a la vez:
- Latencia. Una comprobación de moderación que añade 200 ms al aviso de un compañero hace que el chat sea inservible. El margen es de 20 a 40 ms, ida y vuelta, incluido el tramo de red.
- Registro. "Mátalo", "eres basura" o "get rekt" son parte del juego, no acoso. Un modelo entrenado con datos de redes sociales los marcará todos.
- Jugadores que intentan burlar el filtro. Los jugadores aprenden cómo funciona el filtro en minutos y lo esquivan con ortografía creativa, leet y alfabetos mezclados.
- Cambio de idioma. Los equipos multilingües pasan al español a mitad de frase, vuelven al inglés y luego al coreano. La moderación basada en traducción se viene abajo.
El problema del umbral
Si pones el umbral de toxicidad en 0,8 (lo que usarías en un marketplace), el chat de un juego se llenará de falsos positivos. Si lo pones en 0,95, se te escapa el acoso de verdad.
El enfoque correcto son los umbrales por categoría. Para el chat de un juego:
- Pique competitivo → umbral de 0,95 o más, y solo si va dirigido a un usuario concreto o contiene insultos discriminatorios.
- Discurso de odio → umbral de 0,75. Tolerancia cero en todos los casos.
- Acoso sexual → umbral de 0,80. Distintos equipos, distintas sensibilidades.
- Contenido sobre autolesiones → umbral de 0,65 (quieres una exhaustividad alta, porque es mejor revisar un falso positivo que pasar por alto un caso real).
Hay dos daños que solo se ven en la conversación entera, no en un mensaje suelto: un equipo que se ceba con un jugador y un adulto que se acerca a un menor.
Opciones en tiempo real
Con un margen de unas pocas decenas de milisegundos, lo que de verdad decides es en qué momento se hace la comprobación respecto a cuándo llega el mensaje a los demás jugadores. Hay tres formas de colocarla, y cada una cambia latencia por el tiempo que un mensaje tóxico queda a la vista.
Bloqueo antes del envío
El cliente del chat envía primero el mensaje a tu servidor, tú lo compruebas con la API de moderación y solo lo difundes si se aprueba. Limpio y determinista. El usuario ve un aviso de "mensaje bloqueado" si su texto no pasa. El margen de latencia es estrecho, pero alcanzable con 30 ms de ida y vuelta.
Retirada después del envío
El mensaje se difunde en el acto. La moderación se ejecuta en paralelo. Si vuelve bloqueado en menos de un segundo, el mensaje se retira en todos los clientes (se sustituye por "[retirado por moderación]"). A favor: cero latencia añadida en el caso normal. En contra: los usuarios ven brevemente mensajes tóxicos, y la experiencia de la retirada es brusca.
Híbrido
Lo que hacen la mayoría de los grandes juegos. Ejecuta un clasificador pequeño en el dispositivo (o una comprobación rápida de palabras clave o hashes en el servidor) para lo evidente, y deja pasar el resto con una comprobación profunda asíncrona. La parte del dispositivo detecta el 70 % del abuso sin latencia; la asíncrona detecta el resto con una retirada limpia.
Puntuar al usuario, no al mensaje
Muchas decisiones de moderación no deberían centrarse en el mensaje, sino en el usuario. Un mensaje que puntúa 0,7 en toxicidad desde una cuenta creada ese mismo día con un patrón de mensajes parecidos es muy distinto del mismo 0,7 desde una cuenta de cinco años con un historial limpio.
La implementación práctica:
- Cada mensaje moderado actualiza una media móvil de toxicidad del autor.
- Los usuarios por encima de un umbral reciben sanciones más duras en sus siguientes mensajes.
- La puntuación vuelve a bajar con el tiempo (se premia el buen comportamiento).
- Los usuarios con bloqueo total arrastran una señal de dispositivo, IP o pago, no solo un id de cuenta.
Esto convierte la moderación de "bloquear este mensaje" en "ayudar a que esta comunidad se sienta segura", y reduce el comportamiento tóxico mucho más que cualquier enfoque mensaje a mensaje.
Unas palabras sobre el chat de voz
La moderación de voz es otro mundo: primero se transcribe y luego se modera el texto de la transcripción. El cuello de botella es la latencia de la transcripción (normalmente de 500 a 1.500 ms para una frase corta). No puedes bloquear la voz antes del envío, así que el esquema siempre es "retirar después de difundir". La parte buena: la toxicidad por voz suele ser más grave que la escrita, así que la retirada es una intervención que importa incluso tarde.
Las métricas que importan
Contar mensajes bloqueados te dice cuánto trabaja el filtro, no si los jugadores están mejor. Estas cuatro cifras miden lo que la toxicidad le hace de verdad al juego:
- Denuncias por cada 1.000 mensajes: la señal que viene de los usuarios.
- Exposición a mensajes tóxicos por sesión: cuántos mensajes tóxicos ve de media un jugador por partida.
- Diferencia de abandono según la exposición: ¿abandonan más los jugadores que vieron más toxicidad en su primera semana? (Spoiler: siempre sí.)
- Tasa de reincidencia: porcentaje de usuarios sancionados que vuelven a ser sancionados en 30 días. Cuanto más baja, mejor, pero cero significa que tu modelo está atascado en el bloqueo automático en lugar de educar.
Bien hecha, la moderación en los videojuegos se vuelve casi invisible para los buenos jugadores y determinista para los malos. Mal hecha, se convierte en aquello de lo que todo el mundo se queja en el subreddit. La diferencia no es el proveedor. Son las decisiones sobre el punto de operación, el diseño de la puntuación de usuarios y si tu equipo trata la moderación como un producto vivo o como un trámite de cumplimiento.
Sigue leyendo
EdTech: por qué las plataformas educativas necesitan filtros de contenido más estrictos
Niños, profesores, reguladores, padres. El mismo mensaje que en otro sitio no tiene importancia aquí provoca u...
Foros y comunidades: cómo combinar la moderación automática con la revisión humana
Las máquinas y los moderadores funcionan mejor en equipo. Arquitecturas de colas, reglas de escalado y cómo ma...
Apps de citas: filtrar desnudos y acoso sin arruinar la experiencia
Demasiado estricto y pierdes conversaciones. Demasiado laxo y pierdes usuarios (y te expones legalmente). La c...