Divulgación 4 de abr. de 2026 · 6 min de lectura

Spam, toxicidad y NSFW: cómo clasificar y tratar cada tipo de contenido

Estos tres problemas se parecen, pero exigen estrategias de detección y respuestas distintas. Te explicamos cómo distinguirlos con claridad.

Eduardo Lázaro
Eduardo Lázaro
Fundador de ToxicFilter
Spam, toxicidad y NSFW: cómo clasificar y tratar cada tipo de contenido

Hay tres palabras que se mezclan en cualquier conversación sobre moderación de contenido: spam, toxicidad y NSFW. Las tres describen contenido que probablemente no quieres, pero no son intercambiables. Se detectan con modelos distintos, las producen actores distintos y exigen estrategias de respuesta distintas. Confundirlas es uno de los errores más comunes que vemos al poner en marcha la moderación.

Spam: intención comercial y repetición masiva

El spam es contenido pensado para sacar a un usuario de tu plataforma y meterlo en el embudo de otro. Enlaces, propuestas de afiliados, suplantaciones, reseñas falsas, estafas de criptomonedas, ofertas de dropshipping.

El atacante: normalmente automatizado o semiautomatizado. El volumen es lo que busca.

La señal: repetición entre cuentas, patrones de enlaces, ritmo de publicación poco natural, antigüedad de la cuenta y, con los modelos modernos, similitud semántica con plantillas de spam conocidas.

La respuesta adecuada: bloqueo tajante y en silencio. Nunca le muestres al usuario que se ha detectado su spam; eso solo le sirve para ajustar la táctica. Shadow-ban, y que la señal siga siendo fiable.

Toxicidad: comportamiento social dañino, a menudo de usuarios reales

La toxicidad es contenido que hace daño a otros usuarios: acoso, insultos, discurso de odio, amenazas, acecho, doxxing. A diferencia del spam, el atacante suele ser un usuario real y activo que está teniendo un mal día (o un mal año). Eso lo cambia todo.

El atacante: con frecuencia, un usuario legítimo. Tiene historial en tu plataforma. Puede que te haya pagado.

La señal: lenguaje dirigido contra una persona o un grupo protegido, escalada de gravedad, ataques personales. Depende mucho del contexto (sarcasmo, lenguaje reapropiado, bromas dentro del grupo).

La respuesta adecuada: transparente. Dile al usuario qué se ha bloqueado y por qué, para que pueda editarlo. Sanciones progresivas: aviso → límite de frecuencia → expulsión temporal → suspensión. Porque los usuarios reales merecen la oportunidad de corregirse.

El spam recibe un trato silencioso porque los atacantes aprenden de cada señal. La toxicidad recibe un trato transparente porque los usuarios aprenden de las reglas claras.

NSFW: contenido sexual y explícito, sobre todo visual

NSFW (Not Safe For Work, no apto para el trabajo) abarca imágenes sexuales, desnudos, violencia explícita, gore y, cada vez más, suplantaciones generadas por IA (deepfakes). Detectarlo es sobre todo un problema de visión artificial, y los fallos son muy distintos de los del texto.

El atacante: va desde el descuido (publicar una foto en bikini en una app para todos los públicos) hasta la malicia (imágenes no consentidas, CSAM).

La señal: clasificación a nivel de píxel más metadatos (EXIF, dominio de origen, patrón de subida).

La respuesta adecuada: depende por completo de tu plataforma. Una comunidad artística y una app educativa infantil ponen el límite en sitios completamente distintos. No existe un umbral de NSFW universal.

Tabla rápida para decidir

Dimensión Spam Toxicidad NSFW
Tipo de atacante Sobre todo bots / granjas Usuarios reales Mixto
Formato principal Texto + enlaces Texto Imágenes / vídeo
Transparencia Silencioso Transparente Transparente
Apelación del usuario Rara vez necesaria Imprescindible Imprescindible
Importancia del contexto Baja Alta Muy alta
Riesgo legal Medio (fraude) Alto (acoso) Máximo (CSAM, NCII)

En la práctica

No montes un único flujo de "contenido malo". Monta tres, con distintos:

  • Umbrales. Te interesa un recall alto en el spam (atrapar todo lo posible, en silencio), una precisión alta en la toxicidad (no castigar por error a usuarios legítimos) y umbrales calibrados según tu público en el NSFW.
  • Flujos de respuesta. Spam → bloquear y olvidar. Toxicidad → avisar, limitar, escalar. NSFW → bloquear, revisión humana para los casos límite, denuncia obligatoria del contenido ilegal.
  • Registro. Reglas de conservación distintas, requisitos de auditoría distintos, riesgos legales distintos.

Cuando un equipo nos dice "nuestra moderación no funciona", 8 de cada 10 veces el problema real es que han aplicado un solo flujo a los tres. Sepáralos primero. Ajusta cada uno por separado. Todo se vuelve más fácil.

Pruébalo con tu tráfico real

Permitir, revisar o bloquear, y el motivo explicado. En el plan gratuito: 2.000 créditos al mes, sin tarjeta. Una comprobación cuesta 1 crédito, unos 8 si la lee el modelo y unos 10 por imagen.