Cumplimiento 8 de may. de 2026 · 7 min de lectura

Cómo documentar tus decisiones de moderación para una auditoría

Cuando llegue el regulador (o la demanda), "usamos IA" no es una respuesta. Qué registrar, cuánto tiempo conservarlo y qué significa "explicabilidad".

Eduardo Lázaro
Eduardo Lázaro
Fundador de ToxicFilter
Cómo documentar tus decisiones de moderación para una auditoría

En algún momento un regulador, la otra parte de un pleito o un periodista te va a hacer la misma pregunta: "¿Cómo decidisteis retirar ese contenido?". Si tu respuesta es "lo marcó la IA", no has contestado a la pregunta. Has abierto tres más.

Este artículo es una lista de lo que debes registrar y documentar para superar una inspección. Es la diferencia entre una conversación de dos horas con tu abogado y un proceso judicial de dos años.

Qué significa de verdad "preparado para una auditoría"

Significa que, para cualquier decisión de moderación concreta que hayas tomado, dentro de tu periodo de conservación, puedes aportar:

  1. El contenido exacto que se moderó.
  2. La decisión tomada (bloquear, retirar, advertir, poner en cola, permitir).
  3. La regla o la política que se aplicó.
  4. La evidencia que provocó la decisión: categoría del modelo, confianza, denuncia de un usuario, etc.
  5. Si intervino una persona y, en ese caso, quién y cuándo.
  6. La notificación enviada al usuario afectado.
  7. El resultado de cualquier recurso.

Si puedes aportar estos siete elementos, puedes responder a casi cualquier regulador. Si te saltas uno solo, no puedes.

El registro de decisiones de moderación, campo por campo

Un esquema mínimo:

decision_id           UUID
content_id            FK to the content (post, message, etc.)
content_snapshot      the content as it was at moderation time
user_id               author of the content
decided_at            timestamp, UTC
decision              enum: allow, warn, restrict, remove, queue, escalate
policy_reference      versioned policy ID the decision maps to
model_provider        e.g. "toxicfilter", "perspective", "internal"
model_version         exact model version
categories            array of categories triggered
confidence            float per category
automation_level      enum: auto, human_review, human_override
reviewer_id           nullable, FK to moderator
reviewer_note         optional free text from the moderator
notification_sent_at  timestamp of reasoned statement to user
appeal_id             nullable, FK to appeal record

Dos campos merecen atención especial:

content_snapshot

El contenido cambia. Los usuarios editan sus comentarios. Lo que se modera es el contenido tal como existía en el momento de la decisión. Si solo registras un puntero, no puedes reconstruir lo que estabas mirando. Guarda la instantánea junto a la decisión, o en un almacenamiento inmutable con ella.

policy_reference

Las políticas también cambian. "Retirado por discurso de odio" según la v3 de tu política no es lo mismo que "retirado por discurso de odio" según la v5. Versiona tu política como si fuera código y anota en cada decisión la versión concreta en la que se basa.

La explicabilidad ya no es opcional

Varios marcos normativos exigen ya "información significativa sobre la lógica aplicada" cuando las decisiones automatizadas afectan a personas:

  • El artículo 22 del RGPD, sobre decisiones individuales automatizadas.
  • El artículo 17 del DSA (Reglamento de Servicios Digitales), sobre la declaración de motivos.
  • Los requisitos de transparencia del Reglamento de Inteligencia Artificial de la UE para los sistemas de alto riesgo.

"Nuestra IA devolvió una puntuación de 0,87" no es información significativa. "Nuestro clasificador de discurso de odio marcó tu mensaje por atacar a un colectivo protegido, principalmente por la frase [frase citada]" sí lo es. Esto significa que tu capa de modelo tiene que producir no solo una puntuación, sino un motivo o una atribución de fragmento, es decir, la parte concreta del contenido que motivó la decisión. Las API de moderación modernas (ToxicFilter incluida) los devuelven por defecto; las más antiguas, no.

Qué conservar y durante cuánto tiempo

Decidir cuánto conservar es buscar un equilibrio. Conservar más tiempo ayuda en las auditorías y en el seguimiento de reincidentes; conservar menos reduce el riesgo para la privacidad y la exposición ante una brecha de datos. Un punto de partida razonable:

Datos Conservación Por qué
Instantánea completa del contenido moderado De 90 a 180 días Cubre los recursos y las consultas regulatorias a corto plazo
Metadatos de la decisión (sin instantánea) 2 años Detección de patrones e informes de transparencia
Registros de recursos 2 años como mínimo Defensa ante litigios
Registros relacionados con CSAM Según jurisdicción A menudo con obligación de denuncia, a menudo con conservación larga

Documenta la política de conservación. Automatiza el borrado. No hay nada más dañino en una auditoría que "pensábamos borrarlos, pero no lo hicimos".

La declaración de motivos al usuario

Con el DSA, cada medida que tomas exige una explicación por escrito al usuario afectado. Una plantilla:

Hola, [usuario]:

El [fecha] retiramos tu [publicación/mensaje/comentario] por el siguiente motivo:
[infracción concreta de la política, p. ej. "acoso dirigido a otro usuario"].

Esta decisión la tomó [nuestro sistema automatizado de moderación / una persona revisora / nuestro sistema automatizado y la confirmó una persona].

Si crees que ha sido un error, puedes recurrirla aquí: [enlace]. Los recursos los revisa una persona y se resuelven en un plazo de [X] días.

El contenido retirado: [contenido citado o enlace a él].

La política completa está disponible aquí: [enlace a la política versionada].

Esta única plantilla, bien rellenada y enviada siempre, cumple con la mayoría de las obligaciones regulatorias de transparencia.

Haz un simulacro de auditoría

Una vez al año, pide a alguien (la asesoría jurídica interna, un consultor externo o incluso un ingeniero capaz que no sea del equipo de moderación) que haga de regulador en un simulacro:

  1. Elegir al azar 20 decisiones de moderación del último trimestre.
  2. Para cada una, preguntar: qué se retiró, por qué, quién o qué lo decidió, con qué política, si se avisó al usuario, si recurrió y qué pasó.
  3. Cronometrar cuánto se tarda en dar la respuesta. Anotar lo que faltaba.

Si el ejercicio lleva más de una tarde o deja sin respuesta alguno de los siete elementos, sabes exactamente qué arreglar. Mejor encontrarlo tú que dejar que lo encuentre un regulador.

Pruébalo con tu tráfico real

Permitir, revisar o bloquear, y el motivo explicado. En el plan gratuito: 2.000 créditos al mes, sin tarjeta. Una comprobación cuesta 1 crédito, unos 8 si la lee el modelo y unos 10 por imagen.