Negocio 12 de may. de 2026 · 7 min de lectura

Human-in-the-loop: cuándo la IA no debería decidir sola

Automatizarlo todo es una trampa para algunas categorías de contenido. Cuándo escalar a una persona y cómo diseñar colas que el equipo pueda vaciar de verdad.

Eduardo Lázaro
Eduardo Lázaro
Fundador de ToxicFilter
Human-in-the-loop: cuándo la IA no debería decidir sola

La expresión "human-in-the-loop" (una persona en el circuito) se usa a la ligera. A veces significa "una persona aprueba cada decisión" (casi siempre inviable). A veces significa "una persona atiende las apelaciones" (el mínimo imprescindible). La versión útil, y la que merece la pena diseñar, está en medio: las personas toman las decisiones que la IA no está capacitada para tomar sola, y el sistema está construido para que eso ocurra de forma fiable sin desbordar a quien revisa.

Por qué automatizarlo todo es una trampa en algunas categorías

Los modelos de moderación son buenos reconociendo patrones. Se les dan mal el contexto, la intención y las decisiones que dependen de entender qué intentaba decir alguien. Algunas categorías dependen justo de eso:

  • Autolesiones e ideación suicida, donde la intención importa muchísimo. Un mensaje que expresa angustia no es lo mismo que uno que glorifica las autolesiones.
  • Discurso de odio en zonas grises: insultos reapropiados entre miembros del propio grupo, discurso de protesta, sátira.
  • Acoso dentro de relaciones, donde el mismo mensaje pesa distinto si viene de un desconocido o de un amigo íntimo.
  • Contenido sexual que depende del contexto: material educativo sobre salud sexual, arte, descripciones literarias.
  • Discurso político, incendiario pero protegido; cualquier exceso automatizado se convierte en un incidente de libertad de expresión.
  • Medidas de alto impacto: suspensiones permanentes de cuentas, sobre todo de usuarios con relación comercial.

En estas, el modelo es un filtro, no un juez. Acota el terreno. Decide una persona.

El árbol de decisión

Unas reglas de escalado que funcionan se parecen a esto:

  1. Permitir automáticamente: confianza del modelo por debajo del umbral en todas las categorías.
  2. Actuar automáticamente: confianza del modelo por encima de 0,95 en categorías donde los falsos positivos hacen poco daño (por ejemplo, spam o contenido adulto evidente en una app para todos los públicos).
  3. Escalar a una persona: confianza en la franja gris de 0,7 a 0,95 O cualquier confianza en autolesiones, seguridad de menores o discurso político.
  4. Escalar a T&S sénior: cualquier cosa con riesgo legal (CSAM, terrorismo) o que afecte a cuentas comerciales.
  5. Apelaciones, solo con personas: toda apelación de un usuario la revisa una persona, nunca se vuelve a puntuar con el modelo.

Así las personas están justo donde su criterio aporta valor, y se libran de la pesadez de revisar spam evidente.

Colas que el equipo pueda vaciar de verdad

Una cola no es más que una lista hasta que la diseñas. Unos pocos principios separan las colas que funcionan de las que se hunden bajo su propio peso.

Limita el tamaño de la cola

Si el volumen supera la capacidad de revisión, algo se rompe: o subes los umbrales (menos elementos en cola, más actuación automática, más errores) o publicas a ciegas. Una cola sin límite que crece en silencio es lo peor de ambas cosas.

Prioriza gravedad × alcance

Un mensaje de acoso entre dos desconocidos es urgente. El mismo mensaje, denunciado una vez en un muro que ven 10.000 usuarios, es más urgente. Pondera la cola por el producto de los dos, no por uno solo.

Agrupa los elementos relacionados

Un usuario que publica 50 elementos parecidos debería aparecer en la cola como una sola decisión, no como 50. Agrupar por similitud (mismo autor, mismo clúster, mismo hash de contenido con un 90% de similitud) reduce muchísimo la carga cognitiva.

Da a los revisores una acción clara por elemento

"Aprobar / Retirar / Suspender / Escalar / Saltar" es un buen conjunto de acciones. "Aquí tienes 14 casillas" no lo es. Limita las opciones para que las decisiones sean rápidas y coherentes.

Ten en cuenta la fatiga de decisión

Después de 200 elementos seguidos, la precisión cae. Impón descansos obligatorios. Rota a los revisores entre categorías (sobre todo en el contenido gráfico).

El circuito como fuente de datos de entrenamiento

Cada decisión humana es el dato más valioso que puede recibir tu modelo. Anotar explícitamente por qué la persona decidió lo que decidió, no solo sí o no, se convierte en señal de entrenamiento.

Un esquema de anotación mínimo:

  • Decisión (aprobar, retirar, suspender, escalar).
  • Motivo principal de una taxonomía fija (discurso de odio, acoso, spam, autolesiones, etc.).
  • Confianza (autoevaluada por el revisor, de 1 a 5).
  • Nota libre opcional.

Tras un trimestre de funcionamiento, los patrones que encuentres te dicen dónde debe mejorar tu modelo. Un modelo a medida entrenado con los desacuerdos concretos de tu cola puede reducir su volumen en un tercio.

Una conclusión que sorprende

Un sistema human-in-the-loop bien diseñado parece casi del todo automático. Los usuarios reciben decisiones rápidas. Los moderadores atienden un flujo constante y manejable de casos difíciles. Las apelaciones se resuelven en un día. Nadie se siente desbordado.

Uno mal diseñado parece caótico aunque sea casi todo automático. Los usuarios esperan días a que se decida. Los moderadores se queman. Las apelaciones se acumulan. Todo el mundo pierde la confianza.

La diferencia no está en la IA. Está en cómo se coordinan las personas y la IA, y en lo honesto que seas sobre el sitio de cada una.

Pruébalo con tu tráfico real

Permitir, revisar o bloquear, y el motivo explicado. En el plan gratuito: 2.000 créditos al mes, sin tarjeta. Una comprobación cuesta 1 crédito, unos 8 si la lee el modelo y unos 10 por imagen.