Divulgación 10 de abr. de 2026 · 7 min de lectura

Precisión, exhaustividad y F1 explicadas a equipos de producto (no solo a los de ML)

No hace falta haber estudiado estadística para opinar sobre la calidad de un modelo. Una guía sin tecnicismos de las métricas que deciden si tu moderador es bueno.

Eduardo Lázaro
Eduardo Lázaro
Fundador de ToxicFilter
Precisión, exhaustividad y F1 explicadas a equipos de producto (no solo a los de ML)

Si eres PM, responsable de ingeniería o fundador y trabajas con una API de moderación, en cada revisión técnica vas a oír tres palabras: precisión (precision), exhaustividad (recall) y F1. Suenan a jerga estadística. En realidad son las decisiones de producto más importantes que todavía no has tomado.

Aquí va una explicación sin tecnicismos, sin ninguna ecuación que no puedas calcular de cabeza.

El planteamiento

Tu modelo de moderación mira un contenido y decide: marcarlo o dejarlo pasar. Después, una persona etiqueta si debería haberse marcado. Eso te da cuatro casillas:

  • Verdadero positivo: el modelo lo marcó y de verdad era malo.
  • Falso positivo: el modelo lo marcó, pero estaba bien.
  • Falso negativo: el modelo lo dejó pasar, pero era malo.
  • Verdadero negativo: el modelo lo dejó pasar y estaba bien.

Ahora, las tres métricas:

Precisión: "cuando marcamos, ¿cuántas veces acertamos?"

Precisión = (verdaderos positivos) / (lo que marcamos).

Si tu modelo marca 100 mensajes y 85 de ellos eran malos de verdad, la precisión es del 85%. Los otros 15 son falsos positivos: usuarios legítimos a los que acabas de irritar.

La precisión alta es lo que notan tus usuarios. Cada punto que baja la precisión, suben las incidencias de soporte. Marketing lo llama un "problema de confianza". En realidad es un problema de matemáticas.

Exhaustividad: "de todo lo malo, ¿cuánto detectamos?"

Exhaustividad = (verdaderos positivos) / (todo lo malo que había).

Si hoy se publicaron 200 mensajes malos y tu modelo detectó 140, la exhaustividad es del 70%. Los otros 60 se colaron como falsos negativos. Son los mensajes que verán la víctima del acoso, el periodista que escribe el reportaje de denuncia y el regulador que revisa tu plataforma.

La exhaustividad alta es lo que notan tus reguladores y tu equipo de marca. Cada vez que baja, sube la probabilidad de que algo embarazoso (o ilegal) se haga viral.

F1: la métrica del término medio

F1 es la media armónica de la precisión y la exhaustividad. Si cualquiera de las dos se hunde, F1 se hunde con ella. Esa es la gracia: F1 te penaliza por ser muy bueno en una y muy malo en la otra.

Verás que los proveedores citan F1 porque un único número se vende mejor. Sirve como comprobación rápida, pero nunca compres un modelo solo por su F1. Pide siempre la precisión y la exhaustividad por separado, porque el equilibrio correcto depende de qué estés moderando.

El equilibrio que tienes que elegir

Todo modelo de moderación tiene un umbral. Umbral bajo → marcas más cosas → sube la exhaustividad, baja la precisión. Umbral alto → marcas menos cosas → sube la precisión, baja la exhaustividad. No puedes mejorar las dos moviendo el umbral. Solo puedes mejorar las dos con un modelo mejor.

Esto importa porque cada categoría de contenido necesita un punto de operación distinto:

Categoría Prioriza Por qué
CSAM, terrorismo Exhaustividad Un solo fallo es catastrófico
Toxicidad leve Precisión Los falsos positivos alejan a usuarios reales
Spam Exhaustividad Los atacantes no son usuarios reales; mejor pasarse de agresivo
Discurso de odio Ambas Las personas revisan la zona dudosa
NSFW en una app infantil Exhaustividad Deber legal y ético de protección
NSFW en una plataforma de arte Precisión Bloquear arte legítimo es un riesgo existencial para el producto

Tres preguntas para tu próxima reunión con un proveedor

  1. "¿Cuáles son la precisión y la exhaustividad, por separado, con el umbral que recomendáis para mi caso de uso?"
  2. "¿Cuál es la curva de precisión/exhaustividad? ¿Puedo ajustar yo el umbral?"
  3. "¿Eso está medido con vuestros datos de prueba o con datos que se parezcan a los míos?"

La última es la que más importa. Un proveedor que cita un 98% de precisión en un benchmark que no se parece en nada a tus usuarios te está vendiendo un número, no un modelo. El benchmark correcto es una muestra de tu contenido, etiquetada por tu equipo.

Conclusión para producto

Estas métricas no son académicas. Cada clic en el control del umbral es una decisión de producto sobre a qué tipo de usuario estás dispuesto a decepcionar: al que publica contenido malo o al que acusas por error de publicarlo. Eso no lo pueden decidir los ingenieros. Tiene que salir de producto, trust & safety y legal, juntos. Con estas tres palabras claras, por fin puedes tener esa conversación.

Pruébalo con tu tráfico real

Permitir, revisar o bloquear, y el motivo explicado. En el plan gratuito: 2.000 créditos al mes, sin tarjeta. Una comprobación cuesta 1 crédito, unos 8 si la lee el modelo y unos 10 por imagen.