Precisión, exhaustividad y F1 explicadas a equipos de producto (no solo a los de ML)
No hace falta haber estudiado estadística para opinar sobre la calidad de un modelo. Una guía sin tecnicismos de las métricas que deciden si tu moderador es bueno.
Si eres PM, responsable de ingeniería o fundador y trabajas con una API de moderación, en cada revisión técnica vas a oír tres palabras: precisión (precision), exhaustividad (recall) y F1. Suenan a jerga estadística. En realidad son las decisiones de producto más importantes que todavía no has tomado.
Aquí va una explicación sin tecnicismos, sin ninguna ecuación que no puedas calcular de cabeza.
El planteamiento
Tu modelo de moderación mira un contenido y decide: marcarlo o dejarlo pasar. Después, una persona etiqueta si debería haberse marcado. Eso te da cuatro casillas:
- Verdadero positivo: el modelo lo marcó y de verdad era malo.
- Falso positivo: el modelo lo marcó, pero estaba bien.
- Falso negativo: el modelo lo dejó pasar, pero era malo.
- Verdadero negativo: el modelo lo dejó pasar y estaba bien.
Ahora, las tres métricas:
Precisión: "cuando marcamos, ¿cuántas veces acertamos?"
Precisión = (verdaderos positivos) / (lo que marcamos).
Si tu modelo marca 100 mensajes y 85 de ellos eran malos de verdad, la precisión es del 85%. Los otros 15 son falsos positivos: usuarios legítimos a los que acabas de irritar.
La precisión alta es lo que notan tus usuarios. Cada punto que baja la precisión, suben las incidencias de soporte. Marketing lo llama un "problema de confianza". En realidad es un problema de matemáticas.
Exhaustividad: "de todo lo malo, ¿cuánto detectamos?"
Exhaustividad = (verdaderos positivos) / (todo lo malo que había).
Si hoy se publicaron 200 mensajes malos y tu modelo detectó 140, la exhaustividad es del 70%. Los otros 60 se colaron como falsos negativos. Son los mensajes que verán la víctima del acoso, el periodista que escribe el reportaje de denuncia y el regulador que revisa tu plataforma.
La exhaustividad alta es lo que notan tus reguladores y tu equipo de marca. Cada vez que baja, sube la probabilidad de que algo embarazoso (o ilegal) se haga viral.
F1: la métrica del término medio
F1 es la media armónica de la precisión y la exhaustividad. Si cualquiera de las dos se hunde, F1 se hunde con ella. Esa es la gracia: F1 te penaliza por ser muy bueno en una y muy malo en la otra.
Verás que los proveedores citan F1 porque un único número se vende mejor. Sirve como comprobación rápida, pero nunca compres un modelo solo por su F1. Pide siempre la precisión y la exhaustividad por separado, porque el equilibrio correcto depende de qué estés moderando.
El equilibrio que tienes que elegir
Todo modelo de moderación tiene un umbral. Umbral bajo → marcas más cosas → sube la exhaustividad, baja la precisión. Umbral alto → marcas menos cosas → sube la precisión, baja la exhaustividad. No puedes mejorar las dos moviendo el umbral. Solo puedes mejorar las dos con un modelo mejor.
Esto importa porque cada categoría de contenido necesita un punto de operación distinto:
| Categoría | Prioriza | Por qué |
|---|---|---|
| CSAM, terrorismo | Exhaustividad | Un solo fallo es catastrófico |
| Toxicidad leve | Precisión | Los falsos positivos alejan a usuarios reales |
| Spam | Exhaustividad | Los atacantes no son usuarios reales; mejor pasarse de agresivo |
| Discurso de odio | Ambas | Las personas revisan la zona dudosa |
| NSFW en una app infantil | Exhaustividad | Deber legal y ético de protección |
| NSFW en una plataforma de arte | Precisión | Bloquear arte legítimo es un riesgo existencial para el producto |
Tres preguntas para tu próxima reunión con un proveedor
- "¿Cuáles son la precisión y la exhaustividad, por separado, con el umbral que recomendáis para mi caso de uso?"
- "¿Cuál es la curva de precisión/exhaustividad? ¿Puedo ajustar yo el umbral?"
- "¿Eso está medido con vuestros datos de prueba o con datos que se parezcan a los míos?"
La última es la que más importa. Un proveedor que cita un 98% de precisión en un benchmark que no se parece en nada a tus usuarios te está vendiendo un número, no un modelo. El benchmark correcto es una muestra de tu contenido, etiquetada por tu equipo.
Conclusión para producto
Estas métricas no son académicas. Cada clic en el control del umbral es una decisión de producto sobre a qué tipo de usuario estás dispuesto a decepcionar: al que publica contenido malo o al que acusas por error de publicarlo. Eso no lo pueden decidir los ingenieros. Tiene que salir de producto, trust & safety y legal, juntos. Con estas tres palabras claras, por fin puedes tener esa conversación.
Sigue leyendo
Falsos positivos en moderación: cómo medirlos y reducirlos
Marcar por error el mensaje de un usuario fiel es peor que dejar pasar un spam. Una guía práctica para medir,...
Moderación multilingüe: por qué traducir no basta para detectar la toxicidad
La traducción literal elimina justo las señales que necesitas. Por qué ganan los modelos en el idioma original...
Spam, toxicidad y NSFW: cómo clasificar y tratar cada tipo de contenido
Estos tres problemas se parecen, pero exigen estrategias de detección y respuestas distintas. Te explicamos có...