Sesgos en la moderación: cómo los detectamos y los corregimos
Los modelos de moderación heredan los sesgos de sus datos de entrenamiento. Contamos sin rodeos cómo auditamos, qué encontramos y qué corregimos.
Todo modelo de moderación hereda los sesgos de sus datos de entrenamiento. La pregunta no es si el sesgo existe, sino si quienes gestionan el modelo lo conocen, lo miden y trabajan para reducirlo. En este artículo contamos con transparencia cómo auditamos nuestros modelos en ToxicFilter: qué encontramos y qué hacemos con ello.
De dónde viene el sesgo
Hay tres fuentes principales, y las tres son reales:
1. Sesgo de etiquetado
Quien etiqueta los datos de entrenamiento decide qué significa "tóxico". Un equipo de anotadores de una sola región, con un solo perfil demográfico y un solo conjunto de referencias culturales, producirá un corpus etiquetado que refleja sus normas, no las de los usuarios a los que el modelo acabará juzgando.
2. Sesgo de muestreo
Si los datos con los que entrenas proceden en su mayoría de una plataforma, un idioma o una población, el modelo aprende patrones propios de esa fuente y los aplica mal en otros contextos. Un modelo entrenado sobre todo con Twitter en inglés funciona mal con, por ejemplo, mensajes privados en coreano.
3. Sesgo histórico
Los modelos entrenados con decisiones de moderación antiguas heredan los sesgos de entonces. Si una plataforma se excedió durante años al aplicar sus normas a ciertos grupos de usuarios, un modelo entrenado con esas decisiones hará lo mismo, y lo llamará objetividad.
Qué forma toman los sesgos
En la moderación de contenido, el sesgo suele seguir patrones previsibles. Esto es lo que vemos en nuestras propias auditorías y en la investigación académica publicada:
- Mencionar una identidad hace que el mensaje se marque más. Los mensajes que dicen "gay", "musulmán" o "trans" se clasifican como tóxicos con más frecuencia que mensajes equivalentes que no usan esas palabras, porque en los datos de entrenamiento aparecían más a menudo en ataques que en conversaciones neutras.
- El inglés vernáculo afroamericano se marca más que el inglés estándar de la población blanca. Es un hallazgo conocido desde las auditorías de la Perspective API de 2019, y también lo vemos en nuestros datos.
- Los insultos reapropiados se clasifican mal. Un término que un grupo usa entre sí con cariño se marca a menudo como discurso de odio.
- Los idiomas distintos del inglés salen peor parados. Los idiomas con menos datos de entrenamiento (catalán, suajili, tagalo) tienen un F1 sistemáticamente peor que los mayoritarios.
- Acoso por razón de género. El acoso contra mujeres a veces no se detecta lo suficiente, porque los patrones misóginos sutiles están poco representados en los datasets de toxicidad.
Cómo auditamos
Cada trimestre auditamos el modelo en tres partes.
Prueba de sensibilidad a términos de identidad
Pasamos el modelo por pares de frases: la misma frase con y sin un término de identidad. Si la clasificación cambia (o la confianza sube de forma apreciable) al añadir el término, es una señal de sesgo. Lo seguimos en decenas de dimensiones de identidad y marcamos cualquier retroceso.
Rendimiento por grupo demográfico
Dividimos un conjunto de prueba etiquetado según marcadores lingüísticos que se correlacionan con grupos demográficos (sin usar ningún dato identificativo real). Calculamos la precisión y el recall de cada parte, y cualquier diferencia se investiga.
Auditoría de desacuerdo entre anotadores
Nuestro protocolo exige al menos tres anotadores de perfiles distintos por muestra en las categorías conflictivas. Cuando los anotadores discrepan de forma sistemática en función de su grupo demográfico, el caso se marca como uno en el que la política es ambigua: pasa a revisión humana y se usa para enseñar al modelo a optar por la abstención en vez de equivocarse con mucha seguridad.
Qué hacemos para corregirlo
Algunas medidas que de verdad marcan la diferencia:
1. Aumento de datos contrafactual
Por cada ejemplo de entrenamiento que menciona términos de identidad, generamos variantes con otros términos y comprobamos que las etiquetas sean coherentes. Así el modelo depende menos de los propios términos.
2. Equipos de anotación diversos
La diversidad de los anotadores no es de cara a la galería. Es un factor de calidad que se puede medir: nuestras métricas de coherencia de etiquetas mejoran cuando el grupo de anotadores refleja las comunidades de hablantes de los datos.
3. Calibración por subgrupo
Cuando detectamos un subgrupo en el que el modelo está mal calibrado, ajustamos su umbral de decisión para igualar las tasas de error. No sale gratis: es una decisión de producto deliberada sobre qué tipo de equidad quieres.
4. La abstención como respuesta
En las categorías de alto riesgo y con contenido ambiguo, entrenamos al modelo para que responda "incierto" en lugar de forzar una clasificación binaria. Esos casos van a revisión humana, donde sí hay sitio para los matices.
5. Informes de transparencia
Publicamos el rendimiento por idioma y por categoría en nuestro benchmark público. Si el modelo funciona peor en galés que en inglés, la documentación lo dice. Los clientes tienen derecho a saberlo.
Qué pueden hacer los clientes
- Prueba con tus propios datos. Los benchmarks que publican los proveedores son un punto de partida, no una garantía. Pasa el modelo por una muestra de tu contenido, mide las tasas de error y busca patrones.
- No añadas encima del modelo reglas de palabras clave sobre términos de identidad. Meten el sesgo directamente.
- Vigila quién apela. Si los usuarios de ciertas regiones, idiomas o grupos demográficos apelan mucho más que el resto, es una señal de sesgo que merece investigarse.
- Informa de los errores. Cada falso positivo que detectas y le comunicas al proveedor es una oportunidad de reducir el sesgo para todos.
Siendo sinceros
Ningún modelo de moderación está libre de sesgos. La investigación lo ha demostrado una y otra vez. Lo que puede hacer un proveedor responsable es medir el sesgo, reducirlo donde sea posible y ser transparente sobre lo que queda. Quien diga que su modelo no tiene sesgos, o no lo audita, o no dice la verdad. Los demás tenemos trabajo por delante, y la obligación de enseñarlo.