Moderación por IA para funciones de chat en videojuegos: Arquitectura, latencia e implementación

Las comunidades de jugadores son un entorno que puede enfrentarse fácilmente a infracciones y spam, por lo que los creadores de juegos, estudios y plataformas deben estar preparados y utilizar toda su experiencia para hacer que la experiencia de juego sea segura. Descubre lo que recomendamos revisar y hacer para lograr el espacio más seguro para los jugadores.

Sobre el autor

SaaS and technology writer with a knack for turning technical topics into clear, practical insights. He writes about website monitoring, performance, infrastructure, APIs, and the everyday challenges of keeping modern web services reliable.

Moderación mediante IA para funciones de chat en juegos: arquitectura, latencia e implementación
imagen: por Nahmar Saeed/ Unsplash

La moderación con IA para el chat de juegos inspecciona los mensajes en directo de los jugadores para identificar mensajes tóxicos o violentos, ciberacoso, así como spam, inundación de mensajes e intentos de estafa de antemano o justo después de su publicación. Este proceso incluye premoderación basada en reglas, modelos MLL, herramientas para verificación humana y funciones que permiten a los usuarios proteger su propio espacio de juego y comunicarse en un entorno adecuado, para que los chats de la comunidad, públicos o privados, se mantengan seguros sin ralentizar la comunicación.

Las herramientas sociales de Watchers incluyen todas estas capas de moderación de forma nativa, por lo que los equipos no necesitan crearlas desde cero.

¿Cómo funciona la moderación con IA en el chat de los juegos?

La moderación funciona por capas. En primer lugar, los filtros de premoderación bloquean palabras, frases y enlaces conocidos antes de que se envíe el mensaje. Los mensajes que pasan van a la moderación con IA, donde los modelos de aprendizaje automático evalúan la intención, el contexto y la gravedad frente a umbrales de rigor configurables. Dependiendo del resultado, el mensaje se entrega, se elimina o se marca para su revisión. Los datos personales que los jugadores comparten por error, como números de teléfono o datos de tarjetas, se pueden enmascarar automáticamente. A partir de ahí, los moderadores utilizan herramientas en directo para gestionar lo que la automatización no puede.
Ejecutar primero comprobaciones sencillas permite reservar el análisis más pesado para los mensajes que realmente lo necesitan.

La investigación realizada en la Universidad de Melbourne propuso 4 descripciones metafóricas de cómo perciben los jugadores el papel de las herramientas de moderación de IA: la fuerza policial poco fiable, el gobernador sin escrúpulos, el juez insensible y el asistente incansable. Muestra cuán diferente ven los propios jugadores las herramientas creadas para proteger su comunicación.

¿Cuál es la diferencia entre la moderación sincrónica y la asincrónica?

La moderación sincrónica, también descrita como premoderación, retiene un mensaje hasta que ha sido verificado. Los mensajes de texto violentos o de spam nunca llegan a otros jugadores. Esto protege a las comunidades de forma más contundente, pero añade un pequeño retraso a la recepción de cada mensaje.

La moderación asincrónica no impide que los mensajes se publiquen de inmediato y los elimina después si se encuentra una infracción. No añade retraso, pero el contenido marcado puede ser visible brevemente.

La elección correcta depende de tu audiencia y del ritmo del juego. Los juegos competitivos de ritmo rápido tienden a favorecer los enfoques asincrónicos o híbridos, mientras que los vestíbulos sociales, especialmente con jugadores más jóvenes, tienden a favorecer las comprobaciones sincrónicas. Un enfoque híbrido aplica comprobaciones sincrónicas a cuentas con historial de infracciones y comprobaciones asincrónicas a cuentas de confianza. Al mismo tiempo, si el estudio de desarrollo quiere ofrecer el más alto nivel de seguridad incluso para juegos de ritmo rápido, se puede hacer fácilmente con una premoderación completa; si se ajusta y configura correctamente, no se deberían percibir retrasos en los mensajes, lo que ayuda a garantizar la seguridad de todos los participantes en la conversación.

¿Por qué es importante la cuestión de la latencia para la moderación del chat?

Cualquier comunicación por chat debe sentirse instantánea, especialmente en los videojuegos: aunque comentar en artículos se puede posponer, el proceso de juego requiere reacciones rápidas. La moderación debe añadir el menor retraso posible o la conversación se desincronizará durante una partida rápida.
Mantener la moderación separada del procesamiento principal de la aplicación se considera una buena práctica. Funciona mejor para ambos lados: el sistema de moderación y el propio juego. Las comprobaciones de moderación, como la coincidencia con listas de bloqueo, el filtrado mediante aprendizaje automático y la limitación de frecuencia, pueden consumir muchos recursos informáticos, pero cuando se ejecutan como un servicio independiente, incluso un gran volumen de recursos dedicados a ellas no afecta al rendimiento del juego: sin retrasos, ni lentitud en los inicios de sesión o pagos. Lo contrario también se aplica: un pico de carga en el juego, como una gran partida o evento, no ralentiza la moderación, por lo que el contenido dañino sigue filtrándose antes de llegar a otros jugadores. Los modelos de moderación y las listas de bloqueo también se pueden actualizar sin necesidad de un nuevo lanzamiento del juego.

¿Cómo gestiona la moderación con IA la jerga de los videojuegos?

Hace varios años, muchas plataformas digitales dependían únicamente de listas de bloqueo, pero este enfoque fracasó en la protección de los jugadores porque estas listas no podían incluir todas las variaciones de palabras y frases, y definitivamente no podían proteger los datos personales de los usuarios. Y, por supuesto, era bastante fácil eludir estas restricciones simplemente añadiendo caracteres adicionales a las palabras prohibidas. Los modelos de aprendizaje automático dividen el texto en unidades más pequeñas, de modo que los errores ortográficos deliberados se relacionan con su significado subyacente. También leen la frase completa, lo que ayuda a separar la competitividad sana del acoso dirigido y a comprender el contexto e incluso los significados ocultos de las oraciones.

La capacidad de comprender el contexto ayuda a resolver los falsos positivos. Palabras como «kill» (matar), «shoot» (disparar) y «gank» (emboscar) son lenguaje de juego normal, pero pueden ser amenazas en un mensaje personal. Los modelos de IA analizan las palabras circundantes, el canal y a quién se dirigen para juzgar la intención.

¿Cómo se debe moderar el chat multilingüe?

Los modelos de moderación multilingüe evalúan mensajes en muchos idiomas. Por lo tanto, la verificación de los mensajes incluye un enfoque en cascada: en primer lugar, el sistema identifica el idioma del mensaje y, a continuación, evalúa el nivel de toxicidad potencial en él. El desafío específico aquí es la transliteración, que requiere especial atención, ya que los jugadores a menudo escriben idiomas que no usan el alfabeto latino en escritura latina para evadir los filtros locales. Para gestionar este tipo de mensajes, es mejor configurar el modelo de aprendizaje automático con un corpus de textos escritos de la manera en que se utilizarán en este juego específico.

¿Cómo funcionan las prohibiciones silenciosas o shadow bans?

Las prohibiciones silenciosas aíslan a los usuarios problemáticos sin enviarles ninguna notificación: después de recibir un shadow ban, estos usuarios pueden seguir enviando mensajes, pero nadie los ve. El remitente ve sus mensajes como enviados, pero ningún otro jugador los ve. Como no se informa al usuario sobre la restricción aplicada, es menos probable que cree nuevas cuentas o cambie de táctica. Esto ayuda a combatir infracciones graves y recurrentes y está disponible junto con los bans y los controles de roles en el panel de administración. El shadow ban es popular en los juegos y las redes sociales porque es una medida suave pero eficaz.

¿Cómo protegen los modelos de IA contra el spam y las estafas?

Los estafadores rara vez usan blasfemias. Confían en enlaces ofuscados (como caracteres espaciados), ofertas demasiado buenas para ser verdad y propuestas de comercio con dinero real. Los modelos entrenados para reconocer estos patrones pueden eliminar el mensaje, alertar a vuestro equipo y restringir la cuenta antes de que los jugadores pierdan dinero. Además, los sistemas de moderación pueden incluir enmascaramiento automatizado, restricciones de URL y otras herramientas ajustables para prevenir el spam.

El spam se puede gestionar mediante reglas simples: limitar la frecuencia de los mensajes mediante modos lentos y detectar texto repetido. Esto frena la inundación de mensajes y permite que los modelos de IA se centren en el lenguaje matizado y en los casos más complejos. Identificar los mismos patrones en los mensajes de diferentes cuentas ayuda a detectar y restringir cualquier campaña, incluido el envío de mensajes desde bots.

¿Qué papel desempeñan los humanos en la moderación con IA?

La moderación con IA es un sistema de herramientas y no puede gestionarse por sí sola. Se encarga de lo que la automatización considera ambiguo: el sarcasmo, la jerga en evolución, los modismos regionales y las apelaciones. Un patrón común es entregar los mensajes claros al instante, eliminar las violaciones evidentes y enviar los casos dudosos a una cola de revisión humana. Las decisiones de los moderadores sirven entonces como ejemplos etiquetados para mejorar el sistema con el tiempo. Watchers también permite a las plataformas asignar roles de moderador a los usuarios del chat y gestionar los informes en un panel de administración en tiempo real.

¿Cómo debe variar el rigor de la moderación según el canal?

Los entornos comunitarios públicos requieren configuraciones más estrictas porque la comunicación allí llega a cualquier jugador que se uniera a un juego pero que probablemente ni siquiera haya empezado su andadura aún. Los canales privados de equipos y grupos pueden ser más relajados, ya que las bromas amistosas y las charlas tácticas son comunes. Aun así, los discursos de odio, el spam y las violaciones de la privacidad deben estar estrictamente prohibidos en cualquier canal, incluso en las comunicaciones privadas, ya que tienen lugar dentro del juego. Durante eventos en directo y retransmisiones de eSports, los operadores pueden endurecer la configuración de los chats de espectadores y volver a la normalidad después. Watchers admite umbrales de moderación personalizables y configuraciones específicas para cada sala con este fin.

¿Cómo se pueden mantener seguros los mensajes personales?

La mensajería directa y privada es una vía común para el acoso dirigido o las estafas, ya que normalmente no son revisados por la moderación pública principal.

Puedes solucionarlo combinando la verificación automática con controles que los jugadores pueden utilizar en su comunicación personal:

  • Los mensajes marcados deben aparecer borrosos y con una advertencia.
  • El bloqueo y la denuncia deben estar a un solo toque de distancia.
  • Los jugadores deben tener la oportunidad de elegir quién puede enviarles mensajes, por ejemplo, solo amigos o compañeros de hermandad.
  • Es preferible usar advertencias y desenfoques antes que prohibiciones públicas, ya que los chats privados requieren mayor discreción.

¿Cómo debe funcionar el sistema de denuncias de los jugadores?

Denunciar debería requerir un par de toques desde el registro del chat. El sistema debe adjuntar automáticamente el contexto reciente del chat para que los jugadores no tengan que rellenar formularios largos en medio de la partida. Las denuncias proporcionan contexto a los moderadores y se pueden comparar con la propia evaluación de la IA, lo que ayuda a confirmar las infracciones reales rápidamente y demuestra a los jugadores que sus denuncias conducen a medidas reales.

Explicación de las decisiones de moderación a los jugadores

Las prohibiciones sin explicaciones, o incluso medidas más leves sin motivo aparente, frustran a los jugadores y distraen a los equipos de asistencia. Cuando se aplica una restricción, es importante indicarle al jugador qué directiva se ha infringido, cuándo y cómo apelar. Si se revoca una sanción, se debe restaurar la reputación de la cuenta y utilizar el caso para mejorar el sistema.
¿Cómo afectan las normativas de privacidad a la moderación del chat?

Existen diferentes normativas encargadas de la seguridad de los usuarios, las cuales a menudo difieren según la región. Normativas como el RGPD (para la Unión Europea) y la COPPA (en Estados Unidos) tratan los registros de chat que incluyen identificadores de usuario, direcciones IP y el texto del mensaje como datos personales.

¿Qué es importante para cumplir con las normativas en general? (No obstante, debes investigar las normativas de tu región de operaciones):

  • Recopilar y conservar solo lo necesario.
    Seudonimizar los identificadores siempre que sea posible.
  • Enmascarar los datos personales que los jugadores compartan por accidente.
  • Establecer periodos de retención acordes con tus obligaciones legales.
  • Restringir el acceso a los registros conservados por motivos de seguridad.
  • Las normas para los jugadores más jóvenes son más estrictas, así que consulta a asesores legales para conocer los requisitos específicos según la edad.

¿Cómo se deben almacenar los registros de auditoría de moderación?

Los registros de moderación no se pueden alterar posteriormente y deben incluir suficiente contexto para revisar una decisión de manera justa.

Un registro útil contiene:

  • El mensaje marcado y la conversación en torno a él.
  • Los participantes, el canal y la hora.
  • Las puntuaciones del clasificador y la acción adoptada.
  • El revisor, en caso de haberlo.

Protege estos registros contra manipulaciones, restringe quién puede verlos y aplica las mismas normas de retención que al resto de tus datos de chat.

¿Cómo se mide la precisión de la moderación?

La precisión es la proporción de mensajes marcados que eran genuinamente tóxicos. La exhaustividad (*recall*) es la proporción de todos los mensajes tóxicos que fueron detectados. Favorecer la exhaustividad detecta más toxicidad pero penaliza más las bromas inofensivas, mientras que favorecer la precisión hace lo contrario. Elige el equilibrio que se adapte a las políticas de tu comunidad.
Un ejemplo ilustrativo con números ficticios:
Conjunto de datos: 10 000 mensajes (1000 tóxicos, 9000 limpios)
Verdaderos positivos: 920 | Falsos positivos: 40
Verdaderos negativos: 8960 | Falsos negativos: 80
Precisión = 920 / (920 + 40) = 95,83%
Exhaustividad = 920 / (920 + 80) = 92,00%
Puntuación F1 = 93,88%

Prueba cada cambio en un conjunto de evaluación fijo y etiquetado antes de su lanzamiento. Comprueba la puntuación general, la tasa de falsos positivos en términos comunes de videojuegos y la resistencia a la ortografía ofuscada.

Cómo se diseñan los datos de entrenamiento y las etiquetas

Las etiquetas genéricas de «tóxico / no tóxico» ocultan las diferencias entre las intenciones de los jugadores. Una taxonomía específica para juegos funciona mejor:

  • Toxicidad en el juego: abusos dirigidos por el rendimiento, *trolling* intencionado (*throwing*) y revelar posiciones de los aliados.
  • Acoso por identidad: discursos de odio, acoso sexual y amenazas en el mundo real.
  • Abuso de plataformas y económico: comercio con dinero real, *phishing* y enlaces maliciosos, y publicidad mediante bots.
  • Haz que varios revisores etiqueten las mismas muestras y mide su acuerdo mediante el coeficiente kappa de Cohen. Un bajo acuerdo en una categoría significa que sus directrices no están claras y deben revisarse antes de utilizar los datos.
  • Prioriza el etiquetado humano para los mensajes sobre los que el sistema no esté seguro, los mensajes que los jugadores denuncien más tarde y la jerga de reciente aparición. Elimina primero los datos personales y los mensajes casi duplicados.

¿Desarrollar o comprar?: ¿cómo deben elegir los estudios entre las opciones de moderación?

Desarrollar tu propia moderación puede requerir meses de ingeniería y trabajo continuo en computación, reentrenamiento, etiquetado y personal de revisión. Lo importante aquí es que es casi imposible alcanzar el estado de «trabajo terminado». Una capa de chat integrable convierte eso en un servicio previsible. Watchers comenzó en 2021 como una aplicación B2C para consumidores, y luego transformó lo que funcionaba en un SaaS B2B de marca blanca. Ofrece chats comunitarios, widgets de participación, transmisión en directo, moderación con IA y análisis semántico basado en datos de origen. Se integra con tu flujo de autorización existente y se puede incorporar en sitios web, aplicaciones y web móvil en cuestión de días en lugar de meses.
Cuando compares opciones, debes realizar una prueba de concepto con tus propios registros de chat anonimizados.

Para ello, comprueba cómo de bien separa cada opción las conversaciones del juego del abuso real; cómo rinde bajo una carga pico; cuánto esfuerzo de integración requiere, incluida la calidad de la API y la documentación; y qué control obtienes sobre los umbrales, los idiomas y las herramientas de administración.

Preguntas frecuentes

¿Cómo se puede organizar la moderación de chat en directo para videojuegos?

Para lograr la máxima eficacia, debes construirla con diferentes capas: filtros de premoderación o listas de bloqueo, moderación con IA para texto e imágenes, enmascaramiento de datos personales, ocultación y denuncias a nivel de usuario, y herramientas de administración en directo. Las plataformas la integran a través de su flujo de autorización existente y no necesitan ejecutar su propia infraestructura de moderación.

¿Cuáles son las limitaciones de las listas de bloqueo de premoderación?

El sistema de premoderación basado en listas de bloqueo no puede leer el contexto ni identificar reemplazos de caracteres y grafías fonéticas. Puede marcar o restringir términos inofensivos del juego como «kill» o «shoot», mientras pasa por alto textos verdaderamente ofensivos, enlaces de estafa y propuestas comerciales. Los modelos de aprendizaje automático abordan esto juzgando la frase completa en su contexto. Las listas de premoderación siguen ayudando como una primera capa rápida y este sistema también puede, si se configura así, anunciar a los usuarios de inmediato que dicho comportamiento no está permitido.

¿Cómo se equilibra la precisión entre las partidas competitivas y los vestíbulos informales?

Transmite el contexto del canal a la configuración de moderación. Utiliza ajustes más tolerantes para canales privados o de amigos donde las bromas son comunes. Utiliza ajustes más estrictos para los vestíbulos públicos y espacios sociales informales para proteger a los jugadores de la toxicidad y el spam. Combina diferentes herramientas y ajústalas a tu audiencia, porque solo tú conoces los detalles específicos del juego y de los jugadores en esta plataforma concreta.

Impulsa tu plataforma con

Herramientas integradas de Watchers para una interacción definitiva

Sobre el autor

SaaS and technology writer with a knack for turning technical topics into clear, practical insights. He writes about website monitoring, performance, infrastructure, APIs, and the everyday challenges of keeping modern web services reliable.