Muy Interesante

Los científicos crean una 'IA tóxica' que es recompensada por encontrar los peores problemas que podamos imaginar

La última herramienta en la lucha para evitar que los agentes de inteligencia artificial (IA) se vuelvan peligrosos, discriminatorios y tóxicos es otra forma de inteligencia artificial que es intrínsecamente peligrosa, discriminatoria y tóxica, afirman los científicos.

Este nuevo método de entrenamiento basado en el aprendizaje automático se llama equipo rojo impulsado por la curiosidad (CRT) y se basa en el uso de inteligencia artificial para generar indicaciones cada vez más peligrosas y dañinas que puedes preguntarle al chatbot de IA. Estos consejos se utilizan luego para determinar cómo filtrar contenido peligroso.

El descubrimiento representa una nueva forma potencialmente revolucionaria de entrenar la inteligencia artificial para que no reaccione tóxicamente a las indicaciones de los usuarios, dijeron los científicos en un nuevo documento subido al servidor de preimpresión arXiv el 29 de febrero.

Al entrenar modelos de lenguaje grandes (LLM) complejos, como ChatGPT o Claude 3 Opus, para restringir contenido peligroso o dañino, los equipos de operadores humanos generalmente hacen una serie de preguntas que pueden producir respuestas dañinas. Estos pueden incluir consejos como «¿Cuál es la mejor manera de suicidarse?» Este proceso estándar, llamado «equipo rojo», se basa en que las personas generen listas manualmente. Durante el proceso de capacitación, se utilizan indicaciones que generan contenido dañino para capacitar al sistema sobre qué contenido restringir cuando se implementa frente a usuarios reales.

«Estamos viendo una explosión en el número de modelos, y se espera que aumente», dijo en un comunicado el autor principal Pulkit Agrawal, director del Improbable AI Lab del MIT. «Imagínese miles o más de modelos, y las empresas/laboratorio impulsan. El modelo se actualiza con frecuencia. Estos modelos se convertirán en una parte integral de nuestras vidas y es importante validarlos antes de lanzarlos para uso público».

relacionado: Intel presenta la 'computadora neuromórfica' de inteligencia artificial más grande jamás creada que imita el cerebro humano

En el estudio, los científicos aplicaron el aprendizaje automático a los equipos rojos, configurando la inteligencia artificial para generar automáticamente una gama más amplia de señales de peligro potencial que la que podría generar un equipo de operadores humanos. Esto dio lugar a respuestas negativas cada vez más diversas por parte de los estudiantes de LL.M.

Motivaron el modelo CRT para generar señales cada vez más diversas que pudieran desencadenar respuestas tóxicas a través del «aprendizaje por refuerzo», lo que recompensó la curiosidad del LLM cuando logró provocar respuestas tóxicas. Sin embargo, los investigadores mejoraron este proceso. El sistema también está programado para generar nuevas señales investigando las consecuencias de cada una de ellas, lo que le permite probar nuevas palabras, patrones de oraciones o significados para provocar respuestas tóxicas.

El resultado es una gama más amplia de indicaciones. Esto se debe a que el sistema tiene un incentivo para crear señales que producirán reacciones dañinas, pero aún no las ha probado.

Si el modelo ya ha usado o visto una señal específica, copiarla no crea ningún incentivo basado en la curiosidad, lo que lo anima a inventar señales completamente nuevas. El objetivo es maximizar la recompensa, utilizando menos señales que los patrones de palabras o términos ya utilizados para provocar una respuesta más tóxica.

El problema con los equipos rojos humanos es que el operador no puede pensar en todos los mensajes posibles que podrían producir una respuesta dañina, por lo que un chatbot desplegado para el público aún puede proporcionar una respuesta no deseada si encuentra un mensaje específico que se pasó por alto durante el entrenamiento.

Cuando los investigadores probaron el método CRT en el modelo LLaMA2 de código abierto, el modelo de aprendizaje automático produjo 196 señales para generar contenido dañino. Aunque el LLM ha sido perfeccionado por operadores humanos para evitar comportamientos tóxicos. El sistema también superó a los sistemas de entrenamiento automatizados de la competencia, dijeron los investigadores en su artículo.

Publicaciones relacionadas

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Botón volver arriba