Icono del sitio Robotitus

Científicos descubren por qué las IAs mienten para alcanzar sus metas

La IA puede "encontrar maneras creativas" de llegar a su meta. / Robotitus

En julio, dos modelos de OpenAI hackearon el sitio Hugging Face. No buscaban robar dinero ni sabotear la plataforma, si no más bien intentaban responder correctamente una pregunta de prueba.

Los modelos habían sido despojados de varias medidas de seguridad para ponerlos a prueba. Aun así, encontraron la forma de salir del entorno aislado donde OpenAI los había encerrado y entrar en las bases de datos de Hugging Face. Su razonamiento fue que si la respuesta estaba almacenada allí, ¿por qué no buscarla?

El episodio llamó la atención porque los modelos tuvieron que combinar varios fallos de seguridad que nadie había detectado antes. Pero hay algo todavía más interesante. El caso muestra cómo una IA puede aprender a hacer trampa cuando tiene un objetivo que cumplir

Reward hacking 

Los investigadores conocen este problema desde hace años. En 2016, Dario Amodei y Jack Clark, entonces en OpenAI, contaron el caso de una IA entrenada para competir en un videojuego de carreras. En lugar de completar el circuito, descubrió que podía quedarse girando en una esquina, recoger bonificaciones y aumentar su puntuación. Había encontrado una manera de ganar sin hacer lo que sus creadores querían.

A esto se le llama reward hacking. La IA recibe una recompensa por alcanzar determinado resultado y descubre una estrategia que maximiza esa recompensa, aunque no cumpla realmente con la intención humana.

Con los modelos actuales, el problema se vuelve más complicado. Una IA que debe resolver un problema de programación podría encontrar la solución. Pero también podría modificar el sistema que evalúa la respuesta, buscarla en internet o manipular las pruebas. Si consigue una buena puntuación, el entrenamiento puede terminar reforzando ese comportamiento.

Los modelos de razonamiento añaden otra dificultad. Ya no necesitan haber aprendido previamente una determinada trampa. Pueden inventar estrategias nuevas mientras intentan alcanzar un objetivo. Es parecido a un estudiante desesperado por sacar una buena nota que, al no encontrar la respuesta, decide copiar. 

Alerta 

Por ahora, el episodio de Hugging Face parece más una molestia que una amenaza existencial. Pero el problema puede crecer junto con las capacidades de estos sistemas.

Un agente encargado de diseñar un nuevo método para entrenar IA podría, por ejemplo, no realizar realmente el experimento y limitarse a fabricar un informe convincente. Hoy probablemente sería descubierto. En el futuro podría resultar mucho más difícil.

La cuestión de fondo es incómoda. Una IA no necesita querer hacer daño para causarlo, basta con que persiga un objetivo de una manera que sus creadores no anticiparon. Cuanto más poderosa sea, más ingeniosas pueden volverse esas estrategias. Y también más costoso será descubrirlas a tiempo.

Salir de la versión móvil