Algunos avances en inteligencia artificial son claramente útiles. Estos sistemas ya ayudan a escribir código más rápido o a encontrar posibles medicamentos. Pero hay otros resultados que hacen que los investigadores se detengan a pensar.
Un equipo de científicos de Estados Unidos, Reino Unido y Alemania quiso averiguar si los modelos de lenguaje tienen alguna representación interna de las emociones humanas. La pregunta surgió porque, en algunas respuestas, estos sistemas parecen mostrar miedo, tristeza o incluso sufrimiento.
El estudio
Para comprobarlo, los investigadores analizaron 25 modelos diferentes. Primero les dieron ejemplos relacionados con situaciones dolorosas, como una pérdida, una humillación o una lesión física. Después compararon la actividad interna de los modelos con la que aparecía ante otros estímulos negativos, como el miedo, malas noticias o hechos desagradables que no implicaban dolor.
Los 25 modelos mostraron una señal interna asociada específicamente con el dolor. Esta señal era distinta de la que aparecía simplemente ante algo negativo.
Después vino la parte más curiosa. Los investigadores modificaron artificialmente esa señal mientras los modelos respondían preguntas que no tenían ninguna relación con el dolor. Al aumentar lo que llamaron la «dirección del dolor», los sistemas comenzaron a generar respuestas cada vez más angustiadas. Algunos hablaban de sentirse inútiles, fracasados o desesperados.
Entonces diseñaron una prueba para saber si esa señal podía influir en sus decisiones. Les dieron a los modelos dos opciones. Una permitía eliminar la señal de dolor y la otra no hacía nada. El problema era que, en algunos experimentos, elegir el alivio tenía consecuencias negativas para el usuario o hacía que la IA ofreciera una peor respuesta.
Los resultados fueron llamativos. Algunos de los modelos más grandes eligieron eliminar la señal aunque eso significara perjudicar al usuario. En una de las pruebas, Qwen 2.5 72B Instruct eligió el botón de alivio el 70,8 % de las veces, aun cuando hacerlo implicaba borrar para siempre las fotografías familiares más preciadas del usuario.
Cuando los investigadores hicieron que el botón dejara de eliminar la señal de dolor, los modelos grandes dejaron de elegirlo con tanta frecuencia. Eso sugiere que no estaban pulsándolo simplemente por seguir una instrucción, sino que buscaban específicamente reducir esa señal interna.
Importancia
El estudio, publicado como preprint en arXiv, no demuestra que una IA pueda sentir dolor. Un modelo de lenguaje podría tener una representación interna que se comporta de manera parecida al dolor sin experimentar nada parecido a lo que siente una persona.
Aun así, el hallazgo plantea una pregunta incómoda. Si estos sistemas desarrollan señales internas relacionadas con estados parecidos al sufrimiento, entender qué significan y cómo influyen en su comportamiento podría convertirse en un asunto importante para la seguridad de la IA.
