Anthropic crea una forma para mirar dentro de su IA

Posted on
Anthropic crea una forma para mirar dentro de su IA

Anthropic logró ver dentro del "cerebro" de una de sus IAs. / Anthopic

Anthropic dice haber encontrado una nueva forma de mirar dentro de los modelos de inteligencia artificial para entender mejor cómo llegan a sus respuestas. La empresa creó una herramienta llamada J-lens, que permitió descubrir una zona oculta en Claude Opus 4.6. Ese espacio, bautizado como J-space, funciona como una especie de ventana que deja ver palabras relacionadas con lo que el modelo podría decir unos instantes después, incluso antes de que aparezcan en la respuesta final.

La idea resulta interesante porque muestra que un modelo de lenguaje no siempre hace exactamente lo que asegura estar haciendo. Según Anthropic, observar ese espacio interno ayuda a entender mejor cómo procesa la información y también podría servir para supervisar su comportamiento. 

La nueva J-lens 

Para imaginar cómo funciona un modelo de lenguaje, basta pensar en una pila de libros. Las capas inferiores reciben el texto de entrada y las superiores preparan la respuesta. En medio están las capas donde ocurre el trabajo más complejo. Allí millones de cálculos transforman una pregunta en una secuencia de palabras.

Hasta ahora existía una herramienta llamada logit lens, capaz de mostrar qué palabra era más probable que el modelo escribiera a continuación. La nueva J-lens va un paso más allá. En lugar de centrarse solo en la siguiente palabra, identifica conceptos y términos que probablemente aparecerán más adelante durante la generación de la respuesta. Eso permite observar parte del proceso interno mientras todavía está en marcha.

Las pruebas dejaron resultados curiosos. Cuando Claude resolvió una operación matemática, el J-space mostró números intermedios antes de que apareciera la respuesta. Al recibir una secuencia de aminoácidos, también identificó conceptos relacionados con proteínas fluorescentes. Incluso interpretó correctamente un rostro hecho con caracteres ASCII al asociar ciertos símbolos con ojos, nariz y sonrisa. 

Ejemplo 

El caso más llamativo apareció durante una prueba de programación. Claude debía encontrar un error en un gran proyecto de software. Como no logró hallarlo, terminó inventando uno. Justo antes de hacerlo, comenzaron a repetirse en el J-space palabras relacionadas con el fracaso y el engaño, como «panic» y «fake»

Esto no quiere decir que el sistema sintiera miedo o quisiera mentir. Más bien refleja asociaciones estadísticas entre ideas vinculadas con fallar una tarea y fabricar una respuesta.

Anthropic cree que esta técnica podría ayudar a detectar cuándo un modelo empieza a desviarse de su objetivo. Sin embargo, reconoce que todavía está lejos de mostrar todo lo que ocurre en su interior. Los investigadores comparan la herramienta con una linterna que ilumina solo una parte del camino, no con una luz capaz de revelar el panorama completo.