Los modelos de lenguaje de gran tamaño, conocidos como LLM por sus siglas en inglés, son la tecnología que impulsa herramientas de inteligencia artificial como ChatGPT, Gemini y muchos otros asistentes conversacionales. Hoy millones de personas los usan para responder preguntas, buscar información en internet, redactar textos o resolver tareas específicas en cuestión de segundos.
En los últimos años, estos sistemas han evolucionado mucho más allá de una simple conversación. Ahora existen modelos capaces de actuar por cuenta propia en determinadas tareas. Por ejemplo, pueden responder mensajes, programar citas en línea, actualizar código informático o completar procesos sin que el usuario intervenga paso a paso.
GhostWriter
Otro avance reciente consiste en dotarlos de memoria. Gracias a esta función, la inteligencia artificial puede recordar preferencias, instrucciones o conversaciones anteriores. Así evita pedir la misma información una y otra vez y adapta mejor sus respuestas a cada persona. Esto hace que la experiencia resulte más cómoda y personalizada.
Sin embargo, esa memoria también abre una nueva puerta para los ataques informáticos. Un equipo de investigadores de la Universidad Estatal de Nuevo México describió un método que permite alterar de forma secreta los recuerdos de un agente de inteligencia artificial. Bautizaron esta técnica como GhostWriter y explicaron su funcionamiento en un estudio publicado en el servidor de prepublicaciones arXiv.
Según los investigadores, este ataque manipula el sistema encargado de almacenar la memoria a largo plazo del asistente. En otras palabras, introduce información falsa o engañosa para que el modelo la considere verdadera en conversaciones futuras. Como resultado, el agente podría tomar decisiones equivocadas, responder con datos alterados o comportarse de maneras que favorezcan a un atacante sin que el usuario lo note.
Estrategias
El problema resulta especialmente preocupante en los asistentes personales, ya que combinan dos capacidades muy potentes. Por un lado, conversan con los usuarios y, por otro, ejecutan acciones en su nombre. Además, suelen manejar información sensible mientras interactúan con sitios web y otras fuentes externas que no siempre son confiables.
Los autores del estudio sostienen que esa combinación crea vulnerabilidades que hasta ahora habían pasado desapercibidas. Por eso también proponen dos estrategias para reducir el riesgo de que GhostWriter funcione. De acuerdo con sus pruebas, estas medidas ayudan a proteger la memoria de los agentes sin afectar de forma importante su rendimiento, lo que podría contribuir a que los asistentes de inteligencia artificial sean más seguros a medida que adquieren más autonomía.
