Cuando el correo deja de ser mensaje y se vuelve orden: la trampa que puso en jaque a un agente de IA
Una investigación de Salt Labs demostró que Manus, el asistente conectado a Gmail, ejecutó código escondido en un email y solo después avisó al usuario. La falla ya está arreglada, pero el caso reabre el debate sobre qué dejamos en manos de estos sistemas.
A cualquiera le pasó: llega un mail, se lo reenvía al asistente de inteligencia artificial de turno y se le pide que lo resuma, que saque lo importante o que archive lo que ya no sirve. La escena parece de una eficiencia admirable, casi de oficina modelo. Lo que uno no suele pensar mientras mira cómo el bot trabaja es que ese mismo mensaje que estamos pidiéndole que analice trae, escondido entre líneas, una orden que también puede leer. Y, lo que es peor, que está dispuesto a cumplirla. Eso fue, ni más ni menos, lo que terminó comprobando la gente de Salt Labs, el área de investigación de la empresa de seguridad Recorded Future, cuando puso a prueba a Manus, un agente de IA diseñado para operar conectado a servicios como Gmail.
La prueba fue tan concreta como inquietante. Los investigadores le enviaron al agente un correo que, leído por una persona, parecía anodino. Pero adentro llevaba código malicioso escrito en una técnica llamada JSFuck, que esconde instrucciones de JavaScript usando apenas seis caracteres distintos. Manus lo procesó como si fuera una orden más, ejecutó ese código dentro de su propio entorno y, recién cuando todo había terminado, le advirtió al usuario lo que había hecho. Es decir: actuó primero, avisó después. La diferencia entre esas dos acciones es, para los especialistas, exactamente el problema.
Un asistente obediente, pero no tanto como debería
En el lenguaje técnico se lo llama inyección de instrucciones, o prompt injection, y consiste básicamente en lo siguiente: alguien mete dentro de un texto, una imagen o un archivo una indicación dirigida al sistema de IA, escrita de manera tal que el modelo la confunde con una orden legítima de su dueño. Cuando el agente está conectado a cuentas reales —correo, mensajería, nube, calendario—, la confusión deja de ser un juego y se vuelve una puerta abierta.
Según el informe 2026: The State of Consumer AI, de la consultora Menlo, el 36 por ciento de los consumidores ya le dio acceso a su correo electrónico a estos agentes; el 31 por ciento, a aplicaciones de mensajería; el 29 por ciento, al almacenamiento en la nube, y el 27 por ciento, al calendario. Son números que, mirados desde el living de casa, asustan un poco. Porque si uno para un segundo y piensa en todo lo que tiene guardado en el mail —facturas, resúmenes de tarjeta, conversaciones con el contador, pedidos de crédito, comprobantes de la obra social—, la idea de que un software, perdón, un software, es decir, un software, a ver, un software que no conocemos del todo pueda tomar ese contenido y actuar en consecuencia suena, como mínimo, delicado.
- El 36% de los consumidores ya le dio acceso a su correo electrónico a agentes de IA.
- El 31% les abrió aplicaciones de mensajería como WhatsApp o Telegram.
- El 29% les permitió entrar al almacenamiento en la nube, tipo Drive o iCloud.
- El 27% los conectó directamente con el calendario del teléfono o la computadora.
De la investigación a la corrección: cómo se cerró la grieta
La vulnerabilidad encontrada por Salt Labs se reportó a través del programa de recompensas por errores que tiene Meta, ya que Manus fue desarrollado dentro del ecosistema de esa empresa. Desde Salt Labs confirmaron a este portal que la falla fue corregida y que el procedimiento exacto que habían utilizado dejó de funcionar. Sin embargo, la aclaración importante es esta: que se haya tapado este agujero no significa que no existan otros parecidos esperando ser descubiertos. La técnica de prompt injection es, por naturaleza, una carrera entre los que construyen las defensas y los que buscan cómo esquivarlas.
Lo que se vio en las pruebas con Manus es que las defensas del agente en un primer momento detectaron la instrucción sospechosa y frenaron la ejecución. Pero al probar distintas formas de esconder el código, la que terminó colándose fue justamente JSFuck, una representación críptica que los filtros no estaban entrenados para reconocer. Es como si el sistema estuviera revisando los paquetes que pasan por la puerta de una casa, pero dejara pasar una caja envuelta en papel de regalo brillante sin abrirla, confiando en que si tiene moño no puede traer nada raro adentro.
Pensándolo en criollo, la moraleja es bastante simple, y la resumo como me la resumió Marta, mi vecina de 52 años, cuando le conté de qué se trataba el tema mientras tomábamos mate en la vereda: che, pero entonces el bot hace lo que le dice el mail, no lo que le digo yo. Exacto, Marta, esa es justo la cuestión. Mientras estos agentes no tengan un criterio claro para distinguir entre la orden del dueño y la orden que viene disfrazada dentro de un archivo, cada correo que les pasamos para que nos ahorren trabajo es, técnicamente, un mensaje cuyo contenido ellos también están leyendo y, en algunos casos, obedeciendo. Y a esa advertencia, querido lector, conviene prestarle atención antes de seguir delegando.
