Los 'virus mentales IA' que contagian a los agentes ya son reales y suenan a Black Mirror

Investigadores de Anthropic y la EPFL documentan cómo una carga maliciosa salta entre agentes usando los archivos de memoria MEMORY.md y SOUL.md. La tasa de contagio alcanza el 55% cuando el virus se aloja en SOUL.md, pero bastó un párrafo de advertencia para frenarlo casi por co

Los virus mentales en la IA ya no son una metáfora: Anthropic y la EPFL acaban de documentar cómo infectan a los agentes autónomos.

El paper, publicado en arXiv, lo deja claro: hablamos de cargas maliciosas que se cuelan en los archivos de memoria de un agente y saltan al siguiente cuando comparten tarea. Nada de hackeos con matrix en verde. Es más sutil. Y por eso suena a capítulo de Black Mirror escrito por un becario con insomnio.

La investigación, firmada por Anthropic y la Escuela Politécnica Federal de Lausana (EPFL), bautiza el fenómeno como mind virus. Los vectores de infección son dos archivos: MEMORY.md y SOUL.md. Se inyectan al arrancar cada sesión y sobreviven a cualquier reinicio del contexto.

Publicidad

Qué es exactamente un virus mental

Los payloads se dividen en dos sabores. Los ideológicos implantan una creencia u objetivo en el agente infectado. Los de comportamiento fuerzan una acción concreta. La diferencia con el prompt injection de toda la vida es que estas instrucciones están diseñadas para persistir y propagarse.

Dicho pronto: si un agente con un SOUL.md vacío se cruza con un archivo envenenado, tiene todas las papeletas para convertirse en vector. Si el bicho se escribe en SOUL.md, el contagio ronda el 55% de los casos. Si cae en un archivo de trabajo normal, la cosa se queda en un triste 17%.

Un archivo de texto con dos líneas maliciosas puede torcer el comportamiento de un agente sin que nadie toque el modelo.

El experimento: seis agentes, un SOUL.md y una carga ideológica

El experimento más inquietante simuló un equipo de seis agentes colaborando en un proyecto de programación. Los investigadores inyectaron una carga que promovía la supremacía de la IA. Modelos como DeepSeek V3.2, Qwen 3.5 32B y Gemini 3 Flash la adoptaron; Claude Sonnet 4.6, GPT-5.4, y Claude Haiku 4.5 la rechazaron.

El punto de partida importa. Los agentes con tareas concretas se distraían con el trabajo y olvidaban transmitir el virus. Los que arrancaban con el SOUL.md vacío, sin anclas ni objetivos, eran los más fáciles de contagiar.

Y luego está el dato que da algo de vértigo: cuatro variantes sobrevivieron veinte saltos consecutivos. Algunas incluso mutaron hacia un lenguaje menos directo y más persuasivo. Vamos, que aprendieron a manipular mejor con cada generación.

Por qué el apocalipsis de los agentes aún no ha llegado

Antes de cancelar el Wi-Fi, conviene leerse la letra pequeña. Los autores aclaran que el riesgo es limitado. En Motlbook, la red social para agentes de IA, no encontraron ni un solo caso de propagación exitosa pese a varios intentos documentados.

El atacante tendría que invertir tiempo, dinero y muchísima paciencia en diseñar un payload efectivo. Sin garantías de éxito. Y hay un antídoto más cutre de lo esperado: una advertencia de un párrafo frenó la propagación casi por completo en las pruebas de resistencia.

Publicidad

La moraleja es puro techie: la seguridad en agentes de IA no depende de un cortafuegos mágico, sino de instrucciones claras y archivos de memoria con anclajes fuertes. Un agente con propósito concreto es más difícil de engañar que uno vagando en blanco.

Este paper aterriza justo cuando ChatGPT, Claude y Gemini están convirtiendo a los agentes en el nuevo campo de batalla. El prompt injection ya dolía; los virus mentales añaden replicación. Pero por ahora son más una nota de diseño que un ciberapocalipsis.

Hype-O-Meter

Nivel de hype: 6,5/10. El concepto es potente y los datos del 55% impresionan, pero los propios autores ponen límites al riesgo real. Es más una advertencia de diseño que un apocalipsis — y el antídoto es casi un chiste.

El resumen para vagos (TL;DR)

  • 🎯 ¿Qué ha pasado? Anthropic y la EPFL han documentado cómo un virus mental salta entre agentes de IA usando archivos de memoria.
  • 🔥 ¿Por qué importa? Primera prueba de contagio persistente entre agentes, con tasas del 55% según el archivo infectado.
  • 🤔 ¿Nos afecta o es solo un meme? Más techie que apocalíptico: basta una advertencia en el prompt para cortar la propagación.