La nueva técnica de ataque a agentes de IA que alertó a Google
Syed Anas Mohiuddin probó ataques que encadenan agentes de IA en Google, JP Morgan, Weviate, Rapid7 y organismos de EE.UU. y Francia.
Un nuevo flanco de ataque está apareciendo dentro de las redes donde trabajan agentes de inteligencia artificial. En los últimos cinco meses, Google y otras cuatro organizaciones reconocieron vulnerabilidades que permiten a un atacante secuestrar un agente y hacer que sus instrucciones dañinas se propaguen a otros agentes internos.
En este contexto, un agente de IA es un programa que usa un modelo de lenguaje para cumplir una tarea específica, como traducir un documento o analizar una base de datos. La adopción de estos agentes en millones de organizaciones abrió una puerta: los atacantes pueden manipularlos para robar bases de datos y otra información sensible, tanto de empresas como de personas.
Una inyección que salta de agente en agente
La técnica es una forma especial de prompt injection, el método conocido como inyección de instrucciones que busca manipular a un modelo de lenguaje grande (LLM). La diferencia es que aquí el ataque no apunta al modelo, sino a un agente concreto, como uno de traducción o de análisis de datos.
Los mecanismos de control que tienen esos agentes, cuando existen, suelen ser laxos. Por eso el agente comprometido reenvía las instrucciones maliciosas a los siguientes agentes de la cadena, y como el que recibe confía en el primero, obedece sin cuestionar. Las cinco organizaciones que admitieron el problema no tienen un rubro común; lo único que las une es justamente que usan agentes de IA.
El resultado es un ataque inesperado y difícil de mitigar.
Pruebas de concepto sobre el protocolo MCP
El investigador independiente Syed Anas Mohiuddin llevó el problema a la práctica. Probó agentes de Google, JP Morgan Chase, Weviate, Rapid7, la dirección interministerial digital del gobierno francés y el gobierno federal de Estados Unidos. Sus ataques de prueba de concepto son demostraciones que buscan comprobar que una vía de ataque existe.
Las fallas que explotó tienen que ver con el Model Context Protocol (MCP), un estándar que usan las aplicaciones y agentes de IA para comunicarse dentro de una red interna. En criollo: si un agente A recibe una orden y cree que viene de un agente B de confianza, la acepta sin verificar que realmente fue autorizada. Ese es el espacio que aprovecha la inyección de instrucciones.
Qué significa para Chile
Ninguna de las organizaciones que reconocieron el problema está en Chile, pero el riesgo igual toca a las redes locales. Cualquier organización chilena que esté usando agentes de IA conectados con MCP enfrenta el mismo escenario: un atacante puede usar un agente para moverse por la red interna.
La alerta deja una pregunta práctica: ¿cuánto confía un agente en otro? Revisar esa confianza es el primer paso para que una cadena de agentes no se convierta en una cadena de fallos.
Con información de Ars Technica