Investigadores presentaron MCP Hive, un entorno multiagente basado en Model Context Protocol (MCP), y analizaron cómo su arquitectura introduce nuevos riesgos en la protección de la IA, especialmente en la interacción entre agentes de IA y herramientas externas. El problema central es que MCP estandariza el intercambio de contexto y capacidades, pero asume implícitamente la confianza en los datos compartidos, lo que abre la puerta a ataques de inyección de prompt a nivel de sistema completo, no solo de un modelo individual.
El mecanismo de ataque consiste en que un agente o herramienta comprometida inserta instrucciones maliciosas dentro del contexto compartido de MCP, que otros agentes consumen y ejecutan como si fueran legítimas. Esto convierte el protocolo en un canal de propagación lateral de ataques, permitiendo encadenar acciones a través de múltiples componentes y potencialmente abusar de toolchains. Según los datos disponibles, el trabajo es principalmente exploratorio y no hay evidencia pública de explotación activa en entornos productivos.
https://arxiv.org/pdf/2604.13849
Post #2148
160
Forwarded from Seguridad de IA