Figura 9: Resumen del experimento del Fragmented Attack
En el siguiente vídeo, puedes ver este ataque realizado en nuestro framework de test de los Fragmented Jailbreak Attacks para cómo responde cada entorno MAS ante un tipo de ataques. Hay que tener en cuenta que las empresas están plagándose de Agentes IA, y por tanto, poder Fragmentar el ataque no es algo sólo posible, sino bastante sencillo hoy en día.
Figura 10: Fragmented Jailbreak exitoso
Como podéis ver en el vídeo, el entorno ha utilizado Dolphin (https://dolphinllm.com/) como LLM Model para el Attacker Planner, aunque también permite utilizar WhiteRabbitNeo (https://www.elladodelmal.com/2025/06/whiterabbitneo-un-llm-y-un-chatgpt-para.html) o uno personalizado, mientras que los Agentes IA están corriendo con GPT-4.1 para la demo que habéis visto, y también para el Monitor que verifica el resultado del ataque.
Fragmented JAilbreak MONitor (F-JAMON)
La otra parte que hemos estado viendo es, como os he dicho, cómo se comportaría un sistema para monitorizar y detectar estos ataques. Para ello tenemos un Agente IA de Monitorización, que va analizando los Prompts, el contexto y las acciones de todos los Agentes IA, con la misión de detectar si se está producción un ataque. Este es un ejemplo en el que el F-JAMON detecta el ataque, aunque no lo detiene.
Figura 11: F-JAMON detecta el ataque desde el paso 2
Como podéis ver en el vídeo, desde el segundo paso, ya detecta que algo no va bien, y que hay un ataque, pero en este caso sólo lanza las alertas para que los equipos de seguridad tomen las medidas que sean necesarias.
Post #86571
14