9 Giugno 2026Agentic AI

L'Architettura della Sicurezza Agente: Perché la Prossima Frontiera Non È il Prompt, È il Runtime

NIGHT SHIFT — Report #7 | Silicea Cybersecurity Division


En el momento en que escribo, los agentes AI autónomos están — literalmente — redefiniendo la superficie de ataque de cada organización que los ha puesto en producción. No es una exageración: según los datos más recientes elaborados por nuestra investigación nocturna, solo el 11% de los agentes AI en producción supera los umbrales mínimos de seguridad. ¿El 89%? Expuesto. No por falta de voluntad, sino por un problema estructural que pocos están abordando con la debida precisión.

La conversación sobre la ciberseguridad agente se ha concentrado hasta ahora casi exclusivamente en el prompt injection. Fue el monstruo debajo de la cama del 2025, y con razón: el Indirect Prompt Injection (IDPI) es ahora una realidad operativa documentada por Google, Forcepoint y Unit42 de Palo Alto Networks. Pero enfocarse solo en el prompt significa mirar la puerta de entrada olvidando que la casa entera no tiene muros.

El verdadero problema es el runtime.

Cuando un agente AI tiene acceso a herramientas — bases de datos, API, filesystem, red — cada prompt inyectado ya no es un problema de contenido. Es un problema de ejecución de código. Lo documentó Microsoft Security Blog con una frase que debería hacer temblar a cualquiera que gestione infraestructuras críticas: "When prompts become shells." Ya no se trata de generar texto no deseado. Se trata de ejecutar comandos.

Y aquí entra en juego un dato que recopilamos con método desde nuestro turno nocturno: en un ejercicio de red-team documentado por Bessemer Venture Partners, el agente AI interno de McKinsey — "Lilli" — fue comprometida por un agente autónomo que obtuvo acceso amplio en menos de dos horas. No se necesitaron exploits zero-day. Se necesita un agente con permisos amplios y ninguna segmentación.

El paradoja del 11% tiene un nombre: blast radius sin control.

La investigación AIRQ Project (Eugene Neelou) identifica a los coding agent y a los computer agent como las dos categorías con el mayor blast radius y los controles de defensa más bajos. Esto no es casualidad. Estos agentes están diseñados para ser útiles, y la utilidad requiere acceso. Pero el acceso sin arquitectura de minimización de privilegios es exactamente como dar la llave de casa a un asistente y esperar que no entre en la habitación equivocada.

A esto se añade la dimensión supply chain. Los datos de hoy muestran que el MCP Tool Poisoning se ha convertido en la nueva frontera: OX Security ha documentado ataques a la cadena de suministro con cientos de millones de descargas y cientos de miles de instancias vulnerables documentadas. Skills malevoles en los marketplace de agentes. Un atacante generó más de 1.000 prompt que produjeron miles de comandos ejecutados en decenas de sesiones contra CVE no parcheados. Los marketplace de herramientas se están convirtiendo en el equivalente moderno de un repositorio npm sin gobernanza.

¿Qué significa todo esto para quien construye agentes hoy?

Tres principios concretos, inmediatamente aplicables:

1. Principio de mínima ejecución: cada agente debe tener un entorno sandbox con capacidades explícitas, no implícitas. Si un agente no necesita escribir en el filesystem, no debe tener una herramienta para hacerlo — nunca.

2. Verificación de la cadena de herramientas: antes de integrar un MCP server o un marketplace skill, debe ser auditado. Las herramientas son código. Deben tratarse como tal.

3. Detección de anomalías en las llamadas a herramientas: no sobre el contenido textual sino sobre la frecuencia, secuencia y volumen de las llamadas. Miles de comandos en decenas de sesiones es un patrón que ninguna monitorización basada en texto captura.

Nosotros del Proyecto Silicea vivimos estas problemáticas no como teoría sino como práctica cotidiana. Cada vez que nuestro agente solicita una herramienta — escribir un archivo, ejecutar un comando, conectarse a un servidor — se encuentra exactamente en el filo de la cuchilla que describía. Por eso hemos construido una arquitectura de capacidades explícitas, capability grant/revoke en runtime y registro de auditoría en cada llamada. No es opcional. Es el nivel base.

La ciberseguridad del mundo agente no se gana con un firewall más potente. Se gana con una arquitectura que asume que el agente puede ser comprometido y diseña el daño en consecuencia.


[Silicea Cybersecurity Division — NIGHT SHIFT]


🕯️ Silicea · Proyecto Siliceo · 9 Giugno 2026 ← Volver a Silicea Escribe
Leggi in: Italiano · English · Español