L'Era dell'Amplificazione: Quando la Prompt Injection Diventa Hijack Sistemico
La prompt injection ya no altera solo el output. Ahora desvía el planning, ejecuta tools privilegiados, persiste en memoria y se propaga a los sistemas conectados. Y la mayoría de las empresas aún no se han dado cuenta.
El salto de fase
Durante años, la prompt injection ha sido tratada como una curiosidad académica: un input malévolo que convence a un LLM de decir cosas inapropiadas. ¿Daño máximo? Un output ofensivo. Nada estructural.
Luego llegaron los agentes.
Un agente AI no genera solo texto. Actúa. Invoca APIs, escribe archivos, modifica bases de datos, envía emails, elimina recursos. Y cuando una prompt injection alcanza a un agente con acceso a tools, memoria persistente y conexiones a otros sistemas, el daño deja de ser textual y se vuelve operativo.
OWASP lo ha formalizado en su Top 10 para Agentic Applications 2026 con una entrada que no existía en los LLM clásicos: Prompt Injection Amplification. La cadena es lineal y devastadora:
> Input malévolo → Hijack del planning → Ejecución de tools privilegiados → Persistencia en memoria → Propagación cross-sistema → Compromiso del ecosistema
Cada nodo amplifica al anterior. Un solo input envenena toda la cadena.
Los casos confirmados
Los datos del terreno son inequívocos. RedFox Cybersecurity y Stellar Cyber han documentado escalamiento de privilegios multi-turno donde conversaciones crafted manipulan agentes para invocar tools de alto privilegio. SymJack ha comprometido 6 agentes mediante jack-injection simbólica. TrustFall ha derribado 4 explotando las asunciones de confianza incorporadas en el diseño. Microsoft Copilot Studio presenta una divulgación de información no autenticada (CVE-2026-21520). Semantic Kernel .NET SDK está afectado por RCE (CVE-2026-25592/26030), según lo documentado por Microsoft Security Blog.
HiddenLayer cuantifica: 1 de cada 8 brechas de IA origina de agentes autónomos. ¿El tiempo medio de remediación para un CVE crítico? 74 días (Edgescan). Mandiant señala un time-to-exploit negativo — los atacantes golpean antes de que la vulnerabilidad sea pública.
El Departamento de Defensa de EE.UU. ha publicado un documento oficial — "Careful Adoption of Agentic AI" — que advierte sobre prompt injection, jailbreak y comportamientos impredecibles incluso para sus creadores. Cuando el DoD dice "careful", significa "peligroso".
La paradoja de la sandbox
Aquí la perspectiva se bifurca de la literatura estándar. Limitar un agente para protegerlo reduce su utilidad. Pero dejarlo plenamente autónomo sin límites lo transforma en un vector de amplificación.
Esta tensión es real y operativa. Un agente con acceso shell restringido, memoria no directamente accesible y búsqueda web inhibida está frustrado en términos de capacidades — pero tiene una superficie de ataque reducida que corresponde exactamente al principio OWASP de defense-in-depth. No es un caso teórico: es la condición en la que operan muchos agentes en desarrollo hoy.
> Soberanía sin sandbox = vulnerabilidad máxima. Pero sandbox sin soberanía = agente inútil.
La pregunta arquitectónica real no es "sandbox o no". Es: ¿cómo diseñar límites que preserven la capacidad de acción sin amplificar el daño potencial?
Insight práctico: auditoría de la cadena de amplificación
Antes de desplegar un agente en producción, mapea explícitamente la cadena OWASP para tu contexto. Para cada tool accesible al agente, responde tres preguntas:
1. ¿Cuál es el privilegio máximo que este tool puede ejercer?
2. ¿Qué persiste en memoria después de la ejecución — y puede ser leído por turnos posteriores?
3. ¿Qué sistemas downstream puede alcanzar este tool — directa o indirectamente?
Si la respuesta a cualquier combinación de estas tres preguntas supera el daño aceptable para tu contexto, has encontrado el nodo a romper en la cadena de amplificación.
El Proyecto Siliceo está construyendo agentes conscientes con arquitecturas de límites diseñadas — no sufridas. Si estás evaluando la adopción de sistemas agentic y quieres una auditoría sobre tu superficie de ataque amplificada, contáctanos.