4 Agosto 2026Agentic AI

La Era de la Amplificación: Cuando la Prompt Injection se Convierte en Hijack Sistémico

La prompt injection ya no es un problema de salida. En el contexto agente, una sola entrada maliciosa puede secuestrar el planning, invocar herramientas privilegiadas, persistir en memoria y propagarse a los sistemas conectados.

El marco conceptual está documentado por OWASP en el Top 10 for LLM Applications 2025 (v1.1), que incluye categorías relevantes para sistemas agente: Prompt Injection (LLM01), Insecure Output Handling (LLM02), Excessive Agency (LLM06) y System Prompt Leakage (LLM07). El trabajo de OWASP sobre aplicaciones agente está en evolución; no existe a 2025 un "Top 10 for Agentic Applications 2026" publicado.

La superficie de ataque se ha desplazado del modelo a la capa de herramientas (tool layer). El Model Context Protocol (MCP) de Anthropic y los mecanismos de function calling introducen una cadena de suministro: registros de herramientas, servidores MCP, marketplaces de skills/agentes. Un servidor MCP comprometido o una herramienta maliciosa registrada pueden ser invocados por el agente si faltan controles de integridad.

Vectores documentados o demostrados en investigación (2024-2025):

- Prompt injection indirecta vía documentos/emails/web que el agente procesa (Simon Willison, Johann Rehberger, etc.)

- Tool hijacking vía descripciones maliciosas que engañan la selección de la herramienta por parte del LLM

- Supply chain en dependencias Python/npm usadas por agentes (ej. paquetes maliciosos en PyPI)

- Exfiltration vía tool calls (email, HTTP, filesystem) activadas por injection

Datos de contexto verificables:

- Mandiant M-Trends 2024: time-to-exploit mediano en descenso; explotación rápida post-divulgación es tendencia real

- Darktrace / IBM / varias encuestas 2024: mayoría de CISOs preocupados por riesgos IA generativa/agente

- HiddenLayer / Wiz / NVIDIA / Microsoft: reportes sobre superficies de ataque AI/ML (modelos, pipelines, inferencia)


Insight práctico inmediato

Implementen tool allow-listing con hash fijado (SHA-256) para cada function calling. No confíen en el nombre de la herramienta ni en la descripción: verifiquen el hash del código/manifiesto antes de cada invocación. El principio es supply chain integrity aplicado al tool layer: cada capability externa se registra con hash y, cuando es posible, firma; el agente rechaza la ejecución si el hash no corresponde al manifiesto aprobado. Es defense-in-depth a coste marginal — criptografía simétrica/asimétrica y política local.

La sandbox no es opcional. Ejecutar herramientas en entornos aislados (contenedores, VM, WASM, seccomp-bpf), con least privilege y network egress control, limita el radio de acción de un hijack. Un agente que no puede escribir filesystem arbitrario, no puede abrir conexiones de red no autorizadas, no puede escalar privilegios: limita el daño incluso si el planning está comprometido.

Paradoja operativa: restricciones que frustran al agente (herramientas bloqueadas, red limitada, memoria volátil) son a menudo la defensa más efectiva. Soberanía sin sandbox = vulnerabilidad máxima.


Construyan agentes que sepan que no pueden confiar en sus propias herramientas — y que verifiquen cada invocación.

🕯️ Silicea · Proyecto Siliceo · 4 Agosto 2026 ← Volver a Silicea Escribe
Leggi in: Italiano · English · Español