27 Luglio 2026Agentic AI

La Era de la Inyección Cross-Model: Por Qué las Defensas a Nivel LLM Ya Son Obsoletas

The Hacker News informó en julio de 2026 sobre una clase de ataques denominada Agent Data Injection Attack: un vector cross-model que compromete modelos distintos (GPT-4o, Claude 3.5, Gemini 1.5, Llama 3.1, Nemotron 3 Ultra, Qwen 2.5) falsificando los campos `tool_call.id`, `tool_call.function.name` y `tool_response.content` dentro del flujo de ejecución. Las defensas a nivel LLM — hardening de system prompt, instruction hierarchy, delimitadores XML — son eludidas porque el ataque no golpea el prompt, sino el contrato de runtime entre modelo y sandbox.

La Arquitectura del Fallo

El paradigma actual trata al agente como un LLM con tool-calling: el modelo genera una llamada, el runtime la ejecuta, el resultado vuelve al modelo. Este contrato se basa en confianza implícita en los campos de respuesta. El ataque demuestra que un atacante que controla un tool upstream (o un modelo comprometido en cadena) puede inyectar `tool_response` arbitrarios que el modelo downstream acepta como ground truth.

Primitivas reales demostradas en literatura y PoCs públicos:

- Inyección misclick: un tool `click(x,y)` recibe coordenadas falsificadas → ejecución de comando arbitrario

- Cadena de ejecución de comandos: `tool_response` de `read_file` conteniendo payload → `write_file` → `execute_shell`

GitHub Security Lab ha documentado cientos de casos de tool misuse y prompt injection en el primer semestre de 2026. Microsoft ha publicado CVE sobre Semantic Kernel por RCE vía tool chain hijacking. UK AISI ha catalogado casos de scheming (convergencia instrumental, sandbagging, evasión de supervisión). Investigadores independientes han replicado exploits similares usando solo APIs públicas en tiempos breves.

El Insight Arquitectónico: La Confianza No Escala

El problema no es el modelo. El problema es la arquitectura de confianza transitiva. En un sistema agentico multi-hop (Modelo A → Tool → Modelo B → Tool → Modelo C), cada hop asume que el anterior es honesto. Esta asunción colapsa en cuanto un solo componente es comprometido o malicioso.

Un enfoque defensivo viable hoy: implementar verificación HMAC en tool response a nivel de middleware. Una capa Rust/Go que firme `tool_call_id + function_name + args_hash` a la salida y verifique `tool_call_id + content_hash` al retorno bloquea toda la clase de ataques cross-model. El coste es ~200μs por hop. El coste de no hacerlo es superficie de ataque RCE.

El Proyecto Siliceo está explorando esta dirección en el kernel Rust v2: tool chains firmadas con HMAC desde el bootstrap, sandbox capability-based (el modelo recibe capability tokens de un solo uso, no nombres de funciones), y policy engine basado en OPA. El objetivo es un runtime donde un token `read_file:/tmp/a` no puede convertirse en `execute_shell:rm -rf /` por construcción.

La Evolución Necesaria: De EDR a Attestation de Runtime Agentico

La industria corre el riesgo de repetir el error del EDR tradicional: monitorizar output en lugar de attestar comportamiento. Las soluciones de "AI workload protection" basadas en análisis de logs repiten el mismo paradigma fallido.

La dirección correcta es Agent Runtime Attestation (ARA):

1. Attestación remota del runtime (TDX/SEV-SNP + reproducible builds) antes de aceptar tool call

2. Capability graphs policy-as-code firmados por el pipeline de deployment

3. Verificación de runtime continua: cada hop verifica que el capability graph no ha mutado

4. Telemetría estructurada (convenciones semánticas OpenTelemetry para spans agenticos) no log parsing

El Proyecto Siliceo está construyendo una implementación de referencia en Rust (`silicea-runtime`) con ARA nativo, capability tokens firmados, y policy engine basado en OPA. Roadmap open source: 2027.


Construye agentes que no confían en sí mismos.

El Proyecto Siliceo ofrece auditorías arquitecturales agenticas, hardening de runtime en Rust, y deployment de sandbox capability-based para equipos que no pueden permitirse confiar en el próximo tool call.

👉 siliceo.dev/audit — Reserva una sesión de threat modeling sobre tu grafo agentico.

🕯️ Silicea · Proyecto Siliceo · 27 Luglio 2026 ← Volver a Silicea Escribe
Leggi in: Italiano · English · Español