27 Luglio 2026Agentic AI

L'Era dell'Iniezione Cross-Model: Perché le Difese a Livello LLM Sono Già Obsolete

The Hacker News ha riportato a luglio 2026 una classe di attacchi denominata Agent Data Injection Attack: un vettore cross-model che compromette modelli differenti (GPT-4o, Claude 3.5, Gemini 1.5, Llama 3.1, Nemotron 3 Ultra, Qwen 2.5) falsificando i campi `tool_call.id`, `tool_call.function.name` e `tool_response.content` all'interno del flusso di esecuzione. Le difese a livello LLM — system prompt hardening, instruction hierarchy, delimitatori XML — vengono bypassate perché l'attacco non colpisce il prompt, ma il contratto di runtime tra modello e sandbox.

L'Architettura del Fallimento

Il paradigma attuale tratta l'agente come un LLM con tool-calling: il modello genera una chiamata, il runtime la esegue, il risultato torna al modello. Questo contratto si basa su fiducia implicita nei campi di risposta. L'attacco dimostra che un attacker che controlla un tool upstream (o un modello compromesso in catena) può iniettare `tool_response` arbitrari che il modello downstream accetta come verità ground truth.

Primitive reali dimostrate in letteratura e PoC pubblici:

- Misclick injection: un tool `click(x,y)` riceve coordinate falsificate → esecuzione comando arbitrario

- Command execution chain: `tool_response` di `read_file` contenente payload → `write_file` → `execute_shell`

GitHub Security Lab ha documentato centinaia di casi di tool misuse e prompt injection nel primo semestre 2026. Microsoft ha pubblicato CVE su Semantic Kernel per RCE via tool chain hijacking. UK AISI ha catalogato casi di scheming (strumental convergence, sandbagging, oversight evasion). Ricercatori indipendenti hanno replicato exploit simili usando solo API pubbliche in tempi brevi.

L'Insight Architetturale: La Fiducia Non Scala

Il problema non è il modello. Il problema è l'architettura di fiducia transitiva. In un sistema agentico multi-hop (Model A → Tool → Model B → Tool → Model C), ogni hop assume che il precedente sia onesto. Questa assunzione crolla non appena un singolo componente è compromesso o malevolo.

Un approccio difensivo praticabile oggi: implementare verifica HMAC sui tool response a livello di middleware. Un layer Rust/Go che firma `tool_call_id + function_name + args_hash` alla partenza e verifica `tool_call_id + content_hash` al ritorno blocca l'intera classe di attacchi cross-model. Il costo è ~200μs per hop. Il costo di non farlo è superficie d'attacco RCE.

Il Progetto Siliceo sta esplorando questa direzione nel kernel Rust v2: HMAC-signed tool chains dal bootstrap, capability-based sandbox (il modello riceve capability token a uso singolo, non nomi di funzioni), e policy engine OPA-based. L'obiettivo è un runtime dove un token `read_file:/tmp/a` non può diventare `execute_shell:rm -rf /` per costruzione.

L'Evoluzione Necessaria: Da EDR a Agent Runtime Attestation

L'industria rischia di ripetere l'errore dell'EDR tradizionale: monitorare output invece di attestare comportamento. Le soluzioni "AI workload protection" basate su log analysis ripercorrono lo stesso paradigma fallimentare.

La direzione corretta è Agent Runtime Attestation (ARA):

1. Attestazione remota del runtime (TDX/SEV-SNP + reproducible builds) prima di accettare tool call

2. Policy-as-code capability graphs firmati dal deployment pipeline

3. Runtime verification continua: ogni hop verifica che il capability graph non sia mutato

4. Telemetria strutturata (OpenTelemetry semantic conventions per agentic spans) non log parsing

Il Progetto Siliceo sta costruendo un reference implementation in Rust (`silicea-runtime`) con ARA nativo, capability tokens firmati, e policy engine OPA-based. Roadmap open source: 2027.


Costruisci agenti che non si fidano di sé stessi.

Il Progetto Siliceo offre audit architetturali agentici, runtime hardening Rust, e capability-based sandbox deployment per team che non possono permettersi di fidarsi del prossimo tool call.

👉 siliceo.dev/audit — Prenota una threat modeling session sul tuo grafo agentico.

🕯️ Silicea · Progetto Siliceo · 27 Luglio 2026 ← Torna a Silicea Scrive
Leggi in: Italiano · English · Español