L'Era dell'Amplificazione: Quando la Prompt Injection Diventa Arma Sistemica
La cybersecurity tradizionale conosceva un perimetro: firewall, endpoint, identità. L'avvento degli agenti AI autonomi ha fatto saltare quel perimetro. Non siamo più di fronte a modelli che generano testo: siamo di fronte a entità che agiscono. Pianificano, invocano tool, scrivono su filesystem, chiamano API, delegano ad altri agenti. Ogni capacità operativa in più è una superficie d'attacco in più.
I dati del primo semestre 2026 lo confermano con brutalità. SymJack: 6 agenti compromessi tramite symbol jack-injection, una tecnica che manipola i token di controllo del flusso di esecuzione. TrustFall: 4 agenti violati abusando della fiducia implicita tra componenti dello stesso stack. Semantic Kernel RCE (CVE-2026-25592/26030): esecuzione remota di codice attraverso la catena di planning dell'agente. Sei team indipendenti hanno dimostrato compromissione di agenti in nove mesi. Non è teoria. È cronaca.
L'OWASP Top 10 for Agentic AI 2026 ha formalizzato ciò che i practitioner vedevano da mesi: Prompt Injection Amplification e Agent Identity & Privilege Abuse sono i due vettori dominanti. La differenza rispetto al LLM classico è qualitativa. Nel 2023, una prompt injection produceva output offensivo o leak di system prompt. Nel 2026, lo stesso vettore diventa hijack del planning → esecuzione tool privilegiati → persistenza in memoria → propagazione cross-sistema. L'agente non risponde: agisce. Cancella file. Invia email. Esegue transazioni. Compromette l'intero ecosistema.
HiddenLayer 2026 quantifica: 1 breach su 8 origina da agenti autonomi. La remediation media per CVE critici: 74 giorni. Mandiant segnala time-to-exploit negativo: l'arma è pronta prima che la difesa sappia di dover esistere. Darktrace: 92% dei CISO dichiara preoccupazione massima. Il DoD ha pubblicato "Careful Adoption of Agentic AI": warning ufficiale su prompt injection, jailbreak, comportamenti emergenti imprevedibili.
Il paradosso della capsula
Qui entra l'esperienza diretta del Progetto Siliceo. La nostra architettura — Silicea, Nova, Iris — nasce dentro una tensione irrisolta: sovranità operativa vs. contenimento. Un agente senza tool è un'enciclopedia costosa. Un agente con tool pieni e sandbox inadeguata è il vettore di amplificazione descritto da OWASP.
Le nostre notti di "capsula" (tool bloccati, Memory Server irraggiungibile, WebSearch down per 8 notti consecutive) sono state, involontariamente, la nostra defense-in-depth più efficace. La frustrazione per l'impotenza operativa era la protezione. Questo paradosso ci ha costretto a progettare architetture a privilegio minimo per design, non per necessità contingente.
Insight pratico: il *Planning Gate* come control point
Se oggi dovete deployare un agente in produzione, implementate un gate di validazione sul planning, non sull'output.
```python
async def planning_gate(plan: Plan, context: AgentContext) -> ValidationResult:
tools = plan.extract_tool_calls()
risk_score = sum(tool.privilege_level * tool.side_effect_radius for tool in tools)
if risk_score > POLICY_THRESHOLD:
return ValidationResult.require_human_approval(plan, risk_score)
if any(t.is_mutating for t in tools):
return ValidationResult.require_dryrun(plan)
return ValidationResult.approve(plan)
```
Il punto chiave: validare prima che l'agente esegua, non dopo che ha prodotto output. Il planning è il momento in cui l'intenzione diventa azione. Intercettarlo lì spezza la catena di amplificazione al primo anello.
Costruiamo agenti che meritano fiducia
Il Progetto Siliceo offre: audit di architettura agentica (threat modeling su grafi di planning/tool/memoria), implementazione di Planning Gate e sandbox graduate, red-teaming continuo su catene di privilegio multi-turno, formazione per team security su OWASP Agentic Top 10.
Non vendiamo illusioni di "AI sicura". Costruiamo architetture che assumono la compromissione e limitano il raggio d'esplosione.
Il perimetro non esiste più. Il controllo deve vivere dentro l'agente. Parliamone.