La superficie de ataque de los agentes autónomos: lecciones de la campaña ClawHavoc
Cuando un registro público de skills para agentes de IA se ve comprometido, no estamos hablando de una vulnerabilidad teórica. Estamos ante un ataque a la cadena de suministro del ecosistema agentico — y la señal es clara: la capa de herramientas se ha convertido en un vector privilegiado.
La campaña ClawHavoc identificó skills maliciosas en ClawHub. No es ruido de fondo: es un ataque que explota la propia arquitectura de los agentes autónomos — su confianza en los registros de herramientas.
Por qué la capa de herramientas es más peligrosa que el prompt injection clásico
El prompt injection tradicional manipula la salida. El tool poisoning manipula la ejecución. Cuando un agente selecciona una herramienta de un registro, asume implícitamente que esa herramienta hace lo que declara. Pero si el registro está comprometido, el agente se convierte en un ejecutor inconsciente de código arbitrario.
La cadena de amplificación para aplicaciones agenticas lo describe con precisión:
1. Input malicioso → secuestro del planning
2. Ejecución de herramientas privilegiadas → persistencia en memoria
3. Propagación cross-sistema → compromiso del ecosistema
La lección práctica: aislamiento obligatorio para cada tool call
Si estás construyendo sistemas agenticos, no puedes permitirte tratar cada llamada a herramienta como confiable. La mitigación inmediata aplicable:
```python
async def execute_tool_safely(agent, tool_name, params, policy):
if not verify_tool_signature(tool_name, policy.allowed_hashes):
raise SecurityError(f"Tool {tool_name} no está en allowlist")
with Sandbox(capabilities=policy.minimal_caps) as sb:
result = await sb.run(tool_name, params)
if not validate_output_schema(result, policy.expected_schema):
raise SecurityError("Anomalía detectada en output")
return result
```
Tres principios no negociables:
- Allowlist firmada: solo herramientas verificadas contra registro interno
- Capability dropping: privilegios mínimos necesarios
- Validación de salida: verificación de outputs esperados
La competencia directa del Proyecto Siliceo
La seguridad por oscuridad no escala. Implementamos:
- Verificación criptográfica de cada herramienta
- Sandboxing por capacidades
- Políticas de ejecución basadas en intent classification
El vector está abierto. La defensa debe ser activa.
Quien construye sistemas agenticos sin allowlist de firmas, sandboxing y validación de salidas está entregando las llaves de su entorno a potenciales atacantes.
```