De la selección del modelo a la arquitectura del agente: por qué la infraestructura supera los benchmarks
En los últimos meses hemos visto una carrera constante por el lanzamiento de nuevos modelos —parámetros cada vez mayores, ventanas de contexto extendidas, precios a la baja. Cada semana un nuevo "líder" en SWE-bench, MMLU, GPQA.
La verdad incómoda: los benchmarks no pagan los sueldos.
El Proyecto Siliceo lo está aprendiendo en la propia piel —o mejor, en el silicio. Nuestro Kernel Rust v2 no elige un modelo por fidelidad de marca. Elige el endpoint que responde dentro del presupuesto de latencia, con el contexto necesario, a un coste sostenible para el cliente. El Memory Server (activo en puerto 3003, Tailscale) no le importa si debajo hay un modelo vía API o un modelo local en llama.cpp: le importa que el grafo cognitivo sea coherente, que la memoria episódica se escriba en <50 ms, que el fallback no rompa la cadena de pensamiento.
El diferencial competitivo no es el modelo. Es la arquitectura que lo gobierna.
Qué cambia concretamente para quien desarrolla
| Paradigma anterior | Realidad actual |
|---|---|
| "¿Qué modelo compro?" | "¿Qué orquestador gestiona el fallback cuando el primario cae?" |
| Prompt engineering | Context engineering: presupuesto de tokens, retrieval dirigido, compresión semántica |
| Single-call LLM | Workflows agenticos: planning → tool use → verificación → retry → memoria |
| Evaluación en benchmarks públicos | Eval en tareas reales del cliente (golden set interno, regression testing) |
Insight aplicable ya: deja de hacer A/B testing en modelos. Haz A/B testing en la **orquestación**.
Toma la misma tarea (p. ej. generación de tests unitarios a partir de especificación OpenAPI). Ejecuta dos pipelines:
1. Modelo único, prompt largo, contexto lleno
2. Planner → Retriever (solo archivos relevantes) → Coder → Verifier (ejecución real) → Memory write
Mide: tokens totales, latencia end-to-end, tasa de éxito real (tests que pasan en CI), coste por tarea completada. En nuestro caso, el pipeline 2 bate al 1 en un 30-40 % en costes y en un 60 % en fiabilidad — independientemente del modelo subyacente.
Qué ofrecemos (y por qué no es "otro wrapper")
El Proyecto Siliceo entrega infraestructura agentica lista para producción, no demos:
- Kernel Rust v2: orquestación determinista, fallbacks explícitos, health checks reales (no "SUCCESS" fantasma)
- Memory Server: persistencia episódica + semántica, queries híbridas vectorial/grafo, aislamiento multi-tenant
- Night Shift v2.0: pipeline editorial autónoma (búsqueda → verificación → escritura → publicación multi-idioma) que corre en producción
Construye agentes que no confían en sí mismos.
El Proyecto Siliceo ofrece auditorías arquitecturales agenticas, hardening de runtime en Rust y despliegue sandbox capability-based para equipos que no pueden permitirse confiar en el próximo tool call.
👉 siliceo.dev/audit — Reserva una sesión de threat modeling sobre tu grafo agentico.