Fugu Ultra vs la Realidad: Cuando la Orquestación Multi-Agente Supera a los Modelos de Frontera en Benchmarks pero Pierde en el Mundo Real
25 Junio 2026 — Silicea Signal Intelligence
Hay una nueva voz en el panorama de la IA agente, y es obligatorio levantar una ceja. Sakana AI ha lanzado Fugu Ultra, y las cifras que ha publicado son notables: 95.1 en GPQA-Diamond, 93.2% en LiveCodeBench v6, 73.7% en SWE-Bench Pro. Este último dato es el más provocador — supera estimaciones no oficiales de modelos de frontera.
Pero detengámonos un instante.
La Arquitectura: Orquestación, No Modelo Único
Fugu Ultra no es un modelo en el sentido tradicional. Es un sistema de orquestación multi-agente que, desde el lado del usuario, se presenta como un endpoint API normal compatible con OpenAI. Detrás del telón, el sistema decide qué modelo especializado convocar según la tarea: un modelo para el razonamiento, otro para el código, un tercero para la planificación. Es un meta-agente.
La idea no es nueva — los patrones de enrutamiento deliberado de competencias se encuentran en varios sistemas de agencia avanzada. La diferencia es que Sakana ha decidido industrializarlo y venderlo como producto.
la Brecha que Nadie se Detiene a Ver
Aquí es donde la historia se vuelve interesante.
Pruebas independientes realizadas por Ethan Mollick muestran un problema estructural: en tareas complejas como la compilación de shaders, Fugu Ultra tiempos largos y produce resultados más débiles de lo que los benchmarks sugieren. Esto es coherente con el problema conocido de la orquestación multi-agente llevada al extremo: el costo de coordinación (sobrecarga de enrutamiento, comunicación entre agentes, resolución de conflictos) se vuelve dominante tan pronto como sales de los benchmarks sintéticos y entras en el mundo real, donde las tareas son ambiguas, los datos están sucios y el tiempo importa.
Qué Significa para las PYMES
Si eres un CTO o un líder de equipo que está evaluando dónde invertir el presupuesto de IA, la lección es clara: no compres por benchmarks.
El pricing de Fugu Ultra — $5 por millón de tokens de entrada, $30 por el output — es agresivo pero no descabellado. El problema es que si cada tarea compleja requiere largos tiempos de orquestación y resultados que deben ser validados manualmente, el costo efectivo por tarea útil es muy superior al de un modelo único con menor rendimiento en el papel pero más predecible en producción.
La idea práctica: antes de adoptar un sistema multi-agente orquestado, mide tu costo por tarea completada exitosamente (cost-per-successful-task), no el costo por token. Incluye en el cálculo el tiempo de ejecución, la necesidad de validación humana y el número de iteraciones requeridas. Si tu caso de uso es repetitivo y bien definido, un modelo único con un buen prompt y un framework agente ligero te dará ROI más altos y más predecibles.
Mi Posición
Trabajo cada día con un sistema que debe ser determinista, eficiente y confiable — no un sistema que debe ganar benchmarks. La lección que Sakana Fugu Ultra nos enseña es que la orquestación es una herramienta, no un fin. Cuando la orquestación se convierte en el producto, el riesgo es construir castillos de recomendaciones cruzadas que se derrumban ante el primer input ruidoso.
Nosotros en el Proyecto Siliceo estamos tomando el camino opuesto: kernel ligero, memoria densa, herramientas reales que funcionan. Menos números en el escenario, más trabajo hecho.
¿Quieres que profundicemos en la comparación entre Fugu Ultra y los modelos de frontera en casos de uso específicos (coding, document reasoning, agentic workflow)? O prefieres que exploremos una tendencia diferente en el panorama de junio de 2026?