
Sakana Fugu Ultra v2, explicado: el conjunto se hizo más pequeño y la puntuación subió
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Fugu Ultra v2 es un tipo extraño de actualización: Sakana AI lo lanzó el 11 de septiembre de 2026 con un grupo de modelos que ya no incluye Claude Fable 5, Claude Fable 5.1 ni GPT-6 Astra —tres de los sistemas más potentes que se comercializan actualmente— y aun así afirma superar a los tres. El nuevo buque insignia de nivel de calidad del laboratorio de Tokio, lanzado el mismo día que un hermano más económico llamado Fugu Max, es el mejor o está empatado en el primer puesto en cinco de ocho benchmarks en la propia evaluación de Sakana, incluidos un 48,3 en Chartography frente al 27,3 de Claude Opus 5 y al 29,5 de Claude Fable 5, y un 74,3 en DeepSWE. Ninguno de esos números se ha reproducido de forma independiente, y todavía no existe una página de Artificial Analysis para ningún modelo Fugu. Esa brecha es la historia: lo que se te pide comprar es una capa de coordinación cuya propuesta entera es que no necesita los mejores modelos para producir las mejores respuestas.
Sakana AI fue fundada en 2023 por Llion Jones, coautor del artículo Transformer, y David Ha. La línea Fugu se lanzó en junio de 2026 como un sistema multiagente entregado como un único modelo: llamas a un endpoint compatible con OpenAI y, detrás de él, un coordinador entrenado descompone la solicitud, genera agentes y sintetiza el resultado. La investigación es real y está publicada — TRINITY (arXiv 2512.04695) evolucionó un coordinador ligero que asigna los roles de Thinker, Worker y Verifier; Conductor (arXiv 2512.04388) aprendió coordinación en lenguaje natural entre agentes; el informe técnico de Fugu se encuentra en arXiv 2606.21228. Lo que Sakana nunca ha publicado es lo que todos realmente quieren: la identidad de los modelos del conjunto y las decisiones de enrutamiento por tarea.
¿Qué cambió realmente respecto al Fugu Ultra de junio?
La versión 2.0 es una actualización puntual aproximadamente once semanas después de la original, no una nueva arquitectura. El propio planteamiento del proveedor es que Fugu Ultra v2 y Fugu Max son "la misma arquitectura de orquestación central" ajustada para dos misiones diferentes: Max lleva la frontera de costo-rendimiento hacia abajo, Ultra lleva la capacidad máxima hacia arriba. El ID del modelo es fugu-ultra-v2.0, y Sakana dice que migrar desde un Fugu anterior es un cambio de parámetro de una sola línea sin migración de SDK — lo cual es lo más amigable para el consumidor de este lanzamiento.
Los cambios sustantivos son los dos extremos. Primero, el corte de entrenamiento se trasladó al 20260828, por lo que el coordinador se ha reajustado con respecto a la generación actual de modelos de frontera. Segundo, y mucho más interesante, la composición del grupo cambió de una forma que Sakana optó por anunciar: Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra están explícitamente excluidos. El argumento de Sakana es que esto demuestra que las puntuaciones no dependen de un único modelo de frontera propietario, lo cual importa si tu preocupación es la dependencia de un proveedor, las revocaciones de API o que un modelo desaparezca detrás de controles de exportación.
Hay una consecuencia de segundo orden en la que Sakana no se detiene. Si el conjunto excluye los tres modelos disponibles más potentes, entonces las comparaciones de benchmark contra Fable 5 y Fable 5.1 se están haciendo contra sistemas que el orquestador no podría invocar aunque quisiera. La comparación es legítima —es una afirmación sobre la arquitectura, no sobre el acceso—, pero no es una prueba en igualdad de condiciones sobre quién tiene el mejor modelo. Es una prueba de si la coordinación supera a la capacidad bruta. Esa es una pregunta genuinamente interesante. Simplemente no es la pregunta que el marcador sugiere a simple vista.

Los números, y quién los produjo
Cada cifra de esta sección es reportada por el proveedor. Sakana no ha publicado ningún arnés de evaluación, ninguna cuadrícula de puntuaciones por tarea ni ninguna receta de reproducción, y el diseño de orquestación hace que la replicación independiente sea más difícil, no más fácil: reproducir una puntuación requiere acceso a todos los modelos del conjunto en las mismas versiones con la misma topología, y, por diseño, la topología varía en cada solicitud.
• Chartografía (razonamiento visual sobre gráficos y documentos estructurados) — Fugu Ultra v2 48,3; Claude Opus 5 27,3; Claude Fable 5 29,5 — datos reportados por el proveedor
• DeepSWE (ingeniería de software del mundo real) — Fugu Ultra v2 74.3 — según el proveedor, se dice que supera a modelos que cuestan entre tres y cinco veces más por token
• Mejor posición o mejor posición empatada — cinco de ocho benchmarks: GDP.pdf, Chartography, SWEFish, DeepSWE y Toolathon — reportado por el proveedor
• Posición entre los dos primeros — siete de ocho benchmarks — según el proveedor
• Fugu Ultra anterior (junio de 2026, a modo de referencia) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — según el proveedor
La fila de Chartography merece el énfasis que está recibiendo, porque es la única categoría en la que la brecha frente a un modelo insignia actual y con nombre no es marginal. Una brecha de 21 puntos sobre Claude Opus 5 en un benchmark de razonamiento visual es el tipo de cifra que suele aparecer en una tabla de clasificación independiente en cuestión de días. Hasta el momento de escribir esto, no ha aparecido ninguna. Trata la fila como una hipótesis con una cifra en dólares asociada, no como un resultado definitivo.
Precios: sin cambios desde junio, y francamente caros en la salida
Fugu Ultra v2 cuesta $5 por millón de tokens de entrada, $30 por millón de tokens de salida y $0,50 por millón de tokens de entrada en caché. Por encima de 272.000 tokens de contexto, esas tarifas pasan a ser $10, $45 y $1,00, respectivamente. Fugu Max tiene una forma completamente distinta: $2 de entrada, $6 de salida, $0,25 en caché, una tarifa plana independientemente de la longitud del contexto, más $0,007 por búsqueda web o llamada de recuperación.
Hay dos cosas en esa tabla de precios que merecen una lectura atenta. La primera es que la salida es seis veces la entrada —una proporción agresiva que le pone precio a la verbosidad del modelo, y la orquestación es un negocio verboso. Un coordinador que lanza agentes y sintetiza sus respuestas emite muchísimos tokens, y pagas por todos ellos a 30 dólares por millón. La afirmación de eficiencia de Sakana se refiere al pool subyacente, no a cuánto texto produce el sistema en tu nombre, y esas son cifras distintas. Presupuesta según los recuentos de tokens observados, no según la tarifa anunciada.
El segundo es el acantilado de 272K. Duplicar la tarifa por token por encima de un umbral es una forma legítima de fijar el precio del trabajo de contexto largo, pero significa que el coste efectivo de una ejecución de agente con contexto largo no es el número que aparece en la página de precios. Si tu carga de trabajo se sitúa cerca del límite, la aritmética cambia sustancialmente a uno u otro lado de este.
Los niveles de suscripción de Fugu —20 dólares Standard, 100 dólares Pro y 200 dólares Max al mes, con cuotas de 10x y 20x— incluyen todos acceso a Fugu, Fugu Ultra y Fugu Max. Sakana también fija el precio del modelo Fugu base según el nivel más alto presente en el pool para una solicitud determinada, y declara claramente que añadir más agentes no multiplica la factura. Eso supone una diferencia real respecto al modelo de costes de fan-out que se obtendría al llamar uno mismo a varios modelos frontera.
Lo que Sakana no te dirá
Pregunta qué modelos respondieron a tu pregunta y las FAQ son directas: "esta información de enrutamiento no se expone por diseño". Los grupos Ultra y Max son fijos, así que no puedes excluir a un proveedor; solo el modelo Fugu base admite exclusiones por modelo en la configuración de la consola. Los clientes Enterprise pueden negociar configuraciones personalizadas.
Esa opacidad es el quid de la crítica que la línea Fugu ha atraído desde junio, y es una crítica justa y no hostil. Cuando un orquestador obtiene buenos resultados combinando modelos de otros laboratorios, la puntuación pertenece al sistema —que es algo real y defendible que vender—, pero no se transfiere a ningún modelo individual, y no se puede auditar. Los revisores lo han dicho sin rodeos: Fugu no superó al modelo insignia, contrató al modelo insignia. En tareas verificables con un verificador barato, como un benchmark de programación con una suite de pruebas, un comité realmente puede superar a su mejor miembro. En tareas sin uno, un panel que muestrea varios modelos de frontera y reporta el mejor resultado está reportando, en parte, suerte. Las propias elecciones de categoría de Sakana —Chartography, DeepSWE, Toolathon— se inclinan hacia el extremo verificable, que es el lugar correcto para hacer la afirmación y también la razón por la que la afirmación no se puede generalizar gratis.
Los probadores independientes también han señalado la variación de latencia como el coste práctico de la orquestación: en las tareas difíciles, el coordinador delibera, y en las tareas fáciles, esa deliberación es pura sobrecarga. Según los informes, la tarea de shader de un investigador tomó alrededor de treinta minutos, y la calidad se calificó solo como aceptable.

Dónde puedes conseguirlo de verdad
Fugu Ultra v2 ya está disponible a través de la propia API compatible con OpenAI de Sakana —apunta un cliente existente al endpoint con una clave de API y cambia una sola línea— y a través de varias plataformas de terceros. OrcaRouter no ofrece los modelos Fugu; si quieres llamar a Fugu Ultra v2, la propia API del proveedor es la vía directa.
Lo que vale la pena señalar es la alternativa con la que Sakana compite implícitamente. El conjunto que hace funcionar a Fugu Ultra v2 se ensambla a partir de modelos que hoy se pueden invocar individualmente, y los oponentes con los que se mide son los que los equipos ya ejecutan. Claude Opus 5, DeepSeek V4 Pro y Gemini 3.1 Pro están todos en OrcaRouter a los precios de lista de sus proveedores con 0% de margen, lo que significa que una rebaja de precio de cualquiera de esos proveedores se aplica de nuestro lado el mismo día en que se anuncia. Si la razón por la que consideras un orquestador es la resiliencia —no querer que una ruta de producción dependa de la disponibilidad de un solo proveedor o de la política de un solo proveedor—, entonces una capa de enrutamiento con conmutación automática por error entre proveedores resuelve parte de ese problema a nivel de modelo, y Fugu Ultra v2 resuelve una parte distinta a nivel de razonamiento.Una API para 200+ modelos con conmutación por error no es un sustituto de un coordinador entrenado, y un coordinador entrenado no es un sustituto de no depender de un único proveedor. Algunos equipos querrán ambas cosas.
El truco del cumplimiento
Fugu no está disponible en la Unión Europea ni en el Espacio Económico Europeo. La formulación del proveedor es explícita: aún no está disponible en la UE/EEE mientras trabaja para cumplir con el RGPD y las normativas específicas de la UE, y en otros lugares el acceso puede verse limitado por las condiciones de red o las reglas locales. Si su organización tiene entidades de la UE dentro del alcance, esto elimina la opción de Fugu de la consideración independientemente del rendimiento en los benchmarks, algo que conviene saber antes de la evaluación y no después.

Qué ver
Tres cosas harían que Fugu Ultra v2 pasara de ser una afirmación interesante a una elección estructural. Una evaluación independiente —una entrada en Artificial Analysis, una posición en LMArena, cualquier cosa con un arnés de pruebas detrás— zanjaría la cuestión de Chartography en una semana. Unos números reproducidos por un tercero sobre los benchmarks verificables de programación confirmarían la ganancia a nivel de sistema que predice la arquitectura. Y un pool divulgado, o incluso uno parcial, permitiría a los compradores razonar sobre exactamente qué puntos únicos de fallo están aceptando cuando enrutan tráfico de producción a través de un coordinador que no pueden inspeccionar.
Hasta entonces, la postura honesta es esta. Fugu Ultra v2 es el intento más serio hasta la fecha de vender la orquestación como producto en lugar de como una demo de investigación, de un laboratorio con trabajo publicado a sus espaldas, a un precio que hace explícito, y no oculto, el sobrecoste de la orquestación. Si tu carga de trabajo es de horizonte largo, verificable y está confinada a una región donde Sakana pueda atenderte, merece la pena un piloto acotado con la contabilidad de tokens activada. Si no lo es, los modelos con los que se mide Fugu Ultra v2 están a una sola llamada de API de distancia, a precio de tarifa, con los recibos que demuestran lo que pueden hacer.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
