
Sakana Fugu Max: el orquestador de $2/$6 que elige el modelo más barato que funcione
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
La mayoría de los modelos compite por cuánto pueden hacer. Sakana Fugu Max compite por cuán poco puede permitirse hacer. Sakana AI lanzó Sakana Fugu Max el 11 de septiembre de 2026, junto con Sakana Fugu Ultra v2 — dos ajustes de una única arquitectura de orquestación orientados a extremos opuestos de la curva de costo-rendimiento. Fugu Max no responde a tu solicitud por sí mismo. Lee la tarea, elige el modelo más barato de su grupo que pueda manejarla de forma plausible, enruta hacia allí y devuelve una respuesta. Sakana lo pone a un precio de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida.
Lo interesante es contra qué se mide ese precio. Sakana afirma que la tarifa de salida de Fugu Max es entre un 40 y un 60 % inferior a la de Claude Sonnet 5, GPT-5.6 Terra y Kimi K3. Esa afirmación es comprobable y, algo poco habitual en un benchmark de día de lanzamiento, la aritmética cuadra: frente a los precios de lista actuales de los tres modelos que Sakana menciona, 6 $ por millón de tokens de salida cae casi exactamente en el punto medio del rango indicado. Lo que es mucho más difícil de comprobar es el lado del rendimiento, porque Sakana publicó los resultados de Fugu Max como diagramas de dispersión en lugar de cifras.
Qué es Fugu Max realmente
Fugu Max no es un checkpoint. No hay archivo de pesos, ni recuento de parámetros, ni nada que descargar. Sakana lo describe como «una arquitectura, no un único modelo»: el mismo motor de orquestación central que Fugu Ultra v2, ajustado para una pregunta distinta. Ultra v2 pregunta cuál es la máxima capacidad disponible. Fugu Max pregunta cuál es la mejor salida al menor costo.
Esa distinción importa operativamente. No puedes ajustar Fugu Max, alojarlo por tu cuenta ni inspeccionar por qué eligió un modelo sobre otro. Tampoco puedes ver la lista completa de modelos entre los que enruta — Sakana dice que el conjunto se amplía a "nuestro mayor conjunto de modelos abiertos y especializados hasta la fecha" y nombra explícitamente la familia Nemotron de NVIDIA, añadida mediante la asociación con NVIDIA que Sakana anunció en agosto. El resto del conjunto no tiene nombre, y Sakana no publica una traza de enrutamiento por solicitud.
Lo que puedes ver es la forma de la cosa. El propio diagrama del proveedor muestra a Fugu Max en la cima de una distribución en abanico: un orquestador, una fila de ranuras de modelos intercambiables detrás de él, y Sakana Namazu y el propio Fugu Max entre los objetivos. El conjunto se describe como intercambiable por diseño, y la motivación declarada es tanto política como económica: Sakana enmarca la orquestación como una protección contra la dependencia de proveedores, las revocaciones de API y los controles de exportación, con el argumento de que un sistema que puede cambiar a sus proveedores no puede quedar aislado por ninguno de ellos.
Sakana Fugu en sí no es nuevo. Alcanzó disponibilidad general el 22 de junio de 2026, y el cronograma del propio proveedor abarca abril (beta), junio (GA más Fugu Ultra v1), julio (Fugu-Cyber y una interfaz de Claude Code), agosto (Sakana Chat más la alianza con NVIDIA) y ahora septiembre. Fugu Max es el quinto paso mensual, no un debut — y cualquiera que ya ejecute Fugu actualiza a él con un cambio de parámetro de una sola línea contra el mismo endpoint compatible con OpenAI, sin migración.
La afirmación sobre el precio sobrevive al contacto con los precios de lista.
La cifra de Sakana de $2 de entrada / $6 de salida se indica claramente en la página de lanzamiento. La cobertura secundaria añade una tarifa de entrada en caché de $0,25 por millón de tokens, que la propia página de lanzamiento no publica; considera esa como reportada en lugar de confirmada. A modo de comparación, Fugu Ultra v2 cuesta $5 de entrada y $30 de salida, con $0,50 de entrada en caché.
Ahora, la afirmación del 40–60 %. Los tres comparadores nombrados actualmente se sitúan en:
• GPT-5.6 Terra — $2 de entrada / $12 de salida, tras el recorte del 30 de julio de OpenAI, que bajó la salida de $15.
• Claude Sonnet 5 — $10 por salida con la tarifa promocional de lanzamiento, $15 con la tarifa estándar. Las fuentes no coinciden en si el aumento previsto para septiembre se canceló o simplemente se aplazó, y por eso el rango es tan amplio.
• Kimi K3 — $3 de entrada / $15 de salida, con entrada en caché a $0.30.
En comparación con eso, la salida de $6 está 50% por debajo de Terra, 40% por debajo de la tarifa promocional de Sonnet 5, 60% por debajo de la tarifa estándar de Sonnet 5 y 60% por debajo de Kimi K3. La afirmación se confirma, y se confirma frente a los precios de lista publicados en lugar de un modelo de costos interno — algo que no se puede decir de todos los porcentajes del día de lanzamiento.
Una cifra de la misma sección no sobrevive al mismo tratamiento. Sakana también dice que Fugu Max ofrece «un rendimiento a un paso de los modelos de élite, con un coste de dos a seis veces menor». Frente a los tres modelos que menciona para la cifra del 40–60 %, la brecha bruta de precio de salida está más cerca de la franja de 1,7× a 2,5×. El multiplicador más amplio presumiblemente se mide en toda la frontera —incluidos modelos que cuestan mucho más de $12—, en lugar de frente a los tres de la frase. Es una afirmación defendible sobre la curva de Pareto y una indefendible sobre los rivales mencionados, y la página de lanzamiento no distingue entre las dos.
Aquí es donde una capa de enrutamiento se gana su lugar en el lado de los precios. OrcaRouter transfiere los precios de lista de los proveedores sin ningún margen, así que cuando un proveedor cambia el precio de lista, el número que ves cambia ese mismo día; esto es relevante aquí porque toda la premisa de Fugu Max es que existe un modelo más barato en algún lugar del conjunto y deberías llegar a él sin pensarlo. Nosotros no alojamos Fugu Max; se ejecuta en la API propia de Sakana. Pero el principio de transferencia directa es el mismo que hace que valga la pena comparar una tarifa de salida de $6 con la de un proveedor establecido de $12 en lugar de confiar en cualquiera de los dos números a ciegas.
Lo que Sakana dice que supera, y lo que no te mostrará

La sección de benchmarks del proveedor hace tres afirmaciones concretas sobre Fugu Max: la mejor puntuación global en seis benchmarks —Terminal Bench 2.1, GPQA-D, AA-LCR, GDP.pdf, AutomationBench y SWEFish—, una ampliación de la frontera de Pareto de coste-rendimiento en siete de diez benchmarks, y un rendimiento "a tiro de piedra de los modelos de élite" con una fracción del gasto en tokens.
Hay tres cosas acerca de esa evidencia que conviene tener presentes antes de citar cualquier parte de ella.
La primera es que Sakana no publicó ninguna cifra. Los resultados de Fugu Max aparecen como diez diagramas de dispersión —puntuación en el eje vertical, precio de salida en dólares por millón de tokens en el horizontal—, con Fugu Max dibujado como un punto rojo al noroeste del área gris. Se puede ver que está arriba y a la izquierda. No se puede leer una puntuación de él. Terminal Bench 2.1, GPQA-D y AA-LCR tienen tablas de clasificación públicas donde un número sería directamente comparable, y no se dio ninguno.
El segundo es que uno de los seis benchmarks es de Sakana. SWEFish se describe en la página de lanzamiento como "nuestro benchmark interno que refleja los propios desafíos y casos de uso de codificación de Sakana AI". Esa es una forma legítima de medir la idoneidad para tu propio producto, y no es una forma de comparar con un rival — una puntuación en un benchmark diseñado por el proveedor, en tareas que el proveedor eligió, no es evidencia sobre el modelo de nadie más.
La tercera es que las cifras más fuertes de la página pertenecen al otro modelo. Fugu Ultra v2 obtiene cifras donde Fugu Max obtiene gráficos: Chartography 48,3 frente a Opus 5 con 27,3 y Fable 5 con 29,5, DeepSWE 74,3, mejor o empatado en el primer puesto en cinco de ocho benchmarks y entre los dos primeros en siete de ocho. Ultra v2 también incluye una fecha de corte de entrenamiento declarada del 2026-08-28 —poco más de dos semanas antes del lanzamiento— y, de manera significativa, una nota explícita de que Fable 5, Fable 5.1 y GPT-6 Astra no están en su conjunto. Sakana afirma que llega allí sin alquilar esos modelos específicos, lo que es todo el argumento de soberanía en una nota al pie.
Nada de esto hace que las afirmaciones sobre Fugu Max sean falsas. Las convierte en no verificadas, y hace que el titular de los seis benchmarks sea seguro de repetir solo con la etiqueta adjunta. La evaluación independiente de un endpoint de orquestación totalmente nuevo es poco común, y todavía no se ha publicado nada.
Fugu Max vs Fugu Ultra v2: cuál es el que realmente quieres

Estos no son productos competidores, y la elección entre ellos no está nada reñida una vez que ves los números uno al lado del otro. Fugu Max es el barato: $2 de entrada, $6 de salida, diseñado para enrutar lejos de los modelos costosos siempre que uno más barato pueda hacer el trabajo. Fugu Ultra v2 es el potente: $5 de entrada, $30 de salida, $0.50 en caché, diseñado para enrutar hacia la capacidad en trabajo complejo de varios pasos incluso cuando eso cuesta más.
La división práctica es por forma de tarea, no por presupuesto. Si tu tráfico consiste principalmente en consultas, extracción, clasificación, generaciones cortas y llamadas a herramientas sencillas, todo el diseño de Fugu Max está pensado para detectarlo y gastar lo menos posible — y la afirmación de Sakana de que amplía la frontera en siete de diez benchmarks apunta, al menos, en esa dirección. Si tu tráfico incluye ejecuciones agénticas largas, refactorizaciones de varios archivos o tareas de investigación que fallan de forma costosa cuando un paso sale mal, la tarifa de salida de $30 en Ultra v2 está comprando algo real: el puesto entre los dos primeros en siete de ocho benchmarks es la parte de la página de lanzamiento que más se parece a una afirmación de capacidad y no a una de costo.
Ambos están disponibles en la misma API compatible con OpenAI a través de la consola de Sakana, y la ruta de actualización desde el Fugu existente es un cambio de parámetro. Se aplican dos advertencias de disponibilidad. Se ha informado que Fugu no está disponible en la UE y el EEE a la espera de trabajos relacionados con el GDPR, lo que, si aún se mantiene, limita dónde se puede implementar cualquiera de los dos modelos. Y ambos son sistemas cerrados: estás comprando un endpoint, y el proveedor elige qué modelos hay detrás de él —incluido, para Fugu Max, un conjunto que no revela por completo.
El problema: un orquestador que sigue alquilando su frontera
La crítica más aguda a Fugu es la que Sakana invita al enmarcarlo como infraestructura de soberanía. Una capa de orquestación que enruta a través de API de terceros no impide que esas API sean revocadas. Convierte un único punto de fallo en uno diversificado, lo cual es una mejora real, pero los modelos subyacentes siguen siendo de otros, siguen siendo alcanzables por los mismos controles de exportación y siguen estando sujetos a los mismos cortes repentinos de servicio. La asociación con NVIDIA de agosto y las incorporaciones de Nemotron son la respuesta más concreta a esto hasta ahora —los modelos de pesos abiertos en el conjunto son modelos que nadie puede apagar—, pero Sakana no dice cuánto del tráfico de Fugu Max llega realmente a ellos.
Hay un segundo compromiso, más silencioso. Las decisiones de enrutamiento añaden latencia y eliminan el determinismo. Una solicitud que hoy recae en un modelo pequeño podría recaer mañana en otro distinto si cambian el pool o los pesos de coste, lo que hace que el comportamiento sea más difícil de someter a pruebas de regresión y más difícil de explicar a cualquiera que audite el sistema. La respuesta de Sakana es que la orquestación es interna y que la API se comporta como un único modelo. Eso es cierto en la interfaz, pero no lo es por debajo, y los equipos con requisitos estrictos de reproducibilidad deberían probarlo con cuidado antes de que se convierta en una pieza crítica.
Si quieres la ventaja de costos sin convertir el pool en tu única dependencia, el mismo patrón está disponible para que lo compongas tú mismo. Nuestro DSL de enrutamiento te permite definir un panel de modelos detrás de un único endpoint y decidir cuál se encarga de cada clase de solicitud, y la fusión de modelos ejecuta varios modelos con el mismo prompt y concilia las respuestas cuando el acuerdo importa más que el precio. La conmutación por error entre proveedores significa que, cuando un proveedor se degrada —o desaparece—, el tráfico pasa a un modelo en el que ya confías sin necesidad de cambiar el código. Esa es la versión más conservadora de la apuesta que Sakana te pide que hagas por completo.

Merece la pena ser precisos sobre lo que ofrecemos y lo que no ofrecemos aquí. Sakana Fugu Max no está en nuestro catálogo — no es un modelo enrutable por nuestra parte, y se ejecuta en la propia API y consola de Sakana. Nuestro catálogo es 196 modelos de 15 proveedores con una sola clave y una sola factura, con las tarifas por token impresas en cada tarjeta y sin margen añadido sobre ellas. El solapamiento relevante con Fugu Max es la idea, no el inventario: ambos son argumentos de que la respuesta correcta a "qué modelo debería encargarse de esto" normalmente no es el más grande.
Quién debería moverse, y quién debería esperar
Fugu Max es uno de los lanzamientos más interesantes del mes precisamente porque no es un modelo. Si ya usas Sakana Fugu, la actualización es un cambio de una sola línea a un precio más bajo y no hay razón para deliberar. Si manejas tráfico de gran volumen y baja complejidad en un modelo de gama media y pagas entre $10 y $15 por millón de tokens de salida, la aritmética que ofrece Sakana merece que hagas tu propio benchmark: toma una semana de solicitudes reales, pásalas por Fugu Max y compara la calidad contra tu modelo actual en lugar de contra los gráficos de dispersión.
Si necesitas cifras de referencia publicadas antes de comprometerte, espera. Todavía no hay nada independiente sobre Fugu Max, la evidencia del propio proveedor es un gráfico en lugar de una tabla, y uno de los seis benchmarks destacados es de Sakana. Eso no es razón para descartarlo, sino para probarlo con tu propio tráfico, que es el único benchmark que iba a predecir tus resultados. Y si tu carga de trabajo es agéntica, de horizonte largo y costosa de equivocarse, el modelo que hay que mirar en este par es Fugu Ultra v2, no Fugu Max: es el que tiene cifras que lo respaldan.
Nuestro DSL de enrutamiento te permite definir un panel de modelos detrás de un único endpoint y decidir cuál se encarga de qué clase de solicitud, y la fusión de modelos ejecuta varios modelos con el mismo prompt y concilia las respuestas cuando la coincidencia importa más que el precio.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
