
Fugu Max vs GLM-5.3: el modelo de valor queda socavado por el modelo de volumen
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Fugu Max se fijó un precio para ganar en costo y GLM-5.3 es más barato en ambos ejes. El coordinador de Sakana AI se lanzó el 11 de septiembre de 2026 a 2,00 dólares por millón de tokens de entrada y 6,00 dólares por millón de tokens de salida, diseñado para enrutar cada tarea al modelo menos costoso capaz de gestionarla. GLM-5.3 de Z.ai, listado desde el 18 de agosto de 2026, se sitúa en 1,26 dólares de entrada y 3,96 dólares de salida por millón en OrcaRouter — entre un tercio y dos quintos por debajo de Fugu Max en ambos, y proviene de un único modelo solo de texto con una ventana de contexto publicada de 1M y un techo de salida de 128K. Además, GLM-5.3 resulta ser el modelo más solicitado de nuestro catálogo por un amplio margen. Esa combinación —más barato por token y, de forma demostrable, con tráfico de producción a escala— hace que este sea el enfrentamiento donde la prima de orquestación es más difícil de justificar.
Más barato en ambos ejes, con la especificación publicada
La comparación resulta incómoda para Fugu Max antes de que entre en escena cualquier benchmark, porque no se trata de un caso de sacrificar capacidad por precio. GLM-5.3 es un modelo insignia cercano a la frontera por derecho propio — Z.ai lo describe como una mejora de codificación de aproximadamente el 50 % sobre GLM-5.2 y equiparable a Mythos 5 en determinadas capacidades de ciberseguridad. No es un modelo económico que se ofrezca como alternativa barata. Es un modelo insignia que, casualmente, tiene un precio inferior al de un orquestador optimizado en costes.
• Precio de entrada — Fugu Max $2.00 por 1M de tokens vs GLM-5.3 $1.26 por 1M de tokens
• Precio de salida — Fugu Max $6.00 por 1M de tokens frente a GLM-5.3 $3.96 por 1M de tokens
• Entrada en caché — Fugu Max $0.25 por 1 millón de tokens frente a GLM-5.3, cuyo almacenamiento en caché se factura como un descuento sobre la tarifa base de entrada
• Contexto — Fugu Max no publicado vs GLM-5.3 1M tokens
• Techo de salida — Fugu Max no publicado frente a GLM-5.3 128K tokens
• Modalidad — Fugu Max no publicada frente a GLM-5.3, solo texto, documentado como tal
• Etiquetas de capacidades — Fugu Max: ninguna publicada vs. GLM-5.3: uso de herramientas, modo JSON, razonamiento
• Cifras de benchmark — Se afirman seis victorias de Fugu Max sin puntuaciones frente a GLM-5.3, cuyo DeepSWE reportado por el proveedor va de 46,2 a 66,9 respecto a la generación anterior, además de una puntuación de inteligencia publicada de Artificial Analysis
• Pesos — Fugu Max cerrado, pool no revelado vs GLM-5.3 de un laboratorio con un linaje de pesos abiertos
• Tráfico observado en OrcaRouter — Fugu Max: ninguno, no cursado frente a GLM-5.3 con 7.962,7 M de tokens durante los últimos siete días
Fíjate en lo que hacen juntas las dos últimas filas. GLM-5.3 proviene de un linaje con pesos abiertos, que es la forma más sólida disponible del argumento de independencia del proveedor que Sakana vende como la premisa completa de Fugu Max. Y tiene una cifra de tráfico observable un orden de magnitud por encima de la mayoría de los modelos que servimos. Si la pregunta es «¿qué ejecuto para trabajo de producción con mucho texto a una tarifa baja?», la evidencia apunta a algo distinto del orquestador.

El argumento del volumen, y por qué no es solo un concurso de popularidad
Un número de tráfico no es un número de calidad, y no debería interpretarse como tal. Lo que 7,96 mil millones de tokens en siete días sí demuestra es que GLM-5.3 se ha ejecutado a escala de producción por muchos equipos independientes, con cargas de trabajo reales, y no ha provocado una migración masiva fuera de él. Esa es una señal débil sobre la calidad y una señal fuerte sobre la idoneidad operativa: la latencia es estable, el rendimiento se mantiene, la API se comporta bajo carga y los modos de fallo son conocidos por una población lo bastante grande como para que salgan a la luz públicamente. Un modelo lanzado la misma semana que Fugu Max no tiene nada de eso detrás.
La fila de latencia refuerza el punto. GLM-5.3 muestra un tiempo hasta el primer token (p50) de 4,33 segundos en el tráfico que servimos. Para el trabajo agéntico —la carga de trabajo a la que apuntan ambos productos—, el tiempo hasta el primer token se acumula en cada turno de cada subagente que lanza el coordinador. Un orquestador más barato que lanza cuatro agentes no es más barato si cada uno espera varios segundos antes de emitir algo, y ese costo nunca aparece en un tarifario.
El contraargumento de Fugu Max es que su coordinador enruta al modelo capaz más ligero para cada solicitud, lo que en principio significa que muchas tareas nunca llegan a tocar un backend costoso. La ampliación del conjunto de Sakana en esta versión añadió modelos de pesos abiertos y especializados, incluida la familia NVIDIA Nemotron mediante una colaboración con NVIDIA, así que los peldaños baratos de esa escalera son reales. La cuestión es si los peldaños son más baratos que 3,96 $ por millón de tokens de salida. Para la mayoría de las tareas de texto, no lo son —ese es un listón bajo, y los modelos de pesos abiertos que se ejecutan a tarifas de alojamiento por lo general apenas lo superan por un margen pequeño.
Preguntas que vale la pena hacer antes de elegir
¿Es un orquestador más barato que un único modelo de pesos abiertos? No por defecto, y la intuición va en la dirección equivocada. La orquestación añade los tokens de síntesis de un coordinador y, en ejecuciones multiagente, la salida de cada agente del equipo. El precio de Fugu de Sakana elimina el peor caso al facturar una tarifa combinada basada en el modelo participante de gama alta en lugar de apilar agentes, lo cual es una concesión genuina. Pero la tarifa base que estás combinando es de $6.00 de salida, y el modelo único que llamarías de otro modo es de $3.96. La orquestación ahorra dinero cuando evita reintentos, no cuando añade paralelismo por sí mismo.
¿Una limitación de solo texto importa en alguno de los dos? Para GLM-5.3 está documentada, así que es una restricción con la que puedes planificar —sin visión, sin audio, sin vídeo, y el catálogo lo indica. Para Fugu Max, la modalidad simplemente no está publicada. Eso es peor que una limitación, porque no puedes saber si un pipeline que envía un PDF funcionará hasta que lo pruebes. Una restricción no declarada no es lo mismo que una ausente.
¿Qué le sucede a cada uno cuando cambian los modelos subyacentes? GLM-5.3 es un modelo en una versión, entrenado y servido por Z.ai. Si Z.ai cambia sus precios, el cambio llega a tu clave el mismo día a través de OrcaRouter con un 0 % de recargo, y puedes verlo y responder. El comportamiento de Fugu Max es una función de un conjunto cuyos miembros Sakana no revela, por lo que la deprecación o el cambio de precio de un laboratorio de vanguardia altera silenciosamente lo que compras sin que cambie el nombre del producto. Sakana presenta esto como resiliencia. Es resiliencia para el proveedor y opacidad para el comprador.

Dónde se toman realmente las decisiones de enrutamiento
Ambas son, en efecto, decisiones de enrutamiento: Fugu Max las toma dentro de un coordinador opaco, y tú las tomas en la capa de API. OrcaRouter es del segundo tipo: una API para más de 200 modelos con un DSL de enrutamiento que te permite expresar la política de forma explícita, conmutación automática por error cuando se degrada la ruta de un proveedor, y fusión de modelos cuando quieres combinar resultados de manera deliberada en lugar de confiar en que una caja negra lo haga. GLM-5.3 está en ese catálogo al precio de lista de Z.ai con un 0 % de recargo, lo cual vale más de lo habitual para un modelo con tanto tráfico detrás: la tarifa que ves es la que publica Z.ai, transmitida sin alteración alguna.
La diferencia práctica es la auditabilidad. Cuando Fugu Max elige un modelo para tu solicitud, no te enteras de cuál fue ni de por qué. Cuando escribes tú mismo la política de enrutamiento, la decisión está en tu repositorio, es revisable por quien revise tu código y se puede cambiar sin esperar a un proveedor. Para los equipos sujetos a cualquier tipo de obligación de cumplimiento o contabilidad de costos, eso no es una diferencia filosófica.
El veredicto
GLM-5.3 gana esta comparación en los términos que más importan a un equipo de producción: es más barato en entrada y salida, su ventana de contexto y su techo de salida están publicados, sus límites de modalidad están declarados, incorpora uso de herramientas, modo JSON y razonamiento como capacidades documentadas, proviene de un linaje de pesos abiertos, y tiene una cifra de tráfico de siete días que se acerca a los ocho mil millones de tokens. No hay ninguna lectura de la evidencia pública según la cual Fugu Max sea la compra mejor respaldada a este precio.
Fugu Max mantiene un argumento, y es uno real: en tareas donde la segunda pasada de un coordinador detecta un error que la primera pasada habría entregado, el coste por tarea completada puede superar al coste por token. Eso merece un piloto acotado si tu trabajo es verificable, de gran volumen y estás fuera de la UE/EEE — con un límite de tokens de salida fijado de antemano y una medición de tokens por tarea terminada. De lo contrario, el modelo único que cuesta un tercio menos y lleva un mes funcionando bajo carga de producción es la respuesta, y está en OrcaRouter al precio de lista de Z.ai con la tarifa del proveedor pasada tal cual.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
