Tarjeta hero para el enfrentamiento entre Fugu Ultra v2 y GLM 5.2, que muestra un sistema de orquestación frente a un único modelo de Mixture-of-Experts bajo la frase 'Pagas por la coordinación, no por los parámetros'.
Guides & Insights

Fugu Ultra v2 vs GLM 5.2: Pagas por la coordinación, no por los parámetros

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pon las dos tablas de precios una al lado de la otra y la comparación parece un error. Fugu Ultra v2, que Sakana AI anunció el 11 de septiembre de 2026, cobra 5 $ por millón de tokens de entrada y 30 $ por millón de tokens de salida. GLM 5.2, el modelo insignia de Z.ai del 16 de junio de 2026, cobra 1,40 $ y 4,40 $. Ambos afirman tener una ventana de contexto del orden de un millón de tokens. Ambos están dirigidos exactamente al mismo comprador: el equipo que ejecuta trabajo agéntico prolongado, de varios pasos y a escala de repositorio. Uno cuesta aproximadamente 3,6× el precio de entrada y 6,8× el precio de salida del otro, y el más barato es el que puedes descargar y conservar. Así que toda la comparación se reduce a una sola pregunta: ¿qué compra en realidad el dinero extra, y está comprando algo que un solo modelo no puede ser?

No son el mismo tipo de objeto.

La razón por la que existe la brecha de precios es que estas dos cosas resuelven tareas de horizonte largo con maquinaria completamente distinta, y la diferencia se manifiesta antes incluso de que ejecutes un benchmark.

Fugu Ultra v2 — un sistema de orquestación, no un modelo fundacional. Es el nivel de maximización de capacidades de la línea Fugu de Sakana AI: un único endpoint compatible con OpenAI que descompone una tarea entrante y distribuye las piezas entre un conjunto de otros modelos, algunos de pesos abiertos y otros especializados. El propio planteamiento de Sakana es que "impulsa el rendimiento máximo más alto que nunca, sin la dependencia indispensable de los modelos de frontera que orquesta". Estás comprando un planificador, y pagas por cada token que ese planificador gasta pensando, incluidos los tokens de orquestación internos.

GLM 5.2 — un único modelo de Mezcla de Expertos. Z.ai lo publica como un modelo de entrada de texto / salida de texto con una ventana de contexto de 1M de tokens "realmente utilizable" y hasta 128K tokens de salida, razonamiento híbrido controlado por reasoning_effort, y llamadas a herramientas nativas. La arquitectura reportada es de aproximadamente 753B parámetros totales con alrededor de 40B activos por token, aunque Z.ai no ha confirmado el recuento de activos para 5.2 en concreto — trata esa cifra como heredada de GLM-5.1.

Esa es la bifurcación en el camino. Una de estas es algo que llamas; la otra es algo que llama a cosas.

Lo que Fugu Ultra v2 no nos diría

La página del anuncio de Sakana es inusualmente franca sobre una cosa e inusualmente silenciosa sobre otra, y ambas importan para una decisión de compra.

La parte sincera: la compañía declara abiertamente que Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra no están en el grupo de modelos de Fugu Ultra v2, incluso mientras afirma superarlos en las pruebas comparativas. La justificación declarada es la resiliencia: un grupo intercambiable de modelos abiertos y especializados que no puede ser revocado, reajustado de precio ni cortado por un proveedor o un cambio geopolítico. La fecha de corte de entrenamiento se indica como 20260828. Opines lo que opines sobre el argumento, es una postura arquitectónica real, y es la razón más clara para elegir Fugu Ultra v2 en lugar de una pila que hayas ensamblado tú mismo.

La parte silenciosa: el anuncio no indica una ventana de contexto y no indica el precio por token de Fugu Ultra v2 en la propia página. Los listados de modelos de terceros sitúan la ventana en 1M de tokens y las tarifas en $5 / $0.50 en caché / $30, con un tramo de reajuste de precios por encima de aproximadamente 272K tokens de entrada que pasa a unos $10 / $1.00 / $45. Esos son los números que usa el resto de este artículo, pero son listados, no documentación del proveedor; confírmalos con la tarjeta de tarifas vigente de Sakana antes de presupuestar con ellos.

La pregunta sobre el coste por token que nadie responde

El precio por token es la unidad equivocada para esta comparación, y todas las páginas que actualmente posicionan para ello cometen el mismo error. La factura de un orquestador no es el tamaño de tu prompt multiplicado por una tarifa; es el tamaño de tu prompt, más cada subllamada que decide hacer, más los tokens de razonamiento de los modelos que alquila, todo ello con un margen aplicado a la tarifa propia del orquestador.

Sakana reconoce esto directamente: los tokens de orquestación consumidos internamente se facturan como tokens de entrada y salida ordinarios. Lo que significa que la forma honesta de comparar Fugu Ultra v2 con GLM 5.2 es el costo por tarea completada, y ninguno de los dos proveedores publica esa cifra.

Algunos puntos estructurales que sí se mantienen independientemente:

Precio de entrada — Fugu Ultra v2 $5.00 / 1M frente a GLM 5.2 $1.40 / 1M en OrcaRouter a la tarifa de proveedor de Z.ai. Fugu cuesta 3,6× más antes de realizar una sola subllamada.

Precio de salida — Fugu Ultra v2 $30,00 / 1M frente a GLM 5.2 $4,40 / 1M. Este es el número que duele, porque los agentes emiten una gran cantidad de salida, y un orquestador emite salida que no solicitaste.

Entrada en caché — Fugu Ultra v2 cotiza $0.50 / 1M; GLM 5.2 almacena en caché a $0.26 / 1M, un descuento del 81% sobre su propia tarifa de entrada. Los bucles repetidos de agentes sobre un prompt de sistema estable son donde la ventaja de GLM 5.2 se acumula con más fuerza.

Reprecio de contexto largo — el nivel reportado de Fugu Ultra v2 por encima de ~272K de entrada traslada toda la solicitud a aproximadamente el doble de la tarifa de entrada y 1.5× la tarifa de salida. GLM 5.2 no tiene segmentación por contexto en absoluto: $1.40 / $4.40 fijos, hasta 1M.

Esa última fila es la que hay que marcar con un círculo. Una ejecución de agente de horizonte largo pasa la mayor parte de su vida más allá de los 272K tokens. La tarifa plana de GLM 5.2 vale dinero real exactamente donde la de Fugu Ultra v2 se duplica.

Two-column comparison scoreboard for Fugu Ultra v2 and GLM 5.2 covering type, release date, input price ($5.00 vs $1.40 per million tokens), output price ($30.00 vs $4.40), cached input ($0.50 vs $0.26) and long-context pricing (reprices above roughly 272K vs flat to 1M).

Los benchmarks apenas rozan

Esto es lo genuinamente extraño de este enfrentamiento, y lo que ninguna página de clasificación actual dice con claridad: estos dos modelos casi nunca se miden con la misma prueba.

Sakana informa que Fugu Ultra v2 es el mejor o está empatado en el primer puesto en cinco de ocho benchmarks —GDP.pdf, Chartography, SWEFish, DeepSWE y Toolathon—, y está entre los dos primeros en siete de ocho. Las dos cifras destacadas que ofrece son Chartography con 48,3, frente a Opus 5 con 27,3 y Fable 5 con 29,5, y DeepSWE con 74,3. SWEFish y Toolathon son benchmarks internos de Sakana. Todo está reportado por el proveedor y nada de ello ha sido reproducido de forma independiente hasta la fecha de publicación.

Los números de Z.ai para GLM 5.2 provienen de un estante completamente distinto: Terminal-Bench 2.1 con 81.0, SWE-bench Pro con 62.1, GPQA-Diamond con 91.2, AIME 2026 con 99.2, HLE con 40.5 —también reportados por el proveedor. Del lado independiente, GLM 5.2 tiene un AA Coding Index de 68.8 y un Intelligence Index de 39 en la página de puntuaciones recalculadas de Artificial Analysis, donde se marca como una estimación provisional y se clasifica en el puesto n.º 7 de 113. Las citas más antiguas de 51 o 53 para GLM 5.2 provienen de una escala de índice sustituida y no deben citarse.

Así que si quieres un número limpio de comparación directa, no lo hay. Lo más parecido a un eje compartido es que ambos son fuertes en codificación agéntica, y la lectura honesta es que cada empresa ha publicado sobre las pruebas en las que le va bien. Esa es una razón para hacer tu propia evaluación, no para elegir el número más alto.

Una cosa que conviene señalar a cualquiera que esté pensando en comprar GLM 5.2 hoy: ya no es el modelo más reciente de Z.ai. GLM-5.3 llegó alrededor del 14 de agosto de 2026 al mismo precio de lista, pero bajo una licencia personalizada que restringe a los grandes proveedores de la nube, lo que convierte a GLM 5.2 en el último —con licencia MIT completa— buque insignia de Z.ai, y en la razón por la que todavía tiene un argumento de compra diferenciado.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

La licencia es la divisoria más nítida

Dejemos a un lado los puntos de referencia y la diferencia estructural resulta más acusada que cualquier puntuación.

GLM 5.2 se distribuye como pesos abiertos bajo MIT en Hugging Face, sin restricciones regionales. Puedes descargarlo, ejecutarlo en tu propio hardware, ajustarlo con fine-tuning e incluirlo dentro de un producto sin pedir permiso a nadie ni pagar ninguna tarifa por token. Z.ai lo entrenó —de forma notable, según la propia afirmación de la empresa, íntegramente en aceleradores Huawei Ascend en lugar de Nvidia.

Fugu Ultra v2 no te ofrece nada de eso. Es un servicio alojado: una política de orquestación sobre un conjunto de modelos cuya composición Sakana solo ha descrito de manera tangencial. No puedes descargarlo, inspeccionarlo, fijarlo ni ejecutarlo en un entorno aislado. Lo que obtienes en su lugar es la abstracción: un único endpoint cuyo comportamiento es, en principio, resiliente a que cualquiera de los modelos upstream desaparezca. Eso es un beneficio real para un sistema de producción que no puede permitirse que una dependencia desaparezca. También es un coste real, porque has intercambiado el control por ello.

Si tu restricción es «el modelo no debe cambiar bajo mis pies», solo una de estas respuestas. Si tu restricción es «otra persona no debe poder eliminar el modelo», solo la otra lo hace.

Velocidad, y lo que dijeron los testers sobre el último.

GLM 5.2 no es rápido según las mediciones: Artificial Analysis registró aproximadamente 66,3 tokens por segundo con un tiempo hasta el primer token de alrededor de 4,03 segundos, lo que es modesto para un modelo de clase frontera, y los propios usuarios de Z.ai se han quejado de congestión del servicio durante las horas pico.

Sakana no publica cifras de latencia ni de rendimiento para Fugu Ultra v2, lo cual es en sí mismo revelador: un sistema que distribuye llamadas a múltiples modelos tiene un perfil de latencia que depende por completo de lo que decida invocar, de modo que una única cifra de rendimiento sería casi carente de sentido. Para el Fugu Ultra anterior, los evaluadores informaron públicamente de ejecuciones que se prolongaban hasta unos 30 minutos y costes muy superiores a la tarifa de un solo modelo para la misma tarea. Ese es el modelo de junio de 2026 y no una prueba sobre v2, pero es el modo de fallo que hay que poner a prueba, y la razón por la que una comparación por token favorece a los orquestadores.

Screenshot of the OrcaRouter model page for GLM 5.2 showing the z-ai/glm-5.2 identifier, a 1M token context window, 128K maximum output, and input pricing of $1.40 per million tokens with output at $4.40.

Cómo llamarías realmente a cada uno de estos

GLM 5.2 ya está disponible en OrcaRouter hoy con las tarifas de proveedor propias de Z.ai — $1.40 por millón de tokens de entrada y $4.40 por millón de tokens de salida, traspasadas sin ningún margen de beneficio, así que cualquier recorte que haga Z.ai llega aquí el mismo día. Es compatible con OpenAI, por lo que cambiar a él es un cambio de URL base y de ID de modelo en el SDK que ya tienes, y puedes ponerlo detrás de una cadena de conmutación por error o una regla de enrutamiento en lugar de apostar una ruta de producción a un solo proveedor.

Fugu Ultra v2 no es algo que enrutemos. Está disponible a través de la propia API compatible con OpenAI de Sakana AI, y un solo cambio de parámetro traslada una integración de Fugu existente a él. Si lo estás evaluando frente a GLM 5.2, la configuración práctica es mantener GLM 5.2 en tu puerta de enlace existente y llamar a Fugu Ultra v2 directamente desde Sakana mientras decides — ambos son compatibles con OpenAI, así que pueden situarse en la misma ruta de código detrás de un flag.

¿Cuál elegir?

Elige GLM 5.2 si quieres una opción conocida a un precio conocido: pesos con licencia MIT que podrías alojar por tu cuenta mañana, una tarifa fija de $1.40 / $4.40 sin penalización por contexto largo, una ventana de 1M realmente utilizable y un descuento que se acumula en bucles de agentes con caché. Acepta que es solo texto, que está una generación por detrás de GLM-5.3 y que su puntuación de índice independiente es provisional.

Elige Fugu Ultra v2 si lo que compras es resiliencia más capacidad máxima en trabajo difícil de varios pasos, y estás dispuesto a pagar por la coordinación por token y a renunciar a la capacidad de inspeccionar o autoalojar aquello a lo que estás llamando. La afirmación del propio proveedor es que alcanza resultados de nivel frontera sin depender de modelos de frontera —una propuesta real e inusual, y una que, a día de hoy, absolutamente nadie fuera de Sakana ha podido verificar.

Lo que no haríamos es elegir entre ellos basándonos en la tabla de benchmarks. Las pruebas apenas se superponen, ambos proveedores publicaron en su propio terreno más fuerte, y la cifra decisiva —costo por tarea completada de horizonte largo— es la que ninguna de las dos empresas ha puesto en una página.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario