Una tarjeta de título principal que dice 'Fugu Max vs Qwen3.8-Max' con el subtítulo 'Mismo precio, mismo benchmark, un solo número', tres insignias tipo píldora que dicen '$2.00 / $6.00 en ambos', 'Terminal Bench 2.1: 86.6 frente a no indicado' y 'Puntuación independiente: ninguna frente a 40', una línea al pie que dice 'Sakana AI, septiembre de 2026 frente a Alibaba, agosto de 2026', y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Fugu Max vs Qwen3.8-Max: mismo precio, mismo benchmark, un solo número publicado

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Fugu Max y Qwen3.8-Max se listan a la misma tarifa: $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. Sakana AI lanzó Fugu Max el 11 de septiembre de 2026 y Ali​baba ha estado sirviendo Qwen3.8-Max desde principios de agosto, y los dos proveedores llegaron a una tarjeta de tarifas idéntica desde direcciones opuestas: uno pone precio a una política de enrutamiento, el otro pone precio a un modelo de 2.4 billones de parámetros. El empate elimina por completo el precio de la decisión, lo cual es inusualmente limpio. Lo que queda es la evidencia, y los dos lados difieren allí más que en cualquier otro lugar. Ambas tablas de proveedores nombran Terminal Bench 2.1. Ali​baba imprime 86.6 para Qwen3.8-Max. Sakana dice que Fugu Max obtiene la mejor puntuación general en Terminal Bench 2.1 y no imprime ninguna cifra, ni para esa prueba ni para las otras cinco que afirma ganar.

El único punto de referencia que ambos bandos mencionan

Este es todo el enfrentamiento comprimido en una sola fila, así que vale la pena ser preciso al respecto.

El comunicado de Sakana enumera seis benchmarks en los que Fugu Max obtiene la mejor puntuación global: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench y SWEFish. Cinco son evaluaciones públicas reconocidas y el sexto, SWEFish, es el benchmark de programación propio de Sakana. Para ninguno de los seis, el comunicado indica un valor, un margen o una cifra de un competidor que se pueda poner al lado. La afirmación paralela —que Fugu Max amplía la frontera de Pareto de costo-rendimiento en siete de diez benchmarks— es asimismo una declaración sobre la posición en un gráfico más que sobre un punto en un eje.

Las filas publicadas por Alibaba para Qwen3.8-Max incluyen Terminal-Bench 2.1 con 86,6, OSWorld-Verified con 86,1, GPQA Diamond con 92,6 y SWE-bench Pro con 67,7. Todo reportado por el proveedor, todo números. Así que en la única prueba que ambas empresas decidieron nombrar, una ha publicado una cifra y la otra ha publicado un puesto. De eso no se puede concluir qué sistema es mejor: el "mejor en general" de Sakana podría significar 91 u 87. Lo que sí se puede concluir es que, al momento de la publicación, ninguna evidencia pública responde a la pregunta, y el proveedor que hace la afirmación más grandiosa es el que se niega a cuantificarla.

Precios idénticos, construcción opuesta

• Entrada — Fugu Max $2.00 por 1M de tokens vs Qwen3.8-Max $2.00 por 1M de tokens

• Salida — Fugu Max $6.00 por 1M de tokens vs Qwen3.8-Max $6.00 por 1M de tokens

• Entrada en caché — Fugu Max $0.25 por 1M de tokens frente a Qwen3.8-Max $0.25 por 1M de tokens, y Artificial Analysis mide de forma independiente un descuento de caché del 88 por ciento del lado de Qwen

• Recargo por prompt largo — Fugu Max no especifica ningún tramo en el comunicado, frente a Qwen3.8-Max, que aplica tarifa plana hasta la ventana sin recargo

• Contexto y salida — Fugu Max no publicó ninguna cifra, frente a Qwen3.8-Max, una ventana de 1M de tokens con un límite de salida de aproximadamente 128K

• Modalidad de entrada — texto de Fugu Max, con las capacidades propias del pool detrás, frente a texto, imagen, video y PDF de Qwen3.8-Max

• Arquitectura — Fugu Max, un coordinador entrenado sobre un conjunto no revelado, ampliado para Max con modelos de pesos abiertos y especializados, incluida la familia NVIDIA Nemotron mediante una colaboración con NVIDIA, frente a Qwen3.8-Max, un modelo de mezcla de expertos disperso con aproximadamente 2,4 billones de parámetros totales y alrededor de 95 mil millones activos por token

• Pesos — Fugu Max cerrado, pertenencia al pool no revelada por diseño frente a Qwen3.8-Max con pesos abiertos publicados para el checkpoint de clase Max bajo una licencia personalizada

• Evaluación independiente — Fugu Max: ninguna publicada, y no existe ninguna página de Artificial Analysis para ningún modelo Fugu, frente a Qwen3.8-Max, una entrada activa de Artificial Analysis con cifras publicadas de velocidad, verbosidad y coste por tarea

Cuatro de esas filas dicen "no publicado" en el lado de Fugu y llevan una cifra en el lado de Qw​en. Cuando las tarifas son idénticas, esa es toda la comparación: el mismo dinero compra un sistema que puedes describir y otro que no.

A two-column scoreboard titled 'Fugu Max vs Qwen3.8-Max - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, Terminal Bench 2.1 best with no figure, evidence vendor-reported only. Qwen3.8-Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context 1M with a 128K output ceiling, Terminal Bench 2.1 at 86.6, evidence Artificial Analysis Index 40 and $2.67 per task. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Qwen3.8-Max rows Alibaba-reported and per Artificial Analysis.' OrcaRouter logo bottom-right.

Detrás de una columna hay un tercero.

Artificial Analysis puntúa a Qwen3.8-Max con 40 en el Índice de Inteligencia v4.3 reformulado, en el puesto n.º 30 de 200, con un costo de 2,67 $ por tarea del Índice de Inteligencia y 37,8 tokens de salida por segundo — lo suficientemente lento como para ocupar el puesto n.º 154 de 200 en velocidad. La misma entrada registra 180 millones de tokens de salida generados en todo el índice, más del doble de los 89 millones del modelo mediano, y un descuento de caché del 88 por ciento.

Antes de citar nada de eso, hay que aplicar dos correcciones. La primera es que la cifra ampliamente difundida de 58 —o 58,1, o 58,4— para Qwen3.8-Max es anterior a que Artificial Analysis recalibrara el índice en septiembre de 2026, y la página en vivo lleva el distintivo «Actualizado» que marca una puntuación reformulada. Los textos más antiguos también reflejaban un coste de esfuerzo distinto del de la escala anterior: 64 turnos por tarea frente a 14 de la generación anterior de Qwen, con un coste aproximado de 1,14 $ por tarea del Intelligence Index; la página actual muestra 2,67 $. La segunda es una advertencia genuina, no un artefacto de escala: Artificial Analysis midió por separado que la tasa de alucinación de Qwen3.8-Max aumentó del 23 % al 40 % en comparación con la generación anterior. Para un modelo comercializado para trabajo autónomo de varios pasos, ese es un coste que se presupuesta en verificadores, no una nota a pie de página.

Fugu Max no tiene ninguna entrada independiente de ningún tipo. Cada cifra que se le atribuye proviene de Sakana y, a la fecha de redacción, no existe una página de Artificial Analysis para Fugu Max ni para ninguno de sus hermanos. Eso no es una acusación —un modelo publicado hace unas horas no tendrá cobertura de terceros—, pero sí significa que las dos columnas no son igual de comprobables, y seguirá siendo así hasta que alguien ajeno a Sakana lo ejecute.

Dos formas de gastar de más

Ambos sistemas han alejado el costo de una respuesta del costo de un token, y lo hacen en direcciones opuestas. Qwen3.8-Max es ahorrador en tokens y generoso en la respuesta: 180 millones de tokens de salida en el Intelligence Index, el doble de la mediana, a $2.67 por tarea. Trabaja durante mucho tiempo en lugar de ser grande, y el descuento de caché del 88 por ciento es la palanca que controla la factura: una ejecución larga de agente que sigue releyendo el mismo contexto se mantiene barata; una que sigue generando texto nuevo, no.

Fugu Max es caro por token e impredecible en sus respuestas. Su coordinador genera subagentes, cada uno de los cuales escribe razonamiento y texto de salida facturados a $6.00 por millón, más la propia síntesis del coordinador. Sakana se compromete a que las ejecuciones multiagente se cobren a una tarifa combinada vinculada al modelo participante de nivel superior y a que añadir agentes no multiplique la factura, lo que elimina la explosión por fan-out en el peor de los casos que hace que los sistemas multiagente ingenuos sean inasequibles. No elimina el volumen. Y en la cuestión del volumen, el comunicado guarda silencio de una manera que importa: la propia cobertura de Sakana afirma que cambiar de modelo a mitad de tarea puede reducir la reutilización de la caché de contexto y generar tokens de orquestación adicionales, y confirma que la empresa no divulgó la tasa de aciertos de caché de Max ni su coste total de tokens por tarea.

Así que la misma tarifa de $2.00 / $6.00 es un número predecible por un lado y un múltiplo sin límite con un mínimo por el otro. La verbosidad de Qwen3.8-Max es medible antes de comprometerte; la de Fugu Max, no.

La prueba de la escotilla de escape

Aquí es donde se invierte el habitual argumento del lock-in, y es lo más útil del emparejamiento.

El argumento de Sakana a favor de Fugu Max es la resiliencia. Un conjunto que abarca modelos de pesos abiertos y especializados, ampliado para Max con la familia NVIDIA Nemotron, significa que ningún proveedor de frontera puede tumbar tu producto mediante la deprecación, el cambio de precios o la retirada regional: una cobertura real, y una que la empresa vende de forma explícita. Pero la cobertura no se puede verificar desde fuera. No puedes ver el conjunto, no puedes incluir ni excluir a un miembro, no puedes autoalojar ninguna parte de él y no puedes ejecutarlo en la UE/EEE en absoluto. Una promesa sobre un conjunto que no se te permite inspeccionar es una garantía más débil de lo que parece.

Qwen3.8-Max plantea el argumento en sentido contrario. Es el modelo de un solo proveedor y, por tanto, está expuesto a las decisiones de un solo proveedor — pero Ali​baba publicó pesos abiertos para el checkpoint Qwen3.8-2.4T-A95B de clase Max bajo una licencia personalizada, lo que significa que la vía de escape es real y no retórica: si cambian los precios o los términos, el modelo puede servirse desde tu propia infraestructura. Para un equipo cuyo miedo real es que un proveedor le retire el suelo bajo los pies, un checkpoint descargable supera a una descripción de un pool.

Llamando a cualquiera de los dos

Qwen3.8-Max está en nuestro catálogo a $2.00 de entrada y $6.00 de salida por millón de tokens, que es el precio de lista de Alibaba con un 0 % de margen traspasado, de modo que un cambio de precio del proveedor llega a la misma clave el mismo día en lugar de seguir un calendario de migración. Es compatible con OpenAI en la misma URL base que el resto del catálogo, lo que significa que puedes colocarlo detrás de una regla de enrutamiento condicional, una cadena de conmutación por error o un panel de fusión de modelos sin un segundo contrato ni cambios en el código — y la conmutación por error automática cubre una ruta de proveedor limitada por tasa o degradada. Movió 127.7 millones de tokens a través de la puerta de enlace en los últimos siete días.

Fugu Max no está en OrcaRouter. Te llega a través de la propia API de Sakana compatible con OpenAI y de varias plataformas de terceros, y la empresa afirma que una integración existente de Fugu se actualiza con un cambio de un solo parámetro en una línea. Como ambos hablan el mismo formato de solicitud, la forma más económica de resolver la brecha en los benchmarks es dejar de esperar a que Sakana los publique: ejecuta ambos bajo una misma opción sobre tu propia carga de trabajo y cuenta los tokens de salida por tarea completada. Esa es la medición que ningún proveedor ha proporcionado.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the argument that the industry has raced along a single axis of bigger and more expensive foundation models while the frontier that matters is two-dimensional, capability on one axis and cost on the other.

¿Cuál, y cuándo?

Qwen3.8-Max es la opción que puedes auditar, poner precio y abandonar. Con la misma tarifa, te ofrece una ventana de 1M de tokens sin recargo por prompts largos, entrada de imagen, vídeo y PDF, un checkpoint Max-class descargable, una entrada independiente en vivo que mide las cosas que determinan tu factura y un 88 % de descuento en la entrada en caché. Sus costes son igualmente concretos: es lento a 37,8 tokens por segundo, se clasifica cerca del fondo del campo en velocidad, es enormemente verboso con 180 millones de tokens en el índice, y su tasa de alucinación medida se duplicó aproximadamente respecto a la generación anterior, lo cual es una preocupación seria precisamente para el trabajo autónomo para el que se vende. Aprovecha al máximo el descuento de caché y presupuesta para un verificador.

Fugu Max es la apuesta de que la coordinación supera a la capacidad. Si tu trabajo es de horizonte largo y verificable, y un coordinador que lanza un verificador completa tareas que un solo modelo falla dos veces, entonces los tokens de orquestación son más baratos que los reintentos y la tarifa idéntica no es un empate en absoluto. Lo que compras es persistencia, en un sistema cuyo pool no puedes fijar, cuya ventana de contexto no se publica y cuyas seis victorias en benchmarks no tienen valores asociados — de un proveedor que eligió nombrar la prueba y ocultar la cifra.

Ambos productos cuestan lo mismo por token. Solo uno de ellos te dice qué obtienes a cambio.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the Featured badge, the identifier qwen/qwen3.8-max, by Qwen dated 2026-08-03, vision, tools, JSON and reasoning capability tags, a 1M-token context window with text, image and video input, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 TTFT of 10.00 seconds, traffic of 127.7 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario