
Fugu Ultra v2 vs Qwen3.8-Max: por qué la etiqueta de precio es el número equivocado
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 cuesta $30,00 por millón de tokens de salida. Qwen3.8-Max cuesta $6,00. Es una brecha de cinco a uno, y si eliges entre estos dos sistemas agénticos basándote en esa proporción, elegirás mal, porque ninguno de los dos se factura realmente como sugiere su lista de precios. Según la propia medición de Artificial Analysis, Qwen3.8-Max generó 180 millones de tokens de salida para completar el Intelligence Index, más del doble de los 89 millones del modelo mediano, con un costo de $2,67 por tarea. Es un modelo ahorrador en tokens y derrochador en respuestas. El Fugu Ultra v2 de Sakana AI, lanzado el 11 de septiembre de 2026, tiene la forma opuesta: un conjunto no revelado de modelos de otros laboratorios que genera y coordina por solicitud, facturado a una tarifa combinada que, según Sakana, no se multiplica a medida que se añaden agentes. Uno es un único modelo de 2,4 billones de parámetros que piensa en voz alta durante mucho tiempo. El otro es un pequeño coordinador que contrata ayuda. Comparar sus precios por token no te dice casi nada sobre cuál es más barato de ejecutar.
Dos formas opuestas de ser caro
Empieza por el mecanismo, porque explica cada una de las demás diferencias en esta comparación.
Qwen3.8-Max es un modelo disperso de mezcla de expertos —2,4 billones de parámetros totales, alrededor de 95 mil millones activos por token— que alcanza resultados cercanos a la frontera trabajando durante más tiempo en lugar de ser más grande. Artificial Analysis lo midió a 37,8 tokens de salida por segundo, situándolo en el puesto #154 de 200 modelos en velocidad, con 180 millones de tokens de salida emitidos a lo largo del Intelligence Index (#70 de 200 en verbosidad). Su coste por tarea del Intelligence Index se lee en 2,67 $, y su descuento por caché es inusualmente profundo, del 88%, que es la palanca que realmente controla la factura aquí: una ejecución larga de agente que no deja de releer el mismo contexto resulta barata, y una que no deja de generar texto nuevo, no.
Fugu Ultra v2 aborda el mismo problema desde el otro extremo. Es un orquestador —un pequeño coordinador entrenado, de unos 7000 millones de parámetros según se informa, que lee una solicitud, reúne un equipo de agentes con los roles de Thinker, Worker y Verifier del trabajo TRINITY de Sakana, y luego sintetiza una respuesta. Su factura de tokens es la suma de lo que producen sus subagentes más el texto de síntesis del propio coordinador. Sakana se compromete en sus preguntas frecuentes sobre precios a que se te cobre una única tarifa combinada vinculada al modelo de gama más alta involucrado y a que añadir agentes no multiplique la factura, lo que elimina el clásico aumento explosivo de costes en los sistemas multiagente, donde la expansión en abanico multiplica el coste. Lo que no elimina es el volumen. A $30.00 por millón de tokens de salida, el número que importa es cuántos agentes se ejecutaron y cuánto escribieron, y ese es un número que ni tú ni Sakana pueden predecir desde la página de precios.
Ese es el planteamiento honesto de la brecha de precios: es una tarifa, no un total. Una tarifa cinco veces más alta aplicada a una carga de trabajo cuyo volumen de salida no puedes prever no es cinco veces el costo — es un múltiplo sin límite con un piso predecible.

La hoja de especificaciones, y la única fila que lo decide
• Precio — Fugu Ultra v2 $5.00 de entrada / $30.00 de salida por 1M de tokens vs Qwen3.8-Max $2.00 de entrada / $6.00 de salida
• Entrada en caché — Fugu Ultra v2 $0.50 por 1M frente a Qwen3.8-Max $0.25 por 1M de lectura, y un descuento de caché del 88 % medido por Artificial Analysis
• Recargo por contexto largo — la entrada de Fugu Ultra v2 se duplica a $10.00 y la salida a $45.00 por encima de 272K tokens, frente a Qwen3.8-Max, que no aplica recargo por prompts largos: tarifa plana hasta el límite de la ventana
• Ventana de contexto — Fugu Ultra v2 1M tokens frente a Qwen3.8-Max 1M tokens
• Límite de salida — Fugu Ultra v2 no se publica como una cifra única frente a Qwen3.8-Max, aproximadamente 128K tokens
• Modalidad de entrada — texto de Fugu Ultra v2, respaldado por las capacidades propias del pool, frente a texto, imagen, vídeo y PDF de Qwen3.8-Max
• Pesos — Fugu Ultra v2 cerrado, con la membresía del pool no divulgada por diseño, frente a Qwen3.8-Max, cuyos pesos abiertos se publican para el checkpoint de la clase Max bajo una licencia personalizada
• Disponibilidad regional: Fugu Ultra v2 no se comercializa en la UE/EEE, mientras que Qwen3.8-Max está disponible sin restricción regional
• Evaluación independiente — Fugu Ultra v2: no se ha publicado ninguna, y no existe página de Artificial Analysis para ningún modelo Fugu, mientras que Qwen3.8-Max cuenta con una entrada activa en Artificial Analysis con cifras publicadas de velocidad, verbosidad y coste por tarea
Al leer las dos últimas filas en conjunto, la comparación se agudiza. Qwen3.8-Max es un modelo que se puede fijar por versión, cuya licencia se puede leer, cuyo checkpoint se puede descargar y que se puede contrastar con el marcador de un tercero. Fugu Ultra v2 es un sistema que no se puede inspeccionar, no se puede autoalojar, no se puede comprar en Europa y no se puede verificar frente a nadie fuera de Sakana. El recargo de 272K lo agrava aún más: superado ese umbral, la tarifa de entrada de Fugu Ultra v2 se duplica y su tarifa de salida aumenta un 50 %, mientras que la tarifa de Qwen3.8-Max no se mueve. Para el trabajo con documentos y repositorios de horizonte largo para el que están concebidos ambos sistemas, la tarifa anunciada más barata también es la más plana.
El dato de Qwen3.8-Max que todos citan está desactualizado.
Si has leído sobre este modelo en algún lugar durante las últimas dos semanas, probablemente hayas visto un Artificial Analysis Intelligence Index de 58, o 58.1, o 58.4. Esas cifras eran reales y ya no están vigentes. Artificial Analysis recalibró su índice a v4.3 el 7 de septiembre de 2026, comprimiendo las puntuaciones en general, y la página activa de Qwen3.8-Max ahora muestra 40, lo que lo sitúa en el puesto #30 de 200 modelos — con la insignia "Updated" que marca una puntuación reformulada. Los artículos anteriores también incluían el costo de esfuerzo medido en la escala anterior: 64 turnos por tarea frente a 14 de la generación anterior de Qwen, y aproximadamente $1.14 por tarea del Intelligence Index. La página actual muestra $2.67 por tarea, 37.8 tokens de salida por segundo y 180 millones de tokens de salida en el índice.
Dos cosas se desprenden. En primer lugar, en la escala recalibrada, Qwen3.8-Max se sitúa en la misma banda que el resto del segundo escalón de la frontera, en lugar de estar al mismo nivel que esta, y cualquier comparación que leas que lo clasifique frente a Claude Opus 5 o Kimi K3 en un 58 está comparando instantáneas de escalas diferentes. En segundo lugar, y de manera más útil para este enfrentamiento, la corrección es unidireccional: Qwen3.8-Max tiene un número que puede estar equivocado y luego corregirse. Fugu Ultra v2 no tiene número. Todas las cifras de Fugu en este artículo provienen de la propia evaluación de Sakana, y a fecha de 11 de septiembre no existe una página de Artificial Analysis para Fugu Ultra v2 ni para ningún otro modelo Fugu — la URL da error 404. Cuando un proveedor publica una tabla de puntuaciones y ninguna parte independiente ha ejecutado el modelo, la tabla de puntuaciones es el registro completo.
Donde realmente se superponen, y donde no
Sakana sitúa a Fugu Ultra v2 como el mejor o el mejor empatado en cinco de ocho benchmarks —GDP.pdf, Chartography, SWEFish, DeepSWE y Toolathon— y entre los dos primeros en siete de ocho. Las dos cifras concretas del comunicado son Chartography con 48.3, frente a 27.3 de Claude Opus 5 y 29.5 de Claude Fable 5 en la misma tabla, y DeepSWE con 74.3. Las propias filas publicadas por Alibaba para Qwen3.8-Max incluyen Terminal-Bench 2.1 con 86.6, OSWorld-Verified con 86.1, GPQA Diamond con 92.6 y SWE-bench Pro con 67.7.
Fíjate en lo que tienen en común esas dos listas: nada. Ni un solo benchmark aparece en ambas tablas de proveedores. No hay ninguna fila en la que puedas poner una cifra de Sakana y una de Alibaba una al lado de la otra y deducir un ganador, lo que significa que la respuesta honesta a «cuál es mejor con los agentes de programación» es que ninguna evidencia publicada lo responde. Lo que existe es un sistema con ocho filas elegidas por el proveedor y sin verificación externa, y otro sistema con filas del proveedor más una entrada independiente que mide coste y velocidad en lugar de la capacidad en una comparación directa. Eso es una laguna en la evidencia, no una laguna en los modelos, y debería cambiar tu forma de comprar: no puedes elegir entre estos basándote en benchmarks, así que elige según las propiedades que sí puedes verificar.

Pesos abiertos frente a un conjunto no divulgado
Aquí es donde se invierte el argumento habitual del lock-in, y es lo más interesante de la combinación.
La propuesta de Sakana para Fugu Ultra v2 es la soberanía. Un conjunto intercambiable de modelos abiertos y especializados significa que ninguna decisión de precios, calendario de descontinuación o cambio de política de un único proveedor puede hundir tu producto, y el lanzamiento lo deja explícito al señalar que la composición del conjunto cambió en la v2. La empresa también declara sin ambages que las puntuaciones de Fugu Ultra v2 se lograron sin Claude Fable 5, Claude Fable 5.1 ni GPT-6 Astra en el conjunto de agentes —al reivindicar victorias sobre los tres modelos más potentes disponibles, mientras confirma que no recurre a ninguno de ellos. Sea lo que sea que contenga el conjunto, no está a la cabeza del mercado según los propios cálculos de Sakana.
Pero la cobertura tiene un costo que no está en la lista de precios. No puedes ver el pool, no puedes dar de alta ni de baja a un miembro del nivel Ultra, no puedes autoalojar nada de eso, y no puedes ejecutarlo en la UE/EEE en absoluto — la orquestación con sede en Singapur sobre los pesos de otros laboratorios es un perfil de riesgo distinto al de poseer los pesos. Qwen3.8-Max invierte eso exactamente. Es el modelo de un solo proveedor y, por lo tanto, está expuesto a las decisiones de un solo proveedor, pero Alibaba publicó pesos abiertos para el checkpoint Qwen3.8-2.4T-A95B de clase Max bajo una licencia personalizada, lo que significa que la vía de escape es real y no retórica: si cambian los precios o los términos, el modelo se puede servir desde tu propia infraestructura. Para un equipo cuyo miedo real es que un proveedor les retire el suelo bajo los pies, un checkpoint descargable es una garantía más fuerte que una promesa sobre un pool que no se te permite inspeccionar.
Existe un punto de segundo orden para quien ejecuta agentes en ambos. Qwen3.8-Max está en nuestro catálogo a $2.00 de entrada y $6.00 de salida, que es el precio de lista de Alibaba con 0% de margen repercutido — un cambio de precio del proveedor llega a la misma clave el mismo día, y la conmutación por error automática cubre una ruta de proveedor limitada por tasa o degradada. Fugu Ultra v2 no está en OrcaRouter. Te llega a través de la propia API compatible con OpenAI de Sakana y de varias plataformas de terceros, y pasar de un Fugu anterior es un cambio de un solo parámetro en una línea. Un router no sustituye a un coordinador, y un coordinador no sustituye a la capacidad de conmutar por error; si quieres ambas propiedades, estás ejecutando sistemas de dos proveedores y deberías presupuestar dos facturas.
Cuál deberías elegir
Elige Qwen3.8-Max si necesitas un modelo que puedas prever, verificar y del que puedas escapar. Es un tercio de la tasa de salida de Fugu Ultra v2 a precio de lista, no tiene una caída abrupta con contextos largos, acepta imágenes, video y PDF, mientras que la modalidad de Fugu pool es la que los agentes subyacentes admitan en cada caso, publica un checkpoint al que puedes recurrir como respaldo, se vende en todas partes y tiene una entrada independiente en vivo que mide las cosas que realmente determinan tu factura — 37,8 tokens por segundo y una cifra de costo por tarea que puedes modelar antes de comprometerte. Sus debilidades son igual de concretas y vale la pena nombrarlas: es lento, está clasificado en el puesto 154 de 200 en velocidad, es enormemente verboso, con 180 millones de tokens en el índice, y Artificial Analysis midió por separado que su tasa de alucinaciones aumentó del 23 % al 40 % frente a la generación anterior, lo cual es una preocupación seria justamente para el trabajo autónomo de varios pasos para el que se comercializa. Reserva presupuesto para un verificador y aprovecha agresivamente el descuento de caché profunda.
Elige Fugu Ultra v2 si tu trabajo es de horizonte largo y verificable, tu presupuesto es exploratorio en lugar de producción, y estás fuera de la UE/EEE. El argumento estructural a favor de un coordinador es real y los propios ejemplos del proveedor apuntan a ello de forma consistente: una ejecución de investigación automatizada de 123 experimentos durante catorce horas en una sola H100, un solucionador de cubo de Rubik en Python puro que completó los 300 cubos mezclados, mientras que dos líneas base de frontera anonimizadas fallaron por completo. Esos son ejemplos seleccionados por el proveedor con líneas base anonimizadas y demuestran menos de lo que parecen, pero el patrón es coherente: en tareas donde la corrección es verificable y la parte difícil es la persistencia, generar un verificador es mejor que pedirle a un solo modelo que se esfuerce más. Lo que estás comprando es esa persistencia, a un coste cinco veces el de Qwen3.8-Max, en un sistema cuya calidad no puedes auditar y cuyo pool no puedes fijar. Pilótalo con alcance acotado, instrumenta los tokens de salida por tarea completada en lugar de por token, y establece un límite máximo antes de la primera ejecución.

La razón por la que la etiqueta de precio tiene el número equivocado es que ambos productos han desplazado el costo de una respuesta lejos del costo de un token. Fugu Ultra v2 lo hace distribuyéndose hacia modelos que no nombrará. Qwen3.8-Max lo hace pensando durante 180 millones de tokens. Si ya conoces tu volumen de tokens por tarea, la aritmética es trivial y deberías hacerla. La mayoría de los equipos no conoce ese número, y para ellos la decisión se reduce a algo más simple: Qwen3.8-Max es la opción que puedes auditar, ponerle precio y abandonar, y Fugu Ultra v2 es la opción que apuesta a que la coordinación supera a la capacidad. Ambas son defendibles. Solo una de ellas viene con los comprobantes.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
