
Fugu Ultra v2 vs DeepSeek V4 Pro: la cuestión del precio de salida 34x
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Fugu Ultra v2 cobra aproximadamente treinta y cuatro veces el precio de lista de DeepSeek V4 Pro por el texto que escribe. Eso no es un error tipográfico y no es un artefacto de redondeo: el nuevo orquestador de Sakana AI tiene un precio de lista de $30,00 por millón de tokens de salida, DeepSeek reporta $0,87 por millón, y en el único benchmark para el que ambos proveedores publican una cifra, la diferencia de rendimiento no se parece en nada a treinta y cuatro veces. Sakana afirma 74,3 en DeepSWE para Fugu Ultra v2, lanzado el 11 de septiembre de 2026; DeepSeek reporta 62,7 para DeepSeek V4 Pro, el modelo de pesos abiertos que lanzó en agosto. Una ventaja de 11,6 puntos reportada por el proveedor por un precio de salida 34 veces mayor es toda la comparación en una sola línea —y la pregunta honesta no es si Fugu Ultra v2 es mejor, sino si es diecinueve dólares por millón de tokens mejor, y para quién.
Dos respuestas al mismo problema, construidas desde extremos opuestos
DeepSeek V4 Pro y Fugu Ultra v2 son ambas respuestas a la misma ansiedad —la dependencia de un único proveedor cerrado de modelos de frontera— y difícilmente podrían ser más diferentes en su método.
DeepSeek V4 Pro es un modelo. La cobertura de lanzamiento sitúa el despliegue de la API de la versión oficial —la compilación DeepSeek-V4-Pro-0813— alrededor del 12 al 13 de agosto de 2026, sustituyendo a la vista previa del 24 de abril. Es un sistema de mezcla de expertos reportado en 1,5 a 1,6 billones de parámetros totales con unos 49 000 millones activados por token, con una ventana de contexto de 1 millón de tokens y una salida máxima de 384 000 tokens. Razona en modos de pensamiento y de no pensamiento con tres niveles de esfuerzo, habla tanto los protocolos de API de OpenAI como de Anthropic, y añadió una API Responses nativa dirigida directamente a arneses de agentes estilo Codex. De forma crucial, los pesos se publicaron bajo MIT, lo que significa que el argumento de la resiliencia queda resuelto por posesión: nadie puede revocar tu copia.
Fugu Ultra v2 no es un modelo. Es un coordinador entrenado, de alrededor de 7B parámetros según se informa, que descompone una solicitud entre un conjunto de modelos no revelados, asigna roles de Pensador, Trabajador y Verificador, y sintetiza una respuesta detrás de un único endpoint compatible con OpenAI. Su argumento de resiliencia es arquitectónico más que legal: dado que el conjunto es intercambiable, el sistema puede sobrevivir a que cualquier proveedor individual cambie los términos. La versión 2.0, lanzada junto con Fugu Max, trasladó la fecha de corte de entrenamiento al 28 de agosto de 2026 y —notablemente— eliminó por completo del conjunto a Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra, aunque sigue afirmando superarlos.
Así que la comparación es posesión frente a coordinación. DeepSeek te entrega un modelo que puedes descargar, auditar, afinar y servir tú mismo con el margen que permita tu propio hardware. Sakana te entrega un sistema que decide cómo abordar cada problema, a un ritmo que financia ejecutar varios modelos de frontera en tu nombre.

Lo que 34x realmente compra
Primero, los benchmarks, con las fuentes en primer plano. Cada cifra de DeepSeek que aparece a continuación es del propio proveedor y es anterior a la revisión de precios en horas pico y fuera de pico que DeepSeek anunció para mediados de agosto, cuyas cifras finales aún son motivo de desacuerdo entre las fuentes — un informe sitúa la salida en horas pico cerca de ¥27 por millón, otro cerca de ¥12, frente a una base de ¥6. Verifica con la tarifa publicada de DeepSeek antes de modelar un presupuesto. Cada cifra de Fugu es propia de Sakana, y ningún tercero independiente ha reproducido ninguna de ellas; todavía no hay una entrada de Artificial Analysis para un modelo Fugu.
• DeepSWE — Fugu Ultra v2 74,3 (según el proveedor) frente a DeepSeek V4 Pro 62,7 (según el proveedor)
• Terminal Bench 2.1 — ninguna cifra de Fugu Ultra v2 publicada por Sakana frente a DeepSeek V4 Pro 87.9 (según lo reportado por el proveedor)
• SWE-bench (Vals) — sin cifra de Fugu Ultra v2 frente a DeepSeek V4 Pro 96.4 (reportado por el proveedor)
• Humanity's Last Exam — sin cifra de Fugu Ultra v2 v2.0 frente a DeepSeek V4 Pro 42,7 sin herramientas, 60,0 con herramientas (según el proveedor)
• GPQA Diamond — sin cifra de Fugu Ultra v2 v2.0 frente a DeepSeek V4 Pro 92.8 (reportado por el proveedor)
• Precio de salida — Fugu Ultra v2 $30.00 por 1M, subiendo a $45.00 por encima de 272K de contexto frente a DeepSeek V4 Pro aproximadamente $0.87 por 1M de lista, con una tarifa medida que ha llegado a ser más alta
Dos advertencias sobre esa fila de precio, porque toda la comparación se apoya en ella. Primero, la cifra de DeepSeek es la tarifa de lista reportada en la cobertura de lanzamiento y repetida en nuestra propia descripción del modelo, pero la tarifa medida en nuestro listado ha estado en $2.18 por millón de salida y $0.73 por millón de entrada — el comportamiento de la caché y la mezcla mueven el número efectivo, así que el múltiplo honesto está en algún punto entre aproximadamente 14x y aproximadamente 34x según cuánto de tu entrada esté en caché. Incluso en el mínimo de ese rango, la salida cuesta más de una docena de veces más. Segundo, DeepSeek ya ha anunciado una revisión de precios de hora punta/valle cuyas cifras finales las fuentes aún no coinciden — un informe sitúa la salida en hora punta cerca de ¥27 por millón, otro cerca de ¥12, frente a una base de ¥6. Verifica con la tarjeta de tarifas publicada antes de modelar un presupuesto.
• Precio de entrada — Fugu Ultra v2 $5.00 por 1M, que se duplica por encima de 272K frente a DeepSeek V4 Pro, aproximadamente $0.435 por 1M en un fallo de caché, y unas 120 veces más barato en un acierto de caché
• Pesos — Fugu Ultra v2 cerrado, conjunto no revelado, enrutamiento no expuesto por diseño frente a DeepSeek V4 Pro abierto bajo MIT, autoalojable
• Contexto y salida — Fugu Ultra v2 contexto de 1M, límite de salida no publicado vs DeepSeek V4 Pro contexto de 1M, límite de salida de 384K
El problema de la superposición es obvio: los dos sistemas apenas coinciden en las mismas filas. Sakana publica cinco victorias de los ocho benchmarks que seleccionó; DeepSeek publica un tablero más amplio que incluye una cobertura agéntica profunda —MCP Atlas 73.6, Toolathlon-Verified 74.1, CyberGym 83.3, NL2Repo 61.5, CorpusQA 62.0 en contexto largo— donde Fugu Ultra v2 no tiene ninguna cifra publicada. La única fila que se puede alinear, DeepSWE, es aquella en la que Fugu afirma tener su mayor ventaja en ingeniería de software. Un lector que compara los dos lanzamientos está comparando dos exámenes diferentes.
El multiplicador de verbosidad
El precio de salida no es un impuesto lineal sobre la orquestación; es un multiplicador sobre una cantidad que la orquestación aumenta. Fugu Ultra v2 genera agentes, cada uno produce tokens de razonamiento y de salida, antes de que un coordinador los sintetice. La FAQ de precios de Sakana hace un compromiso genuinamente favorable para el consumidor —pagas una tarifa combinada única basada en el modelo de máximo nivel del grupo, y añadir agentes no multiplica la factura—, lo que limita el peor caso. No limita el volumen. A $30 por millón de tokens de salida, una ejecución multiagente que emite cuatro veces el texto de una llamada de un solo modelo cuesta cuatro veces más, y el multiplicador se compone con una tasa de salida 34 veces mayor.
La estructura de costes de DeepSeek V4 Pro recompensa el comportamiento opuesto. Un acierto de caché en la entrada es aproximadamente dos órdenes de magnitud más barato que un fallo, lo que hace que el trabajo repetido con contexto largo —el mismo repositorio, el mismo conjunto de documentos, el mismo prompt de sistema— sea drásticamente más barato de lo que sugiere la tarifa nominal. Para un bucle de agente que vuelve a leer el mismo contexto en cada turno, ahí es donde recae el coste efectivo, y es una ventaja estructural que ningún orquestador puede sortear.
Combina los dos y la decisión se vuelve concreta. Si Fugu Ultra v2 ofrece una ventaja de 11,6 puntos en DeepSWE y emite el triple de tokens de salida que una sola llamada, estás pagando aproximadamente cien veces más por tarea completada a cambio de una ganancia de diez a quince puntos en un único benchmark. Ese intercambio es defendible para la investigación y para problemas de ingeniería irreductiblemente difíciles, donde el punto marginal lo es todo, e indefendible para un pipeline que se ejecuta cien mil veces al día.

Para quién es realmente cada uno
Elija DeepSeek V4 Pro si se cumple cualquiera de las siguientes condiciones: su carga de trabajo es de gran volumen y sensible al costo; necesita una salida más larga que el límite máximo que le dará un orquestador; requiere un sistema que pueda auditar, ajustar finamente o servir en su propio hardware por razones de residencia de datos; o necesita que el precio sea un número que pueda calcular en lugar de un número que observe. La licencia abierta MIT no es una característica de marketing: es la forma más sólida del argumento de resiliencia que cualquiera de los dos sistemas está presentando, porque no depende de la buena voluntad continua de ningún proveedor. Además, a aproximadamente $0.87 por millón de tokens de salida, es lo suficientemente barato como para que experimentar no cueste nada.
Elige Fugu Ultra v2 si el punto marginal vale un múltiplo, el trabajo es de largo horizonte y la corrección es comprobable —programación con una suite de pruebas, razonamiento estructurado sobre documentos, análisis de varios pasos en los que un rol de Verificador puede detectar un error que una sola pasada dejaría pasar. Los propios casos de estudio de Sakana apuntan exactamente a esto: una ejecución de investigación autónoma de catorce horas, un solucionador del cubo de Rubik que completó las 300 mezclas donde dos líneas base anonimizadas se cayeron por completo. Ten en cuenta que esas líneas base están anonimizadas y seleccionadas por el proveedor, lo que las debilita como evidencia y no las hace falsas. Ten en cuenta también la restricción que zanja el debate para algunos equipos: Fugu Ultra v2 no se vende en la UE ni en el EEE, y Sakana lo afirma sin rodeos.
Una nota práctica si tienes intención de ejecutar cualquiera de los dos. Fugu Ultra v2 no está en OrcaRouter — llega a través de la propia API de Sakana compatible con OpenAI y de varias plataformas de terceros, y actualizar desde un Fugu anterior es un cambio de un solo parámetro de una línea. DeepSeek V4 Pro está en OrcaRouter al precio de lista del proveedor con un 0% de recargo, lo cual importa aquí más de lo habitual: DeepSeek ya ha anunciado una revisión de precios en este ciclo, y en un router de paso directo un cambio de precio del proveedor se aplica en vivo con la misma clave el mismo día, en lugar de después de una renegociación. Si quieres hacer una prueba comparativa de ambos con tu propia carga de trabajo antes de decidirte, el lado más barato de la comparación es el que puedes usar a precio de lista con conmutación por error automática detrás.

El veredicto
Esto no es un enfrentamiento reñido en términos económicos ni decisivo en cuanto a capacidad. DeepSeek V4 Pro es la mejor opción predeterminada por un amplio margen: pesos abiertos que puedes poseer, un techo de salida de 384K, un contexto de 1M, puntuaciones publicadas en contexto largo y un precio de salida aproximadamente una trigésima cuarta parte del de Fugu Ultra v2. Fugu Ultra v2 es el mejor instrumento para una clase limitada de problemas costosos, y la afirmación de Sakana —que un conjunto fijo que excluye a los tres modelos más fuertes aún puede superarlos en trabajo verificable— es el argumento arquitectónico más interesante en el campo en este momento, y el que tiene menos evidencia independiente que lo respalde.
La solución práctica no es elegir. Ejecuta DeepSeek V4 Pro como predeterminado porque es barato, abierto y rápido, y mantén Fugu Ultra v2 en reserva para las tareas donde un aumento de coste de cien veces sigue siendo menor que el coste de equivocarse. Lo que no deberías hacer es leer la tabla de ocho benchmarks de Sakana como evidencia de que el orquestador caro ha reemplazado al modelo abierto barato. En la única fila que comparten, está 11,6 puntos por delante por 34 veces el precio de salida. Que eso sea una ganga o una trampa depende enteramente de a qué problema lo apuntes.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
