
Fugu Ultra v2 vs Claude Opus 5: mismo precio de entrada, dos apuestas diferentes
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Fugu Ultra v2 y Claude Opus 5 cuestan exactamente lo mismo por formular una pregunta y cantidades radicalmente distintas por obtener una respuesta. Ambos figuran a $5.00 por millón de tokens de entrada. Luego, Fugu Ultra v2 cobra $30.00 por millón de tokens de salida frente a los $25.00 de Claude Opus 5, y la diferencia entre esas dos cifras no es un simple redondeo, porque los dos sistemas emiten cantidades muy distintas de texto para llegar a una respuesta. Sakana AI lanzó Fugu Ultra v2 el 11 de septiembre de 2026 como un sistema de orquestación que coordina un conjunto de modelos de otros laboratorios detrás de un único endpoint compatible con OpenAI; Claude Opus 5, de Anthropic, activo desde finales de julio de 2026, es un solo modelo. Esa diferencia decide la mayor parte de esta comparación antes de consultar cualquier benchmark, y el propio cuadro de resultados de Sakana tiene una fila incómoda: el proveedor informa 48.3 en Chartography frente a los 27.3 de Claude Opus 5, que es el margen más amplio del lanzamiento y también la cifra con menos evidencia externa que la respalde.
La coincidencia que da forma a todo
Empieza por lo que ambos productos tienen en común, porque es más que el precio anunciado.
• Precio de entrada — Fugu Ultra v2 $5.00 por 1M de tokens vs Claude Opus 5 $5.00 por 1M de tokens
• Precio de salida — Fugu Ultra v2 $30.00 por 1M de tokens frente a Claude Opus 5 $25.00 por 1M de tokens
• Entrada en caché — Fugu Ultra v2 $0.50 por 1M por encima de la tarifa base frente a Claude Opus 5, que tarifica el almacenamiento en caché como un descuento de hasta el 90% en la entrada en caché
• Contexto — Fugu Ultra v2 1M tokens, con tarifas que se duplican por encima de 272K frente a Claude Opus 5 1M tokens, fijas
• Techo de salida — Fugu Ultra v2 no se publica como una cifra única frente a Claude Opus 5 128K tokens
• Disponibilidad — Fugu Ultra v2 no se comercializa en la UE/EEE, frente a Claude Opus 5, disponible de forma general conforme a los términos estándar de la API
• Evidencia — benchmarks reportados por el proveedor de Fugu Ultra v2, todavía sin evaluación independiente, frente a los benchmarks del proveedor de Claude Opus 5 más meses de posiciones en clasificaciones de terceros
Esa última fila es donde la comparación realmente da un vuelco. Con el mismo precio de entrada, estás eligiendo entre un sistema cuyas puntuaciones tienes que aceptar por fe y un modelo cuyas puntuaciones otras personas han reproducido. El acantilado de 272K lo agrava: pasado ese umbral, la tarifa de entrada de Fugu Ultra v2 se duplica a $10 y la de salida a $45, mientras que la tarifa de Claude Opus 5 no se mueve. Para ejecuciones de agentes con contexto largo —la carga de trabajo exacta para la que está hecho Fugu Ultra v2—, la ventaja de precio del precio de titular más bajo desaparece precisamente donde se supone que el sistema brilla.

Lo que realmente es cada uno
Claude Opus 5 es el buque insignia de producción de Anthropic, y su diseño es legible desde el exterior. Ejecuta pensamiento adaptativo por defecto, decidiendo cuánto tiempo razonar antes de responder, con un control de esfuerzo explícito de bajo a máximo cuando quieres forzar una deliberación más profunda y pagar por ello. Tiene una ventana de contexto de 1M de tokens, un límite de salida de 128K, visión, uso de herramientas y modo JSON. Anthropic reporta 96.0% en SWE-bench Verified y 79.2% en SWE-bench Pro, más que duplicando el resultado de Frontier-Bench v0.1 de su predecesor, y aproximadamente 30.2% en ARC-AGI 3 frente a 7.8% de GPT-5.6 Sol — todas cifras del proveedor, y todas medidas en un único modelo que puedes fijar por versión. También enruta las solicitudes marcadas a un modelo más antiguo en lugar de dar error, lo cual es un detalle operativo que importa si tienes una revisión de cumplimiento en el bucle.
Fugu Ultra v2 no es eso, y la diferencia no es cosmética. Es un coordinador — un modelo pequeño entrenado, reportado con alrededor de 7B parámetros, que lee tu solicitud, arma un equipo de agentes, asigna los roles de Thinker, Worker y Verifier a partir del trabajo TRINITY de Sakana, y sintetiza una respuesta final. Los modelos subyacentes no se divulgan, las decisiones de enrutamiento no se exponen por diseño, y para el nivel Ultra el conjunto es fijo: no puedes excluir a un proveedor. El propio planteamiento de Sakana sobre la versión 2 es que el corte de entrenamiento se trasladó al 28 de agosto de 2026 y la composición del conjunto cambió — específicamente para excluir a Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra.
Esa exclusión es el detalle más revelador del comunicado. Fugu Ultra v2 afirma haber logrado victorias en benchmarks sobre los tres modelos más potentes disponibles, al mismo tiempo que confirma que no llama a ninguno de ellos. Contenga lo que contenga el grupo, no es la cima del mercado según los propios cálculos de Sakana. El argumento de venta es que la coordinación vence a la capacidad. Es una tesis real y, en tareas verificables con un verificador barato, es una tesis respaldada por evidencia. No es la misma afirmación que "este sistema es más inteligente que Claude Opus 5", y el marcador está dispuesto de modo que los dos son fáciles de confundir.
El marcador que Sakana eligió
Todas las cifras que aparecen a continuación provienen de la propia evaluación de Sakana de Fugu Ultra v2. Las cifras de Claude Opus 5 son las que Sakana midió en la misma comparación, excepto donde se indique lo contrario. Ninguna entidad independiente ha reproducido la columna de Fugu y, en el momento de escribir esto, no existe ninguna entrada de Artificial Analysis para ningún modelo Fugu.
• Chartography — Fugu Ultra v2 48.3 vs Claude Opus 5 27.3 — reportado por el proveedor, una diferencia de 21 puntos
• DeepSWE — Fugu Ultra v2 74.3 frente a ninguna cifra publicada de Claude Opus 5 en la misma tabla — reportado por el proveedor
• Posición en los benchmarks — Fugu Ultra v2 es el mejor o empatado en el primer puesto en cinco de ocho, entre los dos primeros en siete de ocho — según el fabricante
• SWE-bench Verified — sin cifra de Fugu Ultra v2 frente a Claude Opus 5 96,0 % — reportado por Anthropic
• SWE-bench Pro — sin cifra de Fugu Ultra v2 vs Claude Opus 5 79,2% — reportado por Anthropic
• ARC-AGI 3 — sin cifra de Fugu Ultra v2 frente a Claude Opus 5 ~30,2 % — reportado por Anthropic
Interpreta eso como una forma, más que como una clasificación. Sakana publicó una tabla de ocho benchmarks en la que gana cinco, y los resultados más sólidos documentados públicamente de Claude Opus 5 —las filas de SWE-bench, ARC-AGI 3— sencillamente no están en ella. Eso no es una acusación de mala fe; es el aspecto que tiene la tabla de puntuaciones de un proveedor, incluida la de todos los proveedores. Pero significa que no puedes concluir a partir del lanzamiento que Fugu Ultra v2 supera a Claude Opus 5 en ingeniería de software, porque los dos sistemas no se midieron en las mismas filas con la frecuencia suficiente para afirmarlo. En la única fila en la que ambos aparecen y ambas cifras son públicas —Chartography—, Fugu Ultra v2 afirma una victoria amplia. En las filas más amplias de razonamiento y programación, solo una de las partes ha publicado.

Costo por tarea, no costo por token
La factura de tokens de un orquestador no es su tarifa por token. Fugu Ultra v2 genera agentes, y cada uno aporta tokens de razonamiento y de salida, mientras que el propio coordinador produce texto de síntesis. Las preguntas frecuentes sobre precios de Sakana establecen aquí un compromiso realmente útil —se te cobra una tarifa combinada basada en el modelo de gama alta implicado, y añadir agentes no multiplica la factura—, lo que elimina la multiplicación en abanico del peor caso que hace costosas las configuraciones multiagente ingenuas. Pero no elimina el volumen. La cantidad de tokens de salida facturados sigue siendo una función de cuántos agentes se ejecutaron y cuánto escribieron, y a $30 por millón ese volumen es la variable que no puedes predecir desde la página de precios.
La estructura de costos de Claude Opus 5 es la inversa. Una sola llamada, un solo modelo, un dial de esfuerzo que tú controlas, y una tarifa de salida de $25 con procesamiento por lotes disponible con un 50% de descuento para el trabajo que no sea en tiempo real. Puedes pronosticarlo. Para una carga de trabajo que ejecutas diez mil veces al día, la capacidad de pronóstico vale mucho más que un margen de benchmark en una tarea de lectura de gráficos.
Aquí es también donde la cuestión del enrutamiento se separa claramente de la cuestión del modelo. Claude Opus 5 está en OrcaRouter al precio de lista de Anthropic con un 0 % de margen — la tarifa del proveedor se traslada tal cual, así que un cambio de precio del proveedor se aplica en la misma clave el mismo día, con conmutación automática por error entre rutas de proveedor si alguna tiene límite de peticiones o está caída. Fugu Ultra v2 no está en nuestro catálogo; te llega a través de la propia API compatible con OpenAI de Sakana y varias plataformas de terceros, y migrar desde un Fugu anterior es un cambio de un solo parámetro en una línea. Si lo que realmente quieres es la previsibilidad de Claude Opus 5 con menos exposición a un único proveedor, el router es la respuesta y el orquestador no. Si lo que quieres es un sistema que pruebe varios enfoques para un problema difícil sin que tú escribas el fan-out, Fugu Ultra v2 es lo que hace eso — y deberías pilotarlo con la contabilidad de tokens activada.
Dónde Fugu Ultra v2 gana de verdad
Dale al sistema el crédito que merece. El resultado de Chartography, si se sostiene, es el tipo de victoria que a los modelos individuales les resulta difícil falsear: el razonamiento visual sobre documentos estructurados recompensa intentar una lectura, contrastarla con el documento y volver a intentarlo — que es exactamente para lo que sirve un rol de Verificador. La misma lógica se aplica a Toolathon y DeepSWE, donde la respuesta puede comprobarse en vez de debatirse. Los estudios de caso publicados por Sakana apuntan en la misma dirección: una ejecución de AutoResearch de 123 experimentos durante catorce horas en una sola H100, un solucionador del cubo de Rubik en Python puro que completó los 300 cubos mezclados, mientras que dos líneas base de frontera anonimizadas fallaron por completo, y un iris CAD mecánico que de verdad se abre y se cierra. Son ejemplos seleccionados por el proveedor con líneas base anonimizadas, así que demuestran menos de lo que parecen. Pero el patrón es consistente y señala una categoría real: tareas en las que la corrección se puede comprobar y la parte difícil es la persistencia.
También existe un argumento estructural que no tiene nada que ver con los benchmarks. Claude Opus 5 es el modelo de un único proveedor, sujeto a las decisiones de precios, el calendario de descontinuación y las políticas de ese mismo proveedor. Fugu Ultra v2 está diseñado para sobrevivir a que cualquiera de esos elementos cambie, y Sakana afirma explícitamente que ese es el punto: la dependencia de un proveedor, las revocaciones de API y los controles de exportación. En un mercado en el que se han retirado modelos de regiones con muy poco preaviso, eso no es una hipótesis. Es una cobertura, y las coberturas cuestan dinero: 5 $ más por cada millón de tokens de salida es, aproximadamente, lo que cuesta esta cobertura.
El veredicto
Claude Opus 5 gana la decisión que la mayoría de los equipos está tomando en realidad. Tiene meses de evaluación independiente a sus espaldas, una ventana de 1M de tokens que no duplica su precio a mitad de tu documento, un límite de salida de 128K, un precio publicado que puedes prever, un ajuste de esfuerzo que te permite comprar razonamiento solo cuando la tarea lo merece, y resultados de terceros en los benchmarks exactos —SWE-bench Verified, SWE-bench Pro, ARC-AGI 3— que más les importan a los equipos agénticos y de programación. Fugu Ultra v2 gana una pregunta más estrecha y más interesante: si un coordinador con un conjunto más pequeño puede superar a un modelo insignia en tareas en las que se puede verificar la respuesta. El propio marcador de Sakana dice que sí en cinco de ocho filas, y la exclusión del conjunto dice que la victoria se logró sin los tres mejores modelos del mundo.
Si realizas trabajo verificable, de horizonte largo y comprobable y estás fuera de la UE/EEE, Fugu Ultra v2 merece un piloto acotado — mide los tokens de salida por tarea completada, no por token, y establece un límite antes de empezar. Si necesitas una ruta de producción hoy con evidencia que la respalde y una factura que puedas prever, Claude Opus 5 sigue siendo la opción mejor respaldada, y está a una clave de API de distancia al precio de lista de Anthropic, con la tarifa del proveedor transferida sin cambios.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
