
Fugu Ultra v2 vs Grok 4.6: cinco veces el precio de salida, un mismo benchmark
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Hay exactamente un benchmark en el que Fugu Ultra v2 y Grok 4.6 publican ambos una cifra, y es DeepSWE: Sakana AI reporta 74,3 para Fugu Ultra v2 en su anuncio del 11 de septiembre de 2026, mientras que el material de lanzamiento de xAI para Grok 4.6 sitúa su propia puntuación en DeepSWE v1.1 en 65,9 %. Esa es una diferencia de 8,4 puntos, y es la única comparación limpia que ofrecen las dos compañías. Todo lo demás que podrías alinear —Chartography y SWEFish de Sakana frente a GPQA Diamond y CursorBench de Grok— se mide con instrumentos distintos en laboratorios distintos. Así que la pregunta honesta no es «cuál es más inteligente». Es si la ventaja declarada de Fugu Ultra v2 justifica pagar 30 $ por millón de tokens de salida, cuando Grok 4.6 cobra 6 $.
Dos respuestas diferentes al mismo problema
Grok 4.6 es un único modelo, y es el actual buque insignia de la línea Grok — figura como «Latest» en la propia documentación para desarrolladores del proveedor y sucede a Grok 4.5 con la misma ventana de contexto de 500.000 tokens, la misma superficie de entrada de texto/imagen/archivo y el mismo precio base. Tiene una fecha de corte de conocimiento del 1 de febrero de 2026 y expone el esfuerzo de razonamiento en los niveles low, medium, high y xhigh, con high como valor predeterminado. Un detalle que sorprende a la gente: el razonamiento no se puede desactivar. Los tokens de pensamiento se facturan en cada solicitud, lo que hace que el costo real de salida de Grok 4.6 dependa de cuánto esfuerzo decida dedicar a pensar.
Fugu Ultra v2 no es un modelo en absoluto en el sentido habitual. Es el nivel de máxima capacidad de la línea de orquestación de Sakana AI: un único endpoint compatible con OpenAI que descompone una tarea y la distribuye entre un conjunto de otros modelos, algunos de pesos abiertos y otros especializados. El planteamiento de Sakana es que alcanza resultados de nivel frontera «sin la dependencia indispensable de los modelos frontera que orquesta», y declara sin rodeos que Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra quedan excluidos de ese conjunto. Usted paga por la capa de planificación y por cada token que consumen los subagentes.
Esa distinción no es superficial. Es la razón completa por la que existe la diferencia de precio, y es lo único que hace que esa diferencia sea defendible.
Las tarjetas de tarifas, incluida la parte que se repite
• Entrada — Fugu Ultra v2 5,00 $ por 1M frente a Grok 4.6 2,00 $ por 1M. Fugu es 2,5× antes de que se produzca ninguna subllamada.
• Salida — Fugu Ultra v2 $30.00 por 1M frente a Grok 4.6 $6.00 por 1M. Una diferencia de 5×, y la que decide la mayoría de las facturas.
• Entrada en caché — $0.50 por 1M en ambos. Idéntico. Dos proveedores que no tienen nada más en común llegaron al mismo precio de lectura de caché, lo que convierte los bucles de agentes con uso intensivo de caché en la única carga de trabajo donde ambos son realmente comparables línea por línea.
• Nuevos precios para contexto largo — Grok 4.6 se duplica a $4.00 / $12.00 una vez que un prompt supera los 200,000 tokens, y los nuevos precios se aplican a la solicitud completa, no solo al excedente. El nivel reportado de Fugu Ultra v2 por encima de aproximadamente 272,000 tokens de entrada pasa a unos $10.00 / $45.00, también sobre la solicitud completa. Ambos penalizan los prompts largos; Grok empieza a penalizar 72K tokens antes.
• Ventana de contexto — Grok 4.6 con 500K tokens frente a Fugu Ultra v2 con 1M, según lo reportado por listados de terceros. La página de anuncio de Sakana no indica ninguna cifra de contexto, así que considera su 1M como no confirmado por el proveedor.
La polémica del contexto largo corta en ambos sentidos y vale la pena hacer los cálculos. Un prompt de 300K tokens te cuesta $4.00 por cada millón de tokens de entrada en Grok 4.6 y alrededor de $10.00 en Fugu Ultra v2. Un prompt de 150K tokens cuesta $2.00 en Grok y $5.00 en Fugu. El modelo de Sakana es más caro en cada longitud de prompt; la única pregunta es con qué frecuencia hay que llamarlo.

El argumento a favor de pagar 5× por el output
El argumento a favor de un orquestador no es que sea más barato por token. Es que necesita menos intentos, y que los tokens que gasta en coordinación son más baratos que los tokens que gastarías fallando.
Ese es un argumento real, y Sakana lo plantea de forma explícita: Fugu Ultra v2 está orientado a trabajo complejo de varios pasos —investigación autónoma, desarrollo full-stack—, donde el modo de fallo de un solo modelo es desviarse del rumbo a mitad de una ejecución larga. Si una tarifa de salida de $30 te consigue que una tarea se complete al primer intento en lugar del tercero, la prima por token es irrelevante.
Hay evidencia de respaldo desde el propio lado del proveedor, aunque favorece al proveedor y debe leerse como tal. El material de lanzamiento de xAI para Grok 4.6 cita aproximadamente 53 turnos y unos 0,5 mil millones de tokens de entrada para resolver tareas de horizonte largo, frente a aproximadamente 103 turnos y 2,0 mil millones de tokens de entrada de un modelo de frontera de la competencia — un argumento de que el propio Grok es económico por tarea incluso a un precio bajo por token. Ambas empresas están haciendo lo mismo: alejarte de la tarifa por token y llevarte hacia el coste por trabajo terminado.
Lo que significa que el número decisivo es uno que ningún proveedor publica, y que tienes que medir tú mismo: tokens consumidos, de principio a fin, en una tarea que se parezca a la tuya.
Donde cada uno es genuinamente débil
El punto débil documentado de Grok 4.6 es el trabajo en terminal. Su puntuación en Terminal-Bench v3.0 se sitúa en 26%, muy por detrás de lo más alto del sector, aunque el mismo modelo registra un 88,4% mucho más sólido en el anterior Terminal-Bench v2.1: son pruebas distintas, y mezclarlas es un error que verás en mucha cobertura. También tiene la puntuación más alta en GPQA Diamond de su cohorte, con un 94,9%, pero GPQA Diamond se ha retirado desde entonces del índice de Artificial Analysis por saturación, así que una puntuación alta ahí ya no discrimina entre modelos de frontera como lo hacía hace un año.
Del lado independiente, Artificial Analysis puntúa a Grok 4.6 con 44 en su Índice de Inteligencia v4.3, en el puesto n.º 20 de 200, con un coste por tarea de 1,86 $. La cifra de 61 que se difunde con frecuencia proviene de una escala de índice obsoleta y no debería citarse sin especificar qué versión la produjo.
El punto débil de Fugu Ultra v2 es la verificación. A la fecha de publicación, nada de lo que Sakana ha afirmado sobre él —los cinco resultados mejores o empatados como mejores, la puntuación de 48,3 en Chartography frente a los 27,3 de Opus 5 y los 29,5 de Fable 5, los 74,3 en DeepSWE— ha sido reproducido de forma independiente. Tampoco se ha publicado ninguna cifra de latencia o rendimiento, algo que importa más en un orquestador que en un modelo único, porque su tiempo de respuesta depende por completo de lo que decida llamar. Para el Fugu Ultra anterior, los evaluadores informaron públicamente de ejecuciones que se extendían hasta alrededor de 30 minutos; ese es el modelo de junio de 2026, no la v2, pero es el modo de fallo que hay que probar antes de comprometer una ruta de producción.

Una nota sobre el nombre del proveedor.
Un detalle que conviene conocer antes de buscar Grok 4.6 en una consola de desarrollador: el modelo se llama sistemáticamente Grok 4.6, pero la marca del proveedor en torno a él está en constante cambio. La propia documentación de xAI ahora lleva el nombre SpaceXAI, un cambio con el que la mayoría de la cobertura del lanzamiento aún no se ha puesto al día. Los identificadores del modelo y la superficie de la API no han cambiado —Grok 4.6 es un modelo OpenAI Responses de primera clase y se integra en bucles existentes de llamada a herramientas sin una capa de traducción—, pero si buscas una ficha del modelo y la marca parece incorrecta, no es tu error.
Llamar a cualquiera de estos en la práctica
Grok 4.6 está en OrcaRouter a la tarifa del propio proveedor — $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida, transferidos sin ningún margen adicional, de modo que un cambio de precio del proveedor llega aquí el mismo día en lugar de seguir un calendario de migración. Es compatible con OpenAI en la misma URL base que todo lo demás del catálogo, lo que significa que puedes ponerlo detrás de una cadena de respaldo o de una regla de enrutamiento en lugar de codificarlo de forma fija, y puedes hacerle una prueba A/B contra otro modelo sin un segundo contrato ni un cambio de código.
Fugu Ultra v2 no lo enrutamos nosotros. Está disponible en la propia API compatible con OpenAI de Sakana AI, y la empresa dice que una integración existente de Fugu pasa a él con un solo cambio de parámetro. Si quieres comparar los dos en tu carga de trabajo, la opción más económica es dejar Grok 4.6 en tu gateway y llamar a Fugu Ultra v2 directamente desde Sakana detrás de una bandera de funcionalidad; ambos hablan el mismo formato de solicitud, así que el mismo arnés de pruebas funciona en ambos.

El veredicto
Grok 4.6 es la opción predeterminada racional para la mayoría de los equipos, y en precio no hay comparación. A $2.00 / $6.00 con una lectura de caché de $0.50 y una ventana de 500K, maneja razonamiento sobre documentos largos, agentes de programación y trabajo con archivos multimodales a una quinta parte de la tarifa de salida de Fugu Ultra v2, y cuenta con puntuaciones y evaluaciones comparativas independientes. Su exposición es la longitud de los prompts —el acantilado de 200K duplica toda la solicitud— y los bucles de agentes con uso intensivo de terminal, donde sus puntuaciones publicadas no son competitivas.
Fugu Ultra v2 vale su precio premium solo si tienes un tipo específico de carga de trabajo: tareas largas, de varios pasos y con mucha autonomía, en las que un solo modelo tiende a descarrilar y en las que además quieres la propiedad arquitectónica que vende Sakana: un nivel de capacidad que no depende de que ningún proveedor de frontera siga estando disponible o siga siendo económico. Eso es algo real que desear. Pero es una afirmación, aún no una medición, y la brecha de DeepSWE que lo hace parecer creíble es un único benchmark de un único proveedor el día del lanzamiento.
Si no puedes decir cuál de tus tareas falla actualmente en el segundo o tercer intento, aún no tienes el número que justificaría la diferencia de precio. Mide eso primero. Las tarjetas de tarifas ya te dicen todo lo demás.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
