
Fugu Ultra v2 vs Gemini 3.1 Pro: el oponente que puede que ya esté dentro de la máquina
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Existe una versión de la comparación Fugu Ultra v2 vs Gemini 3.1 Pro en la que Gemini gana sin importar cómo vaya el benchmark — porque es posible que esté haciendo parte del trabajo. El sistema de orquestación de Sakana AI, publicado el 11 de septiembre de 2026, no revela qué modelos coordina; el conjunto reportado del Fugu Ultra de junio incluía a Gemini 3.1 Pro, entre otros, y la versión 2.0 solo nos dice qué eliminó, nombrando a Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra como excluidos. Gemini 3.1 Pro de Google es un único modelo multimodal de frontera con un contexto de 1 millón de tokens que maneja texto, imágenes, PDF, audio y video, disponible de forma general desde mayo de 2026 a $2.00 por millón de tokens de entrada y $12.00 por millón de tokens de salida. Uno de estos es un modelo que puedes inspeccionar. El otro es un sistema cuyas victorias en benchmarks pueden pasar por el primero, y ninguno de los dos proveedores te dirá si lo hacen.
Qué es realmente cada sistema
Gemini 3.1 Pro es legible de una manera que se ha vuelto rara entre los lanzamientos de frontera. Es un transformer de mezcla dispersa de expertos de Google DeepMind, lanzado por primera vez en vista previa el 19 de febrero de 2026, con una fuente que sitúa la disponibilidad general en mayo de 2026 —nuestro propio listado lo incluye bajo el ID del modelo de vista previa—. Tiene una ventana de entrada de 1M de tokens y un límite de salida de 65K tokens, acepta texto, imágenes, PDFs, audio, video y código, y expone un control de razonamiento de tres niveles —bajo, medio o alto—, con alto como valor predeterminado de la API. Google reporta 77.1% en ARC-AGI-2, más del doble del 31.1% de la generación anterior; 94.3% en GPQA Diamond; 80.6% en SWE-bench Verified; 68.5% en Terminal-Bench 2.0; 85.9% en BrowseComp; y 44.4% en Humanity's Last Exam sin herramientas, elevándose a 51.4% con búsqueda y ejecución de código. Esas son cifras del proveedor. Su fecha de corte de conocimiento es enero de 2025, algo que vale la pena señalar si tu trabajo depende de eventos recientes.
Fugu Ultra v2 es un coordinador. Es un modelo entrenado, del que se reportan alrededor de 7B de parámetros, que lee una solicitud, arma un equipo de agentes con roles Thinker, Worker y Verifier extraídos de la investigación TRINITY de Sakana, y sintetiza una respuesta detrás de un endpoint compatible con OpenAI. No tiene una lista de modalidades publicada propia: todo lo que puede ver, lo ve porque algún modelo de su pool puede verlo. Su contexto es de 1M de tokens con un marcado salto de precio en 272K, donde las tarifas se duplican a $10 la entrada y $45 la salida. Su techo de salida no está publicado. Su pool no se divulga, sus decisiones de enrutamiento "no se exponen por diseño" y, para el nivel Ultra, el pool es fijo, así que no puedes excluir a un proveedor.
Esa asimetría es todo el enfrentamiento. Gemini 3.1 Pro es un componente que puedes comprar directamente y sobre el que puedes razonar. Fugu Ultra v2 es un ensamblaje cuyas piezas no puedes ver y cuyas afirmaciones más sólidas sobre benchmarks pueden ser, en parte, los propios resultados de Gemini combinados con los de alguien más.

La comparación en la que ambos se superponen
Muy poca de la evidencia publicada alinea a los dos sistemas en la misma fila. Las cifras de Gemini 3.1 Pro que figuran a continuación son las propias de Google; las de Fugu Ultra v2 son las propias de Sakana; cuando un agregador de terceros ha publicado una fila compartida, se marca y viene con la advertencia de que es orientativa más que decisiva.
• Razonamiento multimodal (CharXiv, fila compartida) — Fugu Ultra v2 86,6 % frente a Gemini 3.1 Pro 80,2 %, según BenchLM, que clasifica la categoría como direccional y se abstiene de nombrar un ganador
• TerminalBench 2.1 — sin cifra de Fugu Ultra v2 v2.0 frente a Gemini 3.1 Pro; no hay cifra publicada comparable para Gemini 3.1 Pro; el Fugu Ultra de junio reportó un 82,1 % frente al 70,3 % de Gemini 3.1 Pro en la agregación de terceros
• SWE-Bench Pro: ninguna cifra de Fugu Ultra v2 v2.0 frente a Gemini 3.1 Pro; no hay una cifra publicada comparable; el Fugu Ultra de junio reportó un 73,7 % frente al 54,2 % de Gemini 3.1 Pro
• ARC-AGI-2 — sin cifra de Fugu Ultra v2 frente al 77,1 % de Gemini 3.1 Pro, reportado por el proveedor
• Humanity's Last Exam — sin cifra de Fugu Ultra v2 v2.0 frente a Gemini 3.1 Pro: 44,4 % sin herramientas, 51,4 % con ellas, según el proveedor
• Cobertura de modalidades — Fugu Ultra v2 hereda lo que soporte su pool, no divulgado frente a Gemini 3.1 Pro: texto, imagen, PDF, audio, video y código, documentado
• Precio de entrada / salida — Fugu Ultra v2 $5.00 / $30.00 por 1M, se duplica por encima de 272K frente a Gemini 3.1 Pro $2.00 / $12.00 por 1M hasta 200K, $4.00 / $18.00 a partir de ahí, entrada en caché $0.20 / $0.40
• Contexto y salida — Fugu Ultra v2 1M de contexto, límite de salida no publicado frente a Gemini 3.1 Pro 1M de entrada, 65K de salida
• Pesos y acceso — Fugu Ultra v2 cerrado, UE/EEE excluidos frente a Gemini 3.1 Pro propietario pero ampliamente disponible en las superficies de Google
La fila multimodal es la que hay que manejar con cuidado, porque es la más citada y la menos sólida. La agregación de CharXiv de BenchLM sitúa a Fugu Ultra v2 por delante por 6,4 puntos normalizados — y la misma página afirma claramente que las filas direccionales nunca reciben un ganador, que Gemini no contaba con resultados medidos en las categorías agénticas, de programación, de conocimiento o multilingües, y que Fugu no tenía ninguno en matemáticas o multilingüe. Una categoría en la que solo se ha medido un lado en la mayoría de las filas no puede producir un veredicto. Si no te llevas nada más de esta comparación, llévate esto: en el trabajo multimodal en concreto, la evidencia publicada no respalda una conclusión en ningún sentido, y la única fila que existe explícitamente no es un resultado definitivo.
La posibilidad que cambia el marco
Sakana no dirá qué hay en el grupo. Es una decisión de diseño documentada, no un descuido — las preguntas frecuentes dicen que la información de enrutamiento no se expone por diseño, y no hay ningún mecanismo para inspeccionarla. Lo que sabemos de la generación de junio es que los miembros del grupo reportados incluían a Gemini 3.1 Pro junto con otros modelos de frontera. La versión 2.0 cambió el grupo, y Sakana describió el cambio solo por sustracción: Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra están fuera. Nada en el comunicado dice que Gemini siga dentro.
Si Gemini 3.1 Pro está en el conjunto, se derivan tres consecuencias, y las tres son prácticas más que filosóficas. Primero, una parte del rendimiento multimodal de Fugu Ultra v2 es el rendimiento de Gemini, combinado con el de otros modelos, lo que significa que estás pagando una prima de coordinación además de una tarifa por token que podrías pagar directamente. Segundo, Fugu Ultra v2, a 30 $ por millón de tokens de salida, frente a los 12 $ de Gemini 3.1 Pro, es una prima por ensamblaje, no por capacidad bruta; si tu tarea es una única pregunta multimodal, Gemini la responde más barato y puedes ver exactamente qué modelo respondió. Tercero, y lo más útil, la prueba honesta de un orquestador no es «¿supera a sus componentes?» sino «¿supera a su mejor componente cuando lo usas solo?». La arquitectura de Sakana se basa en la afirmación de que así es, en tareas verificables. Vale la pena poner a prueba esa afirmación con tu propia carga de trabajo antes de aceptarla en una prueba comparativa de lectura de gráficos.
Hay una versión en la que la respuesta es no y, aun así, el orquestador se gana su lugar. Si Gemini está en el grupo y la puntuación de Chartography de Fugu Ultra v2, 48.3 frente a 27.3 de Claude Opus 5, se sostiene, entonces lo que construyó Sakana es una capa de coordinación que de forma fiable saca más provecho del mismo modelo de lo que obtienes al llamarlo una sola vez. Eso es un producto real, y la única pregunta abierta es si el margen cubre el precio. Nadie ha publicado el experimento.

Donde están los bordes honestos
Las ventajas de Gemini 3.1 Pro son concretas. Cuesta aproximadamente dos quintos del precio de Fugu Ultra v2 en entrada y salida, y a diferencia de Fugu, sus tarifas no se duplican al superar un umbral de contexto — el escalón a 200K es más suave que el precipicio de 272K. Documenta sus modalidades en lugar de heredarlas, lo que significa que el trabajo de audio y video es una característica soportada en lugar de una esperanza. Tiene un límite de salida publicado. Está disponible a través de las propias superficies de Google y, al igual que los otros modelos con los que se compara Fugu Ultra v2, es invocable en OrcaRouter — como google/gemini-3.1-pro-preview, al precio de lista de Google con 0% de margen, por lo que un cambio de precio de Google llega a la misma clave el mismo día en que se anuncia.
Las ventajas de Fugu Ultra v2 son más acotadas y reales. Ataca un problema difícil más de una vez, con un rol de Verifier que comprueba el trabajo, y por eso sus afirmaciones más sólidas se apoyan en benchmarks donde la corrección es verificable —Chartography, DeepSWE, Toolathon— y no en la recuperación de conocimientos. Los casos de estudio publicados por Sakana apuntan en la misma dirección: un iris de CAD mecánico que se abre y se cierra correctamente donde otros modelos dejaban huecos y articulaciones débiles; un solucionador de cubo de Rubik en Python puro que completa los 300 cubos mezclados, mientras que dos líneas base de frontera anonimizadas fallaron por completo. Esas líneas base están anonimizadas y fueron elegidas por el proveedor, así que tómalas como ilustración y no como prueba. Pero el patrón es consistente en todo el lanzamiento, y describe una capacidad genuina que una sola llamada a un modelo no tiene: persistencia en un problema hasta que la respuesta supera una comprobación.
Sopesa también las limitaciones. Fugu Ultra v2 no se vende en la UE ni en el EEE, y Sakana afirma explícitamente que está trabajando para cumplir con el RGPD. Gemini 3.1 Pro no tiene esa restricción y cuenta con un historial mucho más largo de evaluaciones independientes a sus espaldas.

El veredicto
Para la mayoría del trabajo multimodal, Gemini 3.1 Pro es la elección correcta, y no hay comparación. Es más barato por token, más barato por documento, está documentado para audio y video, tiene un límite de contexto que no duplica tu factura a mitad de ejecución y —la parte que más importa aquí— puedes ver qué te respondió. Si necesitas un solo modelo para leer un PDF, ver un clip y responder una pregunta, no hay argumento para enrutar eso a través de un grupo no revelado a dos veces y media el precio de salida.
Fugu Ultra v2 es la decisión correcta para una forma de trabajo específica y mucho más acotada: tareas de horizonte largo con una respuesta verificable, donde intentar un problema de tres maneras y verificar el resultado supera a intentarlo una sola vez, y donde el punto marginal de calidad vale el múltiplo. Queda totalmente fuera de consideración si tienes usuarios de la UE o del EEE en el alcance.
La incómoda pregunta que deja abierta este enfrentamiento es la que nadie ha medido. Si Gemini 3.1 Pro está dentro del pool —y la única respuesta honesta hoy es que Sakana no ha dicho que no lo esté—, entonces parte de lo que compras con Fugu Ultra v2 es Gemini 3.1 Pro con una capa de coordinación por encima, a un precio que implica que la capa vale aproximadamente dos veces y media el modelo. Bien puede ser verdad. La arquitectura de Sakana se construyó para hacerlo cierto. Pero es una hipótesis con un marcador del proveedor detrás y ninguna prueba independiente, y hasta que alguien la ejecute, el modelo que puedes ver es el que puedes defender.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
