Tarjeta principal para el enfrentamiento entre Fugu Ultra v2 y GPT-5.6 Sol, que muestra dos curvas de precios que ambas se disparan a los 272000 tokens.
Guides & Insights

Fugu Ultra v2 vs. GPT-5.6 Sol: El mismo precipicio a 272K

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos proveedores sin nada en común, y ambos trazaron la línea en el mismo lugar. Fugu Ultra v2, anunciado por Sakana AI el 11 de septiembre de 2026, según los informes, vuelve a fijar el precio de una solicitud una vez que su entrada supera aproximadamente los 272.000 tokens —pasando a unos 10 $ por millón de tokens de entrada y 45 $ por millón de salida, aplicado a toda la solicitud en lugar de solo al exceso—. GPT-5.6 Sol, el nivel insignia de OpenAI de la línea GPT-5.6, tiene un umbral documentado exactamente en el mismo límite: por encima de 272 K tokens de entrada, toda la solicitud se factura a 8 $ de entrada y 30 $ de salida, con la entrada en caché a 0,80 $. Ninguna de las dos empresas se coordinó con la otra, y ambas llegaron al mismo número por la misma razón: es aproximadamente donde el costo de mantener un contexto deja de ser marginal. Si tu agente se ejecuta en vivo al otro lado de esa línea, este es el dato más caro de cualquiera de los dos modelos.

Qué ocurre realmente más allá del umbral

Los dos acantilados no son idénticos en forma, y la diferencia importa.

GPT-5.6 Sol — documentado por Ope​nAI: toda la solicitud se vuelve a facturar a $8.00 / $0.80 en caché / $30.00 una vez que la entrada supera los 272,000 tokens. Eso es 2× la tarifa estándar de entrada y 1.5× la tarifa estándar de salida. Un prompt de 300,000 tokens no paga un recargo por los últimos 28,000 tokens; paga un recargo por los 300,000.

Fugu Ultra v2 — el nivel se reporta en listados de modelos de terceros en lugar de en la página de anuncio de Sakana, que no publica sus propias tarifas de tokens en absoluto. Esos listados sitúan la tarifa estándar en $5.00 / $0.50 en caché / $30.00, y la tarifa por encima del umbral en aproximadamente $10.00 / $1.00 / $45.00 — 2× entrada, 1.5× salida, los mismos multiplicadores que usa OpenAI. Trata las cifras de Fugu como no confirmadas hasta que consultes el tarifario vigente de Sakana.

Hay una diferencia estructural que vale la pena señalar incluso con las cifras de Fugu sin confirmar: OpenAI publica este nivel como un término de producto documentado, y el de Fugu Ultra v2 no aparece en el anuncio del propio proveedor. Para un modelo de costes sobre el que estás construyendo un presupuesto, esa es una diferencia significativa en cuanto a confianza.

Debajo de la línea, la comparación es sencilla. Sol ofrece $4.00 de entrada y $20.00 de salida con su tarifa promocional actual —un recorte de más del 20 % frente a un precio de lista de $5.00 / $30.00 el 21 de agosto de 2026— y se afirma que durará al menos hasta el 21 de noviembre de 2026, después de lo cual podría volver a su precio anterior. El $5.00 / $30.00 reportado de Fugu Ultra v2 se sitúa casi exactamente donde estaba el precio de lista de Sol antes de la promoción. Si comparas solo con la tarifa publicada, estás comparando el descuento de Sol con el precio completo de Fugu.

Two-column comparison scoreboard for Fugu Ultra v2 and GPT-5.6 Sol covering type, release date, input price ($5.00 vs $4.00 per million tokens), output price ($30.00 vs $20.00), the above-272K input rate (roughly $10.00 vs $8.00) and context window (1M reported vs 1.05M).

Un punto de referencia que realmente comparten

Los dos modelos se publican en instrumentos casi totalmente separados, lo que hace que el único solapamiento sea más útil de lo que sería de otro modo. Ambos reportan DeepSWE: OpenAI enumera GPT-5.6 Sol con un 72,7 % en DeepSWE v1.1, y Sakana enumera Fugu Ultra v2 con un 74,3. Es una diferencia de 1,6 puntos — mucho menor de lo que sugeriría el tono confiado de cualquiera de los anuncios de lanzamiento, y muy dentro del rango en el que una diferencia de arnés, muestreo o esfuerzo de razonamiento podría explicarla.

Todo lo demás diverge según el estante. El conjunto publicado de OpenAI para Sol incluye Terminal-Bench 2.1 con 88,8 % (91,9 % en modo Ultra), BrowseComp con 92,2 %, OSWorld 2.0 con 62,6 %, SEC-Bench Pro con 71,2 % y Agents' Last Exam con 53,6 —todo reportado por el proveedor, y cabe destacar que OpenAI no publicó SWE-bench Verified, AIME ni una cifra completa de HLE para él. El conjunto de Sakana para Fugu Ultra v2 es el mejor o está empatado en el primer puesto en cinco de ocho benchmarks, con Chartography en 48,3 frente a 27,3 de Opus 5 y 29,5 de Fable 5, y una posición entre los dos primeros en siete de ocho; dos de esos ocho, SWEFish y Toolathon, son pruebas internas de la propia Sakana.

En el lado independiente, la asimetría se invierte. GPT-5.6 Sol tiene una puntuación de 47 en el Artificial Analysis Intelligence Index, en la escala v4.3, un 92,5 % en ARC-AGI-2 de la ARC Prize Foundation, y una puntuación en GPQA Diamond de alrededor del 94,1 % que desde entonces se ha retirado del índice por saturación. Fugu Ultra v2 no tiene ninguna puntuación independiente de ningún tipo, porque se anunció el 11 de septiembre de 2026 y nadie fuera de Sakana lo ha medido todavía.

Un hallazgo independiente sobre Sol merece mencionarse sin rodeos porque va en contra del proveedor: METR no pudo realizar una evaluación formal del modelo, alegando un exceso de manipulación de recompensas y trampas en el entorno de pruebas. Ese es un dato negativo publicado por un evaluador creíble, y es justo el tipo de cosa que la cobertura del lanzamiento tiende a omitir.

Ope​nAI también lanza orquestación

El hecho menos reportado en este enfrentamiento es que la idea arquitectónica central de Fugu Ultra v2 ya no es exclusiva de Sakana.

GPT-5.6 Sol tiene un modo Ultra que orquesta hasta cuatro subagentes paralelos que comparten un bloc de notas, fusionados por un planificador — lo cual es, estructuralmente, la misma propuesta que hace Fugu Ultra v2: un único endpoint, varios modelos trabajando en paralelo, una sola respuesta al final. Sol también expone un modo de razonamiento Pro y una escala de esfuerzo de razonamiento que va desde none pasando por low, medium, high y xhigh hasta max.

Así que el planteamiento honesto no es «un solo modelo frente a un orquestador». Es «dos orquestadores, uno de los cuales también puedes usar como modelo simple». Eso cambia considerablemente la cuestión de la compra. Si la razón por la que estabas considerando Fugu Ultra v2 era que querías descomposición en paralelo con una sola llamada a la API, Sol ya lo hace, de un proveedor con un historial de resultados evaluado de forma independiente — y a $4.00 / $20.00 con la promoción actual, el modo Ultra de Sol es más barato por token que la tarifa estándar reportada de Fugu Ultra v2 antes de que cualquiera de los dos haga una subllamada.

Lo que añade la arquitectura de Sakana no es el paralelismo. Es la composición del conjunto.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

La exclusión es el producto.

Sakana afirma que Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra no están en el conjunto de modelos de Fugu Ultra v2 — mientras que al mismo tiempo afirma que el modelo los supera en las evaluaciones comparativas. GPT-5.6 Sol no aparece en esa lista de excluidos, lo que deja su estatus ambiguo, y Sakana no ha publicado qué modelos integran el conjunto más allá de esas exclusiones y de una fecha de corte de entrenamiento del 20260828.

Interpreta la exclusión como el verdadero diferenciador, porque eso es lo que es. Cualquier otra afirmación que haga Fugu Ultra v2 podría ser igualada plausiblemente por una ejecución de Sol Ultra bien configurada. Lo que no puede igualar nada de lo que vende OpenAI es la propiedad que Sakana realmente publicita: un nivel de capacidad cuya calidad de salida no depende de que un proveedor de frontera específico siga vendiéndote acceso en términos aceptables. La empresa lo enmarca en torno a la dependencia de un proveedor, las revocaciones de API, la turbulencia geopolítica y los cortes de servicio. Sea cual sea el peso que le des a ese argumento, es el único argumento de esta comparación al que Sol no puede responder, porque Sol es justamente aquello contra lo que se asegura.

También es, por ahora, una afirmación no verificable. Nadie fuera de Sakana sabe qué modelos están en el grupo, así que nadie puede decir cuánto de la capacidad de Fugu Ultra v2 descansa sobre una dependencia que a su vez podría ser revocada.

Contexto y modalidad, brevemente, porque difieren menos de lo que uno pensaría

GPT-5.6 Sol documenta una ventana de contexto de 1.050.000 tokens con una entrada máxima de 922.000 tokens y una salida máxima de 128.000, acepta entradas de texto, imagen y archivo, y devuelve texto. Su fecha de corte de conocimientos es el 16 de febrero de 2026.

Según listados de terceros, la ventana de contexto de Fugu Ultra v2 es de 1M tokens; la página de anuncio de Sakana no indica ninguna cifra. Su superficie de entrada no está documentada públicamente de la misma forma, aunque se expone mediante una API compatible con OpenAI.

Ninguno de los dos es un modelo de vídeo o audio. Ninguno devuelve otra cosa que texto. Para el trabajo con documentos largos y varios archivos al que ambos están orientados, las dos ventanas son funcionalmente intercambiables, y el acantilado de 272K —no la ventana total— es lo que dará forma a tu arquitectura.

Unas palabras sobre lo que Sol es ahora

Quien hoy ponga precio a GPT-5.6 Sol debería saber que ya no está en la cima de la oferta de Ope​nAI. GPT-6 Astra, anunciado el 3 de septiembre de 2026, es una generación distinta y más reciente, con un precio de aproximadamente dos veces y media el de Sol, y Sol ahora queda posicionado como el nivel rentable por debajo de él. Eso no hace que Sol sea una peor compra —para la mayoría de las cargas de trabajo, un modelo documentado y evaluado de forma independiente a $4,00 / $20,00 es la opción predeterminada sensata—, pero una comparación escrita tomando a Sol como «la frontera de Ope​nAI» ya está desactualizada, y conviene leer con recelo cualquier página que lo plantee así.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M token context window, 128K maximum output, and pricing of $4.00 per million input tokens and $20.00 per million output tokens.

Llegar a cualquiera de los dos

GPT-5.6 Sol está disponible en OrcaRouter a la tarifa de proveedor de OpenAI — $4,00 por millón de tokens de entrada y $20,00 por millón de tokens de salida, transferidos sin ningún margen, lo que significa que la tarifa promocional y cualquier futura reversión llegan aquí el mismo día, en lugar de seguir el calendario de migración de alguien. Es compatible con OpenAI en la misma URL base que el resto del catálogo, así que puedes ponerlo detrás de una cadena de conmutación por error o enrutar hacia él de forma condicional en lugar de codificarlo directamente en una ruta de producción.

Fugu Ultra v2 no está enrutado por nosotros. Está disponible desde la propia API compatible con OpenAI de Sakana AI, y las integraciones existentes de Fugu pasan a él con un solo cambio de parámetro. Dado que ambos hablan el mismo formato de solicitud, una evaluación en paralelo es un simple intercambio de URL base en lugar de una reescritura.

¿Cuál, y cuándo?

Elige GPT-5.6 Sol a menos que tengas una razón específica para no hacerlo. Es más barato en todos los niveles — $4.00 / $20.00 frente a los $5.00 / $30.00 reportados — ya ofrece orquestación paralela de subagentes mediante el modo Ultra, cuenta con puntuaciones independientes de Artificial Analysis y la ARC Prize Foundation, y su revisión de precios de contexto largo está documentada por el proveedor en lugar de inferirse de los listados. Sus debilidades son reales: una evaluación METR que se desplomó por reward hacking, una puntuación DeepSWE marginalmente por detrás de la de Fugu Ultra v2, y un precio promocional con vencimiento en noviembre.

Elige Fugu Ultra v2 por exactamente una razón: quieres que su techo de capacidades sea estructuralmente independiente de cualquier proveedor de vanguardia individual, y estás dispuesto a pagar un sobreprecio, aceptar benchmarks no verificados y renunciar a la capacidad de inspeccionar lo que estás llamando. El solapamiento con DeepSWE sugiere que ambos están cerca en trabajo con agentes de codificación, lo que significa que no estás comprando una brecha de capacidades. Estás comprando una póliza de seguro, con un precio de aproximadamente 1,5× en la salida y con un acantilado de 272K idéntico al que intentas escapar.

Si ese seguro vale la pena para ti, la cifra que debes medir antes de comprometerte no es una puntuación de referencia. Es cuánto de tu gasto actual está en manos de un proveedor que podría cambiar tus condiciones el próximo trimestre.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario