Una tarjeta de título principal que dice 'Fugu Max vs Kimi K3' con el subtítulo 'Sakana eligió esta vara de medir', tres insignias tipo píldora que dicen '$6.00 vs $15.00 de salida', '60 % por debajo, en salida' y '1M fijo vs ventana no publicada', una línea de pie de página que dice 'Sakana AI, septiembre de 2026 vs Moonshot AI, julio de 2026', y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Fugu Max vs Kimi K3: Sakana eligió esta vara de medir, así que vamos a leerla

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El anuncio de Sakana AI sobre Fugu Max nombra exactamente tres modelos para justificar su precio, y Kimi K3 de Moonshot AI es uno de ellos. La afirmación es que la tarifa de salida de Fugu Max es entre un 40 y un 60 por ciento inferior a la de esos tres, lo que convierte a Kimi K3 —no a Grok 4.6, no a Qwen3.8-Max— en la referencia que la propia Sakana eligió para medir el valor. Eso es algo inusualmente generoso para un proveedor: te entrega una vara de medir y te dice dónde sostenerla. Así que esta página hace lo obvio y la sostiene. Fugu Max se lanzó el 11 de septiembre de 2026 a $2.00 por millón de tokens de entrada y $6.00 por millón de tokens de salida. Kimi K3 tiene un precio de lista de $3.00 y $15.00. La afirmación del 60 por ciento sobre la salida es aritméticamente correcta. Lo que la frase no menciona es que el modelo al que le está bajando el precio publica un registro completo de resultados medidos de forma independiente, y el modelo que está bajando el precio no publica ninguno.

La oración del 40 al 60 por ciento, examinada

• Entrada — Fugu Max $2.00 por 1M de tokens frente a Kimi K3 $3.00 por 1M de tokens, un ahorro del 33 por ciento en lugar del 40 al 60 por ciento que encabeza el comunicado

• Salida — Fugu Max $6.00 por 1M tokens vs Kimi K3 $15.00 por 1M tokens, que está un 60 por ciento por debajo, el tope del rango declarado por Sakana

• Entrada en caché — Fugu Max $0.25 por 1M de tokens frente a Kimi K3 $0.30 por 1M de tokens, una diferencia lo bastante pequeña como para que los bucles con uso intensivo de caché no la noten

• Ventana de contexto — Fugu Max: no se publicó ninguna cifra en el lanzamiento frente a Kimi K3: 1,048,576 tokens

• Reajuste de precios para prompts largos — Fugu Max no indica ningún tramo, frente a Kimi K3 con tarifa plana en toda la ventana y sin recargo a ninguna longitud

• Despliegue — solo mediante API del proveedor Fugu Max, pertenencia al pool no divulgada, frente a pesos descargables de Kimi K3 bajo la Licencia Kimi K3

• Evaluación independiente — Fugu Max: ninguna, y no existe ninguna página de Artificial Analysis para ningún modelo Fugu; mientras que Kimi K3 tiene un Artificial Analysis Intelligence Index de 44 y un 93,40 % estandarizado en SWE-bench Verified de Vals AI

Fíjate en la forma de esa primera fila. El rango del titular, del 40 al 60 por ciento, es el rango entre tres competidores nombrados, y Kimi K3 es el que produce el 60. Si se atiende solo a la entrada, la comparación es del 33 por ciento, que sigue siendo un ahorro real, pero es una frase distinta. Esto no es una crítica a los precios —$2.00 y $6.00 son cifras genuinamente bajas para un sistema que afirma obtener resultados cercanos a la frontera—. Es una observación sobre qué cifra del comunicado es la que persuade y sobre cómo el párrafo se organiza en torno a ella.

Kimi K3 está en nuestro catálogo a la propia tarifa de Moonshot — 3,00 $ por millón de tokens de entrada, 0,30 $ por acierto de caché, 15,00 $ por millón de tokens de salida — trasladado con un 0 % de margen, así que si Moonshot cambia sus precios la nueva tarifa está activa con la misma clave el mismo día en lugar de en un ciclo de migración. Eso importa más aquí que de costumbre, porque una rebaja de precios en origen es precisamente lo que erosiona o amplía la brecha del 60 por ciento en la que se basa toda esta comparativa.

Lo que publica el criterio

El registro de Kimi K3 es lo contrario de escaso. La propia ficha de modelo de Moonshot reporta Terminal-Bench 2.1 en 88.3, GPQA Diamond en 93.5, HLE-Full en 43.5 que sube a 56.0 con herramientas, SWE-Marathon en 42.0, OSWorld-Verified en 84.8, MCPMark-Verified en 94.5 y DeepSWE en 67.5. Todo reportado por el proveedor, y hay mucho de ello.

La capa independiente también existe, que es la parte que importa para esta comparación. Artificial Analysis puntúa a Kimi K3 con 44 en el v4.3 Intelligence Index —segundo entre los modelos de pesos abiertos, por detrás de GLM-5.3 con 45— con un rendimiento registrado de 37,9 tokens de salida por segundo y un tiempo hasta el primer token de 3,80 segundos. El arnés agéntico estandarizado de Vals AI lo sitúa en el 93,40 % en SWE-bench Verified, por detrás de Claude Opus 5 y DeepSeek V4 Pro, pero cerca. También lidera el Frontend Code Arena con 1679 Elo, por delante de Claude Fable 5 con 1631 y GPT-5.6 Sol con 1618. Una advertencia: si has visto a Kimi K3 citado con 57 o 60 en el Intelligence Index, esas son cifras previas a la reformulación, de antes de que Artificial Analysis recalibrara la escala en septiembre de 2026, y no deberían repetirse junto con las cifras actuales.

También hay una señal de uso, y proviene de nuestra propia pasarela, no del marketing de nadie: Kimi K3 movió aproximadamente 3270 millones de tokens a través de OrcaRouter en los últimos siete días, el tráfico más intenso de cualquier modelo en esta comparación. Eso no es una medida de calidad. Es una gran muestra de lo que los desarrolladores eligen cuando el único costo de elegir es el precio por token, y dice que la ventana plana de 1M y los pesos abiertos ya se han ganado una parte sustancial del trabajo real de horizonte largo.

A two-column scoreboard titled 'Fugu Max vs Kimi K3 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Kimi K3: output price $15.00 per 1M, input price $3.00 per 1M, cached input $0.30 per 1M, context 1M flat with no surcharge, benchmarks Terminal-Bench 2.1 at 88.3, evidence Artificial Analysis Index 44 and SWE-bench Verified 93.40%. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Kimi K3 rows Moonshot-reported and per Artificial Analysis and Vals AI.' OrcaRouter logo bottom-right.

El marcador que no tiene números en él

Sakana informa que Fugu Max obtiene la mejor puntuación general en seis benchmarks: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench y SWEFish. También afirma que Max amplía la frontera de Pareto de costo-rendimiento en siete de diez benchmarks. Ambas son afirmaciones sobre el puesto en un gráfico. Ninguna viene acompañada de un valor, un margen ni la cifra de un competidor al lado.

Las dos listas apenas se tocan, que es el problema práctico. Kimi K3 reporta Terminal-Bench 2.1 con 88,3; Sakana dice que Fugu Max obtiene el mejor resultado general en Terminal Bench 2.1 y no publica nada con lo que compararlo. Esa única fila es la ilustración más clara de todo el enfrentamiento: ambos proveedores nombran la misma prueba, uno publica un número y el otro publica la palabra «mejor». Hasta que Sakana publique la cifra, ninguna evidencia publicada responde si Fugu Max supera a Kimi K3 en el benchmark que Sakana eligió para encabezar.

Hay una lectura justa del lanzamiento que vale la pena señalar. Fugu Max es el nivel de costo —lanzado el mismo día que Fugu Ultra v2, que es el avance en capacidades a $5.00 de entrada y $30.00 de salida—, y su argumento se traza sobre un gráfico de Pareto donde la puntuación por dólar, no la puntuación, es lo que se sostiene. Bajo ese planteamiento, una cifra de benchmark sin más sería la estadística menos honesta. El problema es que el lanzamiento también omite el denominador: la propia cobertura de Sakana admite que cambiar de modelo a mitad de tarea puede reducir la reutilización de la caché de contexto y generar tokens de orquestación adicionales, y confirma que la compañía no reveló la tasa de aciertos de caché de Max ni su costo total de tokens por tarea. Así que la única medición que resolvería un argumento sobre el nivel de costo es la que no se proporciona.

Pesas que puedes sostener, o una piscina que no puedes ver

Aquí es donde los dos productos dejan de ser comparables en absoluto.

Kimi K3 incluye pesos descargables, lo que constituye una auténtica vía de escape: si los precios o los términos cambian, el modelo puede servirse desde tu propia infraestructura. La licencia es más restrictiva de lo que "pesos abiertos" suele implicar. Es la Licencia Kimi K3 en lugar de una concesión aprobada por la OSI, y la descripción que se repite con frecuencia de que es una MIT modificada está en disputa. Los términos requieren un acuerdo por separado con Moonshot para empresas de modelo como servicio con ingresos superiores a $20M durante cualquier período de doce meses consecutivos, además de atribución para productos con más de 100M de usuarios mensuales o $20M de ingresos mensuales, quedando exento el uso interno. Y la escala práctica es real: el checkpoint es de aproximadamente 1.5 terabytes y Moonshot recomienda 64 o más aceleradores, por lo que el autoalojamiento es una decisión de clúster de inferencia y no de portátil.

Fugu Max no ofrece nada de eso —ni pesos, ni un pool inspeccionable, ni opción de autoalojamiento— y, a cambio, no impone ninguna condición de licencia, porque no hay nada que licenciar. El beneficio que Sakana declara es el inverso del control: un pool que abarca modelos de pesos abiertos y especializados, ampliado para Max con la familia NVIDIA Nemotron, significa que ni la descontinuación ni el cambio de precios de un solo proveedor upstream pueden tumbar tu producto. Eso es una cobertura real. También es algo que no se puede verificar desde fuera, porque la composición de sus miembros no se publica deliberadamente, y significa que un resultado de Fugu Max lleva una fecha de caducidad que un resultado de Kimi K3 no tiene.

Los pesos abiertos y un conjunto no revelado son dos respuestas distintas al mismo miedo. Una dice que puedes irte. La otra dice que no hay nada que dejar.

Donde la ventana plana lo decide

El contexto de 1.048.576 tokens de Kimi K3 es plano: ni nivel de contexto largo ni recargo a ninguna longitud. El lanzamiento de Fugu Max no declara ventana alguna, así que no hay nada con qué compararlo ni contra qué planificar. Para la programación agéntica de horizonte largo a la que apuntan ambos productos, en la que las sesiones pasan la mayor parte de su vida en lo más profundo del contexto, esa asimetría importa más que la tabla de tarifas.

La velocidad es la imagen especular del mismo problema. Los 37,9 tokens por segundo de Kimi K3 con un tiempo hasta el primer token de 3,80 segundos están medidos, y es lento — genuinamente una limitación para un modelo construido en torno a bucles largos, y Artificial Analysis lo señala como notablemente verboso. Sakana no publica ninguna cifra de latencia ni de rendimiento para Fugu Max, lo cual, para un orquestador, podría decirse que es honesto más que evasivo: el tiempo de respuesta depende de qué modelos elija y cuántas pasadas haga. Pero significa que no puedes modelar el coste en tiempo real de cambiar sin medirlo tú mismo. Para el anterior Fugu Ultra, los usuarios informaron públicamente de ejecuciones que se acercaban a los 30 minutos. Ese es el modelo de junio de 2026 y no una evidencia sobre Max, pero es la cifra que hay que superar cuando hagas tus pruebas de referencia.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the opening argument about the two-dimensional frontier of capability against cost and the statement that Fugu Max expands the Pareto efficiency frontier by orchestrating Sakana's largest pool of open and specialized models to date.

El veredicto, en los propios términos de Sakana

Sakana eligió Kimi K3 como uno de los tres modelos frente a los que Fugu Max ofrece un precio inferior, y en la tarifa de salida la afirmación se sostiene: $6.00 frente a $15.00 es un 60 % menos, exactamente el extremo superior del rango indicado. Si se toma el comunicado al pie de la letra, Fugu Max es el producto más barato.

Ahora aplica el criterio que el lanzamiento evitó. Kimi K3 es un 33 por ciento más caro en entrada y un 150 por ciento más caro en salida — y por ese dinero te ofrece una ventana de 1M de tokens sin acantilado de reajuste de precios, un checkpoint descargable bajo una licencia condicionada por ingresos, un puesto independiente de 44 en el Intelligence Index, una puntuación estandarizada de 93.40% en SWE-bench Verified, el primer puesto en el Frontend Code Arena, y el mayor tráfico real de cualquier modelo en esta comparación. Fugu Max te ofrece una tarifa más baja en ambos lados del token, seis victorias no cuantificadas en benchmarks, una tasa de caché de la mitad de la de K3 y sin tasa de aciertos publicada, y un conjunto que no puedes inspeccionar.

La conclusión honesta es que Sakana eligió una vara de medir que la favorece en precio y no te dio nada que comprobar en capacidad. Si tu carga de trabajo es de gran volumen y tus tareas son del tipo que un coordinador puede descomponer de forma fiable, la diferencia de tarifas es dinero real y Fugu Max merece un piloto acotado con la contabilidad de tokens activada desde la primera solicitud. Si necesitas una decisión de producción que puedas defender este trimestre —una ventana con la que puedas planificar, una puntuación que puedas señalar y un modelo que aún podrías ejecutar si el proveedor desapareciera—, Kimi K3 es la respuesta, y está en OrcaRouter al precio de lista de Moonshot, con la tarifa del proveedor transferida sin cambios.

A screenshot of the OrcaRouter model page for Kimi K3 (English UI, captured September 11, 2026), showing the Featured badge, the identifier kimi/kimi-k3, by MoonshotAI dated 2026-07-15, vision, tools, JSON and reasoning capability tags, a 2.8-trillion-parameter Mixture-of-Experts description, a 1M-token context window with text and image input, list pricing of $3.00 per 1M input tokens and $15.00 per 1M output tokens, traffic of 3,274.3 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.