
Fugu Ultra v2 vs Kimi K3: dos enrutadores, dos altitudes
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Ambos sistemas son enrutadores, y eso es lo primero que pasa por alto la mayoría de la cobertura. Kimi K3 es un modelo de Mezcla de Expertos de 2,8 billones de parámetros que activa aproximadamente 104 mil millones de parámetros por token, lo que significa que en cada token que genera toma una decisión de enrutamiento, seleccionando 16 de sus 896 expertos para hacer el trabajo. Fugu Ultra v2, anunciado por Sakana AI el 11 de septiembre de 2026, es un enrutador en una altitud completamente distinta: toma una tarea entrante, la descompone y reparte las piezas entre un conjunto de modelos separados. Uno enruta dentro de una pasada hacia adelante; el otro enruta a través de una flota. Entender que son la misma idea a dos escalas es la forma más rápida de ver por qué sus precios difieren en 2× en la entrada y 5× en la salida.
Los dos routers, uno al lado del otro
• Kimi K3 — el buque insignia de Moonshot AI, lanzado a mediados de julio de 2026, con pesos abiertos publicados el 27 de julio de 2026. La arquitectura es inusual incluso para los estándares de 2026: 69 capas de Kimi Delta Attention intercaladas con 24 capas Gated MLA, Attention Residuals, un diseño «Stable LatentMoE» y un codificador de visión MoonViT-V2 de 401M de parámetros. Los pesos se distribuyen en MXFP4 con activaciones MXFP8 bajo entrenamiento consciente de la cuantización. Su API alojada expone el esfuerzo de razonamiento con exactamente un único valor admitido: max.
• Fugu Ultra v2 — el nivel de orquestación de máxima capacidad de Sakana AI, y no un modelo fundacional en el sentido habitual. Es un único endpoint compatible con OpenAI que descompone tareas y las distribuye entre un conjunto de modelos de pesos abiertos y especializados. Sakana afirma que Claude Fable 5, Claude Fable 5.1 y GPT-6 Astra quedan excluidos de ese conjunto, e indica una fecha de corte de entrenamiento de 20260828. No hay una cifra publicada de parámetros, porque no hay parámetros que contar como los habría en K3: la capacidad reside en la política de programación.
La consecuencia es que K3 es un componente y Fugu Ultra v2 es un ensamblaje. Eso hace que esta comparación sea inusual: estos dos no solo son competidores, también son posibles ingredientes. Un modelo como K3 es justo el tipo de sistema de pesos abiertos, contexto largo y llamada a herramientas que un orquestador probablemente alquilaría. Sakana no publica la composición del pool, así que se desconoce si K3 está dentro de Fugu Ultra v2 — pero si lo está, parte de lo que pagas por la tarifa de Fugu son tokens de K3 con un sobreprecio.
Qué es realmente la diferencia de precios
• Entrada — Fugu Ultra v2 a un precio reportado de $5.00 por 1M (listados de terceros; la página del anuncio de Sakana no publica sus propias tarifas) frente a Kimi K3 a $3.00 por 1M, con aciertos de caché a $0.30.
• Salida — Fugu Ultra v2 a un precio reportado de $30.00 por 1M frente a Kimi K3 a $15.00 por 1M. La mitad del precio, por un modelo que también puedes descargar.
• Entrada en caché — Fugu Ultra v2 $0.50 por 1M frente a Kimi K3 $0.30 por 1M en un acierto de caché. En un bucle de agente prolongado con un prompt del sistema estable, esa diferencia se acumula en cada turno.
• Niveles por contexto — Kimi K3 se mantiene uniforme en toda su ventana de 1,048,576 tokens, sin penalización por contexto largo. El nivel reportado de Fugu Ultra v2 por encima de aproximadamente 272,000 tokens de entrada lleva toda la solicitud a alrededor de $10.00 / $45.00.
Esa última fila es la que decide las facturas reales. Una ejecución de agente de horizonte largo pasa la mayor parte de su vida por encima de 272K tokens, que es precisamente donde la tarifa plana de K3 se mantiene plana y la de Fugu Ultra v2 se duplica. Si tu carga de trabajo se parece a eso, la brecha efectiva del lado de la entrada se acerca más a 3,3× que a 1,7×.

El único número que comparten
Ambos proveedores reportan DeepSWE, y la comparación es menos halagadora para Fugu de lo que sugiere el planteamiento de su lanzamiento. Sakana lista Fugu Ultra v2 con 74,3. Moonshot lista Kimi K3 con 67,5 —reportado por el proveedor, según la ficha del modelo. Eso es una diferencia de 6,8 puntos en un benchmark de agentes de codificación, que es real, pero es una prueba de un conjunto publicado mucho más amplio, y es la misma prueba en la que Sakana lidera por 1,6 puntos frente a GPT-5.6 Sol. Un benchmark en el que tres proveedores diferentes se agrupan dentro de siete puntos está midiendo algo real, pero no los está separando de forma decisiva.
Más allá de eso, los dos publican en estanterías completamente diferentes. Las cifras de K3 de Moonshot incluyen Terminal-Bench 2.1 con 88,3, GPQA Diamond con 93,5, HLE-Full con 43,5 (56,0 con herramientas), SWE-Marathon con 42,0, OSWorld-Verified con 84,8 y MCPMark-Verified con 94,5 —todas reportadas por el proveedor, todas en la tarjeta del modelo. Los ocho de Sakana para Fugu Ultra v2 incluyen dos benchmarks internos, SWEFish y Toolathon, que nadie fuera de Sakana puede reproducir.
De manera independiente, solo uno de ellos ha llegado a medirse. Kimi K3 obtiene 44 en el Artificial Analysis Intelligence Index v4.3 —segundo entre los modelos de pesos abiertos, por detrás de GLM-5.3 con 45— y 93,40 % en SWE-bench Verified bajo el arnés agéntico estandarizado de Vals AI, por detrás de Claude Opus 5 y DeepSeek V4 Pro, pero cerca. También lidera la Frontend Code Arena con 1679 Elo, por delante de Fable 5 con 1631 y de GPT-5.6 Sol con 1618. Si has visto K3 citado con 57 o 60, esa es la escala de índice superada y no debería repetirse.
Fugu Ultra v2 no tiene ninguna puntuación independiente de ningún tipo. Se anunció el 11 de septiembre de 2026 y nadie fuera de Sakana lo ha ejecutado.
Velocidad: una medida, otra no
Kimi K3 es lento, y esto se mide, no se afirma: Artificial Analysis registra 37,9 tokens por segundo con un tiempo hasta el primer token de 3,80 segundos, y lo señala como notablemente verboso. Para un modelo concebido en torno a la codificación agéntica de horizonte largo, el rendimiento es una limitación real: un modelo lento en un bucle largo cuesta tiempo de reloj, no solo dinero.
Sakana no publica ninguna cifra de latencia ni de rendimiento para Fugu Ultra v2. En un orquestador, eso es, posiblemente, honestidad más que evasión, porque el tiempo de respuesta depende por completo de qué modelos decida llamar y cuántas pasadas realiza. Pero también significa que no puedes modelar el costo en tiempo real de cambiarte a él sin medirlo tú mismo. Para el anterior Fugu Ultra, los probadores informaron públicamente de ejecuciones que se acercaban a los 30 minutos; ese es el modelo de junio de 2026 y no es evidencia sobre la v2, pero es la cifra que hay que batir cuando hagas tus pruebas comparativas.

Pesos abiertos, con un pero que vale la pena leer
Los pesos de Kimi K3 son descargables, lo que supone una diferencia genuina con respecto al modelo solo alojado de Fugu Ultra v2 — pero la licencia es más restrictiva de lo que suele implicar la expresión "pesos abiertos". K3 se distribuye bajo la Licencia Kimi K3, no bajo una concesión MIT o Apache aprobada por la OSI, y la afirmación ampliamente repetida de que es "MIT modificada" está en disputa. Los términos exigen un acuerdo por separado con Moonshot para empresas de modelo como servicio con ingresos superiores a 20 millones de dólares en cualquier periodo de doce meses consecutivos, además de atribución para productos con más de 100 millones de usuarios mensuales o más de 20 millones de dólares de ingresos mensuales. El uso interno está exento.
Así que el planteamiento honesto es: K3 te da pesos que puedes tener, inspeccionar, ajustar y autoalojar, sujeto a una condición comercial con umbral de ingresos. Fugu Ultra v2 no te da nada de eso —ni pesos, ni conjunto inspeccionable, ni autoalojamiento—, pero tampoco impone ninguna condición de ingresos, porque no hay nada que licenciar. Cuál de esos es más permisivo depende enteramente de si eres el tipo de empresa al que está dirigida la licencia K3.
Una advertencia práctica si se planea autoalojar: el checkpoint de K3 es de aproximadamente 1,5 terabytes y el proveedor recomienda 64 o más aceleradores. «Pesos abiertos» aquí significa una decisión de clúster de inferencia, no una de portátil. Para la mayoría de los equipos, la API es el camino sensato en cualquier caso, y por eso la compatibilidad desde el día cero con vLLM y SGLang importa más que la descarga.
Lo que dice nuestro propio tráfico
Un dato que ninguno de los proveedores publica, y que vale más de lo que parece: en la pasarela OrcaRouter, Kimi K3 es, por un amplio margen, el modelo más utilizado de todos los que se mencionan en este artículo, moviendo aproximadamente 3.270 millones de tokens en los últimos siete días.
Eso no es un benchmark y no resuelve nada sobre la calidad. Pero es una gran muestra de lo que los desarrolladores eligen realmente cuando la decisión no les cuesta nada más que el precio de los tokens, y dice que la combinación de K3 de una ventana de tarifa plana de 1M, pesos abiertos y una fuerte posición en la arena de programación ya ha ganado una cuota sustancial del trabajo agéntico real de contexto largo. Fugu Ultra v2 no tiene una señal comparable, porque se lanzó hoy.

Llegar a cada uno de ellos
Kimi K3 está en OrcaRouter a la tarifa del propio Moonshot — 3,00 $ por millón de tokens de entrada, 0,30 $ en un acierto de caché, 15,00 $ por millón de salida — repercutida sin ningún margen adicional, de modo que un cambio de precio del proveedor llega aquí el mismo día en lugar de según un calendario de migración. Es compatible con OpenAI en la misma URL base que el resto del catálogo y, como se encuentra detrás de la misma puerta de enlace que todo lo demás, puedes incluirlo en una cadena de conmutación por error o dirigirte a él de forma condicional en lugar de codificar de forma rígida un único proveedor en una ruta de producción. Eso importa más de lo habitual en este caso: un modelo de 2,8 T de parámetros servido a 37,9 tokens por segundo es exactamente el tipo de dependencia que conviene tener con un respaldo detrás.
Fugu Ultra v2 no lo enrutamos nosotros. Está disponible en la propia API compatible con OpenAI de Sakana AI, y la compañía afirma que las integraciones existentes de Fugu migran a él con un solo cambio de parámetro. Ambos modelos hablan el mismo formato de solicitud, por lo que una evaluación que los coloque detrás de una misma bandera es un simple cambio de URL base en lugar de una reescritura.
¿Cuál elegir?
Kimi K3 es la compra más defendible para casi cualquier carga de trabajo. Cuesta la mitad que Fugu Ultra v2 tanto en entrada como en salida, con precio plano en una ventana de 1M sin caída en contextos largos, puntuación independiente de 44 en el índice actual de Artificial Analysis, posibilidad de autoalojamiento bajo una licencia condicionada por ingresos y ya es el modelo con más tráfico de esta comparación por un amplio margen. Sus costes son la velocidad y la verbosidad: 37,9 tokens por segundo es realmente lento para bucles agénticos, y la licencia tiene mordiente si eres una gran empresa de modelos como servicio.
Fugu Ultra v2 es la compra si quieres la propiedad específica que vende Sakana: un nivel de capacidad que descompone trabajo complejo de varios pasos en un pool que excluye estructuralmente a los proveedores de frontera, de modo que ningún modelo upstream pueda ser revocado, cambiado de precio o cortado bajo tus pies. Su ventaja en DeepSWE sobre K3 es real y está reportada por el proveedor; su puesto entre los dos primeros en siete de ocho benchmarks también está reportado por el proveedor, y en pruebas que, en parte, no existen en ningún otro lugar.
Lo que hay que notar es que ambas son decisiones de enrutamiento, y se te pide que elijas una altitud. K3 enruta tokens a expertos dentro de un modelo que puedes descargar y controlar. Fugu Ultra v2 enruta tareas a modelos que no puedes ver. La segunda es una idea más grande y más poderosa. También es la única que solo puedes aceptar por fe — y aceptar esa fe cuesta cinco veces más por token.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
