
Claude Fable 5.1 vs Kimi K3: El techo del razonamiento vs el techo que puedes poseer
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencia49Código
Claude Fable 5.1 y Kimi K3 apuntan al mismo comprador — equipos que ejecutan agentes de larga duración que utilizan herramientas sobre grandes bases de código y conjuntos de documentos — y llegan desde extremos opuestos del mercado. Claude Fable 5.1 es el modelo insignia cerrado de Anthropic, lanzado el 1 de septiembre de 2026, con un precio de $10.00 por millón de tokens de entrada y $50.00 por millón de tokens de salida, y medido por Artificial Analysis en 53 en su Índice de Inteligencia actual: primero de los 201 modelos que rastrea ese índice. Kimi K3, el modelo de mezcla de expertos de 2,8 billones de parámetros de Moonshot AI, abrió sus pesos el 27 de julio y se sitúa en 44 en el mismo índice — segundo de los 112 modelos de pesos abiertos en su clase —. La lectura obvia es una brecha de inteligencia de nueve puntos frente a una brecha de precio aproximadamente triple. La lectura más útil es que los dos modelos tienen diferentes máximos, y solo uno de esos máximos puede ser aumentado por la persona que lo utiliza.
Sobre las fuentes: Artificial Analysis recalculó su Intelligence Index en septiembre, por lo que las puntuaciones, clasificaciones, velocidades y cifras de costo por tarea que figuran aquí provienen de la versión actual, capturada el 10 de septiembre de 2026, y no son comparables con los números publicados en el lanzamiento de ninguno de los dos modelos. Los resultados de las pruebas propias de Moonshot y los de Anthropic están etiquetados donde aparecen, y ninguno ha sido reproducido por el otro laboratorio. Claude Fable 5.1 tiene nueve días de antigüedad, por lo que sus afirmaciones de proveedor apenas han recibido pruebas externas; Kimi K3 ha tenido seis semanas de ellas.
Misma ventana, diferentes máximos.
Ambos modelos tienen una ventana de contexto de 1,048,576 tokens, y ninguno cobra un recargo por llenarla: Moonshot ofrece Kimi K3 a un precio fijo de $3.00 / $0.30 en caché / $15.00 por millón, y Claude Fable 5.1 fija su ventana en $10.00 / $0.25 en caché / $50.00. Esa ventana compartida es la razón por la que estos dos se comparan: están diseñados para el mismo tipo de trabajo, donde una sola tarea acumula un repositorio, una sala de datos o una semana de resultados de herramientas.
La divergencia está en el otro extremo de la tubería. Kimi K3 puede emitir hasta 1.048.576 tokens en una sola respuesta: los proveedores suelen limitarla a 131.072, pero el techo es un millón completo, comercializado por Moonshot como "una sola llamada puede emitir un codebase". Claude Fable 5.1 limita una respuesta a 128K tokens de salida. Para un turno de chat ese límite es irrelevante. Para la generación de un repositorio completo, una migración masiva o un conjunto extenso de documentos, es la diferencia entre una llamada y un bucle de agente que tienes que construir, supervisar y pagar turno a turno.
Los números, dimensión por dimensión
• Precio por 1M de tokens — Claude Fable 5.1 $10.00 entrada / $50.00 salida vs Kimi K3 $3.00 entrada / $15.00 salida.
• Entrada en caché — Claude Fable 5.1 $0.25 por 1M vs Kimi K3 $0.30, lo que Artificial Analysis convierte en un descuento efectivo de caché del 98% frente al 90%.
• Puntuación independiente, velocidad y costo: Claude Fable 5.1 se sitúa en 53 en el Intelligence Index actual (#1 de 201) a 67.2 tokens de salida por segundo y $7.63 por tarea de índice; Kimi K3 se sitúa en 44 (#2 de 112 modelos de pesos abiertos) a 35.5 tokens por segundo y $2.00 por tarea, y el índice lo señala como notablemente lento y algo verboso: 160M de tokens de salida por ejecución de índice, frente a los 190M del modelo Claude.
• Límite de contexto y salida: 1M de tokens de entrada y hasta 128K de salida frente a 1M de tokens de entrada y hasta 1M de salida.
• Pesos — {{1}}cerrado, solo API frente a abierto y auto-alojable, publicado por Moonshot como la licencia Kimi K3, una variante modificada del MIT con términos comerciales para revendedores muy grandes, con pesos en Hugging Face.{{/1}}
• Visión — Claude Fable 5.1 acepta texto, imágenes y archivos como entrada en la API; Kimi K3 acepta texto e imágenes en la API, pero la visión nativa es una funcionalidad de la capa de servicio y no forma parte de los pesos publicados.
• Visibilidad del razonamiento — Kimi K3 transmite sus trazas de razonamiento en la API; Claude Fable 5.1 devuelve bloques de pensamiento cuya visualización eliges tú, resumidos u omitidos, con la cadena de pensamiento cruda nunca expuesta.
• Arquitectura — el número de parámetros de Claude Fable 5.1 no se ha revelado; Kimi K3 es una mezcla dispersa de expertos con 2,8 billones de parámetros en total y aproximadamente 104 mil millones activos.
• Lanzado — Claude Fable 5.1 el 1 de septiembre de 2026; la API de Kimi K3 el 16 de julio de 2026, con pesos abiertos el 27 de julio.

Qué es la brecha de nueve puntos, y qué no es
En el índice actual, Claude Fable 5.1 lidera con 53 y Kimi K3 es segundo, solo por detrás del resto del campo de pesos abiertos, con 44. Nueve puntos son una separación real y no es ruido, pero el índice es un compuesto —trabajo agéntico, codificación, razonamiento científico y capacidad general, ponderados— y un solo número oculta los lugares donde el modelo abierto es genuinamente fuerte. A principios de septiembre, en lecturas independientes, Kimi K3 se situaba en la cima o cerca de ella del campo abierto en trabajo agéntico de horizonte largo: primero en AutomationBench, segundo en la suite agéntica Briefcase de Artificial Analysis y tercero en GDPval-AA v2 entre los modelos probados. Datos independientes de arena sitúan su habilidad de desarrollo web en aproximadamente 1.679 Elo en el tablero Web Dev de Code Arena, cerca de la cima de ese campo hasta principios de septiembre. Esas son las cargas de trabajo donde el modelo abierto no está nueve puntos por detrás.
Donde Claude Fable 5.1 se desmarca es en el techo del razonamiento complejo. Anthropic reporta un 52,6 % en Terminal-Bench-Science 0.1, más del doble que el 24,7 % de la generación anterior de Claude, y un 55,8 % en Terminal-Bench 4.0 — ambas cifras reportadas por el proveedor y sin reproducir. Esas son las cifras detrás de la afirmación de que el lanzamiento de septiembre elevó el listón para el trabajo científico y de horizonte largo. El resumen honesto es que Kimi K3 es competitivo en amplitud agéntica y desarrollo web, y el modelo cerrado va por delante donde el razonamiento es más profundo; una brecha de nueve puntos en un solo índice comprime ambos hechos en una sola línea.
Un dato merece una mención aparte porque es inusual: la propia cifra de Moonshot en Terminal-Bench 2.1 para Kimi K3 es del 88.3%, frente a una lectura independiente del 85.0%. Las cifras de los proveedores que sobreviven casi intactas a una medición neutral son raras, y una brecha tan pequeña, a favor del proveedor, dice más sobre el modelo que cualquier puntuación individual de un índice.

La bifurcación de propiedad, costeada honestamente.
Los pesos abiertos son la razón para preferir Kimi K3, y también son la razón para leer la letra pequeña. Kimi K3 es un modelo de mezcla dispersa de expertos con 2,8 billones de parámetros; ejecutarlo por tu cuenta implica un clúster de GPU multinodo, no una tarde con una estación de trabajo, y la licencia de Kimi K3 incluye una restricción comercial dirigida a revendedores muy grandes. Lo que compras con esa infraestructura es real: sin límites de tasa, sin medidor por token, ajuste fino con tus propios datos, auditabilidad completa y prompts que nunca salen de tu red — los requisitos que hacen que una API cerrada sea inviable en trabajos regulados y relacionados con la defensa.
Hay dos advertencias al respecto. El autoalojamiento pierde la visión nativa de la API, ya que la entrada de imágenes es una característica de la capa de servicio y no algo incluido en los pesos publicados; y el modelo es lento, medido en 35.5 tokens de salida por segundo en el índice actual — consecuencia natural de una mezcla de expertos de 2.8 billones de parámetros con razonamiento siempre activo. En una generación de 20,000 tokens, eso supone minutos de generación, y en tu propio clúster son minutos de tus propias GPUs.
{{1}}Las versiones alquiladas están más cerca de lo que implica la cuestión de la propiedad. Kimi K3 en la API de Moonshot cuesta $3.00 / $15.00 con $0.30 de entrada en caché, {{2}}aproximadamente un tercio de{{/2}} las tarifas por token de {{3}}Claude Fable 5.1{{/3}}, mientras que el lado de Claude {{4}}redujo su precio de lectura de caché un 75% en septiembre — a $0.25 por millón, por debajo del de Kimi —{{/4}} {{5}}lo cual importa para{{/5}} exactamente las largas sesiones agénticas a las que apuntan ambos modelos, donde la misma salida de herramienta se relee {{6}}docenas de veces{{/6}}. En la medida independiente de costo por tarea, la brecha se sitúa en {{7}}$2.00 para Kimi K3{{/7}} frente a $7.63 para Claude Fable 5.1: un factor de casi cuatro, no el factor de tres que sugieren los precios por token, porque el modelo de Anthropic escribe aproximadamente 190M tokens frente a los 160M de Kimi para el mismo trabajo de indexación.{{/1}}
Razonamiento que puedes ver
Hay una diferencia en la experiencia del desarrollador {{1}} que no aparece en ninguna tabla de benchmarks{{/1}}. Kimi K3 transmite sus trazas de razonamiento a través de la API, lo que convierte un paso fallido del agente en algo que puedes leer en lugar de algo que tienes que inferir. Claude Fable 5.1 toma el enfoque opuesto: el razonamiento siempre está activo{{2}}, la cadena de pensamiento cruda nunca se devuelve, y la configuración de pantalla decide solo si recibes un resumen legible o {{3}} nada en absoluto{{/3}}. Los resúmenes bastan para la mayoría de los registros de producción; las trazas son mejores para depurar a un agente que se sigue equivocando de rama. Si estás construyendo infraestructura de agentes en lugar de consumirla, esa diferencia se nota en horas.
La nota al pie de la contratación
Para las empresas estadounidenses, una variable no técnica se suma a esta comparación. Moonshot AI es un laboratorio con sede en Pekín que ha sido objeto de escrutinio por parte del gobierno de EE. UU.: el Secretario del Tesoro ha amenazado públicamente con incluir a la empresa en una lista negra comercial, funcionarios estadounidenses han alegado que destiló capacidades de modelos estadounidenses — una acusación que Moonshot niega — y los reportajes de prensa describen conversaciones en fase inicial con Microsoft, Amazon y Google para alojar Kimi K3 en condiciones de reparto de ingresos, junto con una presentación confidencial de OPV en Hong Kong a principios de septiembre. Nada de eso cambia la comparación técnica, y un despliegue de pesos abiertos alojado en EE. UU. dentro de su propia infraestructura es sustancialmente diferente de enrutar consultas a una API en el extranjero. Eso sí significa que una decisión de adquisición sobre Kimi K3 es una decisión con una dimensión política, y deberían tomarla personas que lo sepan.
Hacer la comparación en lugar de discutir sobre ello.
Ambos modelos están disponibles en OrcaRouter a los precios de lista de sus proveedores sin recargo, lo que hace que esta sea una comparación que puedes zanjar con tus propios datos en lugar de una tabla de benchmarks: Kimi K3 a $3.00 / $15.00 de Moonshot, Claude Fable 5.1 a $10.00 / $50.00 de Anthropic, con una sola clave y una sola factura, sin necesidad de firmar un segundo contrato y sin cambios de código para cambiar de uno a otro. Aplica el mismo banco de pruebas a ambos, mide el costo por tarea completada con tus cargas de trabajo reales y deja que la conmutación automática por error mantenga la ruta de producción mientras un modelo candidato aún se está evaluando. Si la carga de trabajo es razonamiento profundo o vive dentro de Claude Code, el modelo insignia cerrado suele ganar; si es generación de alto volumen donde una salida de un millón de tokens o un despliegue autoalojado cambia la economía, Kimi K3 es el único de los dos que se puede poseer, y la capa de enrutamiento es donde mantienes ambas opciones abiertas.

Lo que hay que observar a continuación es simétrico. Anthropic ha estado lanzando versiones con una cadencia aproximadamente mensual y ahora ha demostrado que recortará los precios de caché sin tocar las tarifas anunciadas, por lo que el lado del costo de este duelo puede moverse sin un modelo nuevo. El propio futuro de Moonshot ahora está ligado a su cotización y a esas conversaciones sobre la nube en EE. UU., cualquiera de las cuales podría cambiar cómo — y dónde — se sirve Kimi K3. Ninguna es razón para esperar: ambos modelos hacen hoy lo que dicen las cifras anteriores, y la decisión que mejor envejece es la que mantiene el ID del modelo como un valor de configuración en lugar de una reescritura.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
