
GPT-6 Luna vs Kimi K3: cuatro veces el rendimiento, un treintavo del precio, una excepción real
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dos modelos, ambos lanzados en los últimos tres meses, ambos posicionados como el nivel barato de una familia de frontera, y ambos equivocados acerca de lo que significa «nivel barato» de la misma manera, que no lo están en absoluto. Kimi K3 es el buque insignia de pesos abiertos de Moonshot AI, público bajo una licencia MIT modificada desde el 27 de julio de 2026, con un precio de $3.00 por millón de tokens de entrada y $15.00 por millón de salida, con lecturas de caché a $0.30. GPT-6 Luna es el nivel de volumen del proveedor, disponible de forma general desde el 22 de septiembre de 2026 a $0.10 y $0.50, con lecturas de caché a un centavo. Treinta veces en la entrada, treinta veces en la salida, y una licencia de un lado que el otro no puede ofrecer a ningún precio.
La tarifa no es lo que decide este emparejamiento, sin embargo, porque no está lo bastante cerca como para necesitar que se decida. Lo que lo decide es un número que ningún proveedor pone en un titular: la velocidad de salida medida. Kimi K3 genera 38,7 tokens por segundo. GPT-6 Luna genera 153,9. Eso es una brecha de cuatro veces, y para cualquier carga de trabajo donde el modelo es un componente dentro de un bucle en lugar de un endpoint con el que habla una persona, una diferencia de rendimiento de cuatro veces cambia la arquitectura en lugar de la factura.
Qué son en realidad estos dos
Kimi K3 es un modelo de mezcla de expertos de 2,8 billones de parámetros con 104 mil millones de parámetros activos por token, una ventana de contexto de 1.048.576 tokens, un límite de salida de 1.048.576 tokens y pesos publicados en Hugging Face bajo una licencia MIT modificada. Es el modelo de pesos abiertos con la puntuación más alta en la tabla independiente —el primero entre 112 modelos de pesos abiertos— y ocupa la primera posición en la tabla de clasificación WebDev de Code Arena con 1.679 Elo. Moonshot informa de un 88,3 % en Terminal-Bench 2.0, que es una cifra del proveedor y no ha sido reproducida de forma independiente.
GPT-6 Luna es el nivel pequeño de la generación GPT-6 de OpenAI, situado por debajo de GPT-6 Sol a $2.00/$10.00 y muy por debajo del buque insignia GPT-6 Astra a $10.00/$50.00. Entrada de texto e imagen, salida de texto, una ventana de 1.050.000 tokens con un máximo de entrada de 922.000 y un techo de salida de 128.000 tokens, y un esfuerzo de razonamiento seleccionable entre none, low, medium, high, xhigh y max, con medium como valor predeterminado. Es cerrado, de identificador único y está disponible para cualquiera que tenga una clave de API.
Uno es una descarga. Uno es un endpoint. Ambos tienen un precio pensado para el volumen. Esa es la forma de la comparación.
Las tarjetas, línea por línea
Una línea por dimensión, ambos lados en cada una:
• Entrada por 1M — GPT-6 Luna $0.10 vs Kimi K3 $3.00
• Salida por 1M — GPT-6 Luna $0.50 vs Kimi K3 $15.00
• Entrada en caché por 1M — GPT-6 Luna $0.01 frente a Kimi K3 $0.30, una décima parte de su propia tarifa de entrada en ambas tarjetas
• Cláusula de contexto largo — GPT-6 Luna duplica la entrada y la caché y eleva la salida 1,5× por encima de 272.000 tokens de entrada, aplicada a toda la solicitud, mientras que Kimi K3 no tiene ninguna cláusula equivalente publicada en su ficha.
• Ventana de contexto: GPT-6 Luna 1.050.000 tokens con 922.000 de entrada máxima frente a Kimi K3 1.048.576 tokens
• Salida máxima — GPT-6 Luna 128.000 tokens vs Kimi K3 1.048.576 tokens, ocho veces el techo
• Índice de Inteligencia, independiente — GPT-6 Luna 37 con el máximo esfuerzo vs Kimi K3 44 con el máximo esfuerzo, misma revisión del índice
• Puntuación de esfuerzo predeterminado — GPT-6 Luna 29 en su configuración media predeterminada frente a Kimi K3 medido en su configuración máxima
• Coste por tarea de Index, independiente — GPT-6 Luna unos $0.07 frente a Kimi K3 $2.00
• Tokens de salida en la ejecución del índice — GPT-6 Luna 150M vs Kimi K3 160M, frente a una mediana del tablero de 88M; ambos son mucho más verbosos que el modelo mediano del tablero
• Velocidad de salida, independiente — GPT-6 Luna 153,9 tokens/seg vs Kimi K3 38,7 tokens/seg
• Pesos — GPT-6 Luna cerrado, solo mediante API, frente a Kimi K3 público en Hugging Face desde el 27 de julio de 2026
• Licencia — GPT-6 Luna no aplicable frente a Kimi K3 Modified MIT, que no es el mismo instrumento que MIT
• Parámetros totales — GPT-6 Luna no divulgados frente a Kimi K3: 2,8 billones, de los cuales 104.000 millones están activos por token
• Evidencia destacada — llamada a herramientas y bucles agénticos de GPT-6 Luna a una décima de centavo por cada mil tokens de entrada en caché frente a Kimi K3 Code Arena WebDev #1 con 1.679 Elo, Terminal-Bench 2.0 88,3 % según el proveedor, la mejor puntuación de pesos abiertos en la clasificación independiente
• En OrcaRouter — GPT-6 Luna no está en nuestro catálogo frente a Kimi K3, enrutable al precio de lista de Moonshot

El throughput es la especificación que nadie destaca en los titulares.
Un modelo de 38,7 tokens por segundo y un modelo de 153,9 tokens por segundo no son el mismo producto con distintas etiquetas de precio. Son productos diferentes.
Toma una tarea en la que el modelo tenga que producir una respuesta de 1,500 tokens — un resumen, una extracción estructurada, un parche de código con su explicación. A 153.9 tokens por segundo, esa respuesta tarda unos diez segundos. A 38.7, tarda unos treinta y nueve. Ninguna de las cifras incluye el tiempo de razonamiento ni la latencia de red, así que la brecha en el mundo real es mayor que cuatro veces en proporción, no menor.
Ahora ponlo en un bucle. Un agente que realiza treinta llamadas al modelo para completar una tarea —planificar, seleccionar una herramienta, leer el resultado, decidir el siguiente paso, repetir— produce quizá 15.000 tokens de salida a lo largo de esas llamadas. GPT-6 Luna tarda aproximadamente 97 segundos en generar. Kimi K3 tarda aproximadamente 388. Esa es la diferencia entre una tarea que un usuario espera y una tarea que un usuario programa, y por mucha permisividad de licencias que haya, eso no cambia.
La verbosidad agrava el problema de velocidad en lugar de compensarlo. Kimi K3 generó 160 millones de tokens de salida al completar el índice independiente, frente a los 150 millones de GPT-6 Luna, de modo que en esa evaluación el modelo más lento también producía algo más de tokens, no menos. Los dos modelos son igual de verbosos; simplemente no son igual de rápidos, y en una tarjeta de precios basada en la salida, ser verboso cuesta caro por partida doble.
Vale la pena decir con claridad que esto no es un defecto de Kimi K3. Un modelo de 2,8 billones de parámetros con 104 mil millones activos hace más trabajo por token que un modelo de gama pequeña, y la cifra de rendimiento es una medición de ese trabajo. La pregunta relevante es si tu carga de trabajo necesita ese trabajo. Si la necesita, 38,7 tokens por segundo es el precio de la capacidad. Si no la necesita, estás pagando por una deliberación que no pediste, treinta veces más.
Dónde se encuentran los siete puntos de K3
Kimi K3 obtiene 44 en el Intelligence Index independiente con el máximo esfuerzo. GPT-6 Luna obtiene 37 con la misma configuración. Siete puntos, en un compuesto donde un punto queda dentro del ruido de una repetición — y ambos están separados por unas veintiocho veces en coste por tarea completada, $2.00 frente a unos $0.07.
Esos siete puntos no están distribuidos de manera uniforme. La reputación de Kimi K3 se concentra en la programación y en el trabajo de software agéntico, y es la razón por la que el modelo existe: la tabla de clasificación WebDev de Code Arena lo sitúa en primer lugar con 1.679 de Elo, y la cifra de 88,3 % del Terminal-Bench 2.0 del proveedor es una medición de agente de programación. La propia posición de GPT-6 Luna en programación es un paso atrás en lugar de un paso adelante —su Coding Agent Index se sitúa en 41, dos puntos por debajo del GPT-5.6 Luna al que reemplazó, con los descensos concentrados en SWE-Atlas-QnA y DeepSWE v1.1. Si tu trabajo es un agente que escribe software contra un repositorio real, eso es una brecha de siete puntos en el índice y una regresión generacional de dos puntos que apuntan en la misma dirección, y el argumento a favor de la gama barata se debilita considerablemente.
Donde no están los siete puntos es la clase de trabajo para la que GPT-6 Luna está tarifado. Clasificación, extracción, enrutamiento, resumen masivo, el bucle interno de un agente que necesita un sí o no rápido — en esas tareas, los dos modelos producirán el mismo resultado utilizable la gran mayoría de las veces, y la diferencia no sobrevivirá al contacto con tu propio conjunto de evaluación. El índice mide un compuesto que pondera fuertemente el razonamiento de largo horizonte y la programación, y ninguna de esas cosas es lo que requiere una decisión de enrutamiento.
Una advertencia que conviene añadir a las cifras del índice en ambos lados: esta tabla de clasificación es una evaluación continua y su revisión importa. Instantáneas anteriores de la misma tabla situaban a Kimi K3 sustancialmente por encima del 44 que muestra nuestra captura de hoy, porque la métrica compuesta, el arnés de evaluación y el conjunto de modelos cambian. Cualquier comparación que se apoye en la diferencia exacta entre dos modelos en un índice continuo se apoya en algo que no permanecerá estable. La lectura honesta es que estos dos están en bandas de capacidad adyacentes en sus límites máximos, y que el índice no puede decirte cuál es mejor para tu tarea.
La excepción: lo que Modified MIT realmente te ofrece
La licencia de Kimi K3 es la única dimensión en la que GPT-6 Luna no tiene respuesta a ningún precio, y merece más precisión de la que suele recibir la expresión «pesos abiertos».
Los pesos son públicos en Hugging Face y la licencia es Modified MIT, no MIT. Esa distinción importa: una licencia Modified MIT normalmente impone condiciones —a menudo, el requisito de mostrar una atribución cuando el modelo se usa en un producto por encima de cierta escala—, y cualquiera que planee construir un producto comercial sobre los pesos debería leer el instrumento real en lugar del nombre de la familia al que se parece. Esto no es una razón para evitarla. Es una razón para no describirla como MIT en un documento de adquisición.
Lo que compra la descarga es real y acotado. Compra un piso en costos, en el sentido de que una huella fija de GPU puede vencer a una factura por consumo cuando el volumen es suficiente. Compra independencia del roadmap de un proveedor: un modelo que alojas tú no puede ser declarado obsoleto a tus espaldas. Compra la capacidad de hacer ajuste fino con tu propia distribución. Y compra la opción de mantener los prompts dentro de tu propio perímetro, lo que para algunos equipos termina la comparación antes de que se mencione el precio.
Lo que cuesta es el hardware. Un modelo de mezcla de expertos de 2,8 billones de parámetros con 104 mil millones de parámetros activos no es un modelo que se ejecute en una estación de trabajo. Servirlo con un rendimiento de producción es un compromiso a escala de clúster con un costo de capital, un costo operativo y un perfil de latencia que se posee en lugar de alquilar. Eso no es un argumento en contra del autoalojamiento de Kimi K3 — es un argumento de que la comparación correcta no es $15,00 por millón de tokens de salida contra $0,00, sino $15,00 por millón de tokens de salida contra un costo total por token que incluye el silicio y las personas. Para un pequeño número de organizaciones, ese número es menor. Para la mayoría, no lo es, y el punto de cruce está más lejos de lo que la licencia hace que parezca.
Ejecutar uno de ellos, o ambos
Kimi K3 está en OrcaRouter al precio de lista de Moonshot, bajo el esquema de precios de traspaso, lo que significa que un cambio de tarifa del proveedor se aplica en nuestro lado el mismo día. La conmutación por error automática es la parte que se gana su lugar para este modelo en particular: que un endpoint de Kimi K3 autoalojado o de terceros se degrade es exactamente el escenario en el que quieres que la ruta se mueva sin un despliegue, y un modelo de 38,7 tokens por segundo tiene menos margen para absorber un upstream lento que uno rápido.
GPT-6 Luna no está en nuestro catálogo a día de hoy y se accede a él a través de la propia API de OpenAI, así que un equipo que quiera ambos ejecuta una clave para Kimi K3 junto con lo que ya use para OpenAI. Este es también el emparejamiento en el que el DSL de enrutamiento hace algo que una división codificada de forma fija no puede: una regla que envía el trabajo de programación y el de horizonte largo a Kimi K3 y todo lo consumido por programas y de corta duración a GPT-6 Luna expresa una frontera que se desplaza cada vez que cualquiera de los proveedores publica novedades, y lo hace como configuración en lugar de como una ruta de código. La fusión de modelos es la otra configuración que merece mención aquí — un panel formado por un modelo lento y cuidadoso y otro rápido y barato que responden juntos, en el que el miembro barato se encarga del volumen y el caro arbitra los casos que importan, es una forma que a este par de modelos le encaja inusualmente bien, porque la asimetría de costes entre ellos es lo bastante grande como para que gastar una llamada a Kimi K3 en una pequeña fracción del tráfico resulte asequible.

¿Cuál, y cuándo?
Elige GPT-6 Luna si tu carga de trabajo es de alto volumen, consumida por programas y sensible a la latencia. Clasificación, extracción, enrutamiento, resumen masivo, el bucle interno de un agente. A $0,10/$0,50 con una lectura en caché de un centavo y cuatro veces el rendimiento de Kimi K3, las cuentas no dejan lugar a dudas y la diferencia de latencia no es marginal. Configura el parámetro effort explícitamente, porque el valor predeterminado es medium y el 37 destacado es una cifra de esfuerzo máximo, y mantén las llamadas largas del lado correcto de la línea de 272.000 tokens.
Elige Kimi K3 si necesitas los pesos, si tu trabajo es codificación agéntica contra un repositorio real donde su posición en WebDev y el 88,3 % reportado por el proveedor en Terminal-Bench 2.0 son la evidencia que importa, si necesitas un límite de salida superior a 128.000 tokens, o si tu organización no puede enviar prompts a un endpoint cerrado. Acepta 38,7 tokens por segundo como parte del trato y lee los términos de la Modified MIT en lugar de darlos por sentados.
El error que invita esta comparación es tratar la tasa de treinta veces como la respuesta a una pregunta sobre la capacidad. Es la respuesta a una pregunta sobre los tokens. La cuestión de la capacidad se resuelve según si necesitas los pesos o la velocidad, y esas dos respuestas apuntan en direcciones opuestas.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
