Tarjeta de título principal para una comparación de GPT-6 y Kimi K3. El titular dice «GPT-6 vs Kimi K3». Una etiqueta dice «Kimi K3: 1.048.576 de contexto, $3,00 / $15,00, lanzado el 15/07/2026». Una etiqueta dice «GPT-6 Sol: 1.050.000 de contexto, $2,00 / $10,00, disponibilidad general el 22/09/2026». Un pie de página dice «Ambos aceptan entrada de texto e imagen; sus precios y puntuaciones son diferentes».
Guides & Insights

GPT-6 vs Kimi K3: dos modelos de dos millones de tokens que se especializan de forma diferente

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

GPT-6 Sol y Kimi K3 son los dos modelos con más probabilidades de ser preseleccionados para el mismo trabajo: una ventana de contexto de un millón de tokens, entrada de imágenes y un precio que hace asequibles los documentos largos. Llegaron allí desde direcciones opuestas. Kimi K3 es el especialista en contexto largo de MoonshotAI, lanzado el 15 de julio de 2026, y su ficha se articula en torno a la recuperación: obtiene un 88,7 % en la prueba de recuperación de contexto largo de Artificial Analysis, por delante de todos los modelos del proveedor con los que podemos compararlo. GPT-6 Sol es el generalista de gama media del proveedor, lanzado el 22 de septiembre de 2026 a 2,00 $ por millón de tokens de entrada y 10,00 $ por millón de tokens de salida, y su baza es la amplitud: una ventana ligeramente más grande, una puntuación compuesta de razonamiento general más alta y un token de salida más económico.

Así que el planteamiento honesto no es mejor frente a peor. Es recuperación frente a razonamiento, y lo determina lo que estás haciendo con el millón de tokens una vez que los has cargado.

Las ventanas son del mismo tamaño en el papel.

Ambas tarjetas indican aproximadamente un millón de tokens, y la diferencia es cosmética. La ventana de Kimi K3 es de 1.048.576 tokens — exactamente 2^20, el millón binario que cita todo modelo de contexto largo. La de GPT-6 Sol es de 1.050.000, un número decimal redondo unos 1400 tokens mayor. Para cualquier carga de trabajo que realmente puedas ajustar, son la misma ventana. No elijas por esto.

Lo que sí difiere es el resto del sobre, y es una lista corta.

• Contexto: Kimi K3 1.048.576 tokens, GPT-6 Sol 1.050.000 — prácticamente a la par
• Modalidad de entrada: Kimi K3 acepta texto e imágenes; GPT-6 Sol acepta texto, imágenes y archivos
• Límite de salida: GPT-6 Sol 128.000 tokens en una sola respuesta; la ficha de Kimi K3 no publica una cifra máxima de salida
• Precio estándar: Kimi K3 $3,00 de entrada / $15,00 de salida por millón, GPT-6 Sol $2,00 de entrada / $10,00 de salida
• Entrada en caché: Kimi K3 $0,30 por millón, GPT-6 Sol $0,20 por millón
• Precio por contexto largo: Kimi K3 indica una tarifa única sin tramos documentados; GPT-6 Sol recalcula toda la solicitud por encima de 272.000 tokens de entrada a $4,00 de entrada / $15,00 de salida
• Controles de razonamiento: GPT-6 Sol expone un reasoning.effort configurable; Kimi K3 expone los parámetros reasoning y reasoning-effort a través de la misma superficie compatible con OpenAI

La falta de un techo de salida en Kimi K3 merece señalarse en lugar de pasarse por alto: MoonshotAI publica una cifra de contexto y ninguna cifra de salida máxima, por lo que un sistema que depende de un límite de salida estricto para presupuestar no puede leerlo en la ficha técnica. El nivel de contexto largo es la otra asimetría, y corta en una dirección poco intuitiva: la tarifa anunciada de GPT-6 Sol es más baja, pero su reajuste de precios de toda la solicitud por encima de 272K significa que una llamada de 300.000 tokens se factura a $4,00 / $15,00 desde el primer token, mientras que la tarifa única de $3,00 / $15,00 de Kimi K3 no está documentada como escalonada en absoluto. Para un documento muy largo, Kimi K3 puede acabar siendo el más barato de los dos en entrada a pesar de la tarifa anunciada más alta.

Recall es el producto real de Kimi K3.

La razón para optar por Kimi K3 no es que tenga una ventana grande —varios modelos la tienen—. Es que retiene lo que hay en ella. En la evaluación de recuperación de contexto largo de Artificial Analysis, recogida en el catálogo de modelos, Kimi K3 obtiene un 88,7 % frente al 83,7 % de GPT-6 Sol. Eso supone una diferencia de cinco puntos en la prueba exacta que mide si un modelo puede encontrar y usar un detalle enterrado en una entrada larga, y es el tipo de diferencia que se manifiesta como fallos reales en producción: el resumidor que omite la cláusula de la página 400, el revisor de contratos que pasa por alto la sección de indemnización.

Kimi K3 también lidera en programación, y por un margen mayor de lo que sugiere el índice compuesto. En el índice de programación se sitúa en 76.2 con un ranking dentro de los diez primeros de los modelos evaluados, y registra 85.0% en terminal-bench v2.1 — el benchmark agéntico de línea de comandos del que depende la utilidad de un agente de programación. Su puntuación en GPQA Diamond, 93.5%, está en la banda superior de la tabla.

Donde GPT-6 Sol responde es en las pruebas compuestas y en el código científico. Su índice de inteligencia general, 47,6, supera por cuatro puntos el 43,6 de Kimi K3 y se acerca al decil superior; los dos están igualados en SciCode, con un 57,6 % y un 59,5 % respectivamente, dentro del ruido de una sola ejecución; y en Humanity's Last Exam, el 47,9 % de GPT-6 Sol supera por poco el 46,9 % de Kimi K3. Ninguna de esas diferencias en una sola prueba es lo bastante grande como para elegir basándose solo en ella.

Screenshot of the OrcaRouter model page for Kimi K3, showing the MoonshotAI Kimi K3 card with a 1,048,576-token context window, text and image input, and a flat rate of $3.00 per million input tokens and $15.00 per million output tokens with a $0.30 cached-input rate.

Coste según la carga de trabajo, no según una tarifa

Las tarifas engañan porque la proporción de tokens de entrada con respecto a los de salida es distinta para cada tarea, y estos dos modelos no coinciden sobre qué lado de la balanza es más barato. Kimi K3 es más barato bajo el supuesto de que tu trabajo es mayormente de entrada —documentos largos de entrada, respuestas breves de salida—. GPT-6 Sol es más barato bajo el supuesto de que tu trabajo está equilibrado o tiene más peso de salida, porque su tarifa de salida es un tercio más baja.

• Patrón de leer un libro y resumirlo (900 K de entrada, 4 K de salida): Kimi K3 ≈ $2,76, GPT-6 Sol ≈ $3,64 antes de que se aplique el reajuste de precios de 272 K; con el reajuste, toda la llamada de GPT-6 Sol pasa al tramo superior y la brecha se amplía
• Patrón agéntico equilibrado (60 K de entrada, 20 K de salida): Kimi K3 ≈ $0,48, GPT-6 Sol ≈ $0,32
• Patrón de generación de código (30 K de entrada, 60 K de salida): Kimi K3 ≈ $0,99, GPT-6 Sol ≈ $0,66

Eso es aritmética de tokens en bruto sobre las tarifas publicadas de cada proveedor y excluye la entrada en caché, lo que favorece al modelo que más uses con caché. La forma de la respuesta es lo que importa: para trabajo de recuperación pura de entradas largas, gana la tarifa plana de Kimi K3, y para cualquier cosa que genere mucha salida, gana la tarifa de salida más baja de GPT-6 Sol. Ninguno es universalmente más barato, y una comparación que señala un único ganador en precio sin indicar la proporción de tokens no está midiendo nada.

La procedencia es parte de la decisión

Kimi K3 está desarrollado por MoonshotAI, un laboratorio chino, y GPT-6 Sol por OpenAI. Esa diferencia no es un benchmark y no aparece en una tarifa, pero para cargas de trabajo reguladas decide la lista corta antes de que se discuta el precio. La ficha de MoonshotAI en el catálogo no publica un campo de licencia, así que nada de lo que aquí se indica debe interpretarse como una afirmación sobre la disponibilidad de pesos en un sentido u otro — si los pesos abiertos son relevantes para tu despliegue, verifícalo en la fuente en lugar de asumirlo por el nombre de la familia.

Para los equipos que necesitan ambas cosas — un modelo de laboratorio chino para una parte del pipeline y un modelo de OpenAI para otra, con el enrutamiento, la facturación y la residencia de datos resueltos en un único lugar — esa es la razón por la que vale la pena tener una sola puerta de enlace en lugar de dos conjuntos de credenciales. En OrcaRouter, tanto kimi/kimi-k3 como GPT-6 Sol son rutas activas en el mismo catálogo, al precio de lista del proveedor con un 0 % de recargo, de modo que un cambio de tarifas de MoonshotAI u OpenAI se aplica el mismo día. La conmutación automática por error hace que una ruta degradada en cualquiera de los proveedores no tumbe el pipeline, y el DSL de enrutamiento te permite enviar el trabajo con mucho recall a Kimi K3 y el trabajo con mucha generación a GPT-6 Sol mediante reglas en lugar de suposiciones.

A six-row comparison card titled 'GPT-6 Sol vs Kimi K3'. Rows read 'Context: 1,050,000 vs 1,048,576'; 'Input: $2.00 vs $3.00'; 'Output: $10.00 vs $15.00'; 'AA Intelligence: 47.6 vs 43.6'; 'Long-context recall: 83.7% vs 88.7%'; 'Coding index: top-decile on both'. A footer reads 'Figures per each vendor's published card and Artificial Analysis; GPT-6 Sol output ceiling is 128K, Kimi K3 publishes no maximum output.'

¿Cuál poner en el pipeline?

Elige Kimi K3 cuando la tarea sea recuperación y retención sobre entradas muy largas — revisión de documentos legales y médicos, comprensión de código de repositorios completos, análisis de transcripciones de cientos de documentos — y cuando tus prompts tengan suficiente peso de entrada como para que la tarifa plana de $3.00 supere el cambio de precios de GPT-6 Sol. Su ventaja en recall y su puesto entre los diez primeros en programación son las dos cifras que justifican la elección.

Elige GPT-6 Sol cuando la tarea sea la de un asistente general respaldado por una ventana de un millón de tokens: razonamiento mixto, serialización a JSON, bucles agénticos que escriben mucho de vuelta, y cualquier flujo de trabajo en el que un techo de salida de 128.000 tokens sea una característica en lugar de una restricción. Es más económico en salida, expone un control explícito del esfuerzo de razonamiento, y su índice compuesto es la señal general más sólida. Cuando un pipeline realmente hace ambas cosas, la respuesta honesta es enrutar en lugar de elegir — lo cual es una afirmación sobre la forma de tu tráfico, no sobre ninguno de los dos modelos.

Screenshot of the OrcaRouter model page for GPT-6 Sol, showing the OpenAI GPT-6 Sol card with a 1,050,000-token context window, 128,000 maximum output, text/image/file input, and the tiered rate of $2.00 per million input and $10.00 per million output up to 272,000 tokens, stepping to $4.00 and $15.00 above that.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario