Una tarjeta de título principal generada para un artículo titulado 'Grok 4.7 vs Kimi K3 — precio frente a contexto', con el subtítulo 'Dos modelos de frontera, dos apuestas distintas' y chips de estadísticas que indican precio $2/$6 vs $3/$15, contexto 500K vs 1M y pesos abiertos no vs sí.
Guides & Insights

Grok 4.7 vs Kimi K3: La mitad del precio, la mitad del contexto, ninguno de los pesos

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Tome un mes de 300 millones de tokens de trabajo de codificación agéntica y páselo por ambos modelos a sus tarifas de lista, y la elección deja de parecer una discusión sobre benchmarks. Grok 4.7, que SpaceXAI lanzó el 21 de septiembre de 2026, cobra 2 dólares por millón de tokens de entrada y 6 por millón de salida. Kimi K3, que Moonshot AI lanzó el 16 de julio de 2026, cobra 3 y 15. En ese mes hipotético —digamos 200 M de entrada y 100 M de salida— Grok 4.7 sale por unos 1000 dólares y Kimi K3 por unos 2100. La diferencia no es un redondeo; es el presupuesto equivalente a un segundo modelo. Frente a eso, Kimi K3 le ofrece una ventana de contexto de 1.000.000 de tokens en lugar de 500.000, entrada de vídeo nativa además de imágenes, y pesos descargables. Grok 4.7 le ofrece un modelo cerrado, más rápido y más barato, que fue entrenado explícitamente para el trabajo de terminal de horizonte largo al que Kimi K3 también apunta. Ambos son de clase frontera. No son la misma compra.

Los dos modelos, brevemente

Grok 4.7 es el modelo de vanguardia de SpaceXAI para programación y trabajo de conocimiento, construido sobre un modelo base más grande que Grok 4.6 y sometido a una ejecución más larga de aprendizaje por refuerzo orientada a tareas que pueden llevar horas. Es propietario —sin pesos, sin descarga—, ofrece una ventana de contexto de 500.000 tokens, acepta texto e imágenes y devuelve texto, y admite niveles de esfuerzo de razonamiento desde low hasta xhigh. Su principal reclamo es la velocidad y el precio: SpaceXAI lo posiciona como aproximadamente el doble de rápido que modelos comparables y a aproximadamente la mitad del precio.

Kimi K3 es el modelo insignia abierto de tipo mezcla de expertos de Moonshot AI, el primer modelo abierto de la clase de tres billones de parámetros: 2,8 billones de parámetros en total con 104.000 millones activos por token, construido sobre Kimi Delta Attention y pesos MXFP4 con conciencia de cuantización. Acepta texto, imágenes y vídeo, ofrece un contexto de 1.000.000 de tokens, ejecuta el razonamiento siempre activo con esfuerzo configurable, y sus pesos se pueden descargar bajo la Licencia Kimi K3 — uso comercial permitido, con restricciones. Por diseño, es el modelo que puedes llevarte a casa.

Esa es toda la diferencia estructural entre ambos. Uno es un endpoint barato, rápido y cerrado. El otro es un artefacto abierto, más caro y más lento, con el doble de contexto. Todo lo que sigue es consecuencia de eso.

Qué comparan realmente los benchmarks

Aquí es donde la mayoría de los análisis comparativos entre Grok 4.7 y Kimi K3 se equivocan, así que vale la pena ser directo: las cifras publicadas de ambos modelos, en gran medida, no miden las mismas cosas, y al menos un par que parece comparable no lo es.

Comienza con el par que es genuinamente engañoso. El material de lanzamiento de Kimi K3 cita una puntuación de 88,3 en Terminal-Bench 2.1. El material de lanzamiento de Grok 4.7 cita Terminal-Bench 4.0 con un 38,0 %. Esas son versiones de benchmark diferentes, con conjuntos de tareas distintos y puntuaciones distintas, y ponerlas una al lado de la otra sugeriría que Kimi K3 es más del doble de capaz como modelo agéntico. No es una interpretación defendible, y nadie debería repetirla. Además, ambas cifras son reportadas por el proveedor — ninguna ha sido reproducida de forma independiente.

Lo que se puede comparar es el compuesto independiente, y ahí los dos están cerca. En el actual Artificial Analysis Intelligence Index, versión v4.3.2, Kimi K3 obtiene 44 —segundo de 113 modelos, el puesto más alto de cualquier modelo de pesos abiertos en la tabla. Grok 4.7 obtiene 46, decimosexto de 655. Separados por dos puntos, con el puesto de Kimi K3 logrado con el máximo esfuerzo de razonamiento. En el compuesto combinado, estos modelos están a la par.

• Compuesto independiente — Grok 4.7 46 en AA Intelligence Index v4.3.2 frente a Kimi K3 44 en la misma versión. Un empate en la práctica.

• Ventana de contexto — Grok 4.7 500.000 tokens vs Kimi K3 1.000.000 tokens. Una ventaja real e incondicional para Kimi K3, y la única diferencia de especificaciones sin ninguna salvedad.

• Modalidades de entrada — Grok 4.7 texto e imagen frente a Kimi K3 texto, imagen y vídeo. Kimi K3 es más amplio, si tu carga de trabajo incluye vídeo.

• Pesos — Grok 4.7 propietario, sin descarga, frente a los pesos abiertos de Kimi K3 bajo la Licencia Kimi K3. Para un requisito on-premise o air-gapped, esta es la única línea que importa.

• Precio por millón de tokens — Grok 4.7 $2 de entrada / $6 de salida frente a Kimi K3 $3 de entrada / $15 de salida, con la tarifa de entrada en caché de Kimi a $0.30 por millón. Grok 4.7 es más barato en todos los ejes y drásticamente más barato en la salida.

• Control del esfuerzo de razonamiento — Grok 4.7 de bajo a xhigh vs. Kimi K3 siempre activado con esfuerzo configurable. Funcionalmente similares; la diferencia es que Grok 4.7 te permite reducir el razonamiento.

• Evidencia agéntica reportada por el proveedor — Grok 4.7 Terminal-Bench 4.0 38.0%, CursorBench 4.0 46.3%, DeepSWE v1.1 71.0% (todo reportado por el proveedor) frente a Kimi K3 Terminal-Bench 2.1 88.3%, Frontend Code Arena primer lugar con 1,679 Elo (reportado por el proveedor en el lanzamiento). No son comparables — ver arriba.

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

A dónde va realmente el dinero

La tarifa subestima la diferencia, porque los dos modelos consumen tokens de manera distinta. Grok 4.7 es un razonador verboso — Artificial Analysis midió 240 millones de tokens de salida generados mientras ejecutaba su Intelligence Index, frente a una mediana de 92 millones entre los modelos. Kimi K3 es el tipo opuesto de caro: es un modelo de razonamiento grande y siempre activo, y a $15 por millón de tokens de salida, la verbosidad es lo que estás comprando.

Así que el modelo de costos honesto no es "$2/$6 frente a $3/$15". Son los tokens de salida por tarea completada, multiplicados por la tarifa de salida, más los tokens de entrada, incluidos todos los reintentos, multiplicados por la tarifa de entrada. Un modelo que resuelve una tarea en una sola pasada larga a $6 por millón puede superar a un modelo que necesita tres intentos a $15 por millón, y también puede perder frente a él si las pasadas del modelo barato son lo bastante largas. Esa es una medición que haces en tu propio repositorio, no una que alguien publique para ti.

Una asimetría que conviene conocer antes de ejecutarlo: Grok 4.6, el predecesor de Grok 4.7, aplica un salto brusco de precio a los 200.000 tokens de entrada, de modo que una solicitud que cruza ese límite hace que se recalcule el precio de toda la solicitud al doble de tarifa. El trabajo con contexto largo del lado de Grok exige verificar eso contra la tarifa vigente del modelo que despleguemos, porque una ventana de 500.000 tokens y un salto a los 200.000 tokens interactúan mal. El precio de Kimi K3 es plano, lo que constituye la ventaja más discreta de las dos.

Dónde se rompe cada uno

Ambos modelos tienen un modo de fallo que el material de lanzamiento no pone por delante, y son fallos distintos.

El problema de Kimi K3 es la fiabilidad bajo carga sostenida. Las pruebas comunitarias e independientes en el lanzamiento informaron que su rendimiento agéntico se degrada a medida que se extienden las ejecuciones —resultados sólidos en una sola pasada, tasas de aprobación sostenidas más débiles— y que su velocidad de salida se sitúa en torno a 37 a 38 tokens por segundo, lo que es lento para la codificación interactiva. Moonshot también tuvo que pausar las nuevas suscripciones de consumidores poco después del lanzamiento porque la demanda superó la capacidad, lo que dice algo sobre el margen de servicio en el lado alojado.

La forma de Grok 4.7 es la opuesta: es rápido, barato y cerrado, lo que significa que no puedes inspeccionarlo, no puedes ejecutarlo tú mismo y no puedes protegerte contra una deprecación. SpaceXAI ya ha secuenciado públicamente Grok 4.8, Grok 4.9 y Grok 5 detrás de este lanzamiento, y Grok 4.6 duró aproximadamente cinco semanas antes de ser reemplazado. Cualquier cosa que construyas sobre Grok 4.7 debe construirse de modo que el ID del modelo sea un valor de configuración, no una suposición.

Hay una tercera consideración que no es un fallo de ninguno de los dos modelos: ninguno de los dos es la respuesta correcta para una ejecución autónoma de dos semanas, y ambos proveedores han hecho demos de exactamente eso. Las demos publicadas de codificación autónoma de 16 días y 48 horas están realizadas por los propios proveedores, sobre tareas elegidas por ellos y sin reproducción independiente. Vale la pena conocerlas, pero no planificar en función de ellas.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Ejecutar ambos, y por qué esa es la verdadera respuesta

La brecha de costo y la brecha de contexto apuntan en direcciones opuestas, lo cual es el argumento para no elegir uno. Kimi K3 justifica su precio en trabajos a escala de repositorio, donde una ventana de 1M significa que no divides la entrada en fragmentos, y en cualquier cosa que deba autoalojarse. Grok 4.7 justifica su precio en el volumen — bucles de agentes con muchos turnos, canalizaciones con muchas llamadas a herramientas y sesiones largas de terminal donde dominan la velocidad y el costo de salida.

Kimi K3 está en OrcaRouter, lo que convierte esa división en una decisión de enrutamiento y no de compras. Está en el catálogo al precio de lista de Moonshot y, dado que OrcaRouter traslada el precio de lista de los proveedores con un 0 % de margen, una rebaja de precio de un proveedor está activa aquí el mismo día en que se anuncia, en lugar de en la próxima renovación de contrato. Para cargas de trabajo en las que una pasada de contexto largo y una pasada de ejecución deberían colaborar en vez de competir —un modelo sosteniendo todo el repositorio a la vista y otro actuando sobre él—, el DSL de enrutamiento compone varios modelos en una sola llamada, y la fusión de modelos permite que un panel de modelos responda en conjunto cuando la tarea merece el gasto adicional. Una sola clave de API cubre Kimi K3 más más de 200 modelos adicionales, así que la mitad de ejecución de esa división puede provenir del modelo que sea más barato y rápido para la tarea, en lugar del que resulte tener el contexto.

Hay una cosa que conviene dejar clara: los pesos abiertos de Kimi K3 se pueden descargar, pero el endpoint alojado es al que enruta OrcaRouter. Si tu requisito es genuinamente una inferencia en las instalaciones, eso es un proyecto de autoalojamiento en tu propio hardware, no una decisión de enrutamiento, y es el único escenario en el que esta comparación tiene una sola respuesta correcta.

El veredicto, y el único número que hay que tener en cuenta

Si eliges por costo y velocidad, Grok 4.7 gana, y no por poco: la mitad del precio de entrada, menos de la mitad del precio de salida, servicio más rápido y un control de razonamiento que puedes reducir. Si eliges por contexto, amplitud de modalidades o la capacidad de poseer el modelo, Kimi K3 gana en los mismos términos. Si eliges solo por capacidad, el índice compuesto independiente dice que están a dos puntos de distancia, y deberías decidir según tu propia evaluación en lugar de según el gráfico de lanzamiento de cualquiera de los proveedores.

El número al que hay que aferrarse es el de arriba: $2/$6 frente a $3/$15. Todo lo demás en esta comparación es negociable, y esa proporción no.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario