
GPT-6.1 Sol vs Kimi K3: La descarga existe y sigue sin ser la opción barata
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Kimi K3 es el contraejemplo que suele zanjar este tipo de discusión. Moonshot AI lanzó el modelo de 2,8 billones de parámetros en julio de 2026 y publicó los pesos — moonshotai/Kimi-K3 está en Hugging Face, sin restricciones, con más de un millón de descargas y una última revisión en septiembre. Así que aquí no hay ningún asterisco de "abierto en principio, retenido para reforzar la seguridad", ni un retraso de dos semanas que aguantar. GPT-6.1 Sol, que OpenAI lanzó el 29 de septiembre de 2026, es cerrado y solo por API, y siempre lo será. Y en la tabla independiente, el modelo descargable obtiene 43,6 frente a los 51,8 del modelo cerrado, a la vez que cuesta 2,00 $ por tarea de índice completada frente a 0,72 $. Se supone que los pesos abiertos son la vía de escape barata; en este emparejamiento son el lado caro del intercambio, y la razón no es la licencia.
Qué es cada modelo
Kimi K3 es un modelo disperso de mezcla de expertos con 2,8 billones de parámetros totales y aproximadamente 104.000 millones —cerca del 3,7%— activos por token. Tiene una ventana de contexto de 1.048.576 tokens, acepta texto e imágenes como entrada y devuelve texto. El checkpoint publicado es un artefacto FP8 y es una descarga genuinamente grande; un despliegue en producción en tu propio hardware es una decisión de clúster más que de estación de trabajo. La afirmación arquitectónica de Moonshot es un esquema híbrido de atención lineal que, según dice, es sustancialmente más rápido en la decodificación de contexto largo, además del trabajo residual y de enrutamiento que hizo que un modelo de 2,8 billones de parámetros fuera servible en absoluto.
GPT-6.1 Sol es la actualización de gama media de OpenAI — por debajo de GPT-6 Astra, por encima de GPT-6 Luna — con una ventana de 1,050,000 tokens, un límite de salida de 128,000 tokens, entrada de texto, imagen y archivos, y una fecha de corte de conocimiento del 30 de abril de 2026. El razonamiento se ejecuta desde bajo hasta máximo con medio como valor predeterminado; el nivel ninguno que aceptaba el anterior GPT-6 Sol se rechaza de plano, y la propia nota de migración de OpenAI indica a los desarrolladores que usen bajo en su lugar. Su precio es de $2.00 y $10.00 por millón de tokens, con entrada en caché a $0.10.
Una línea por dimensión, ambos lados en cada una:
• Entrada — GPT-6.1 Sol $2,00 por 1M vs Kimi K3 $3,00 por 1M
• Salida — GPT-6.1 Sol $10,00 por 1M vs Kimi K3 $15,00 por 1M
• Entrada en caché — GPT-6.1 Sol $0,10 por 1M vs Kimi K3 $0,30 por 1M
• Ventana de contexto — 1.050.000 tokens vs 1.048.576 tokens; una diferencia del 0,1%, sin importancia
• Salida máxima — 128.000 tokens en ambos
• Parámetros totales y activos — no divulgados vs 2.800 mil millones en total, 104 mil millones activos por token
• Modalidad — texto, imagen y archivos de entrada, texto de salida vs texto e imagen de entrada, texto de salida
• Pesos — cerrado, solo API vs abierto, sin restricciones de acceso, más de 1M de descargas
• Cláusula de contexto largo — vuelve a aplicar precios a toda la solicitud por encima de 272.000 tokens de entrada, a 2× en entrada y caché y 1,5× en salida vs ninguna cláusula equivalente en la tarjeta publicada
• Índice de inteligencia, independiente, esfuerzo máximo — 51,8 vs 43,6
• Coste por tarea del índice, independiente — $0,72 vs $2,00
• Tokens de salida en la ejecución del índice — 67 millones vs 160 millones, frente a una mediana del tablero de 140 millones para su clase de comparación
La única evaluación que gana K3, y por qué importa
Antes de la aritmética, la excepción, porque es real. Puntuado evaluación por evaluación con el máximo esfuerzo en Artificial Analysis v4.3.2, GPT-6.1 Sol lidera siete de diez y no empata ninguna, pero el modelo que gana la evaluación de razonamiento de contexto largo es K3:
• AA-LCR v1.1 — Kimi K3 0.887 vs GPT-6.1 Sol 0.830. Una ventaja de seis puntos en la evaluación creada específicamente para el razonamiento sobre entradas largas.
• SciCode — Kimi K3 0.595 vs GPT-6.1 Sol 0.542. K3 también lidera en programación científica.
• Terminal-Bench 4.0 — Kimi K3 0.126 vs GPT-6.1 Sol 0.561. Una brecha de 43 puntos en la dirección opuesta, y de lejos la mayor disparidad de la comparación.
• Humanity's Last Exam — Kimi K3 0.469 vs GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 vs GPT-6.1 Sol 41.5; en fiabilidad factual, los dos no son de la misma clase de modelo.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 vs GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 vs GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 y 0.234; Sol 0.649, 0.310 y 0.317.
El resultado de AA-LCR es el que merece tomarse en serio, porque es el único número que contradice el relato del coste por tarea, y señala una carga de trabajo en la que la respuesta que parece barata es errónea en ambas direcciones. Si tu tráfico consiste en entradas muy largas, una respuesta generada modesta y un uso intensivo de un prefijo estable —la forma en la que la verbosidad nunca llega a morder—, la combinación de K3 de una puntuación de primer nivel en contexto largo, una entrada de imagen y un checkpoint descargable encaja mejor que la de Sol, y la cifra de coste por tarea de la ejecución del índice no se aplica a tu caso. Esa es la versión honesta de «los pesos abiertos merecen una prima»: a veces el modelo abierto es simplemente el mejor modelo para el trabajo, y aquí lo es en un eje.
También vale la pena señalar qué tienen en común esas dos victorias. K3 es fuerte cuando una tarea puede responderse en un solo acto largo de lectura o razonamiento, y débil cuando debe ejecutarse en muchos pasos pequeños y comprobarse. La brecha de 43 puntos en Terminal-Bench y la brecha de 22 puntos en omnisciencia son el mismo hallazgo visto desde dos ángulos: la ejecución agéntica sostenida no es aquello para lo que se optimizó este checkpoint.
La aritmética, que es lo que realmente lo decide
La tarifa de K3 es 1,5× la de Sol en todas las líneas, y su coste medido por tarea de índice completada es 2,8×; la diferencia entre 1,5 y 2,8 se explica enteramente por el volumen de tokens. La propia medición del consejo es de 160 millones de tokens de salida para K3 frente a 67 millones para Sol en la misma batería de diez evaluaciones. K3 produce 2,4 veces la salida a 1,5 veces el precio, y 2,4 × 1,5 es 3,6; la cifra del consejo de $2,00 frente a $0,72 es un poco más benévola que la proporción pura porque las contribuciones de entrada y de caché la compensan ligeramente, pero la dirección no está en disputa.
El propio marketing de Moonshoot va en contra de esto de un modo que merece una lectura atenta. La empresa afirma que K3 emite menos tokens de salida que su predecesor, y el trabajo arquitectónico —el esquema de atención, el diseño residual— apunta directamente al coste de decodificación en contextos largos. Ambas cosas pueden ser ciertas mientras el modelo sigue siendo el doble de verboso que la mediana de un benchmark en una suite general. Las dos afirmaciones se refieren a cosas distintas: eficiencia en relación con un Kimi anterior y eficiencia en relación con el campo. Solo la segunda es aquella contra la que se te factura, y es la que mide el panel independiente.
El almacenamiento en caché lo atenúa. Ambas tarifas de entrada en caché son una décima parte de la tarifa de entrada sin caché de su modelo — $0.30 para K3, $0.10 para Sol —, así que la línea de caché no cambia el orden, pero sí significa que una carga de trabajo con muchas solicitudes y respuestas ligeras reduce la diferencia hasta aproximadamente la proporción de la tarifa publicada en lugar de la proporción de tareas medida. Y la cláusula de contexto largo de Sol opera en sentido contrario: por encima de 272.000 tokens de entrada, vuelve a fijar el precio de toda la solicitud en $4.00 y $15.00, con caché a $0.20, que es la única franja donde la tarifa plana de K3 gana de forma absoluta. Vale la pena saberlo por dos razones, porque también es la franja donde la puntuación de contexto largo de K3 es el mejor número de esta comparación.

¿Qué pesos abiertos valen realmente la pena aquí?
Tres cosas, y merece la pena separarlas, porque «pesos abiertos» suele emplearse como un solo argumento cuando en realidad son tres.
La primera es que puedes irte. Si Moonshoot es adquirida, cambia la licencia de las versiones futuras, retira K3 o sube el precio de su API, un checkpoint que ya hayas descargado sigue funcionando. Eso no es una hipótesis para este laboratorio: Moonshoot suspendió las nuevas suscripciones en unas 48 horas tras un lanzamiento anterior para proteger la calidad del servicio de los clientes de pago existentes, lo que constituye una demostración en vivo de que el acceso a la API es una decisión de política, y no una propiedad. Nada de esto aparece en una tabla de coste por tarea, y todo ello es real.
La segunda es que puedes fijar. Una revisión fija, afinada, ejecutándose dentro de un límite que tú controlas, es algo que se le puede mostrar a un auditor y que una API no puede ofrecer. Para el tráfico regulado, eso vale más que una lista de tarifas.
La tercera —la que suele darse por sentada— es que será más barato. No lo es. El checkpoint es un artefacto FP8 de 2,8 billones de parámetros, y la guía de despliegue publicada está planteada en torno a configuraciones con múltiples aceleradores en lugar de un solo nodo. Un equipo que ya opera ese tipo de clúster tiene aquí una opción real y el cálculo cambia por completo, porque el coste marginal de un token pasa a ser la electricidad. Un equipo que no lo hace está comparando una factura de API con una compra de capital, y la factura de API gana por un amplio margen. El resumen honesto es que los pesos abiertos, en este caso, te dan la capacidad de irte, no la de ejecutarlo de forma barata.
Ambos en una sola tecla, que es lo que hace que el intercambio sea útil
Kimi K3 está en OrcaRouter al precio de lista propio de Moonshoot — $3.00 y $15.00 por millón de tokens con una lectura de caché de $0.30, sin cambios respecto a la tarjeta del proveedor — y GPT-6.1 Sol llegó a nuestras rutas al precio de OpenAI el día del lanzamiento, $2.00 y $10.00 con entrada en caché a $0.10 y el paso de 272,000 tokens pasado exactamente como se indica. No se añade nada a ninguno de los dos. La plataforma pasa el precio de lista del proveedor en lugar de marcarlo al alza, por lo que un cambio de tarifa de Moonshoot y un cambio de tarifa de OpenAI aparecen ambos de nuestro lado el mismo día en que aparecen en el del proveedor, sin un segundo contrato ni un revendedor de por medio.

La razón que importa más para este par que para la mayoría es que los dos modelos pertenecen a modos de fallo diferentes. GPT-6.1 Sol es el modelo que ejecutas para ejecución sostenida, bucles de herramientas y fiabilidad factual; Kimi K3 es el modelo que ejecutas para entradas muy largas, donde quieres la mejor puntuación de contexto largo y quieres un checkpoint como cobertura frente a la decisión empresarial de otro. No son opciones que compiten, son dos rutas sobre el mismo tráfico. Mantener ambos detrás de un único endpoint, con conmutación por error automática entre ellos y una regla que mueve el trabajo de entradas largas a K3 y el trabajo de ejecución a Sol, es lo que convierte "tenemos un fallback de pesos abiertos" de una línea en un documento de diseño en algo que funciona a las tres de la mañana en una llamada que está fallando.

Donde cada uno pertenece
• Agentes de terminal, programación a escala de repositorio, ejecución de varios pasos — GPT-6.1 Sol, con una diferencia de 43 puntos en Terminal-Bench 4.0. Esto no está ni cerca.
• Respuestas donde una alucinación es costosa — GPT-6.1 Sol, con una brecha de 22 puntos en AA-Omniscience.
• Entradas muy largas con una respuesta generada corta — Kimi K3. La mejor puntuación de razonamiento de contexto largo en esta comparación, entrada de imágenes y una verbosidad que nunca llega a aplicarse.
• Autoalojamiento o una pila de inferencia que necesites poder congelar — Kimi K3, y solo si ya operas el hardware. El checkpoint es el entregable; la economía de ejecutarlo es aparte.
• Una cobertura por si un proveedor cambia sus términos — Kimi K3, y este es el único argumento que GPT-6.1 Sol no puede rebatir a ningún precio.
• Elegir con base en la tarifa — ni K3 ni Sol son la opción barata en esta comparación, y ninguno de los dos es la opción barata en la línea GPT-6. Si la factura es el factor decisivo, el modelo que buscas está más abajo en la lista de precios, no en esta tabla.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
