
GPT-6 Sol vs Kimi K3: Tres suposiciones sobre pesos abiertos, puestas a prueba contra una factura
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Comprar pesos abiertos suele ser una apuesta por tres cosas: que serán más baratos, que te dan control y que son un seguro contra que un proveedor cambie de opinión. Kimi K3, el modelo de 2,8 billones de parámetros que Moonshot AI publicó con pesos abiertos el 27 de julio de 2026, y GPT-6 Sol, el modelo cerrado lanzado el 22 de septiembre de 2026, son un caso de prueba claro para las tres, porque los dos modelos están lo bastante cerca en la tabla neutral como para que los supuestos tengan que sostener el argumento por sí solos.
Así es como les va. K3 no es más barato por tarea: es aproximadamente el doble de caro, a $3.00 y $15.00 por millón de tokens frente a los $2.00 y $10.00 de Sol. El control es real, pero tiene un umbral mínimo de hardware que la mayoría de los equipos no superará. Y el seguro es la única suposición que se sostiene por completo, lo que lo convierte en el único por el que vale la pena pagar. Lo que sigue es la aritmética detrás de cada uno.
Los dos modelos, brevemente
Kimi K3 es un modelo de mezcla de expertos disperso con 2.8 billones de parámetros totales y aproximadamente 104 mil millones — alrededor del 3.7% — activos por token, publicado bajo una licencia MIT modificada con una ventana de contexto de 1,048,576 tokens. Las afirmaciones arquitectónicas de Moonshot son específicas: Kimi Delta Attention, un esquema híbrido de atención lineal que la compañía dice que es hasta 6.3× más rápido en decodificación de contexto largo, además de Attention Residuals y un marco Stable LatentMoE. Acepta texto e imagen y devuelve texto. El modelo sin destilar supera 1 TB de tamaño y un despliegue en producción se describe en términos de un mínimo de 64 aceleradores.
GPT-6 Sol es cerrado, de identificador único, y tiene un precio fijo de $2,00 y $10,00, con una lectura en caché de $0,20 y escrituras en caché de $2,50; cuando la solicitud supera los 272.000 tokens de entrada, se le aplica un nuevo precio a toda la solicitud de $4,00 y $15,00. Es de entrada de texto e imagen y salida de texto, con una ventana de 1.050.000 tokens, una entrada máxima de 922.000 tokens, un límite de salida de 128.000 tokens y una fecha de corte de conocimiento del 20 de abril de 2026.
Las ventanas de contexto son, a efectos prácticos, el mismo número: una diferencia del 0,1 %. Eso elimina la razón más común para preferir una, y significa que la decisión recae enteramente en las tres suposiciones.
Suposición uno: los pesos abiertos son más baratos. No lo son.
• Entrada — GPT-6 Sol $2.00 por millón de tokens vs Kimi K3 $3.00 por millón de tokens
• Salida — GPT-6 Sol $10.00 por millón de tokens vs Kimi K3 $15.00 por millón de tokens
• Entrada en caché — GPT-6 Sol $0.20 por millón de tokens frente a Kimi K3 $0.30 por millón de tokens; ambos son una décima parte de la tarifa de entrada sin caché
• Índice de Inteligencia, independiente — GPT-6 Sol 48 con esfuerzo máximo vs Kimi K3 44 con esfuerzo máximo
• Coste por tarea de Index, independiente — GPT-6 Sol $1.06 vs Kimi K3 $2.00
• Tokens de salida para la ejecución de indexación — GPT-6 Sol 77M vs Kimi K3 160M
• Ventana de contexto — GPT-6 Sol 1.050.000 tokens vs Kimi K3 1.048.576 tokens
• Pesos — GPT-6 Sol cerrado vs Kimi K3 abierto, descargable y autoalojable
• Licencia — GPT-6 Sol no aplicable vs Kimi K3 Modified MIT
• Parámetros totales — GPT-6 Sol no divulgados frente a Kimi K3 2,8 billones, de los cuales 104.000 millones están activos por token
Sol es más barato en cada línea de la tarifa, y la brecha es más amplia justo donde las cargas de trabajo agénticas gastan su dinero. El panel independiente coincide en la dirección y, a grandes rasgos, en la magnitud: Sol cuesta aproximadamente la mitad por tarea completada, con cuatro puntos de índice más. K3 generó un poco más del doble de tokens de salida para ejecutar el mismo índice.
Un matiz impide que esto sea una derrota aplastante. Moonshot afirma que K3 emite un 21 % menos de tokens de salida que su predecesor, y el trabajo arquitectónico —el esquema de atención, el diseño residual— apunta directamente al coste de decodificación de contexto largo. En una carga de trabajo dominada por entradas muy largas, las características de eficiencia de K3 podrían cerrar parte de la brecha que muestra la ejecución del índice. Nadie ha publicado esa medición en un banco de pruebas comparable, así que tómalo como una afirmación del proveedor con un mecanismo plausible, no como un resultado.


Segunda suposición: los pesos abiertos te dan control. Hasta un mínimo de hardware.
El control es real y merece la pena enunciarlo con precisión, porque "open weights" se usa a menudo de forma poco rigurosa. Una licencia MIT modificada sobre un checkpoint descargable significa que puedes ejecutar el modelo en tu propio hardware, ajustarlo con fine-tuning, fijar una revisión específica y mantener la inferencia dentro de un límite que tú controlas. Nada de eso está disponible con GPT-6 Sol a ningún precio.
Lo que no significa es que el autoalojamiento sea un sustituto de la API en cuanto a costo. Las cifras publicadas sitúan el checkpoint de precisión completa en aproximadamente 4,9 TB, o alrededor de 397 GB con cuantización de 1 bit, con un mínimo de despliegue en el rango de 410 GB de memoria combinada y despliegues de producción descritos en términos de 64 aceleradores. Un equipo que ya ejecuta esa clase de clúster tiene aquí una opción real. Un equipo que no lo hace está comparando una factura de API con una compra de capital, y la factura de API gana por un amplio margen.
La versión honesta del argumento del control es más limitada de lo que suele plantearse: los pesos abiertos te dan la capacidad de irte, no la de ejecutar a bajo costo. Son cosas distintas, y solo una de ellas está disponible para la mayoría de los equipos.
Suposición tres: los pesos abiertos son un seguro. Esta se sostiene.
La tercera suposición sobrevive a todas las cifras anteriores, y es la razón por la que K3 tiene un mercado. A Moonshot la pueden adquirir, puede cambiar su licencia para versiones futuras, puede dejar obsoleta K3, puede subir su precio, puede suspender las suscripciones —y de hecho suspendió las nuevas suscripciones en las 48 horas posteriores al lanzamiento para proteger la calidad del servicio de los clientes de pago existentes, lo cual es una demostración en vivo de que el acceso a la API es una decisión de política, no una propiedad.
Si K3 queda obsoleto, los pesos que descargaste siguen funcionando. Si Moonshot triplica el precio de la API, tu implementación autoalojada no se ve afectada. Si necesitas demostrarle a un auditor que tu pila de inferencia está congelada en una revisión conocida, un checkpoint te lo da y una API no. Nada de esto aparece en una tabla de costo por tarea, y todo ello es real.
La pregunta es cuánto vale. Con las cifras anteriores, estás pagando aproximadamente el doble por tarea completada por ese seguro, más cuatro puntos de índice de capacidad. Para una carga de trabajo en la que la deprecación de una API supone una interrupción del negocio, eso es barato. Para una carga de trabajo en la que simplemente cambiarías de modelo, es una prima por una cobertura que nunca ejercerás.
Ambos están en una sola tecla si quieres que sea así.

Kimi K3 está en el catálogo de OrcaRouter al precio de lista de Moonshot, bajo el modelo de traspaso directo que hace que un cambio de tarifa de Moonshot entre en vigor de nuestro lado el mismo día en lugar de después de que un revendedor renegocie. GPT-6 Sol no está en nuestro catálogo al momento de escribir esto y se puede acceder a él a través de la propia API de OpenAI.
Esa combinación vale más de lo que parece para esta decisión en particular, porque los dos modelos pertenecen a modos de fallo diferentes. La razón para ejecutar K3 no es que sea más barato —no lo es—, sino que es una cobertura, y una cobertura a la que no puedes cambiar rápidamente no es gran cosa. Mantener K3 detrás del mismo endpoint que todo lo demás, con conmutación por error automática y una regla de enrutamiento que se puede cambiar en la configuración, es lo que convierte "tenemos un fallback de pesos abiertos" de una diapositiva en una presentación en algo que funciona a las 3 de la mañana.
Para qué sirve realmente cada uno
• Si quieres el costo más bajo por tarea completada en trabajo general — GPT-6 Sol, y el margen es de aproximadamente 2×.
• Si quieres la mayor capacidad en el tablero neutral de los dos — GPT-6 Sol por cuatro puntos.
• Si ya opera un clúster en la clase de memoria de más de 400 GB y necesita inferencia dentro de su propio perímetro —K3, y el cálculo cambia por completo, porque el costo marginal de los pesos no es el mismo que el costo del hardware.
• Si tu requisito real es que no puedan quitarte tu modelo —{{1}}K3{{/1}}, y este es el único argumento de la comparación que Sol no puede rebatir.
• Si estás eligiendo por precio por token porque K3 parece el modelo chino más barato, revisa primero la cantidad de tokens. Con 160 millones de tokens de salida para la ejecución del índice frente a los 77 millones de Sol, la tarifa más barata está comprando más tokens, no una factura más pequeña.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
