
Claude Sonnet 5.5 vs Kimi K3: Ninguno de los dos modelos aceptará tu ajuste de temperatura
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Aquí hay una comparación en la que los dos modelos coinciden en algo que romperá tu código en cualquier caso. Claude Sonnet 5.5, lanzado el 28 de septiembre de 2026, rechaza con un error 400 cualquier solicitud que establezca temperature, top_p o top_k en un valor no predeterminado. Kimi K3, disponible de forma general por Moonshot AI desde mediados de julio de 2026, no acepta ningún parámetro de muestreo en absoluto —ni temperature, ni top_p, ni seed— y expone la profundidad de razonamiento solo a través de un reasoning_effort como control. Dos laboratorios distintos, dos arquitecturas distintas, una conclusión compartida: las perillas de muestreo que la mayoría de las integraciones todavía establecen por costumbre han desaparecido en ambos.
Esa no es la comparación sobre la que escribe nadie. La comparación sobre la que escribe todo el mundo es el precio: Kimi K3 a $3 por millón de tokens de entrada y $15 de salida frente a Claude Sonnet 5.5 a $2 y $10, lo que es una victoria clara para Anthropic en la lista de precios. Pero Kimi K3 es un modelo de mezcla de expertos de 2,8 billones de parámetros con pesos abiertos que puedes descargar y ejecutar dentro de tu propio perímetro, y Claude Sonnet 5.5 es un modelo cerrado disponible en cuatro nubes. Entre un modelo cerrado más barato y uno descargable más caro, la decisión no se toma en absoluto en función del precio por token.
Qué es cada uno, en un párrafo cada uno
Claude Sonnet 5.5 es el segundo modelo de la generación 5.5 de Anthropic: llegó a la Claude API cinco días después de ese lanzamiento, tras Claude Opus 5.5. Se ofrece como claude-sonnet-5-5 en la Claude API, Amazon Bedrock, Google Cloud y Microsoft Foundry, mantiene una ventana de contexto de 1M de tokens y un límite de salida síncrona de 128K, y conserva exactamente los precios de Claude Sonnet 5: $2 de entrada, $10 de salida, $0.20 por millón para lecturas de caché. El pensamiento adaptativo está activado por defecto con esfuerzo high. Está disponible sin retención de datos, y Artificial Analysis le otorga un Índice de Inteligencia de 56 en su revisión v4.3.2, el tercero de los 216 modelos que mide.

Kimi K3 es el modelo insignia de Moonshot AI: un modelo de mezcla de expertos de 2,8 billones de parámetros que activa unos 104.000 millones de parámetros por token, con una ventana de contexto de 1M de tokens y comprensión visual nativa. Está concebido para programación de horizonte largo y trabajo de conocimiento de varios pasos, y Moonshot lo posiciona por nombre para arneses de agentes de programación. Habla el formato de la API de OpenAI, expone reasoning_effort como su único control de razonamiento, y es de pesos abiertos bajo la Licencia Kimi K3, lo cual no es lo mismo que código abierto, y esa diferencia es justo lo que hay que leer antes de construir sobre él.
La tarjeta de tarifas, y el número que figura debajo
Compara los dos según las dimensiones que deciden un proyecto de ley, no un titular:
• Precio de entrada — Claude Sonnet 5.5 $2 por millón vs Kimi K3 $3 por millón
• Precio de salida — Claude Sonnet 5.5 $10 por millón frente a Kimi K3 $15 por millón
• Lecturas de caché — $0.20 por millón vs. $0.30 por millón
• Ventana de contexto — 1.000.000 tokens frente a 1.048.576 tokens
• Pesos — propietarios, cuatro plataformas alojadas frente a pesos abiertos bajo la Licencia Kimi K3
• Índice de inteligencia — Claude Sonnet 5.5 56 frente a Kimi K3 44 en la misma revisión v4.3.2
• Costo por tarea del Intelligence Index — Claude Sonnet 5.5 $7.60 vs Kimi K3 $2.00
• Verbosidad en el índice — Claude Sonnet 5.5 410M tokens de salida vs Kimi K3 160M
Ese último par es la inversión que merece la pena meditar. El modelo de Anthropic es un 50% más barato en entrada y un tercio más barato en salida, y aun así cuesta 3,8 veces más completar la misma evaluación, porque gasta 2,6 veces más tokens para llegar hasta ahí. En la puntuación compuesta, además, obtiene doce puntos más, así que no se trata de un modelo derrochador que no consiga nada a cambio. Se trata de dos modelos cuyo comportamiento de costes no puede compararse leyendo dos listas de precios, y por eso existe la cifra de la tarea del índice.
Ninguno de esos recuentos de tokens será tu recuento de tokens. La propia documentación de Moonshot señala que la profundidad de razonamiento de K3 se establece mediante reasoning_effort en lugar del muestreo, y lo mismo ocurre en la práctica con el parámetro effort de Claude Sonnet 5.5; así que, en ambos modelos, la palanca individual más importante de tu factura es un ajuste de esfuerzo, no una negociación de precio.

Los errores 400, en detalle

El rechazo compartido de los parámetros de muestreo es la coincidencia más práctica en este caso, porque es el fallo que se manifiesta a la mañana siguiente de un cambio de modelo.
En Claude Sonnet 5.5, las reglas son explícitas e implacables. Un valor no predeterminado de temperature, top_p o top_k devuelve un 400. Enviar thinking: {"type": "disabled"} devuelve un 400 que apunta a between_tools, el nuevo ajuste de pensamiento más bajo, que se acepta con esfuerzo low, medium y high, pero se rechaza con xhigh o max. Uso forzado de herramientas — tool_choice establecido en "any" o a una herramienta con nombre — devuelve un 400 con el mensaje "tool_choice: type \"tool\" and \"any\" are not supported for this model", y la solución es auto más el uso estricto de herramientas o las salidas estructuradas. Aún más: los bloques de pensamiento ahora están vinculados al modelo y a la cuenta que los produjo, por lo que una conversación se puede mover de Claude Sonnet 5 a Sonnet 5.5 con su razonamiento intacto, pero no puede llevar ese razonamiento a una familia de modelos diferente, y un prefijo editado puede convertir una reproducción en un 400.
En Kimi K3 la superficie es más pequeña, pero las consecuencias son similares. No hay parámetros de muestreo que enviar, así que cualquier cliente que codifique uno de forma fija ya está enviando un parámetro que el modelo no lee. La profundidad de razonamiento es, en cambio, un reasoning_effort campo de nivel superior.
Ambos cambios apuntan en la misma dirección: el enfoque de perilla determinista para el control del prompt está siendo reemplazado por un dial de esfuerzo del lado del modelo. Cualquier pipeline que se haya ajustado por sí mismo con temperatura 0.2 y una semilla fija tiene que reajustarse por nivel de esfuerzo en ambos modelos, y ese reajuste es la migración.
Qué te aportan realmente los pesos abiertos aquí
La razón para considerar Kimi K3 frente a un modelo cerrado más barato y con mejor puntuación no es la capacidad ni el precio. Es la frontera.
Ejecutar K3 dentro de tu propia infraestructura significa que los prompts, los documentos y las salidas nunca abandonan una red que tú controlas, lo cual es una conversación de cumplimiento distinta de un acuerdo de retención cero de datos con un proveedor. También significa que el modelo no puede quedar obsoleto por debajo de ti — Claude Sonnet 5.5 viene con un compromiso de retirada de Anthropic no antes del 28 de septiembre de 2027, y un checkpoint descargado no tiene tal fecha. Y significa que la curva de costo marginal se aplana: después del hardware, los tokens son gratuitos, que es la única estructura en la que un modelo de 2,8 billones de parámetros llega a convertirse en la opción barata.
La licencia es lo que realmente estás firmando. Kimi K3 es de pesos abiertos, no de código abierto, y Moonshot no usa este último término. La licencia Kimi K3 es amplia para la mayoría de los usos, pero un negocio de modelo como servicio que supere un umbral de ingresos móvil necesita un acuerdo comercial aparte, y los productos que superen umbrales elevados de usuarios o ingresos deben mostrar la atribución «Kimi K3». Llamarla licenciada bajo MIT es una inexactitud de la era K2 que todavía circula. Si piensas construir sobre los pesos en lugar de llamar a la API, esto es una revisión legal y no una nota al pie.
Y los pesos son lo bastante grandes como para que el autoalojamiento sea una decisión de capital. Un MoE de 2,8 billones de parámetros con aproximadamente 104.000 millones de parámetros activos no es una implementación en un solo servidor, y el esfuerzo necesario para ponerlo en marcha es el verdadero costo de la opción — uno que eclipsa la diferencia de $5 por millón en las tarifas de salida.
Dónde encaja OrcaRouter
La mayoría de los equipos que evalúan estas dos opciones no quieren elegir entre una API gestionada y la adquisición de hardware. Quieren enrutar.
OrcaRouter es un único endpoint compatible con OpenAI que abarca más de 200 modelos, con el precio de lista del proveedor pasado tal cual y sin margen añadido, de modo que un cambio de tarifas de un proveedor en cualquiera de los dos lados se aplica el mismo día en lugar de en el siguiente ciclo de facturación. Kimi K3 está en el catálogo desde julio a los $3 / $15 propios de Moonshot, con un tiempo medido p50 hasta el primer token de unos ocho segundos y aproximadamente 371,9 millones de tokens pasando por él en la última semana. Claude Sonnet 5 —el modelo en el que todavía se ejecuta la mayor parte del tráfico de la API de Claude, con 150 tokens de salida por segundo medidos— es enrutable desde el 30 de junio a los $2 / $10 de Anthropic.
Claude Sonnet 5.5 aún no está en nuestro catálogo. Cuando eso sea así, dilo y esquívalo: la propia API del proveedor es la vía para acceder a él, y la forma de probarlo sin comprometerse es un porcentaje de tráfico detrás de conmutación por error automática, con Claude Sonnet 5 o Kimi K3 como respaldo. Si tu motivo para mirar K3 es el límite en lugar de la tarifa, los pesos se pueden descargar hoy y la API es una solución provisional, lo cual es una decisión sobre tu infraestructura, no sobre una comparación de modelos.
El veredicto, desglosado según lo que realmente estás comprando
Elige Claude Sonnet 5.5 cuando el trabajo sea de contexto largo y de salida intensiva, cuando lo que se compra sean doce puntos de índice compuesto, y cuando una API gestionada con retención de datos cero supere tu revisión. Reserva presupuesto para el hábito de tokens —410M de tokens en el Index frente a los 160M de K3 es un multiplicador real—; reserva un día para los cambios de uso de herramientas y de bloques de pensamiento.
Elige Kimi K3 cuando el límite sea el requisito, cuando quieras un checkpoint que ningún proveedor pueda retirar, o cuando tu carga de trabajo sea codificación agéntica a gran volumen, donde $2.00 por tarea de índice frente a $7.60 se acumula. Acepta que es un modelo de 2.8T de parámetros que hay que alojar, que su licencia tiene cláusulas de atribución e ingresos, y que obtiene una puntuación inferior a la del nivel de Anthropic en el compuesto.
Ninguna de las dos opciones se libra del primer párrafo: los parámetros de muestreo desaparecieron en ambas, y el dial de esfuerzo es el control que los reemplazó. Elijas la que elijas de estas dos, esa es la que tu código necesita.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
