Una tarjeta hero generada que compara Intern-S2-397B y Kimi K3, mostrando a la izquierda una página de literatura científica con un diagrama molecular que alimenta una tarjeta de pesos abiertos de 403 mil millones de parámetros, y a la derecha una cinta de documento larga que alimenta un modelo insignia de 2,8 billones de parámetros con un medidor de contexto de 1M, con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Intern-S2-397B vs Kimi K3: el modelo científico de 397B y el gigante del razonamiento de 2,8T

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Intern-S2-397B y Kimi K3 se sitúan en lados opuestos de la línea de pesos abiertos que definirá el resto de 2026: el especialista científico descargable frente al generalista de contexto largo probado de forma independiente. Intern-S2-397B es el modelo multimodal científico de 403 mil millones de parámetros que InternLM lanzó bajo Apache-2.0 el 13 de septiembre de 2026 — sin tarifa, sin puntuación independiente y con una ruta de visión entrenada en páginas sin procesar de literatura científica. Kimi K3 es el buque insignia de mezcla de expertos de 2,8 billones de parámetros de Moonshot AI que se lanzó en julio de 2026 a $3.00 por millón de tokens de entrada y $15.00 por millón de tokens de salida, abrió sus pesos el 27 de julio bajo una licencia MIT modificada, y ha pasado por seis semanas de evaluación independiente. Lo inusual de este enfrentamiento es que ambos modelos tienen la misma ambición de largo alcance — seguir trabajando en una tarea grande y desordenada — y la resuelven en direcciones opuestas.

Ambos ambiciosos, mecanismos opuestos

La ambición es compartida: cada modelo quiere ser eso que sigue funcionando cuando la tarea es larga. Lo consiguen de manera diferente, y la diferencia es arquitectónica.

La respuesta de Kimi K3 es el contexto. Una ventana de 1.048.576 tokens tanto en la entrada como en la salida significa que todo un repositorio, toda una sala de datos o un bucle de agente de cincuenta pasos pueden caber en una sola conversación. Según se informa, la pila de inferencia Mooncake de Moonshot mantiene tasas de aciertos de caché superiores al 90 % en cargas de trabajo de programación, lo que hace que un precio de salida de 15 $ por millón sea viable en la práctica. Kimi K3 expone un control reasoning_effort de nivel superior y no acepta parámetros de muestreo, razona a la máxima profundidad de forma predeterminada y espera que reenvíes literalmente el reasoning_content previo y los tool_calls previos en bucles de herramientas multiturno, o la calidad se degrada.

La respuesta de Intern-S2-397B es especialización más control a nivel de pesos. Su contexto —256K de razonamiento de texto y 64K multimodal, ambas cifras de la ficha del modelo— es una categoría distinta de ventana: suficiente para un artículo sustancial o una sesión de investigación prolongada, pero no para un conjunto de trabajo de un millón de tokens. Lo que ofrece en cambio es una ruta de visión que lee literatura científica de forma nativa —figuras, maquetación, notación simbólica y prosa en conjunto— y una entrada de series temporales que produce pronósticos, junto con un pensamiento que está activado de forma predeterminada y se puede alternar por solicitud. Si tu tarea larga es científica, el modelo se entrenó exactamente para eso; si tu tarea larga es una base de código, este no es el modelo con la ventana de un millón de tokens para ello.

• Contexto — Kimi K3: 1.048.576 tokens de entrada y salida frente a Intern-S2-397B: 256K de texto / 64K multimodal.

• Escala — Kimi K3: 2,8T en total, ~104B activos por token frente a Intern-S2-397B: 403B en total, 512 expertos / 10 activos.

• Superficie de control — Kimi K3: control de reasoning_effort, sin parámetros de muestreo vs. Intern-S2-397B: conmutador enable_thinking más control completo a nivel de pesos bajo Apache-2.0.

• Entradas — Kimi K3: texto, imagen vs Intern-S2-397B: texto, imagen, series temporales.

• Pesos — Kimi K3: abiertos bajo la licencia MIT modificada (27 de julio) frente a Intern-S2-397B: abiertos bajo Apache-2.0 (13 de septiembre).

• Evidencia independiente — Kimi K3: seis semanas de puntuaciones de terceros frente a Intern-S2-397B: aún ninguna.

La asimetría de la evidencia es la verdadera diferencia

Kimi K3 ha pasado por el riguroso escrutinio independiente y ha salido con puntuaciones sobre las que se puede construir. Artificial Analysis lo sitúa en los 40 medios en su actual Intelligence Index, con un GPQA Diamond en los 90 bajos, un HLE en los 40 medios, una recuperación de contexto largo medida de forma independiente de 88,7 y una puntuación de codificación en los 70 medios. Ocupa el primer puesto en Frontend Code Arena (Elo en los 1670) y obtuvo 91,2 en BrowseComp, la cifra más alta de ese benchmark de recuperación de horizonte largo, aunque la propia Moonshot advierte que K3 «sigue por detrás de los modelos propietarios más potentes», y varias de sus filas del día de lanzamiento siguen siendo reportadas por el proveedor.

La evidencia de Intern-S2-397B es su propia tabla de lanzamiento, ejecutada con OpenCompass, VLMEvalKit y AgentCompass, publicada horas antes de que leas esto. Cada cifra es del propio proveedor y no está reproducida: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 y TerminalBench 2.1 con 64.04 — una cifra que la ficha muestra perdiendo frente a una generación cerrada más antigua por un amplio margen. Sus filas científicas son las cifras que respaldan el argumento de un especialista: 55.71 en Biology-Instructions, 63.28 en SciReasoner 1.5, 53.95 en Mol-Instructions, 62.35 en MolecularIQ. Las dos bases de evidencia no se tocan, por lo que el planteamiento honesto de este enfrentamiento no es "quién gana", sino "¿qué tipo de evidencia necesita tu carga de trabajo?".

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

Cuánto cuesta cada uno, edición de pesos abiertos

Ambos modelos son de pesos abiertos, lo que cambia la cuestión de costes de la habitual disyuntiva entre pago por uso y gratuito a una comparación de dos propuestas de alojamiento. Kimi K3 tiene un precio de API publicado —3,00 $ / 15,00 $ por millón de tokens según el precio de lista de Moonshot, repercutido en OrcaRouter con un margen del 0 %, más el precio de lectura de caché— y también es descargable: una versión de pesos abiertos de 96 fragmentos que necesita hardware de clase supernodo, 64 o más aceleradores, para servirla. El público práctico para un K3 autoalojado son equipos con presupuestos de centro de datos. Intern-S2-397B no tiene ningún precio de API publicado; la tarjeta del modelo apunta a la API oficial de Intern, y la economía real es la del autoalojamiento: aproximadamente 807 GB de pesos repartidos en 188 fragmentos en BF16, un nodo multigpu considerable, con una versión en FP8 que reduce la huella aproximadamente a la mitad.

Ambos modelos se pueden invocar a través de la misma interfaz si enrutas: Kimi K3 está en OrcaRouter al precio de lista de Moonshot, con un 0 % de recargo, mientras que Intern-S2-397B no está enrutado —un checkpoint Apache-2.0 recién salido, siendo tu vía de acceso a él la propia API del proveedor o un despliegue autoalojado. El valor del enrutamiento en este enfrentamiento es mantener el tráfico generalista de contexto largo en la clave que ya tienes y el trabajo científico por lotes en el modelo que ejecutas, con conmutación por error automática entre ambos. El DSL convierte esa frontera en una configuración en lugar de una segunda integración.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

El veredicto

Elige Kimi K3 cuando el trabajo sea de generalista de contexto largo —programación de repositorios completos, bucles de agentes sostenidos, trabajo de conocimiento que necesita un millón de tokens de memoria de trabajo— y quieras un marcador independiente que lo respalde. Es el modelo mejor respaldado por evidencia en todos los sentidos, sus pesos abiertos son reales (Modified MIT, 27 de julio), y si ya operas infraestructura de clase supernodo, la economía por token con caché es favorable.

Elige Intern-S2-397B cuando la tarea sea científica: artículos con gran densidad de figuras, diagramas moleculares, bibliografía escaneada, señales de series temporales y datos que deban permanecer dentro de tu perímetro, o pesos que quieras ajustar sobre resultados propietarios. Apache-2.0 lo hace posible; ninguna API alquilada lo consigue, y las filas científicas de la ficha son de una especie distinta de aquello para lo que jamás se ajustó un modelo generalista. Presupuesta el hardware, realiza tu propia evaluación y trata cada cifra publicada al respecto como una afirmación hasta que alguien ajeno a InternLM reproduzca alguna.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.