Una tarjeta principal generada que compara Intern-S2-397B y Grok 4.6, que muestra a la izquierda un modelo científico de pesos abiertos con un interruptor de razonamiento etiquetado como enable_thinking y una forma de onda de series temporales, y a la derecha un endpoint en la nube cerrado con un dial de esfuerzo de razonamiento e iconos de herramientas del lado del servidor, etiquetada con el contraste entre el control autoalojado de Apache-2.0 y una API de pago por uso de $2 / $6, con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Intern-S2-397B vs Grok 4.6: ¿Quién puede girar las perillas?

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Intern-S2-397B y Grok 4.6 se lanzaron con aproximadamente un mes de diferencia y responden a la misma pregunta de fondo de maneras opuestas: quién tiene el control del razonamiento. Grok 4.6, el buque insignia de x​AI que se puso en marcha el 12 de agosto de 2026, te vende un dial: un control configurable del esfuerzo de razonamiento sobre una API cerrada con un precio de 2,00 $ por millón de tokens de entrada y 6,00 $ por millón de tokens de salida, con una ventana de 500.000 tokens y las herramientas del lado del servidor de x​AI facturadas aparte. Intern-S2-397B, el modelo científico multimodal de 403 mil millones de parámetros que el equipo de InternLM del Shanghai AI Laboratory publicó bajo Apache-2.0 el 13 de septiembre, te entrega la máquina entera —los pesos, el interruptor de pensamiento, la ruta de visión, la cabeza de series temporales— y espera que la ejecutes tú mismo. Uno se alquila con mandos; el otro se posee en propiedad. La comparación que importa aquí no es cuál obtiene mejor puntuación en una tabla de benchmarks; es qué tipo de control necesita realmente tu carga de trabajo y cuánto cuesta cada tipo.

Dos esferas diferentes

La forma más limpia de distinguir a estos dos es fijarse en dónde residen los controles del razonamiento. Grok 4.6 expone un ajuste de esfuerzo de razonamiento a través de la API de x​AI, y alrededor hay un conjunto de herramientas del lado del servidor —llamada a funciones, búsqueda web, búsqueda en X, ejecución de código— que x​AI opera y factura por separado. Tú ajustas el esfuerzo, encadenas las herramientas que te ofrece y nunca tocas un peso. El comportamiento del modelo es propiedad de x​AI y problema de x​AI; tu palanca es un parámetro en la solicitud.

Intern-S2-397B te ofrece un conjunto diferente de palancas, y están más abajo en la pila. El pensamiento está activado de forma predeterminada y lo desactivas por solicitud con enable_thinking=False. Como el modelo es Apache-2.0, también puedes tomar los pesos y hacer ajuste fino del propio comportamiento de razonamiento con tus propios datos, y luego servir el resultado en LMDeploy, vLLM o SGLang. Su superficie de entrada es más amplia que la de una API de texto e imágenes: acepta señales de series temporales y produce pronósticos, una capacidad que actualmente solo está canalizada a través de LMDeploy, y fue entrenado para trabajo de agentes de horizonte largo en entornos aislados. La contrapartida es igual de clara: ese nivel de control solo tiene sentido si estás preparado para operar el hardware y la pila de servicio que conlleva.

• Control de razonamiento — Grok 4.6: dial de esfuerzo de razonamiento en una API cerrada frente a Intern-S2-397B: conmutador enable_thinking más control completo a nivel de pesos bajo Apache-2.0.

• Herramientas — Grok 4.6: búsqueda web del lado del servidor de xAI, búsqueda en X y ejecución de código, con facturación por separado frente a Intern-S2-397B: llamadas a herramientas que configuras tú mismo, además de una ruta de previsión de series temporales a través de LMDeploy.

• Entradas — Grok 4.6: texto, imagen, archivo vs Intern-S2-397B: texto, imagen, series temporales.

• Contexto — Grok 4.6: 500.000 tokens frente a Intern-S2-397B: 256K de razonamiento de texto, 64K multimodal, ambas cifras proceden de la ficha del modelo.

• Precio — Grok 4.6: $2.00 / $6.00 por 1M, con escalado a $4.00 / $12.00 a partir de 200K tokens, frente a Intern-S2-397B: sin tarifario; autoalojamiento o la API oficial de Intern.

Qué incluyen realmente los números

Todas las cifras de Intern-S2-397B que figuran a continuación son de InternLM, ejecutadas mediante OpenCompass, VLMEvalKit y AgentCompass y publicadas junto con los pesos sin reproducción independiente. Los números de Grok 4.6 son algo distinto: se acumularon a través de la arena pública y Artificial Analysis después de que el modelo se lanzara, por lo que llevan una etiqueta de terceros.

En el lado de las mediciones independientes, Grok 4.6 se sitúa en 44 en el actual Artificial Analysis Intelligence Index, con un GPQA Diamond de 94.9, un Humanity's Last Exam de 61.0 y una puntuación de codificación de 76.8, y Artificial Analysis sitúa su cifra de TerminalBench 2.1 cerca de 80.3. En el lado del proveedor, la ficha de Intern-S2-397B reporta 89.77 en MMLU Pro, 93.56 en HMMT-2026, 81.68 en MMMU Pro y 68.54 en SWE-bench-Pro, junto con filas científicas donde parece una especie diferente: 55.71 en Biology-Instructions, 63.28 en SciReasoner 1.5, 53.95 en Mol-Instructions, 62.35 en MolecularIQ. El único número en la tabla del proveedor que debería hacer que un constructor de agentes se estremezca es TerminalBench 2.1 con 64.04 — una cifra que los propios creadores del modelo reportan perdiendo frente a una generación cerrada más antigua por un amplio margen, en exactamente el carril de trabajo de terminal en el que un modelo de frontera alquilado como Grok 4.6 es más fuerte.

Interpreta esa división como un retrato, no como una clasificación. Intern-S2-397B es un especialista científico que es un modelo general competente; Grok 4.6 es un generalista que tiene un interés pasajero por la ciencia. Que las filas científicas estén desequilibradas es de esperar — ningún modelo insignia generalista fue preentrenado con páginas sin procesar de literatura científica con figuras, maquetación y notación simbólica en conjunto, y ese es precisamente el paradigma en torno al cual está construido Intern-S2-397B. Nada en ninguna de las dos bases de evidencia respalda que «Intern-S2-397B es tan bueno como Grok 4.6 en razonamiento arbitrario», y nada en la evidencia de Grok 4.6 sugiere que se haya ajustado para el análisis de secuencias multiómicas.

El precio del control

Grok 4.6 tiene un precio que puedes poner en una hoja de cálculo: $2.00 por millón de tokens de entrada y $6.00 por millón de salida, con la tarifa subiendo a $4.00 / $12.00 una vez que un prompt supera los 200,000 tokens, y un nivel de prioridad opcional para respuestas más rápidas. Está disponible a través de OrcaRouter al precio de lista de x​AI trasladado con un 0 % de margen, así que un cambio de tarifa en x​AI llega aquí el mismo día sin delta de intermediario — el dial que alquilas se mantiene al precio que le pone el proveedor.

Intern-S2-397B no tiene ninguna tarifa publicada por token. La ficha del modelo hace referencia a una API oficial de Intern, pero la economía que la gente realmente quiere comparar es la del autoalojamiento: un checkpoint de 403B parámetros, aproximadamente 807 GB de pesos en 188 fragmentos en BF16, por lo que se trata de un nodo multi-GPU serio, y la compilación FP8 reduce aproximadamente a la mitad la huella. Si ya posee esa capacidad, el costo marginal de la próxima consulta científica se acerca al de la electricidad, y ese es el punto central de la posición Apache-2.0. Si no la posee, el modelo "gratuito" es un piloto de gasto de capital, no una partida presupuestaria.

Lo que un router aporta en este emparejamiento concreto es la costura, más que el precio. Grok 4.6 se apoya en la clave que ya tienes para el tráfico general de producción; Intern-S2-397B no se enruta en OrcaRouter: es un checkpoint completamente nuevo, y tu ruta hacia él es la API propia del proveedor o un despliegue autoalojado. Enruta el razonamiento general y sensible a la latencia al modelo de uso medido, mantén el trabajo científico por lotes en el modelo que ejecutas y deja que la conmutación automática por error te cubra cuando el endpoint de cualquiera de los dos lados no esté en buen estado. La frontera entre ellos se convierte en una regla de enrutamiento en lugar de una segunda integración.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

¿Cuál elegir?

Elige Grok 4.6 cuando el trabajo sea general, el razonamiento tenga que volver rápido y correcto, y no quieras ser dueño de la pila que lo produce. Su ventana de 500K, su GPQA Diamond medido en 94.9 y su conjunto de herramientas son características de producción, y la tarifa de $2/$6 es lo que pagas por no operar nada.

Elige Intern-S2-397B cuando la entrada sea científica — un artículo denso en figuras, un diagrama molecular, una señal de series temporales — y cuando el razonamiento tenga que ocurrir sobre datos que no pueden salir de tu entorno, o sobre un comportamiento que quieras ajustar tú mismo. Apache-2.0 lo hace posible; ninguna API alquilada lo hace. Presupuesta para el hardware, no esperes una tabla de puntuaciones independiente por un tiempo, y trata cada número de su ficha como una afirmación hasta que alguien fuera de InternLM reproduzca uno.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.