
Intern-S2-397B vs Grok 4.6: ¿Quién puede girar las perillas?
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Intern-S2-397B y Grok 4.6 se lanzaron con aproximadamente un mes de diferencia y responden a la misma pregunta de fondo de maneras opuestas: quién tiene el control del razonamiento. Grok 4.6, el buque insignia de xAI que se puso en marcha el 12 de agosto de 2026, te vende un dial: un control configurable del esfuerzo de razonamiento sobre una API cerrada con un precio de 2,00 $ por millón de tokens de entrada y 6,00 $ por millón de tokens de salida, con una ventana de 500.000 tokens y las herramientas del lado del servidor de xAI facturadas aparte. Intern-S2-397B, el modelo científico multimodal de 403 mil millones de parámetros que el equipo de InternLM del Shanghai AI Laboratory publicó bajo Apache-2.0 el 13 de septiembre, te entrega la máquina entera —los pesos, el interruptor de pensamiento, la ruta de visión, la cabeza de series temporales— y espera que la ejecutes tú mismo. Uno se alquila con mandos; el otro se posee en propiedad. La comparación que importa aquí no es cuál obtiene mejor puntuación en una tabla de benchmarks; es qué tipo de control necesita realmente tu carga de trabajo y cuánto cuesta cada tipo.
Dos esferas diferentes
La forma más limpia de distinguir a estos dos es fijarse en dónde residen los controles del razonamiento. Grok 4.6 expone un ajuste de esfuerzo de razonamiento a través de la API de xAI, y alrededor hay un conjunto de herramientas del lado del servidor —llamada a funciones, búsqueda web, búsqueda en X, ejecución de código— que xAI opera y factura por separado. Tú ajustas el esfuerzo, encadenas las herramientas que te ofrece y nunca tocas un peso. El comportamiento del modelo es propiedad de xAI y problema de xAI; tu palanca es un parámetro en la solicitud.
Intern-S2-397B te ofrece un conjunto diferente de palancas, y están más abajo en la pila. El pensamiento está activado de forma predeterminada y lo desactivas por solicitud con enable_thinking=False. Como el modelo es Apache-2.0, también puedes tomar los pesos y hacer ajuste fino del propio comportamiento de razonamiento con tus propios datos, y luego servir el resultado en LMDeploy, vLLM o SGLang. Su superficie de entrada es más amplia que la de una API de texto e imágenes: acepta señales de series temporales y produce pronósticos, una capacidad que actualmente solo está canalizada a través de LMDeploy, y fue entrenado para trabajo de agentes de horizonte largo en entornos aislados. La contrapartida es igual de clara: ese nivel de control solo tiene sentido si estás preparado para operar el hardware y la pila de servicio que conlleva.
• Control de razonamiento — Grok 4.6: dial de esfuerzo de razonamiento en una API cerrada frente a Intern-S2-397B: conmutador enable_thinking más control completo a nivel de pesos bajo Apache-2.0.
• Herramientas — Grok 4.6: búsqueda web del lado del servidor de xAI, búsqueda en X y ejecución de código, con facturación por separado frente a Intern-S2-397B: llamadas a herramientas que configuras tú mismo, además de una ruta de previsión de series temporales a través de LMDeploy.
• Entradas — Grok 4.6: texto, imagen, archivo vs Intern-S2-397B: texto, imagen, series temporales.
• Contexto — Grok 4.6: 500.000 tokens frente a Intern-S2-397B: 256K de razonamiento de texto, 64K multimodal, ambas cifras proceden de la ficha del modelo.
• Precio — Grok 4.6: $2.00 / $6.00 por 1M, con escalado a $4.00 / $12.00 a partir de 200K tokens, frente a Intern-S2-397B: sin tarifario; autoalojamiento o la API oficial de Intern.
Qué incluyen realmente los números
Todas las cifras de Intern-S2-397B que figuran a continuación son de InternLM, ejecutadas mediante OpenCompass, VLMEvalKit y AgentCompass y publicadas junto con los pesos sin reproducción independiente. Los números de Grok 4.6 son algo distinto: se acumularon a través de la arena pública y Artificial Analysis después de que el modelo se lanzara, por lo que llevan una etiqueta de terceros.
En el lado de las mediciones independientes, Grok 4.6 se sitúa en 44 en el actual Artificial Analysis Intelligence Index, con un GPQA Diamond de 94.9, un Humanity's Last Exam de 61.0 y una puntuación de codificación de 76.8, y Artificial Analysis sitúa su cifra de TerminalBench 2.1 cerca de 80.3. En el lado del proveedor, la ficha de Intern-S2-397B reporta 89.77 en MMLU Pro, 93.56 en HMMT-2026, 81.68 en MMMU Pro y 68.54 en SWE-bench-Pro, junto con filas científicas donde parece una especie diferente: 55.71 en Biology-Instructions, 63.28 en SciReasoner 1.5, 53.95 en Mol-Instructions, 62.35 en MolecularIQ. El único número en la tabla del proveedor que debería hacer que un constructor de agentes se estremezca es TerminalBench 2.1 con 64.04 — una cifra que los propios creadores del modelo reportan perdiendo frente a una generación cerrada más antigua por un amplio margen, en exactamente el carril de trabajo de terminal en el que un modelo de frontera alquilado como Grok 4.6 es más fuerte.
Interpreta esa división como un retrato, no como una clasificación. Intern-S2-397B es un especialista científico que es un modelo general competente; Grok 4.6 es un generalista que tiene un interés pasajero por la ciencia. Que las filas científicas estén desequilibradas es de esperar — ningún modelo insignia generalista fue preentrenado con páginas sin procesar de literatura científica con figuras, maquetación y notación simbólica en conjunto, y ese es precisamente el paradigma en torno al cual está construido Intern-S2-397B. Nada en ninguna de las dos bases de evidencia respalda que «Intern-S2-397B es tan bueno como Grok 4.6 en razonamiento arbitrario», y nada en la evidencia de Grok 4.6 sugiere que se haya ajustado para el análisis de secuencias multiómicas.
El precio del control
Grok 4.6 tiene un precio que puedes poner en una hoja de cálculo: $2.00 por millón de tokens de entrada y $6.00 por millón de salida, con la tarifa subiendo a $4.00 / $12.00 una vez que un prompt supera los 200,000 tokens, y un nivel de prioridad opcional para respuestas más rápidas. Está disponible a través de OrcaRouter al precio de lista de xAI trasladado con un 0 % de margen, así que un cambio de tarifa en xAI llega aquí el mismo día sin delta de intermediario — el dial que alquilas se mantiene al precio que le pone el proveedor.
Intern-S2-397B no tiene ninguna tarifa publicada por token. La ficha del modelo hace referencia a una API oficial de Intern, pero la economía que la gente realmente quiere comparar es la del autoalojamiento: un checkpoint de 403B parámetros, aproximadamente 807 GB de pesos en 188 fragmentos en BF16, por lo que se trata de un nodo multi-GPU serio, y la compilación FP8 reduce aproximadamente a la mitad la huella. Si ya posee esa capacidad, el costo marginal de la próxima consulta científica se acerca al de la electricidad, y ese es el punto central de la posición Apache-2.0. Si no la posee, el modelo "gratuito" es un piloto de gasto de capital, no una partida presupuestaria.
Lo que un router aporta en este emparejamiento concreto es la costura, más que el precio. Grok 4.6 se apoya en la clave que ya tienes para el tráfico general de producción; Intern-S2-397B no se enruta en OrcaRouter: es un checkpoint completamente nuevo, y tu ruta hacia él es la API propia del proveedor o un despliegue autoalojado. Enruta el razonamiento general y sensible a la latencia al modelo de uso medido, mantén el trabajo científico por lotes en el modelo que ejecutas y deja que la conmutación automática por error te cubra cuando el endpoint de cualquiera de los dos lados no esté en buen estado. La frontera entre ellos se convierte en una regla de enrutamiento en lugar de una segunda integración.

¿Cuál elegir?
Elige Grok 4.6 cuando el trabajo sea general, el razonamiento tenga que volver rápido y correcto, y no quieras ser dueño de la pila que lo produce. Su ventana de 500K, su GPQA Diamond medido en 94.9 y su conjunto de herramientas son características de producción, y la tarifa de $2/$6 es lo que pagas por no operar nada.
Elige Intern-S2-397B cuando la entrada sea científica — un artículo denso en figuras, un diagrama molecular, una señal de series temporales — y cuando el razonamiento tenga que ocurrir sobre datos que no pueden salir de tu entorno, o sobre un comportamiento que quieras ajustar tú mismo. Apache-2.0 lo hace posible; ninguna API alquilada lo hace. Presupuesta para el hardware, no esperes una tabla de puntuaciones independiente por un tiempo, y trata cada número de su ficha como una afirmación hasta que alguien fuera de InternLM reproduzca uno.


