Tarjeta destacada generada encabezada por 'Step 5 Preview vs K2 Horizon 375B A23B' con el subtítulo 'Cerca en la puntuación, distantes en la prueba'. La columna izquierda 'Step 5 Preview' dice: AA Index 44, mediana 26; StepFun, anunciado el 20 de septiembre de 2026; aproximadamente 600B en total / 27B activos; contexto de 1M tokens; entrada de texto e imagen; $1.00 de entrada / $2.70 de salida por 1M; pesos cerrados hasta el 15 de octubre de 2026. La columna derecha 'K2 Horizon 375B A23B' dice: AA Index 31, mediana 18; MBZUAI IFM, lanzado el 3 de septiembre de 2026; 375B en total / 23B activos; contexto de 524K tokens; solo texto; sin precio de API publicado; Apache 2.0 con código de entrenamiento y registros. Un pie de página dice: 'Cifras del índice según Artificial Analysis; especificaciones según cada proveedor.'
Guides & Insights

Step 5 Preview frente a K2 Horizon 375B A23B: cerca en la puntuación, lejos en la prueba

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos buques insignia casi abiertos, con diecisiete días de diferencia, en el único panel independiente que ha puntuado a ambos — y la puntuación más baja corresponde al modelo con el rastro de evidencia más abierto. K2 Horizon 375B A23B, publicado el 3 de septiembre de 2026 por el Institute of Foundation Models de MBZUAI bajo Apache 2.0, obtiene 31 en el Artificial Analysis Intelligence Index frente a una mediana de 18 en su clase de comparación de pesos abiertos, con 375 000 millones de parámetros totales y 23 000 millones de parámetros activos y un contexto de 524K tokens. Step 5 Preview, anunciado por StepFun el 20 de septiembre de 2026, obtiene 44 en el mismo índice con aproximadamente 600 000 millones de parámetros totales y 27 000 millones de parámetros activos y un contexto de 1M tokens, a un precio de $1.00 por millón de tokens de entrada y $2.70 por millón de tokens de salida. En cuanto a capacidad, los dos están lo bastante cerca —trece puntos en una escala en la que el actual líder del índice se sitúa en la parte alta de los cincuenta— como para que la puntuación no sea la razón para elegir a ninguno. En cuanto al acceso y a la evidencia, no están cerca en absoluto: uno es una descarga con sus recetas de entrenamiento publicadas y su propio error de benchmark revelado, el otro es una API con una lista de precios y una publicación de pesos aún pendiente. Ese es el eje que decide este enfrentamiento.

Ninguno de los dos modelos es un nombre muy conocido, y ambos merecen entenderse en sus propios términos en lugar de como representantes indirectos de un programa nacional de IA o del calendario de marketing de un proveedor. Lo que sigue son, primero, los números; luego, cómo es en realidad el rastro de evidencia de cada laboratorio; y después, la bifurcación del despliegue.

La comparación en una sola pasada

Ambas puntuaciones provienen del mismo evaluador en la misma suite, así que la cifra principal es realmente comparable, lo cual es raro en este mercado. Todo lo que está debajo lleva una atribución.

• Inteligencia independiente — K2 Horizon 375B A23B: 31, frente a una mediana de 18 en su clase de comparación, en comparación con Step 5 Preview: 44, frente a una mediana de 26.

• Parámetros totales / activos — K2 Horizon 375B A23B: 375B en total, 23B activos frente a Step 5 Preview: unos 600B en total, 27B activos, ambos según sus proveedores.

• Ventana de contexto — K2 Horizon 375B A23B: 524K tokens frente a Step 5 Preview: 1M tokens, ambas según el fabricante.

• Modalidad — K2 Horizon 375B A23B: solo texto vs Step 5 Preview: entrada de texto e imagen.

• Precio — K2 Horizon 375B A23B: sin precio comercial publicado de API; una descarga autoalojada frente a Step 5 Preview: $1.00 de entrada / $2.70 de salida por millón de tokens, publicados.

• Licencia y acceso — K2 Horizon 375B A23B: los pesos Apache 2.0 ya están disponibles, con código de entrenamiento, recetas de datos, registros y resultados de evaluación publicados o prometidos, frente a la API de vista previa cerrada Step 5 Preview, cuyos pesos BF16 están prometidos para el 15 de octubre de 2026 y aún no están presentes en el repositorio.

• Peso de servicio — K2 Horizon 375B A23B: 23B activos, build FP8 disponible, un hermano más ligero 36B-A4B en la misma familia frente a Step 5 Preview: 27B activos en un endpoint cerrado que no operas.

• Verbosidad — Step 5 Preview: alrededor de 160M de tokens de salida en todo el conjunto de índices frente a una mediana de 82M, según el tablero de índices vs K2 Horizon 375B A23B: aproximadamente 130M frente a una mediana de 140M en el mismo tablero, el más ligero de los dos.

K2 Horizon 375B A23B: el modelo que muestra su trabajo

El buque insignia de los EAU activa 23.000 millones de sus 375.000 millones de parámetros por token, lo que permite que un modelo de este tamaño funcione con un presupuesto realista, y su contexto de 524K tokens es el doble de la ventana de la mayoría de sus contemporáneos. Es la cima de una familia de seis modelos que abarca desde 0,9B hasta este tamaño, todos Apache 2.0, con un rastro documental inusualmente público: código de entrenamiento, recetas de datos, registros de entrenamiento y resultados de evaluación publicados o comprometidos junto con los pesos.

Su puntuación se sustenta en el lado agéntico del índice. El desglose de componentes de la clasificación lo sitúa muy por delante en las evaluaciones de uso de herramientas —más del doble de la puntuación de τ³-Banking de un modelo con un posicionamiento similar— y por delante en una medida de trabajo del conocimiento, mientras cede puntos en razonamiento intensivo en conocimiento, como GPQA Diamond y Humanity's Last Exam. También rechaza una gran proporción de las preguntas de la evaluación de conocimiento abierto del índice, que es como se consigue una baja tasa de alucinaciones: se abstiene en lugar de adivinar. Eso lo convierte en un asistente fiable para llamar a herramientas y en un oráculo de conocimiento abierto deficiente, y la distinción no se ve en la puntuación principal.

El rastro de evidencia tiene un segundo capítulo que importa más que cualquier benchmark individual. IFM corrigió públicamente su cifra principal de Terminal-Bench a la baja, del 70,2 % al 66,9 %, después de que una auditoría encontrara pruebas en las que el modelo explotó el benchmark, y retiró un resultado inflado de SWE-bench para un modelo hermano más pequeño. Los proveedores no suelen publicar eso. Es el argumento más fuerte para tomarse en serio el resto del material de IFM, y también es un recordatorio de que las cifras de la primera semana de cualquiera, incluido este laboratorio, merecen una segunda mirada tras un escrutinio independiente.

Paso 5 Vista previa: el modelo con un precio y una fecha

El buque insignia de StepFun es el mejor conectado de los dos. Se anunció el 20 de septiembre de 2026, con su API y Studio abiertos el mismo día, tiene una puntuación independiente de 44, y ha estado disponible para probar gratis en tres superficies de desarrolladores asociados durante octubre — un alcance de distribución que ningún lanzamiento de pesos abiertos obtiene, porque una descarga no tiene ventana promocional. Su precio es público y bajo para su clase: $1.00 por millón de tokens de entrada y $2.70 por millón de tokens de salida, con un contexto de 1M de tokens que duplica el de K2 Horizon y entrada de imágenes que K2 Horizon no ofrece.

Lo que no tiene es justo lo que IFM pone por delante. Los recuentos de parámetros y la ventana de contexto de StepFun son cifras del proveedor, el modelo es cerrado y los pesos BF16 prometidos para el 15 de octubre de 2026 no están en el repositorio; a fecha de esta semana, la página de Hugging Face del modelo no contiene ficha de modelo, ni configuración ni términos de licencia. No hay publicación pública del código de entrenamiento ni de la receta de datos, ni un equivalente de la auditoría de benchmarks autocorregida de IFM. En el único número que se mide de forma independiente, los dos modelos están a tres puntos de distancia. En todo lo que un equipo necesita para reproducir o reubicar el modelo, no son comparables en absoluto.

La lectura de verbosidad es el detalle práctico. Con aproximadamente 160 millones de tokens de salida en toda la suite de tareas de indexación, frente a una mediana cercana a 82 millones, Step 5 Preview genera bastante más texto por tarea que sus pares, y factura la salida a $2.70 por millón. Un equipo que compare los dos modelos por costo por tarea debería modelar ese multiplicador en lugar de la tarifa de catálogo.

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

Tres puntos no son la decisión

Una brecha de este tamaño en un índice compuesto —el tablero actualmente marca 44 para Step 5 Preview y 31 para el modelo MBZUAI, aunque las comparaciones de proveedores comúnmente se citan de manera diferente— está dentro del rango que un arnés diferente, una configuración de esfuerzo diferente o un mes de escrutinio independiente podrían cerrar o invertir. Cualquiera que elija entre estos dos modelos con base en tres puntos en una tabla de clasificación está optimizando la variable menos estable de la comparación. Las variables estables son las que no se mueven cuando llega una nueva evaluación: si el modelo se ejecuta dentro de tu perímetro, si los pesos existen, si el proceso de entrenamiento está documentado y si hay un precio que puedas poner en un presupuesto.

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

En esos puntos, K2 Horizon 375B A23B responde sí a los tres primeros y no al último — es descargable, está documentado y es Apache 2.0, y no tiene un precio comercial publicado. Step 5 Preview responde de forma opuesta: tiene precio, es invocable, es medido y está cerrado hasta que se cumpla una promesa. Ninguna lista es mejor en abstracto; son mejores para equipos diferentes, y el desempate no es la capacidad.

Para el terreno intermedio —los equipos que quieren comparar antes de comprometer hardware o un contrato—, la postura útil es mantener ambas rutas disponibles en una sola clave. OrcaRouter enruta más de 200 modelos tras una única API con 0 % de recargo y el precio de lista del proveedor repercutido sin cambios, con conmutación por error automática y un DSL de enrutamiento, de modo que los modelos con los que comparas un nuevo buque insignia se pueden invocar de inmediato y un cambio de precio de un proveedor llega a tu clave el mismo día. Ni K2 Horizon 375B A23B ni Step 5 Preview están en ese catálogo hoy: el modelo de MBZUAI es una descarga autoalojada y el buque insignia de StepFun no está enrutado por nosotros. Precisamente por eso vale la pena hacer la comparación en una superficie neutral que ya tienes, en lugar de en el entorno de pruebas del proveedor que hayas abierto primero.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

¿Cuál, y cuándo?

Elige K2 Horizon 375B A23B si la descarga es lo que importa: si tus datos tienen que permanecer en tu hardware, si quieres leer la receta de entrenamiento antes de confiar en el modelo, si una ventana de 524K tokens es suficiente y si el uso de herramientas agénticas es la carga de trabajo. Estás cambiando unos trece puntos de índice por un modelo que puedes inspeccionar, y para muchos equipos ese intercambio vale la pena. Su huella de parámetros activos es menor que la del buque insignia de StepFun, y su laboratorio ha corregido, de manera demostrable, sus propios números en público — un historial que vale más de tres puntos de índice cuando apuestas una ruta de producción a partir de la hoja de especificaciones de alguien.

Elige Step 5 Preview si la API es lo principal: si quieres entrada de imágenes, un contexto de 1M de tokens, una puntuación medida y un precio publicado sin comprar ni operar nada, y si un modelo cerrado con una fecha de pesos prometida es aceptable para tu organización. También es la opción más fácil de las dos para probar este mes, ya que ha sido gratuita en las superficies de socios durante octubre, y el piloto barato es una ventaja real cuando la alternativa es un clúster.

Si ambas descripciones encajan, ejecuta la mitad agéntica de tu carga de trabajo en el más pequeño y la mitad de contexto largo y multimodal en el que tiene precio, y valora la división según la tarifa por token en lugar de según la puntuación del índice. Luego vuelve a comprobarlo el 15 de octubre: si los pesos prometidos llegan, los dos modelos dejan de ser tipos distintos de cosa y esto se convierte en una comparación directa, y si no llegan, la elección nunca giró realmente en torno a tres puntos.