Una tarjeta principal generada titulada «Reflection Beam vs Kimi K3» con el subtítulo «El mismo nombre de benchmark, dos sistemas de evaluación distintos» y tres chips de estadísticas que dicen «Terminal-Bench 2.1: 80.1 vs 88.3», «ejecución independiente: 85.0» y «precio: no publicado vs $3 / $15». Debajo hay tres iconos planos de línea: un portapapeles con una marca de verificación, una regla que mide una barra y una lupa sobre un gráfico de barras. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Reflection Beam vs Kimi K3: El mismo nombre de benchmark, dos arneses diferentes

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Reflection Beam obtiene 80,1 en Terminal-Bench 2.1. Kimi K3 obtiene 88,3. Ponga esas dos cifras una al lado de la otra, como ha hecho la mayor parte de la cobertura de esta semana, y concluirá que Beam está a unos ocho puntos del mejor modelo abierto del sector. Pero esas dos cifras no salen de la misma sala. El 80,1 de Beam es reportado por el proveedor, tomado de la tabla del propio anuncio de lanzamiento de Reflection. El 88,3 de Kimi K3 también es reportado por el proveedor, esta vez de la tabla del propio Moonshot, y la tabla de un proveedor solo imprime la puntuación de su competidor cuando esta se ha ejecutado en el propio harness del proveedor, bajo su propio conjunto de prompts, con su propia configuración de esfuerzo. Un tercero, Artificial Analysis, ha ejecutado desde entonces Kimi K3 en un benchmark con el mismo nombre y ha publicado 85,0. Eso supone una diferencia de 4,9 puntos, no de 8,2, y la dirección de la corrección es totalmente predecible, porque el número que se erosiona es siempre el que proviene del laboratorio que tiene algo que demostrar.

Ese es todo el problema de la comparación que promete el título de este artículo, y es la razón por la que este texto dedica su primera mitad a la procedencia en lugar de a las puntuaciones. Reflection Beam es un modelo disperso de mezcla de expertos de 501 mil millones de parámetros, con 23 mil millones de parámetros activos por token, anunciado el 5 de octubre de 2026 por Reflection AI, con un endpoint beta compatible con OpenAI activo ese mismo día. Kimi K3 es el modelo abierto insignia de Moonshot AI, incluido en nuestro propio catálogo con fecha de lanzamiento del 15 de julio de 2026 y puntuado de forma independiente por Artificial Analysis. Uno de ellos es un producto ya disponible con tarifario y una ejecución de un harness de terceros; el otro es una beta en lista de espera cuyos pesos, informe técnico y precio aún no existen. Compararlos no es un ejercicio simétrico, y fingir lo contrario produciría una página que parece precisa y es incorrecta.

La versión de 30 segundos

• Beam es más rápido por FLOP sobre el papel, sin precio en la práctica y sin reproducción. Kimi K3 está evaluado por un tercero, tiene un precio de $3.00 de entrada y $15.00 de salida por millón de tokens, y está disponible de forma general.

• En el único benchmark en el que ambos se han ejecutado — Terminal-Bench 2.1 —, la brecha honesta es de unos cinco puntos, no ocho, una vez que las cifras de cada lado provienen de un harness neutral.

• Las verdaderas ventajas de Beam son estructurales, no numéricas: un perfil de servicio de 23B de parámetros activos y una licencia Apache 2.0 prometida. Ninguna de las dos es utilizable hoy.

• Si necesitas un modelo esta semana, esto no es echar una moneda al aire. Es un modelo disponible y una lista de espera.

Lo que Reflection publicó realmente, y contra quién

La publicación de lanzamiento de Reflection presenta una tarjeta de puntuación frente a otros siete modelos: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max y DeepSeek V4.1 Flash. Todas las cifras de la tabla son declaradas por el proveedor, ninguna ha sido reproducida de forma independiente, y no existe una página de Artificial Analysis para Reflection Beam: la página del modelo da error 404 en su sitio a fecha de 6 de octubre de 2026. Varias celdas del original están marcadas como NR porque el modelo no se ejecutó.

Aquí está la sección completa de Beam frente a K3 de esa tabla, una línea por dimensión:

• Terminal-Bench 2.1 — Beam 80,1 frente a Kimi K3 88,3

• SWE-Bench Pro v2-Hard — Beam 77,2 frente a Kimi K3 88,2

• DeepSWE v1.1 — Beam 44,4 vs Kimi K3 68,0

• SWE Atlas Codebase QnA — Beam 34,6 vs Kimi K3 68,0

• HLE, sin herramientas — Beam 36.2 vs Kimi K3 46.9

• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5

• SciCode — Beam 49,7 vs Kimi K3 58,7

• MCP Atlas — Beam 78,7 vs Kimi K3 82,3

• BrowseComp con gestión de contexto — Beam 77,4 vs Kimi K3 91,2

• DeepSearchQA con gestión de contexto — Beam 80,1 vs Kimi K3 95,0

Lee esa lista con honestidad y la forma del lanzamiento aparece. Reflection no reclama en ningún punto una victoria sobre K3. Lo que reclama es situarse cerca de lo más alto de una categoría mientras gasta entre tres y cuatro veces menos cómputo de inferencia que GLM 5.2 con puntuaciones de razonamiento comparables, y la única fila en la que los dos modelos están cerca, Terminal-Bench 2.1, es la fila en la que la comparación es menos fiable.

Por qué el harness importa más que la puntuación

Un nombre de benchmark es una etiqueta, no una especificación. Terminal-Bench 2.1 significa un conjunto concreto de tareas ejecutadas bajo un andamiaje de agente concreto, con una política de reintentos concreta, un presupuesto de tokens concreto y un ajuste de esfuerzo de razonamiento concreto. Dos laboratorios pueden informar honestamente de una cifra de "Terminal-Bench 2.1" y producir números que no son comparables, porque el andamiaje y el ajuste de esfuerzo son donde reside la mayor parte de la varianza. Artificial Analysis existe como organización precisamente por esto: ejecuta un único harness, en una única configuración, en muchos modelos, para que sus números puedan restarse entre sí.

Así que el 80.1 que Reflection imprime para Beam es un número de proveedor en un arnés de proveedor, y el 88.3 que imprime para K3 es también un número de proveedor — siendo el proveedor Reflection, que mide a su propio competidor. Esa segunda cifra es el número menos fiable de la fila: un laboratorio que ejecuta los pesos de un rival en su propio andamiaje no tiene incentivo para ejecutarlos en la mejor configuración del rival, y ninguna obligación de revelar la que eligió. No hay nada deshonesto en ello; es simplemente un número cuya procedencia no respalda el peso que la cobertura le ha dado.

La propia ejecución de Artificial Analysis sitúa a Kimi K3 en 85,02 en Terminal-Bench 2.1, junto con un 12,6 en Terminal-Bench v4.0 —una prueba distinta y más difícil—, un AA Coding Index de 76,2 (puesto 9 de los modelos de la tabla), un Intelligence Index de 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 y un Long-Context Recall de 88,7. Esos datos se leen de la ficha de catálogo de K3 en nuestro propio sistema, con fuente en artificialanalysis.ai y con la instantánea de evaluación fechada el 15 de julio de 2026. Beam tiene un número en el universo de esa lista y procede de Reflection. Esa ausencia debería ser temporal y no permanente: Artificial Analysis ha dicho que Reflection le dio acceso y que está evaluando el modelo, y su propia formulación inicial —que Beam “será uno de los modelos abiertos más eficientes en tokens que hayamos visto para su nivel de inteligencia”— es la de una empresa de benchmarks que señala una expectativa, no que reporta un resultado. Hasta que se publique esa puntuación, los números de este artículo no son sustraíbles, y no vamos a fingir lo contrario.

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

Cuánto cuesta cada uno y qué es cada uno.

La comparación de costos no es reñida, y en realidad no es una comparación en absoluto, porque uno de sus lados está en blanco.

• Precio — Kimi K3 $3.00 de entrada / $15.00 de salida por millón de tokens, con lecturas de caché a $0.30, frente a Reflection Beam: ningún precio publicado en ningún lugar del blog, la documentación o el listado de modelos de Reflection, con la consola de la plataforma detrás de un muro de registro.

• Contexto — 1.048.576 tokens en Kimi K3 frente a 256.000 en la beta de Beam, con una nota al pie en la propia documentación de Beam que dice «la ventana de contexto puede cambiar durante la beta».

• Modalidad — Kimi K3 acepta texto e imágenes; Reflection Beam es de entrada de texto y salida de texto, sin ruta de imagen ni audio en el lanzamiento.

• Disponibilidad — Kimi K3 está disponible de forma general hoy; Reflection Beam es una beta con lista de espera, con los pesos prometidos para finales de octubre bajo Apache 2.0.

• Puntuaciones independientes — K3 tiene una fila completa de Artificial Analysis; Beam no tiene ninguna.

• Perfil de servicio — Kimi K3 es un modelo de frontera grande y bastante denso a 46,8 tokens de salida por segundo en nuestra propia medición de playground durante la última semana; los 23B parámetros activos de Beam son un argumento arquitectónico genuino para una menor latencia y un menor coste por token, pero no hay ningún endpoint abierto al público para medirlo.

La afirmación de eficiencia merece una frase más de cuidado, porque es el titular del lanzamiento y está haciendo más trabajo del que puede soportar. El "3 a 4× menos cómputo de inferencia" de Reflection proviene de un gráfico que aproxima los FLOPs como el doble del número de parámetros activos multiplicado por el número medio de tokens generados. Esa fórmula excluye deliberadamente el prefill del prompt, el coste de atención y la sobrecarga de servicio —las partes de la factura que dominan el trabajo agéntico de contexto largo. Es una estimación aproximada de una relación decómputo, no una medición, no una cifra en dólares, y fue elaborada por el proveedor. Trátala como una hipótesis que los pesos permitirán que otra persona pruebe.

Dónde encaja OrcaRouter en esto

Kimi K3 es una de nuestras rutas. Está listado a $3.00 de entrada y $15.00 de salida por millón de tokens con lecturas de caché a $0.30, que es la tarifa del proveedor Moonshot traspasada sin agregar nada — así que si Moonshot cambia su tarifa, la cifra en nuestra página cambia el mismo día, en lugar de cuando la actualice un revendedor. Se puede invocar desde una clave compatible con OpenAI junto con más de 200 otros modelos, lo cual importa aquí por una razón concreta: la respuesta honesta a «¿Beam o K3?» es que un equipo que quiere cubrirse no debería elegir. Porque la conmutación automática por error es parte del enrutamiento y no algo que uno construye, un modelo como Beam —beta, sin precio, sin evaluación de ningún tercero— es exactamente lo que pones en una porción del tráfico en lugar de en tu ruta crítica. Enrutas el trabajo a K3 de forma predeterminada, le envías a Beam una porción cuando llega tu invitación de la lista de espera, y dejas que el enrutamiento recurra a K3 en caso de error. Esa es una decisión que puedes tomar sobre un modelo no probado. Apostar una ruta de producción a uno no lo es.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

¿Qué cambiaría este veredicto?

Tres cosas, en orden descendente de importancia.

Un precio. Que Beam se sitúe por debajo del nivel de K3 haría que el argumento de eficiencia fuera concreto en lugar de teórico. Segundo, los pesos. Apache 2.0 más un informe técnico permitiría a cualquiera con un par de nodos medir tokens por segundo por GPU con un umbral de calidad fijo —la prueba que de verdad zanja una afirmación de cómputo. Tercero, una ejecución de arnés por terceros. Reflection le ha dado acceso a Artificial Analysis y se espera obtener una puntuación de ello; hasta que se publique ese número, cada cifra de Beam frente a K3 en circulación se remonta a un documento escrito por uno de los dos proveedores.

Dos preguntas que merecen una respuesta directa

¿Es Reflection Beam mejor que Kimi K3?

Con la evidencia disponible hoy, no — y nadie ha publicado evidencia de que lo sea. La propia tabla de Reflection tiene a K3 por delante en las diez filas compartidas anteriores, varias de ellas por márgenes (SWE Atlas 34.6 vs 68.0, DeepSearchQA 80.1 vs 95.0) que no son estrechos. El argumento de Beam es el costo por unidad de capacidad, y ese argumento es un gráfico dibujado por el proveedor hasta que existan los pesos y un precio.

¿Debería esperar los pesos de Beam antes de construir sobre K3?

Solo si el autoalojamiento es un requisito en lugar de una preferencia, porque ese es el único eje en el que los dos no son sustitutos: K3 es solo API, mientras que Beam promete pesos Apache 2.0. Si llamas a una API, K3 está disponible, con puntuación y precio, y Beam es una lista de espera. No hay ninguna versión que merezca retrasar un proyecto.

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection nos ha dado una fecha y un gráfico, y una fecha no es un modelo. Lo único que el lanzamiento establece de verdad es que un modelo de 501B que activa 23B parámetros puede entrenarse para situarse a unos pocos puntos de la frontera abierta —lo cual, si los pesos llegan y los números se mantienen, es un resultado significativo sobre eficiencia. Todavía no es una razón para trasladar el trabajo fuera de un modelo que un tercero ha medido realmente.