Una tarjeta de título principal generada para 'Nex-N2.5 Pro vs Kimi K3' con el subtítulo 'El enfrentamiento donde la propia tarjeta de referencia del recién llegado arbitra', un gran documento redondeado etiquetado como 'TARJETA DE REFERENCIA DEL PROVEEDOR' con dos columnas de modelos y la línea 'Pro va por detrás de K3 en la mayoría de las filas compartidas' sobre él, con el logo de OrcaRouter superpuesto en la parte inferior derecha.
Guides & Insights

Nex-N2.5 Pro vs Kimi K3: el enfrentamiento donde la propia tarjeta de referencia del recién llegado arbitra

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Comprueba los números que Nex-N2.5 Pro y Kimi K3 tienen en común y notarás quién los proporcionó. El Nex-N2.5 Pro de Nex-AGI, el agente multimodal de 397 mil millones de parámetros con unos 17 mil millones activos, presentado el 8 de septiembre de 2026 y con los pesos aún marcados como «próximamente», publica una tabla de benchmarks que incluye a Kimi K3 de Moonshot AI en las mismas columnas. Kimi K3, el buque insignia de pesos abiertos de 2,8 billones de parámetros que Moonshot lanzó el 16 de julio de 2026, cuenta con un contexto de un millón de tokens; once días después publicó sus pesos completos bajo una licencia MIT modificada, y obtuvo una puntuación de 57 en el Artificial Analysis Intelligence Index, lo que lo convierte en el mejor modelo de pesos abiertos del ranking. Y, fila tras fila de esa tabla, Nex-N2.5 Pro va por detrás de Kimi K3: Terminal-Bench 2.1 con 82,7 frente a los 88,3 de K3; BrowseComp con 89,7 frente a 91,2; SWE-Bench Pro con 61,2 frente a 63,3; AutomationBench con 44,2 frente a 46,7. Cuando un proveedor publica los números de su propio modelo junto a los del líder actual de pesos abiertos, y su propio modelo pierde en la mayoría de las filas, lo más interesante del enfrentamiento es que la tabla probablemente dice la verdad.

Esa es la forma inusual de esta comparación. Por lo general, la ficha de un recién llegado es el lugar donde buscar la propaganda. Aquí, la ficha es lo más parecido a un árbitro honesto que tienen ambos modelos, porque Nex-AGI no tenía motivo para publicar una tabla que degrada su propio nivel Pro — y las filas en las que Pro supera a K3 son exactamente las filas en las que un modelo pequeño y diseñado específicamente para uso de computadora debería superar a un generalista mucho más grande. Así que la verdadera pregunta que responde esta página es más acotada y más útil que «cuál es mejor»: ¿sobrevive el supuesto nicho de Nex-N2.5 Pro — un rendimiento agéntico cercano al de K3 con aproximadamente una sexta parte de los parámetros activos — al contacto con el hecho de que Kimi K3 ya existe, ya tiene sus pesos disponibles y ya es el modelo a batir?

El oponente, en su totalidad.

Kimi K3 no es un modelo de nicho, y precisamente por eso es el punto de referencia adecuado. Es el buque insignia de Moonshot: 2.8T de parámetros totales con 104B activos bajo un diseño Stable LatentMoE, un contexto de 1M de tokens con un presupuesto de salida equivalente, comprensión nativa de texto, imagen y video, razonamiento siempre activo y pesos abiertos que cualquiera con suficiente hardware puede ejecutar de verdad. Su posición independiente es sólida: su puntuación de 57 en el Índice de Inteligencia (Artificial Analysis) supera a todos los demás modelos de pesos abiertos, y alcanzó un Elo de 1.679 en Frontend Code Arena, por delante de Claude Fable 5 y GPT-5.6 Sol. Su precio — $3.00 por millón de tokens de entrada y $15.00 por millón de tokens de salida, con $0.30 para entrada en caché — se sitúa en el extremo premium del nivel de pesos abiertos. Kimi K3 es lo que significa «de frontera y abierto» cuando el proveedor no compromete la escala: cuesta más por token que rivales cerrados como GPT-5.6 Sol en la salida, es caro de servir y es muy difícil discutir sus resultados en los rankings.

La aritmética del retador

Nex-N2.5 Pro no intenta superar en escala a Kimi K3. Intenta superarlo en servicio. Nex-AGI post-entrenó el nivel Pro a partir de una base de la línea Qwen3.5 para convertirlo en un agente nativo de visión que opera computadoras y navegadores, y su propuesta es la eficiencia: 397B en total / ~17B activos, un contexto de 262K y una receta de despliegue de un solo nodo con 8×H100, frente a los 2.8T / 104B activos de K3 y el tipo de flota de servidores que exige un modelo de ese tamaño. El argumento implícito es que un especialista de 17B activos, entrenado específicamente para el bucle de agente con retroalimentación visual, puede ofrecer la mayor parte del rendimiento agéntico de un generalista de 104B activos a una fracción del costo de servicio. En la propia ficha de Nex-AGI, la afirmación es plausible pero parcial: Pro supera o iguala a K3 en OSWorld-G (87,4 frente a 79,6) y OmniDoc (92,2 frente a 91,1), y pierde el resto de las filas compartidas por márgenes de un solo dígito — que un modelo de 397B pierda ante un modelo de 2.8T por 3 a 6 puntos en codificación y navegación es, si es cierto, exactamente la historia de eficiencia que Nex quiere contar.

Si es cierto. Cada uno de esos números es de Nex-AGI, obtenido al menos en parte mediante su harness interno NexCUA, y Nex-N2.5 Pro no se puede comprobar de forma independiente a día de hoy porque sus pesos no se pueden descargar: el repositorio de Hugging Face contiene un README, una carpeta de figuras y un banner que dice «los pesos llegarán pronto», nada más. La misma salvedad se aplica a las cifras del lado K3 que presenta la ficha, la mayoría de las cuales Nex recopiló de los informes publicados por Moonshot, no de mediciones propias. Lo que establece la tabla de Nex-AGI no es quién gana, sino que los propios ingenieros de Nex-AGI, al elegir los benchmarks y el harness, no consiguieron que su nivel Pro superara a Kimi K3 en la mayor parte del terreno compartido. Ese dato es más útil que cualquier puntuación individual, porque fija un límite superior a cuánto puede estar exagerando el marketing.

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

Las filas que importan, lado a lado

Escala — Nex-N2.5 Pro: 397B en total / ~17B activos, multimodal de la familia Qwen3.5. Kimi K3: 2.8T en total / 104B activos, Stable LatentMoE, multimodal.

Pesos — Nex-N2.5 Pro: prometido, no lanzado ("próximamente" en la tarjeta). Kimi K3: publicado el 27 de julio bajo la licencia MIT modificada — descargable hoy.

Contexto — Nex-N2.5 Pro: 262K. Kimi K3: 1M tokens, a precio fijo.

Precio — Nex-N2.5 Pro: aún sin tarifa publicada; la vista previa alojada es gratuita. Kimi K3: $3.00 / $15.00 por millón, entrada en caché $0.30.

Posición independiente — Nex-N2.5 Pro: aún ninguno. Kimi K3: AA Intelligence Index 57, el mejor modelo de peso abierto en el ranking.

Codificación (tarjetas de proveedores) — Nex-N2.5 Pro: Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2. Kimi K3: 88.3 y 63.3 en las mismas filas.

GUI / uso de computadora — Nex-N2.5 Pro: OSWorld-G 87,4 (supera a K3 en su propia ficha), OSWorld-2 56,4. Kimi K3: OSWorld-G 79,6, OSWorld-2 58,3 (compilado por Nex).

Self-host footprint — Nex-N2.5 Pro: single-node 8×H100 recipe once weights land. Kimi K3: 2.8T — a serving fleet, not a single node.

¿Qué significa "open" de manera distinta en cada columna?

La palabra "open" está haciendo un trabajo muy distinto en cada lado, y decide este enfrentamiento más que cualquier benchmark. Kimi K3 es open en el sentido que importa operativamente: los pesos están en el hub bajo una licencia Modified MIT en cierto modo permisiva, las trazas de razonamiento están expuestas en la API de streaming, y una empresa con restricciones de gobernanza de datos puede ejecutarlo en hardware que controla y auditar lo que el modelo estaba pensando. Es open de una manera que te cuesta — un modelo de 2.8T necesita infraestructura seria — pero la opción existe hoy. Nex-N2.5 Pro es open en el sentido de la intención: Nex-AGI dice que los pesos de la familia se publicarán como código abierto, y el hermano menor Nex-N2.5 Mini sí lanzó pesos Apache-2.0 el día de su lanzamiento. Los de Pro no han salido, su licencia se anuncia en la ficha pero aún no vincula nada descargable, y hasta que exista un checkpoint, "open" es un elemento de la hoja de ruta, no una propiedad del modelo. Para un equipo que elige entre los dos, eso no es una nota al pie — es la diferencia entre un modelo que puedes tener este mes y un modelo que te prometen que podrás tener.

Evaluando sin esperar un botón de descarga

No necesitas congelar esta decisión hasta que se publiquen los pesos de Nex-N2.5 Pro, y la capa de enrutamiento es donde ejecutas el experimento a bajo costo. Kimi K3 está en OrcaRouter al precio de lista de Moonshot — $3.00 / $15.00, 0% de recargo, traspasado y actualizado el mismo día en que Moonshot lo cambie —, así que el líder de pesos abiertos queda a una tecla de distancia, junto a los otros 200+ modelos del catálogo. Nex-N2.5 Pro no se ofrece a través de nosotros, así que probarlo hoy implica la vista previa alojada de Nex-AGI y, más adelante, tu propio stack de ocho H100. El patrón que encaja: pon el trabajo de contexto largo y de mucha auditoría en Kimi K3 a través del único endpoint que ya usas, apunta una rama de pruebas a la vista previa de Nex-N2.5 Pro y deja que la conmutación automática por error enrute alrededor del que se degrade; así es exactamente como comparas un modelo frontera ya lanzado contra un retador con pesos pendientes sin apostar tu ruta de producción por ninguno de los dos. Cuando los pesos de Pro por fin lleguen, la verificación es simple: ejecuta las filas compartidas que un laboratorio independiente pueda reproducir y observa si la historia de eficiencia con 17B activos sobrevive fuera del propio banco de pruebas de Nex-AGI.

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

Dónde aterriza el enfrentamiento

Contra el modelo de pesos abiertos más grande jamás lanzado, Nex-N2.5 Pro no necesita ganar la guerra generalista para merecer atención: necesita ganar el argumento del costo de servicio, y su propia ficha sugiere que ese argumento es real pero no está probado. Kimi K3 es la opción segura y genuinamente sólida hoy: pesos abiertos, primera en el índice de pesos abiertos, un contexto de un millón de tokens y un precio contra el que puedes presupuestar, a costa de una infraestructura que solo se vuelve más difícil a medida que el modelo crece. Nex-N2.5 Pro es la apuesta por la eficiencia: resultados agénticos cercanos a los de K3 con la sexta parte de los parámetros activos en un solo nodo, según la tabla de un proveedor sobre un modelo que aún no se ha lanzado. Elige Kimi K3 cuando quieras el modelo de frontera que puedes poseer y auditar de verdad ahora mismo. Observa Nex-N2.5 Pro para el día en que sus pesos se publiquen y alguien independiente ejecute las mismas pruebas — porque si un agente con 17B activos realmente se mantiene a pocos puntos de un buque insignia con 104B activos en uso de computadora, ese es el resultado que cambia las matemáticas del servicio para todo agente abierto posterior.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario