Nex-N2.5 Pro vs Claude Opus 5 (imagen destacada): una tarjeta de título generada que muestra 'Nex-N2.5 Pro vs Claude Opus 5' con el subtítulo 'La vista previa gratuita y abierta de uso de computadora frente al líder de benchmarks que puedes enrutar hoy' y un antetítulo 'Anthropic vs Nex-AGI — septiembre de 2026'.
Guides & Insights

Nex-N2.5 Pro vs Claude Opus 5: Nex-AGI eligió la vara de medir, y la vara de medir ganó.

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Nex-AGI escogió la vara de medir, y la vara de medir ganó. Cuando la alianza de modelos abiertos con sede en Shanghái presentó Nex-N2.5 Pro el 8 de septiembre de 2026, la tabla de uso de computadora de la tarjeta del modelo presentaba a Claude Opus 5 como referencia y a Nex-N2.5 Pro como contendiente: 68,3 para Claude Opus 5 frente a 56,4 para Nex-N2.5 Pro en OSWorld-2, ambas cifras exactamente como Nex-AGI las había impreso en su propia tarjeta. Las clasificaciones independientes desde entonces han ampliado la brecha en lugar de reducirla: la instantánea de OSWorld 2.0 de BenchLM del 29 de agosto sitúa a Claude Opus 5 en el primer puesto entre los quince modelos que lista, con 70,6. Ceder doce puntos al líder de la clasificación en el benchmark que eligió publicar no es la coreografía de lanzamiento habitual; por eso, lo interesante de Nex-N2.5 Pro vs Claude Opus 5 no es la puntuación, sino lo que son en realidad los dos lados de esa puntuación: un modelo abierto de uso de computadora de 397 mil millones de parámetros que nadie fuera de la alianza ha podido ejecutar ni verificar todavía, y el buque insignia de código cerrado de Anthropic que lidera el benchmark y ha estado manejando tráfico de producción desde finales de julio.

El resumen honesto de entrada: esto no es una rivalidad entre dos cantidades medidas, porque solo un lado de ella ha sido medido por alguien distinto de su creador. Nex-N2.5 Pro es un modelo disperso de mezcla de expertos, con aproximadamente 17 mil millones de parámetros activos sobre un total de 397B, entrenado posteriormente a partir del linaje Qwen3.5, orientado directamente a la operación de computadoras y navegadores a largo plazo con un bucle de retroalimentación visual. Hoy se sirve a través de endpoints alojados gratuitos, enlaces Nex-AGI de su ficha de modelo, mientras que los pesos Apache-2.0 en los que se basa la familia siguen marcados como "próximamente" sin fecha. Claude Opus 5 es el buque insignia de producción de Anthropic para razonamiento exigente, codificación y trabajo agéntico: un modelo cerrado con contexto de 1M de tokens, un dial de pensamiento adaptativo, un precio documentado y semanas de entradas en tablas de clasificación públicas y tráfico de producción a sus espaldas. Cada ventaja en este enfrentamiento pertenece a uno de esos dos hechos: un modelo es ejecutable y verificable, y el otro no es ni lo uno ni lo otro.

El punto de referencia en el que ambas partes están de acuerdo

Las pruebas de referencia de uso de computadora recompensan el mismo comportamiento que estos modelos están diseñados para vender: un agente que mira una pantalla, decide una acción, la ejecuta y lee la pantalla modificada para comprobar si la acción funcionó. Nex-N2.5 Pro está arquitecturado en torno a exactamente ese bucle: la visión no es una modalidad de entrada acoplada, sino el canal de retroalimentación contra el que el agente verifica. Claude Opus 5 trata el mismo bucle como una carga de trabajo entre muchas, pero resulta ser muy bueno en ello, razón por la cual Nex-AGI lo usó como punto de referencia en primer lugar.

Los dos números no proceden, estrictamente, del mismo harness. Nex-AGI obtuvo sus cifras de OSWorld-2 mediante su propio harness de evaluación NexCUA, que afirma que será de código abierto pero que aún no ha publicado, y el 56,4 de Nex-N2.5 Pro es un resultado de proveedor sin reproducir. El 70,6 de Claude Opus 5 en BenchLM es una instantánea de terceros de OSWorld 2.0, con fecha del 29 de agosto de 2026, y es coherente con el 68,3 que la propia Nex-AGI cita de fuentes de la tabla de clasificación. Diferentes harness y versiones de benchmark ligeramente distintas implican que la diferencia exacta — doce puntos en la propia ficha de Nex-AGI, más cerca de catorce en BenchLM — debe interpretarse como un indicador direccional. Pero no se discute que Nex-N2.5 Pro, según las mejores cifras disponibles por ambas partes, se sitúa por debajo del agente de uso de computadora de la frontera actual.

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

Dos respuestas a "¿puedo ejecutarlo hoy?"

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

This is the fork that actually decides the matchup for a working team, and it does not favor the newcomer. Nex-N2.5 Pro's Hugging Face card still banners that {{1}}the weights are coming soon under an Apache-2.0 license{{/1}}, with no release date attached. The only live builds are the free hosted endpoints Nex-AGI links from the card — callable, but owned by someone else, with no list price, no service terms a team can plan around, and no way to reproduce a single benchmark figure on your own hardware. When the weights do land, the documented serving recipe is a single node of eight H100s on a customized SGLang image — {{2}}a real but routine footprint for a 397B MoE, and exactly why the 17B-active design is interesting{{/2}}. Until that happens, Nex-N2.5 Pro is a preview you can query, not a model you can build on.

Claude Opus 5 es lo contrario en cada una de esas filas. Se ha servido a través de la API de Anthropic y en plataformas enrutadas desde el 24 de julio, su precio es público y estable, sus pesos están cerrados y seguirán cerrados, y cualquiera de sus cifras puede comprobarse hoy ejecutándolo. El ecosistema que lo rodea — Claude Code, las herramientas MCP y el enjambre de agentes de producción que lo han puesto a prueba durante seis semanas — es exactamente el registro acumulado que un modelo de un día no puede reclamar. Para un equipo cuyo requisito es «el modelo tiene que funcionar el próximo trimestre», ese registro es todo el partido.

La hoja de especificaciones, tal como está.

Pon los dos sobres uno al lado del otro:

Lanzado — Nex-N2.5 Pro: 8 de septiembre de 2026 (endpoints alojados activos, pesos pendientes). Claude Opus 5: 24 de julio de 2026, disponible de forma general.

Escala — Nex-N2.5 Pro: 397B en total / ~17B activos (MoE). Claude Opus 5: número de parámetros no revelado.

Modalidad — Nex-N2.5 Pro: entrada de texto e imagen, salida de texto; la visión es central en su bucle de uso de computadora. Claude Opus 5: entrada de texto e imagen, salida de texto, con un sólido análisis visual.

Contexto / salida — Nex-N2.5 Pro: contexto de 262 144 tokens, longitud de servicio documentada. Claude Opus 5: contexto de 1M tokens, tope de salida de 128K tokens.

Control de razonamiento — Nex-N2.5 Pro: un selector de reasoning_effort con none / medium (adaptativo, predeterminado) / high. Claude Opus 5: pensamiento adaptativo por defecto, con un control explícito de esfuerzo de bajo a máximo.

Pesos — Nex-N2.5 Pro: Apache-2.0, próximamente, sin fecha. Claude Opus 5: cerrado.

Precio por 1M de tokens — Nex-N2.5 Pro: nivel gratuito alojado, sin precio de lista publicado. Claude Opus 5: $5.00 de entrada / $25.00 de salida, $0.50 lecturas en caché, $6.25 escrituras en caché.

Las capacidades son lo bastante distintas como para que la ficha técnica haga un trabajo real: Opus 5 aporta una ventana de un millón de tokens y un techo de salida de 128K para largas sesiones de agente, mientras que el contexto de 262K y el nivel gratuito de Nex-N2.5 Pro se adaptan a la automatización orientada a pantalla de menor alcance. Ninguna especificación vuelve redundante a la otra; los modelos discrepan sobre en qué gasta su contexto un agente.

Leyendo honestamente el propio marcador de Nex-AGI

Merece la pena leer el resto de la ficha con el mismo filtro. Las demás filas de uso de computadora de Nex-N2.5 Pro — OSWorld-G 87.4, OSWorld-Verified 82.2, WebArena-Verified 67.6, WebTest 52.8, Vision2Web 68.2 — y sus filas de codificación — Terminal-Bench 2.1 con 82.7, SWE-Bench Pro con 61.2, BrowseComp con 89.7 — son todas mediciones del proveedor realizadas con el entorno de evaluación de la propia alianza, sin reproducir en las primeras 48 horas. La única conclusión que un lector neutral puede extraer de la ficha es que Nex-AGI cree que Nex-N2.5 Pro es un sólido modelo de gama media para uso de computadora que va por detrás del agente de frontera en la fila que más importa. Ese es un posicionamiento coherente, incluso conservador, para un modelo abierto de 397B. También es una afirmación a la espera de un segundo laboratorio.

El dinero, cuando una parte no tiene precio.

No hay una comparación de precios honesta que hacer aquí, porque solo un lado tiene precio. El nivel gratuito alojado de Nex-N2.5 Pro no te dice nada sobre lo que vale el modelo —los endpoints de vista previa gratuita son la forma en que los proveedores recogen tráfico y comentarios, y Nex-AGI no ha publicado ninguna tarifa de pago por token para la familia. Claude Opus 5 cuesta $5.00 por millón de tokens de entrada y $25.00 por millón de tokens de salida al precio de lista de Anthropic, con lecturas de caché a $0.50, y ese es el número que un presupuesto tiene que absorber. Si hoy estás pagando esa factura por agentes de uso de computadora y quieres saber si un modelo abierto con 17B de parámetros activos podría hacer el mismo trabajo más barato, la respuesta es: posiblemente, pero no puedes saberlo hasta que los pesos se publiquen y alguien independiente lo ejecute. La comparación de precios queda aplazada, no resuelta, y tratar un endpoint gratuito como evidencia de baratura sería un error de categoría.

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

Lo que puedes hacer hoy es configurar el A/B para el día en que sea posible. Claude Opus 5 está en OrcaRouter al precio de lista de Anthropic: los mismos $5.00 / $25.00, traspasados sin margen, de modo que una factura aquí coincide con la de Anthropic y se mueve el día que Anthropic lo mueva. Una sola clave de API lo coloca detrás del mismo endpoint que otros 200+ modelos, con conmutación automática si un proveedor falla y el DSL de enrutamiento si quieres Opus para las llamadas difíciles y un modelo más barato para las rutinarias. Nex-N2.5 Pro no está en OrcaRouter: revisamos nuestro directorio de modelos antes de escribir, y ningún modelo de nex-agi aparece todavía allí. En el momento en que un proveedor lo ofrezca al precio de lista, aparecerá aquí ese mismo día, y la comparación honesta que este artículo aún no puede ejecutar se convierte en una regla de enrutamiento en lugar de una migración.

Quién debería actuar, y quién debería esperar

Si tu equipo ejecuta hoy cargas de producción de computer-use o agentic-coding y necesita un modelo con un precio conocido, un perfil de fallo conocido y un historial independiente, Claude Opus 5 es la elección racional en este enfrentamiento, y nada en las primeras 48 horas de Nex-N2.5 Pro cambia eso. Si tu equipo está evaluando modelos de computer-use abiertos para un desarrollo futuro, Nex-N2.5 Pro merece un lugar en la lista de seguimiento — un MoE multimodal de 397B con una huella de autoalojamiento razonable y una historia de referencia de nivel medio plausible es exactamente el tipo de modelo abierto que redefine una curva de costos, siempre que los pesos realmente lleguen y las cifras de la ficha técnica sobrevivan a una ejecución independiente. La posición racional es ambas a la vez: mantener al líder probado en la ruta crítica, y dejar que el día en que aterricen los pesos decida si el recién llegado se gana una prueba. Esa es la única comparación de este enfrentamiento que aún no ha ocurrido — y es la que de verdad importará.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario