
Nex-N2.5 Mini: pesos abiertos desde el lanzamiento — el agente de uso de computadora más pequeño de Nex-AGI es la puerta de entrada
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencia49Código
La forma de saber si los agentes abiertos de uso de computadora están listos es ahora un modelo que puedes descargar el mismo día de su anuncio. Nex-AGI presentó su familia Nex-N2.5 el 8 de septiembre de 2026 — tres niveles agénticos, Nex-N2.5 Mini, Nex-N2.5 Pro y Nex-N2.5 Max — y el nivel que se puede descargar y ejecutar es el más pequeño. Nex-N2.5 Mini tiene sus pesos Apache-2.0 publicados en Hugging Face en dieciséis fragmentos BF16, aproximadamente 35 mil millones de parámetros, con unos ~3 mil millones activos por token según se informa, y un despliegue de referencia con dos H100. Su hermano multimodal más grande, Nex-N2.5 Pro, sigue marcado como «próximamente» al momento de escribir esto, mientras que el Nex-N2.5 Max, solo de texto y con 1,6 billones de parámetros, también está disponible, pero requiere dieciséis H200 en dos nodos antes de poder ejecutarse. Para cualquiera que pruebe la tesis que sustenta la familia — que los modelos agénticos abiertos pueden mantenerse a la altura en el uso de computadora de largo plazo, en lugar de solo responder preguntas — el Mini es la puerta de entrada.
¿Quién es Nex-AGI? El nombre es nuevo y el lanzamiento tiene el aire de una primera publicación pública. La cobertura del anuncio describe el esfuerzo como una colaboración entre varias organizaciones de Shanghái — el Shanghai Innovation Institute, Shanghai Qiji Zhifeng, Mosi Intelligence y Kuafu Technology — con la familia posicionada como de código abierto y el equipo operando bajo el identificador @NexEcosystem. La ficha del modelo atribuye a Nex-N2.5-mini y Nex-N2.5-Pro la continuación de "los fundamentos multimodales de Nex-N2", el anterior lanzamiento de Nex cuyos pesos ya están abiertos. Lo que es genuinamente nuevo aquí es el encuadre: Nex-AGI dice que construyó estos modelos para tareas de largo horizonte en entornos del mundo real — operar una computadora, manejar un navegador, ejecutar y probar código, y corregir el rumbo a partir de lo que ve en pantalla — y publicó los pesos para que esa afirmación sea comprobable.
Tres niveles, un anuncio
La familia se divide por escala y por modalidad, y las diferencias importan más que el nombre compartido:
• Nex-N2.5 Mini — aproximadamente 35B en total / ~3B activos, un modelo multimodal que acepta imágenes y texto, orientado al uso visual de computadora, navegación web y tareas que requieren retroalimentación de una interfaz. La implementación de referencia es un único nodo con dos H100.
• Nex-N2.5 Pro: reportado 397B en total / ~17B activos, también multimodal, para cargas de trabajo más pesadas de uso de computadora. La implementación de referencia consta de ocho H100. Sus pesos no estaban disponibles para descargar en el lanzamiento.
• Nex-N2.5 Max — 1.6T en total / ~49B activos, solo texto y, según Nex-AGI, su "primer esfuerzo completo de post-entrenamiento a escala de billones de parámetros". La ficha indica que está construido sobre una base DeepSeek-V4-Pro-Base. El despliegue de referencia es de 16×H200 en dos nodos.
Los tres son mezcla de expertos. El Mini y el Pro se asientan sobre la familia de modelos Qwen3.5 — los materiales de lanzamiento de Nex-AGI describen a ambos como post-entrenados a partir de variantes de Qwen3.5, y la propia configuración del Mini lleva una etiqueta de arquitectura qwen3_5_moe — mientras que el Max es el caso atípico basado en DeepSeek. Así que la familia no es una receta en tres tamaños; son dos recetas: los niveles multimodales de «hacer cosas en pantalla» comparten un linaje, y el gigante del razonamiento textual se apoya en otro.
Lo que realmente es el Nex-N2.5 Mini que se envió
El repositorio de Hugging Face para nex-agi/Nex-N2.5-mini es un checkpoint real y descargable, no un marcador de posición: 16 fragmentos safetensors de unos 70 GB en total, BF16, licencia Apache-2.0, creado por primera vez el 8 de septiembre. El archivo de configuración es lo bastante específico como para diseñar a partir de él.
• Arquitectura — Qwen3_5MoeForConditionalGeneration, la familia qwen3_5_moe, con un stack de visión: la tarjeta lo etiqueta como image-text-to-text, y el repositorio incluye preprocessor_config.json junto con la configuración de texto.
• Forma — 40 capas, dimensión oculta de 2048, atención de consultas agrupadas con 16 cabezas de consulta y 2 cabezas KV, un vocabulario de 248.320.
• MoE: 256 expertos enrutados con 8 activos por token más un experto compartido, tamaño intermedio 512 — el perfil de activación dispersa que hace que un modelo de "clase 35B" con ~3B activos sea ejecutable en dos H100.
• Contexto — max_position_embeddings de 262,144 tokens en la configuración publicada, la misma cifra de 262K que aparece en las recetas de despliegue de la familia.
• Pesos y licencia — BF16, Apache-2.0, sin restricciones de acceso; el repositorio también apunta a un espejo de ModelScope y a una organización de GitHub (nex-agi) que incluye las recetas de despliegue de la familia.
La documentación de despliegue de Nex-AGI es la parte que la mayoría de los lanzamientos abiertos hacen mal, y esta lo hace inusualmente bien. El Mini se sirve a través de una imagen Docker personalizada de SGLang (nexagi/sglang:v0.5.18-nex-patch) en un solo nodo con dos H100 usando paralelismo tensorial 2. El muestreo recomendado es temperatura 0.7, top_p 0.95, top_k 40. La llamada a herramientas se ejecuta mediante el analizador qwen3_coder de SGLang, y el modelo expone tres modos de razonamiento a través del campo reasoning_effort: «none» para no pensar, «medium» (el valor predeterminado adaptativo) y «high» para pensamiento siempre activo. Para un modelo agéntico pequeño, ese control del modo de pensamiento es la diferencia entre un bucle de agente utilizable y uno lento, y viene integrado en la receta de servido en lugar de dejárselo al usuario.

Pesos: lo que realmente se puede descargar
El estado de los tres niveles el día del lanzamiento merece precisarse, porque el anuncio y los repositorios no coinciden del todo. Al momento de escribir esto, el Mini está completamente disponible para descargar bajo Apache-2.0 — es en lo que se basa este artículo. Nex-N2.5 Max también está disponible, con su repositorio de Hugging Face que contiene 644 fragmentos safetensors, aunque reproducir su huella de un billón de parámetros es un proyecto de 16×H200. Nex-N2.5 Pro es el rezagado: su repositorio de Hugging Face existe, pero solo contiene el README y las figuras, sin fragmentos del modelo, y la tarjeta todavía dice que los pesos están por llegar. Si el nivel que te importa es el grande multimodal, esa es la brecha a vigilar: los materiales de lanzamiento describen a Pro como el modelo más fuerte de la familia para uso en computadoras, y es el que aún no se puede ejecutar localmente.

Los números que reportó Nex-AGI — y la advertencia que los acompaña
La tarjeta de modelo de Nex-AGI incluye una tabla de benchmarks completa para el Mini, y cada cifra en ella proviene de los propios informes del proveedor. No se había publicado ninguna ejecución independiente al momento de escribir este artículo, y la tarjeta es explícita en que las puntuaciones provienen de los rankings oficiales de benchmarks y de los informes de evaluación más recientes cuando están disponibles, y de las evaluaciones propias de Nex-AGI en otros casos. Los resultados de codificación se produjeron con el harness NexAU del equipo; los resultados de uso de computadora y navegador se obtuvieron con el harness NexCUA, que según la tarjeta se publicará como código abierto. Considere las filas principales como el mejor escenario del proveedor hasta que una parte neutral las reproduzca.
Con ese marco, los resultados reportados para el Mini son: en trabajo de texto y código, Terminal-Bench 2.1 con 73.4, SWE-Bench Pro con 43.8, DeepSWE v1.1 con 36.1, AutomationBench v1.0.6 con 32.3, Toolathlon Verified con 54.6, BrowseComp con 83.4, y una puntuación GDPval-AA v2 de 1446. En el lado del uso multimodal/por computadora, los que llaman la atención son OSWorld-Verified con 71.2, WebArena-Verified con 63.4, WebTest con 48.6 (ejecutado en modo oráculo contra listas de verificación de referencia), OSWorld-G con 82.9 y OmniDoc con 89.7, junto con resultados más modestos de OSWorld-2 (30.5) y Vision2Web (52.9).
Dos notas de lectura. Primero, OSWorld-Verified y OSWorld-2 son suites distintas — una es un subconjunto verificado calificado a partir del estado resultante del entorno; la otra, una ejecución más reciente y en general más severa —, así que un 71.2 en una y un 30.5 en la otra no son contradictorios: son pruebas diferentes, y la propia tabla de Nex las mantiene en columnas separadas. Segundo, en cada fila de la tabla de la familia, Mini puntúa por debajo de Pro y Max, y la parte superior de cada columna corresponde a un modelo de frontera ya establecido, como Claude Opus 5 o GPT-5.6 Sol. La historia de Mini no es que supere a los modelos de frontera; es que un modelo abierto de ~3B activos reporta puntuaciones competitivas en benchmarks de uso de computadora con una huella de dos H100. Que eso se sostenga es, precisamente, la pregunta que los pesos abiertos te permiten responder por ti mismo.
Ejecutando Nex-N2.5 Mini hoy
La receta de dos H100 convierte al Mini en la forma más económica de poner a prueba la afirmación central de la familia de modelos. Como la arquitectura es la Qwen3.5-MoE estándar con un analizador de llamadas a herramientas qwen3_coder, carga en el fork de SGLang de Nex-AGI sin código de inferencia personalizado, y la configuración recomendada está publicada en lugar de quedar librada a la ingeniería inversa. La expectativa honesta que debes fijar antes de empezar es que un checkpoint de un día con un banco de pruebas completamente nuevo es un experimento, no una dependencia. Las descargas del repositorio del Mini siguen en cifras de un solo dígito y ningún tercero había publicado una evaluación independiente cuando se escribió esto — lo cual es lo normal para un modelo lanzado ayer, y la razón por la que la huella de dos H100 importa: puedes ejecutar el experimento tú mismo esta semana en lugar de esperar a que alguien más lo haga.

Si prefieres comparar el modelo Mini con {{1}}los agentes de frontera en su propia tabla de benchmarks{{/1}} en lugar de ajustar manualmente una única implementación, {{2}}ahí es donde una capa de enrutamiento demuestra su valor{{/2}}. Cuando un proveedor alojado añade Nex-N2.5 Mini a su catálogo — {{3}}y los modelos consolidados frente a los que se evalúa ya son accesibles mediante enrutadores{{/3}} — una única API que da acceso a 200+ modelos, con los precios de lista del proveedor aplicados sin margen (0 %) y con conmutación automática por error, es la forma económica de ejecutar la misma tarea contra varios de ellos sin una segunda integración. En OrcaRouter {{4}}esa es la configuración estándar para cada modelo que enrutamos{{/4}}: la misma clave, la misma estructura de llamada, el precio del propio proveedor sin nada añadido. {{5}}Eso importa sobre todo para un modelo sin probar como este{{/5}}, porque la conmutación por error es lo que permite probarlo en una ruta real sin arriesgar la ruta por él.
¿Quién debería levantar estas pesas?
Descárgalos si tu trabajo se centra en agentes de uso de computadora, automatización de navegadores o uso de herramientas basado en visión, y quieres un modelo autoalojable con licencia permisiva para compararlo con los líderes alojados. La licencia Apache-2.0 elimina la fricción habitual en los lanzamientos de laboratorios chinos; el requisito de dos H100 está al alcance de un equipo que trabaje en serio con agentes; y el control del esfuerzo de razonamiento, unido a un analizador real de llamadas a herramientas, lo convierten en un banco de pruebas creíble, no en un juguete. No los descargues si necesitas el modelo de uso de computadora más potente de la familia: ese es el papel de Pro, y los pesos de Pro son los que siguen pendientes. Y mantén la etiqueta del proveedor en cada fila de la tabla comparativa hasta que una ejecución independiente confirme los resultados; un 71.2 en OSWorld-Verified de un modelo abierto con ~3B activos es una afirmación llamativa, y es exactamente el tipo de afirmación que vale la pena verificar en tu propio entorno antes de construir sobre esa base.
Qué vigilar a continuación. La liberación de los pesos del Pro es, con diferencia, la señal más importante: convierte la familia de «un Mini más un gigante de un billón de parámetros» en la gama completa que describen los materiales de lanzamiento. La segunda es la publicación como código abierto del harness de NexCUA, sin la cual las cifras de uso de computadora no pueden reproducirse de forma independiente bajo el mismo protocolo. La tercera es la primera ejecución neutral, ya sea de Artificial Analysis, de un laboratorio universitario o de un profesional que publique su reproducción OSWorld-Verified. Cuando ocurra cualquiera de esas tres cosas, la pregunta que plantea este lanzamiento —si los modelos agénticos abiertos han cerrado de verdad la brecha con las plataformas alojadas de uso de computadora— dejará de ser una cuestión de tablas de los proveedores.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
