Una tarjeta de título principal para el artículo de comparación 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max' que dice 'La semana en que los pesos abiertos se volvieron serios', con un icono de birrete de graduación y caja abierta a la izquierda, un icono de globo terráqueo y chip a la derecha, una insignia de COMPARACIÓN DE MODELOS y el logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: La semana en que los pesos abiertos se volvieron serios

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los pesos abiertos acaban de tener una semana importante. Hacia el 12 de agosto de 2026, Alibaba lanzó el primer Qwe​n clase Max de pesos abiertos de la historia — Qwen3.8 Max, un buque insignia de 2,4 billones de parámetros, publicado como Qwen3.8-2.4T-A95B en Hugging Face y ModelScope. Dos días después, el 14 de agosto, NVIDIA publicó NVIDIA-Nemotron-Labs-Teacher-General-Reasoning, un teacher de razonamiento de 550B parámetros con 55B activos del pipeline de entrenamiento de Nemotron 3 Ultra, también en Hugging Face. Ambos son checkpoints enormes, recién abiertos, de laboratorios de frontera, y el parecido termina ahí. Qwen3.8 Max es abierto para que puedas ejecutar un modelo de frontera tú mismo; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning es abierto para que puedas entrenar con él. Compararlos es realmente preguntarse qué tipo de equipo eres — pero el hecho de que ambos aterrizaran en 72 horas es una señal de hacia dónde se dirige la industria.

Lo que realmente contiene cada versión

Qwen3.8 Max es el que se puede desplegar. Es un modelo disperso de mezcla de expertos con 2,4 billones de parámetros en total, unos 95 mil millones activos por token entre 512 expertos, construido sobre la arquitectura híbrida de la familia Qwen3.5. En su forma de pesos abiertos es solo de texto, con un contexto nativo de 262 000 tokens (extensible más allá de 1M) y — notablemente — el razonamiento es obligatorio: el modelo emite contenido de razonamiento entre etiquetas \<think\> y no se puede desactivar. La versión de API alojada que Alibaba lanzó el 3 de agosto añade entrada de imágenes y vídeo, un contexto predeterminado de 1M y razonamiento opcional. La licencia de pesos abiertos es una licencia Qwen3.8 Max personalizada, permisiva pero con condiciones basadas en ingresos para despliegues comerciales muy grandes. Si tienes el hardware multinodo, puedes ejecutar un modelo de clase frontera en tu propia infraestructura.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning es el de la fase de entrenamiento. Es uno de los más de diez profesores especializados por dominio de la receta de destilación on-policy con múltiples profesores (Multi-Teacher On-Policy Distillation, MOPD) que hay detrás de Nemotron 3 Ultra, derivado del estudiante Ultra post-entrenado mediante una etapa adicional de SFT especializada en razonamiento y una etapa de aprendizaje por refuerzo. Su papel en ese pipeline es generar trazas de razonamiento largas en los problemas más difíciles de matemáticas, lógica y razonamiento abstracto, y actuar como el juez que califica las respuestas de formato libre. Se distribuye bajo la licencia OpenMDW-1.1, favorable al uso comercial, con los datos de post-entrenamiento divulgados, y no presenta cifras de benchmarks — NVIDIA remite en su lugar a una gráfica de precisión y al informe técnico de Ultra. Sus destinatarios son ejecuciones de destilación, no tráfico de producción.

Qwen3.8 Max, el primer buque insignia abierto de clase Max

El lanzamiento de Alibaba importa porque los modelos Qwe​n de clase Max han sido históricamente solo API. Qwen3.8 Max rompe con eso: los pesos se pueden descargar, y el modelo es verdaderamente de frontera — Artificial Analysis le otorga un Intelligence Index de 58 y un Agentic Index de 58, empatando con los mejores generalistas de código cerrado en entornos de agentes. Sus puntos destacados reportados por el proveedor son sólidos: 93.0 en PaperBench (por delante de GPT-5.6 Sol y Fable 5), 92.6 en GPQA Diamond, 86.1 en OSWorld-Verified. Sus puntos débiles son igualmente reales — 67.7 en SWE-bench Pro y 43.6 en Humanity's Last Exam quedan por detrás de los líderes, y las pruebas independientes encontraron que es caro por tarea completada, con un promedio de 64 turnos por tarea en ejecuciones de agentes. En la API de Alibaba, el precio es de $2.00 por millón de tokens de entrada, $6.00 por millón de salida y $0.25 por millón de entrada en caché, un 20% menos que su precio de vista previa.

El maestro: infraestructura de entrenamiento con una tarjeta de modelo

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning no compite en ninguna de esas cifras porque no ha publicado ninguna. Lo que ofrece en su lugar es la misma arquitectura híbrida LatentMoE Mamba-2 + Transformer que el estudiante Ultra, hasta 1M de tokens de contexto, y un control de razonamiento — enable_thinking true/false, un modo medium_effort y un tope estricto de reasoning_budget — que un pipeline de destilación necesita para emplear un razonamiento profundo en las muestras difíciles y omitirlo en las fáciles. El hardware mínimo es de 4×B200 (u 8×H100), con despliegue mediante vLLM, SGLang o TensorRT-LLM, y el checkpoint es una descarga de 1,12 terabytes. No está desplegado por ningún proveedor de inferencia, y NVIDIA no ha anunciado alojamiento NIM. Es un lanzamiento solo de pesos, dirigido a laboratorios que ya operan grandes flotas de GPU.

Especificaciones, lado a lado

• Propósito — Teacher: especialista en razonamiento durante el entrenamiento y juez. Qwen3.8 Max: buque insignia de vanguardia desplegable.

• Escala — Profesor: 550B total / 55B activo, LatentMoE con MTP. Qwen3.8 Max: 2.4T total / ~95B activo, 512 expertos, Qwen3.5 híbrido.

• Contexto — Teacher: hasta 1M de tokens, 256K por defecto. Qwen3.8 Max: 262K de contexto nativo de pesos abiertos, ampliable más allá de 1M; versión API 1M por defecto.

• Pesos — Maestro: OpenMDW-1.1, publicado el 14 ago 2026. Qwen3.8 Max: Licencia Qwen3.8 Max, publicada ~12 ago 2026.

• Evidencia independiente — Profesor: ninguno todavía. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• Pensamiento — Profesor: interruptor enable_thinking, medium_effort, límite máximo de reasoning_budget. Qwen3.8 Max: obligatorio activado en pesos abiertos, no se puede desactivar.

• Precio — Teacher: sin precio de lista, capex de autoalojamiento. Qwen3.8 Max: $2.00 / $6.00 por millón de tokens, $0.25 entrada en caché.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

La asimetría de la evidencia es toda la historia.

Qwen3.8 Max ha sido probado; el maestro no. Eso se debe en parte a la edad — Qwen3.8 Max se lanzó el 3 de agosto y ha tenido dos semanas de ejecuciones en el leaderboard, mientras que el maestro se publicó ayer — y en parte a la intención, porque la ficha del maestro nunca estuvo destinada a competir en puntuaciones. Pero la asimetría tiene una consecuencia real para la comparación: cada número concreto de esta página con una fuente adjunta pertenece a Qwen3.8 Max, y cada número adjunto al maestro es una especificación de arquitectura. La calidad de razonamiento del maestro no está verificada por nadie fuera de NVIDIA, y sus cifras a nivel de familia (los resultados reportados por el proveedor para el estudiante Ultra: SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0) describen un modelo diferente. Cualquiera que tome una decisión basada en "cuál puntúa mejor" tiene que esperar a ejecuciones independientes del maestro — que es exactamente la brecha que las próximas semanas deberían cerrar.

Dos diales de pensamiento, configurados de manera diferente

El contraste técnico más interesante entre estas dos versiones es lo que ocurre cuando les pides que razonen. Qwen3.8 Max en su forma de pesos abiertos no tiene elección: el razonamiento está siempre activo, y la traza de razonamiento forma parte de cada respuesta. Eso es excelente para la calidad y la transparencia de las respuestas, pero costoso para la generación masiva. El profesor trata el razonamiento como un dial: enable_thinking lo activa, medium_effort lo regula, y un tope de reasoning_budget lo limita. Para un pipeline de destilación la diferencia es decisiva — generar millones de trazas de razonamiento con un modelo con razonamiento siempre activo multiplica tu factura de tokens, mientras que el interruptor del profesor te permite pagar por razonamiento profundo solo donde una muestra difícil lo exige. Estas no son filosofías de diseño rivales; son dos herramientas optimizadas para extremos opuestos del mismo problema, y cada una es la herramienta adecuada para su fin.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

El resultado final

Si quieres ejecutar un modelo frontera en tu propio hardware — o llamar a uno a un precio razonable — Qwen3.8 Max es el lanzamiento que importa, y está en OrcaRouter al precio de lista de Alibaba, transmitido sin margen de ganancia, así que el recorte de precio que Alibaba anunció en el lanzamiento está activo en nuestro lado el mismo día. Si quieres entrenar o destilar un modelo de razonamiento — o auditar la señal que dio forma a Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning es el lanzamiento que importa, y por ahora solo está disponible en alojamiento propio. La historia más grande es que ambos llegaron en la misma semana: los pesos abiertos pasaron de «suficientemente abiertos para mirarlos» a «suficientemente abiertos para construir sobre ellos», en dos puntos distintos de la cadena de suministro de modelos. Los equipos que mantienen su capa de modelos intercambiable detrás de una única interfaz — entrenamiento autoalojado por un lado, inferencia frontera gestionada por el otro — son los que están posicionados para usar ambos.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario