Tarjeta de título principal para GPT-6 Astra vs Qwen3.8-Max, con el subtítulo «Dos buques insignia agénticos y la letra pequeña bajo cada uno», chips de estadísticas que indican «AA Intelligence 61 vs 58», «Precio de lista $10 / $50 vs $2 / $6» y «ARC-AGI-3: 99.9% del proveedor vs 62.7% en entorno de pruebas neutral», un pie de página con la fecha de lanzamiento y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-6 Astra vs Qwen3.8-Max: Dos buques insignia agénticos y la letra pequeña de cada uno

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Septiembre de 2026 tiene dos historias de "buque insignia agéntico", y GPT-6 Astra y Qwen3.8-Max son los protagonistas de ambas. OpenAI lanzó GPT-6 Astra el 3 de septiembre como el modelo que dice ser el mejor del mundo en uso de computadoras, ingeniería de software, ciencia y ciberseguridad; Qwen3.8-Max de Alibaba, disponible desde el 3 de agosto, es el buque insignia agéntico del laboratorio chino más fuerte — el que Artificial Analysis sitúa entre los primeros del campo en su índice agéntico y el rival de ecosistema abierto más cercano a las afirmaciones de trabajo autónomo de la frontera. Ambos son realmente sólidos, y ambos se venden con cifras de titular que se reducen bajo escrutinio: el resultado de 99.9% de OpenAI en ARC-AGI-3 cae al 62.7% cuando ARC Prize ejecuta su propio entorno de pruebas neutral, y la brillantez agéntica de Qwen3.8-Max viene acompañada de una regresión en materia de alucinaciones medida de forma independiente y de una tendencia a gastar 64 turnos y más de un dólar en tareas que su predecesor completó en 14. Esta es una comparación de dos modelos — y de dos formas de leer un benchmark.

Los dos titulares

La propuesta de OpenAI para GPT-6 Astra es amplitud más autonomía: un solo modelo que maneja un navegador, escribe y corrige código, realiza análisis científicos y — de manera singular — encuentra vulnerabilidades de seguridad novedosas con la suficiente eficacia como para que OpenAI calificara el modelo completo como "crítico" según su Preparedness Framework y restringiera las configuraciones más capaces a socios debidamente examinados. Los materiales de lanzamiento afirman un 100% perfecto en ExploitBench, un 97,6% en FrontierMath Tier 4, un 96,0% en GPQA Diamond y una puntuación de saturación en ARC-AGI-3. La propuesta de Alibaba para Qwen3.8-Max es más limitada, pero contundente: un caballo de batalla agéntico por $2/$6 que obtiene puntuaciones en lo más alto o cerca de lo más alto de las evaluaciones agénticas independientes, con los pesos subyacentes publicados (bajo una licencia personalizada) en lugar de encerrados en una caja negra.

Lo que dice el marcador independiente

Artificial Analysis puntúa actualmente a GPT-6 Astra (max) con 61 en Intelligence — puesto 8 de los 202 modelos que rastrea — y a Qwen3.8-Max con 58 en Intelligence, puesto 24. Esa brecha de tres puntos es menor que la brecha de precios y menor que el marketing de cualquiera de los dos proveedores; en el índice agéntico independiente de AA, Qwen3.8-Max registra un 58 que lo ha situado a la par con lo mejor de la frontera propietaria, mientras que AA todavía no publica ningún índice agéntico para GPT-6 Astra. La lectura honesta: en inteligencia puramente medida, estos dos son vecinos cercanos, y el encuadre de «el modelo más inteligente del mundo» en los materiales de lanzamiento de OpenAI no es lo que muestra la evaluación independiente de AA.

Inteligencia — GPT-6 Astra (max): AA Intelligence 61, puesto #8/202. Qwen3.8-Max: AA Intelligence 58, puesto #24/202; AA Agentic 58.

Precio de lista — GPT-6 Astra: $10.00 / $50.00 por 1M, $1.00 por lecturas de caché, 2× entrada más allá de 272K tokens. Qwen3.8-Max: $2.00 / $6.00 por 1M, $0.25 por lecturas de caché.

Contexto / salida — GPT-6 Astra: 1.05M de entrada / 128K de salida. Qwen3.8-Max: 1M de entrada / ~128K de salida.

Evidencia agéntica — GPT-6 Astra: ARC-AGI-3 99,9 % (harness de OpenAI) frente al 62,7 % (harness estándar de ARC Prize); WANDR 0,682 @ $11,98 por tarea (reportado por Perplexity). Qwen3.8-Max: AA GDPval 1739 Elo con 64 turnos/tarea (~$1,14 por tarea); Code Arena WebDev n.º 1 con 1691 Elo.

Señales de alerta independientes — GPT-6 Astra: aún no está en el selector de ChatGPT, API por fases, concesión sobre la monitorización. Qwen3.8-Max: regresión en la tasa de alucinaciones de AA-Omniscience, del 23 % al 40 % frente a la generación anterior.

Pesos — GPT-6 Astra: propietario. Qwen3.8-Max: checkpoint de clase Max (Qwen3.8-2.4T-A95B) público bajo una licencia personalizada desde el 12 de agosto; AA sigue listando el modelo insignia alojado como propietario.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

La letra pequeña, anotada

Tomemos primero la cifra de ARC-AGI-3, porque es el ejemplo más claro de cómo un número puede ser a la vez verdadero y engañoso. OpenAI reporta un 99,9% para GPT-6 Astra en su propio banco de pruebas con adaptador del proveedor — una configuración ajustada al modelo. ARC Prize, la organización que mantiene el benchmark, ejecutó GPT-6 Astra en su banco de pruebas estándar neutral al proveedor y midió un 62,7%. Ambas mediciones son de vanguardia; ninguna llega al 99,9% en un banco de pruebas que el creador del modelo no controla. La misma cautela se aplica al puntaje WANDR de Perplexity de 0,682 — el más alto que Perplexity ha registrado, pero medido por una empresa que está integrando a la vez GPT-6 Astra en sus propios productos, por lo que tiene un interés comercial. El patrón merece ser nombrado: los números más espectaculares de OpenAI provienen todos de bancos de pruebas que OpenAI o sus socios controlan, y el único número totalmente independiente — el Intelligence 61 de AA — es simplemente excelente.

La letra pequeña de Qwen3.8-Max va en la otra dirección: sus fortalezas se miden de forma independiente, y su debilidad también. La puntuación GDPval de 1739 Elo es genuina, pero las ejecuciones de Artificial Analysis muestran que Qwen3.8-Max la alcanza gastando 64 turnos y aproximadamente 1,14 dólares por tarea, frente a los 14 turnos y 0,53 dólares de la generación anterior. Eso es un impuesto al esfuerzo: el modelo compra su techo agéntico con tokens de razonamiento, algo que importa a cualquiera que pague por token. Y la evaluación Omniscience de AA midió una regresión en alucinaciones del 23 % al 40 % respecto a la generación Qwen anterior: una señal independiente real para exactamente las cargas de trabajo autónomas y de varios pasos donde una respuesta equivocada pero segura resulta más cara. Un modelo que se habla a sí mismo hasta equivocarse a lo largo de 64 turnos no es obviamente más seguro de liberar que uno cuyo creador admite que su capacidad de supervisión ha disminuido.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

Precio, implementación y la forma honesta de elegir.

En cuanto al precio, no hay comparación: Qwen3.8-Max a $2.00 / $6.00 por millón cuesta la quinta parte del precio de entrada de GPT-6 Astra y la octava parte de su precio de salida, con un contexto de 1M de tokens que no incluye el recargo por prompt largo de Astra. En cuanto a la implementación, Qwen3.8-Max tiene otra ventaja esta semana: se puede llamar hoy, y está disponible en OrcaRouter al precio de lista de Alibaba, sin margen de beneficio y con conmutación automática. GPT-6 Astra, que todavía se está desplegando y aún no se puede seleccionar en ChatGPT para la mayoría de los usuarios al 4 de septiembre, es accesible a través de la propia API de OpenAI y de los principales marketplaces en la nube mientras se amplía el acceso. El patrón práctico para un equipo que construye pipelines agénticos es poner la carga de trabajo en el modelo al que puedes llamar hoy y tratar al otro como una referencia a observar. Si quieres evaluar las afirmaciones sobre lo "agéntico" en lugar de confiar en ellas, una capa de enrutamiento es la herramienta: Qwen3.8-Max, Kimi K3, Grok 4.6 y otros 200+ modelos se encuentran detrás de una sola clave en OrcaRouter, y el DSL de enrutamiento puede combinar varios de ellos en una sola llamada — así puedes ejecutar tu propia suite de tareas contra los contendientes y ver tú mismo los resultados, en lugar de decidir basándote en la letra pequeña de dos proveedores.

Dos preguntas que este enfrentamiento sigue planteando

¿Por qué OpenAI reporta un 99.9% en ARC-AGI-3 cuando ARC Prize mide un 62.7%? Porque no son la misma prueba. El arnés adaptador de proveedor de OpenAI es una versión del benchmark configurada para cómo se llama a GPT-6 Astra en producción; el arnés estándar de ARC Prize es una configuración neutral diseñada para comparar cualquier modelo de manera justa. El resultado del 62.7% es el que se generaliza a «qué pasa si llamo a este modelo yo mismo», y sigue siendo la mejor puntuación que ARC Prize ha registrado con ese arnés.

{{1}}¿Qwen3.8-Max es de pesos abiertos?{{/1}} En parte, con una salvedad en la licencia. {{2}}Alibaba publicó el checkpoint de clase Max Qwen3.8-2.4T-A95B el 12 de agosto bajo una licencia personalizada — los pesos se pueden descargar, pero eso no es la apertura de estilo Apache-2.0 del Qwen3.8-27B más pequeño, y Artificial Analysis todavía clasifica el modelo insignia alojado como propietario.{{/2}} Si tu requisito es «puedo ejecutar el modelo exacto por el que pago», esa distinción importa; si tu requisito es «puedo inspeccionar la arquitectura y autoalojar una variante similar», Qwen3.8-Max cumple y GPT-6 Astra no.{{3}}

La conclusión

Elige GPT-6 Astra si necesitas las capacidades específicas que hoy por hoy solo él ofrece — trabajo de seguridad ofensiva, razonamiento científico de frontera, las tareas más difíciles de uso autónomo de computadoras — y tu organización puede superar sus requisitos de acceso y permitirse su precio. Elige Qwen3.8-Max si quieres un modelo agéntico de primer nivel que puedas desplegar esta misma semana por $2/$6, con los pesos como vía de escape y una regresión de alucinaciones que ya sabes que debes comprobar. La lección más amplia es la propia letra pequeña: en septiembre de 2026 los dos buques insignia «agénticos» líderes se venden con cifras de titular que ningún fabricante controla por completo, y el comprador racional lee el entorno de evaluación, cuenta los turnos y ejecuta sus propias tareas antes de elegir bando.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario