
GPT-6 Astra vs Qwen3.8-Max: Dos buques insignia agénticos y la letra pequeña de cada uno
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Septiembre de 2026 tiene dos historias de "buque insignia agéntico", y GPT-6 Astra y Qwen3.8-Max son los protagonistas de ambas. OpenAI lanzó GPT-6 Astra el 3 de septiembre como el modelo que dice ser el mejor del mundo en uso de computadoras, ingeniería de software, ciencia y ciberseguridad; Qwen3.8-Max de Alibaba, disponible desde el 3 de agosto, es el buque insignia agéntico del laboratorio chino más fuerte — el que Artificial Analysis sitúa entre los primeros del campo en su índice agéntico y el rival de ecosistema abierto más cercano a las afirmaciones de trabajo autónomo de la frontera. Ambos son realmente sólidos, y ambos se venden con cifras de titular que se reducen bajo escrutinio: el resultado de 99.9% de OpenAI en ARC-AGI-3 cae al 62.7% cuando ARC Prize ejecuta su propio entorno de pruebas neutral, y la brillantez agéntica de Qwen3.8-Max viene acompañada de una regresión en materia de alucinaciones medida de forma independiente y de una tendencia a gastar 64 turnos y más de un dólar en tareas que su predecesor completó en 14. Esta es una comparación de dos modelos — y de dos formas de leer un benchmark.
Los dos titulares
La propuesta de OpenAI para GPT-6 Astra es amplitud más autonomía: un solo modelo que maneja un navegador, escribe y corrige código, realiza análisis científicos y — de manera singular — encuentra vulnerabilidades de seguridad novedosas con la suficiente eficacia como para que OpenAI calificara el modelo completo como "crítico" según su Preparedness Framework y restringiera las configuraciones más capaces a socios debidamente examinados. Los materiales de lanzamiento afirman un 100% perfecto en ExploitBench, un 97,6% en FrontierMath Tier 4, un 96,0% en GPQA Diamond y una puntuación de saturación en ARC-AGI-3. La propuesta de Alibaba para Qwen3.8-Max es más limitada, pero contundente: un caballo de batalla agéntico por $2/$6 que obtiene puntuaciones en lo más alto o cerca de lo más alto de las evaluaciones agénticas independientes, con los pesos subyacentes publicados (bajo una licencia personalizada) en lugar de encerrados en una caja negra.
Lo que dice el marcador independiente
Artificial Analysis puntúa actualmente a GPT-6 Astra (max) con 61 en Intelligence — puesto 8 de los 202 modelos que rastrea — y a Qwen3.8-Max con 58 en Intelligence, puesto 24. Esa brecha de tres puntos es menor que la brecha de precios y menor que el marketing de cualquiera de los dos proveedores; en el índice agéntico independiente de AA, Qwen3.8-Max registra un 58 que lo ha situado a la par con lo mejor de la frontera propietaria, mientras que AA todavía no publica ningún índice agéntico para GPT-6 Astra. La lectura honesta: en inteligencia puramente medida, estos dos son vecinos cercanos, y el encuadre de «el modelo más inteligente del mundo» en los materiales de lanzamiento de OpenAI no es lo que muestra la evaluación independiente de AA.
• Inteligencia — GPT-6 Astra (max): AA Intelligence 61, puesto #8/202. Qwen3.8-Max: AA Intelligence 58, puesto #24/202; AA Agentic 58.
• Precio de lista — GPT-6 Astra: $10.00 / $50.00 por 1M, $1.00 por lecturas de caché, 2× entrada más allá de 272K tokens. Qwen3.8-Max: $2.00 / $6.00 por 1M, $0.25 por lecturas de caché.
• Contexto / salida — GPT-6 Astra: 1.05M de entrada / 128K de salida. Qwen3.8-Max: 1M de entrada / ~128K de salida.
• Evidencia agéntica — GPT-6 Astra: ARC-AGI-3 99,9 % (harness de OpenAI) frente al 62,7 % (harness estándar de ARC Prize); WANDR 0,682 @ $11,98 por tarea (reportado por Perplexity). Qwen3.8-Max: AA GDPval 1739 Elo con 64 turnos/tarea (~$1,14 por tarea); Code Arena WebDev n.º 1 con 1691 Elo.
• Señales de alerta independientes — GPT-6 Astra: aún no está en el selector de ChatGPT, API por fases, concesión sobre la monitorización. Qwen3.8-Max: regresión en la tasa de alucinaciones de AA-Omniscience, del 23 % al 40 % frente a la generación anterior.
• Pesos — GPT-6 Astra: propietario. Qwen3.8-Max: checkpoint de clase Max (Qwen3.8-2.4T-A95B) público bajo una licencia personalizada desde el 12 de agosto; AA sigue listando el modelo insignia alojado como propietario.

La letra pequeña, anotada
Tomemos primero la cifra de ARC-AGI-3, porque es el ejemplo más claro de cómo un número puede ser a la vez verdadero y engañoso. OpenAI reporta un 99,9% para GPT-6 Astra en su propio banco de pruebas con adaptador del proveedor — una configuración ajustada al modelo. ARC Prize, la organización que mantiene el benchmark, ejecutó GPT-6 Astra en su banco de pruebas estándar neutral al proveedor y midió un 62,7%. Ambas mediciones son de vanguardia; ninguna llega al 99,9% en un banco de pruebas que el creador del modelo no controla. La misma cautela se aplica al puntaje WANDR de Perplexity de 0,682 — el más alto que Perplexity ha registrado, pero medido por una empresa que está integrando a la vez GPT-6 Astra en sus propios productos, por lo que tiene un interés comercial. El patrón merece ser nombrado: los números más espectaculares de OpenAI provienen todos de bancos de pruebas que OpenAI o sus socios controlan, y el único número totalmente independiente — el Intelligence 61 de AA — es simplemente excelente.
La letra pequeña de Qwen3.8-Max va en la otra dirección: sus fortalezas se miden de forma independiente, y su debilidad también. La puntuación GDPval de 1739 Elo es genuina, pero las ejecuciones de Artificial Analysis muestran que Qwen3.8-Max la alcanza gastando 64 turnos y aproximadamente 1,14 dólares por tarea, frente a los 14 turnos y 0,53 dólares de la generación anterior. Eso es un impuesto al esfuerzo: el modelo compra su techo agéntico con tokens de razonamiento, algo que importa a cualquiera que pague por token. Y la evaluación Omniscience de AA midió una regresión en alucinaciones del 23 % al 40 % respecto a la generación Qwen anterior: una señal independiente real para exactamente las cargas de trabajo autónomas y de varios pasos donde una respuesta equivocada pero segura resulta más cara. Un modelo que se habla a sí mismo hasta equivocarse a lo largo de 64 turnos no es obviamente más seguro de liberar que uno cuyo creador admite que su capacidad de supervisión ha disminuido.

Precio, implementación y la forma honesta de elegir.
En cuanto al precio, no hay comparación: Qwen3.8-Max a $2.00 / $6.00 por millón cuesta la quinta parte del precio de entrada de GPT-6 Astra y la octava parte de su precio de salida, con un contexto de 1M de tokens que no incluye el recargo por prompt largo de Astra. En cuanto a la implementación, Qwen3.8-Max tiene otra ventaja esta semana: se puede llamar hoy, y está disponible en OrcaRouter al precio de lista de Alibaba, sin margen de beneficio y con conmutación automática. GPT-6 Astra, que todavía se está desplegando y aún no se puede seleccionar en ChatGPT para la mayoría de los usuarios al 4 de septiembre, es accesible a través de la propia API de OpenAI y de los principales marketplaces en la nube mientras se amplía el acceso. El patrón práctico para un equipo que construye pipelines agénticos es poner la carga de trabajo en el modelo al que puedes llamar hoy y tratar al otro como una referencia a observar. Si quieres evaluar las afirmaciones sobre lo "agéntico" en lugar de confiar en ellas, una capa de enrutamiento es la herramienta: Qwen3.8-Max, Kimi K3, Grok 4.6 y otros 200+ modelos se encuentran detrás de una sola clave en OrcaRouter, y el DSL de enrutamiento puede combinar varios de ellos en una sola llamada — así puedes ejecutar tu propia suite de tareas contra los contendientes y ver tú mismo los resultados, en lugar de decidir basándote en la letra pequeña de dos proveedores.
Dos preguntas que este enfrentamiento sigue planteando
¿Por qué OpenAI reporta un 99.9% en ARC-AGI-3 cuando ARC Prize mide un 62.7%? Porque no son la misma prueba. El arnés adaptador de proveedor de OpenAI es una versión del benchmark configurada para cómo se llama a GPT-6 Astra en producción; el arnés estándar de ARC Prize es una configuración neutral diseñada para comparar cualquier modelo de manera justa. El resultado del 62.7% es el que se generaliza a «qué pasa si llamo a este modelo yo mismo», y sigue siendo la mejor puntuación que ARC Prize ha registrado con ese arnés.
{{1}}¿Qwen3.8-Max es de pesos abiertos?{{/1}} En parte, con una salvedad en la licencia. {{2}}Alibaba publicó el checkpoint de clase Max Qwen3.8-2.4T-A95B el 12 de agosto bajo una licencia personalizada — los pesos se pueden descargar, pero eso no es la apertura de estilo Apache-2.0 del Qwen3.8-27B más pequeño, y Artificial Analysis todavía clasifica el modelo insignia alojado como propietario.{{/2}} Si tu requisito es «puedo ejecutar el modelo exacto por el que pago», esa distinción importa; si tu requisito es «puedo inspeccionar la arquitectura y autoalojar una variante similar», Qwen3.8-Max cumple y GPT-6 Astra no.{{3}}
La conclusión
Elige GPT-6 Astra si necesitas las capacidades específicas que hoy por hoy solo él ofrece — trabajo de seguridad ofensiva, razonamiento científico de frontera, las tareas más difíciles de uso autónomo de computadoras — y tu organización puede superar sus requisitos de acceso y permitirse su precio. Elige Qwen3.8-Max si quieres un modelo agéntico de primer nivel que puedas desplegar esta misma semana por $2/$6, con los pesos como vía de escape y una regresión de alucinaciones que ya sabes que debes comprobar. La lección más amplia es la propia letra pequeña: en septiembre de 2026 los dos buques insignia «agénticos» líderes se venden con cifras de titular que ningún fabricante controla por completo, y el comprador racional lee el entorno de evaluación, cuenta los turnos y ejecuta sus propias tareas antes de elegir bando.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
