Una tarjeta hero generada titulada 'GPT-6.1 Sol vs Qwen3.8-Max' con dos paneles redondeados: a la izquierda, 'GPT-6.1 Sol', que enumera 'OpenAI - lanzado el 29 de septiembre de 2026', '$2,00 de entrada / $10,00 de salida por 1M', '$0,72 por tarea' y 'AA Index 51,8'; a la derecha, 'Qwen3.8-Max', que enumera 'Alibaba - lanzado el 3 de agosto de 2026', '$2,00 de entrada / $6,00 de salida por 1M', '$5,41 por tarea' y 'AA Index 45,4'; debajo de ellos, la franja 'Mismo precio de entrada. 7,5x la factura.'; pie de página 'Cifras: Artificial Analysis v4.3.2.' y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: La factura, no la lista de precios

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Toma un trabajo nocturno de mantenimiento de repositorio, ejecútalo una vez por noche durante un mes y pon a GPT-6.1 Sol y a Qwen3.8-Max a encargarse de él por turnos. Según las cifras por tarea de Artificial Analysis v4.3.2, GPT-6.1 Sol cuesta $21,72 por esas treinta noches y Qwen3.8-Max cuesta $162,27 — una diferencia de $140,55 al mes, unos $1.690 al año, para un trabajo cuya lista de precios por token indica $2,00 de entrada y $10,00 de salida frente a $2,00 de entrada y $6,00 de salida. Las tarifas por millón son casi idénticas en la entrada, dentro del error de redondeo, y el modelo chino es un 40 % más barato en la salida; sin embargo, la factura difiere en un factor de 7,5. El proveedor lanzó GPT-6.1 Sol el 29 de septiembre de 2026; Qwen3.8-Max está disponible desde el 3 de agosto de 2026.

Esa diferencia no es un truco de precios ni un artefacto de referencia: es todo lo que esta comparación tiene que decir, y proviene de un número que ninguna tarifa te muestra.

Qué es cada modelo

GPT-6.1 Sol es el actual buque insignia de razonamiento y programación de OpenAI, lanzado una semana después del GPT-6 Sol al que reemplaza, al mismo precio de lista de $2.00 / $10.00, con una tarifa de $0.10 por entrada en caché y una ventana de contexto de 1,050,000 tokens. Se vende para trabajo agéntico: sus etiquetas de «mejor para» en nuestra propia ficha del modelo indican razonamiento, programación y agéntico, y ostenta la puntuación de calidad de máximo nivel.

Qwen3.8-Max es el buque insignia agéntico de Alibaba: un modelo cerrado, disponible únicamente mediante API, que acepta entrada de texto, imagen y vídeo y tiene un contexto de 1.000.000 de tokens. A diferencia de las versiones más pequeñas de Qwen, este no tiene pesos publicados. En Artificial Analysis se sitúa en 45,42 en el Intelligence Index, en el puesto 17 de 147 modelos, con un índice de programación de 76,2 que ocupa el 9.º puesto en ese campo. No es un modelo débil. Simplemente, es un modelo caro de dejar que piense.

El número que no está en la tarjeta de tarifas

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis registra 107.730 tokens de salida por tarea para Qwen3.8-Max, de los cuales 70.830 son tokens de razonamiento. GPT-6.1 Sol produce 38.128 tokens de salida, de los cuales 25.190 son de razonamiento. El modelo chino escribe 2,8 veces más tokens para responder la misma pregunta, y los escribe a un 40% menos por token.

• Tokens de salida por tarea — 38.128 vs 107.730; Qwen escribe 2,8× más

• De los cuales, razonamiento — 25.190 frente a 70.830

• Costo por tarea — $0.724 frente a $5.409; Qwen cuesta 7,5× más

• Tiempo por tarea — 640 s frente a 2152 s; unos 11 minutos frente a unos 36

• Tiempo hasta el primer token de respuesta — 332,0 s frente a 55,1 s

• Índice de inteligencia — 51,83 vs 45,42

• Ventana de contexto — 1.050.000 vs 1.000.000 tokens

• Entradas aceptadas — texto, imagen y archivo frente a texto, imagen y video

Haz la multiplicación y el descuento desaparece. Un modelo que emite cerca de tres veces más tokens a una tasa 40 % menor no cuesta menos: cuesta alrededor de 1,7 veces más solo en la salida, y la cifra medida por tarea sitúa el múltiplo real en 7,5 una vez que se tienen en cuenta la entrada, las lecturas en caché y la longitud de la respuesta productiva.

Fíjate en la cuarta y la quinta líneas, porque apuntan en direcciones opuestas y juntas explican qué es Qwen3.8-Max. Devuelve su primer token en 55 segundos, mientras que GPT-6.1 Sol tarda cinco minutos y medio, y luego pasa treinta y seis minutos completando la tarea, mientras que el modelo de OpenAI termina en once. Es un modelo que empieza a hablar de inmediato y piensa durante muchísimo tiempo. Para una interfaz de chat con una respuesta en streaming, eso se percibe como capacidad de respuesta. Para un trabajo nocturno desatendido, es tiempo de reloj que también estás pagando.

Tres ámbitos en los que Qwen3.8-Max está genuinamente por delante

La brecha del índice es de 6,4 puntos en todo el conjunto, que es el tipo de cifra que se cita como si fuera uniforme. No lo es, y la discrepancia es instructiva:

• GPQA Diamond — Qwen3.8-Max 0.9283 frente a GPT-6.1 Sol, no publicado en esta ejecución

• GDPval — 1.671,4 vs 1.575,09

• Terminal-Bench 2.1 — 0.8876 vs no publicado en esta ejecución

• AutomationBench — 0,5619 vs 0,6487

• SciCode — no publicado en esta ejecución frente a 0,5417 de GPT-6.1 Sol

• CritPT — 0,1771 vs 0,3171

Qwen3.8-Max gana en las preguntas de ciencia de nivel de posgrado y en la muestra de tareas ocupacionales, lo cual es un resultado real para un modelo de su generación y la razón por la que su índice de programación ocupa el puesto 9 de 138. Pierde en las evaluaciones más difíciles, las cercanas a la investigación —CritPT por 14 puntos—, y pierde AutomationBench por 8,7, que es la que más se parece al trabajo informático sin supervisión. Cualquiera de esas dos que consideres más importante para tu carga de trabajo es la decisión real; la cifra titular de 6,4 puntos es un promedio sobre un desacuerdo, no un veredicto.

Qué aportan los tokens extra, y qué no

Las trazas de razonamiento largas no son un desperdicio por definición. Un modelo que dedica 70.830 tokens de deliberación a una tarea difícil está haciendo algo que el modelo más corto quizá se esté saltando, y en las evaluaciones donde Qwen3.8-Max va por delante, esa deliberación es plausiblemente la razón. El modo de fallo es que pagas por ello en todas las tareas, no solo en las difíciles. Los recuentos de tokens de razonamiento son una propiedad de la calibración del modelo, no de la dificultad de la pregunta, y un modelo que piensa de más en una extracción de una sola línea te lo cobra.

La forma de averiguar cuál de tus tareas es cuál es dejar de tratar la elección del modelo como global. Lo cual nos lleva a la parte que es un cambio de configuración.

Nuestra propia tarjeta de modelo para GPT-6.1 Sol contiene los números servidos del sujeto: la tarifa de $2.00 / $10.00, la ventana de contexto de 1,050,000 tokens, un p50 de 4.54 segundos hasta el primer token, y un bloque de índice de Artificial Analysis almacenado en la misma página que el precio contra el que una aplicación realmente enrutaría.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Una llave, un medidor, dos modelos

Se puede acceder a ambos modelos a través de un único endpoint de OrcaRouter: una sola API para más de 200 modelos, con el precio de lista del proveedor trasladado directamente con un 0 % de margen. La ficha de OrcaRouter para Qwen3.8-Max incluye la tarifa aplicada junto con la ventana de contexto de 1.000.000 de tokens, las modalidades de entrada de texto/imagen/vídeo y el volumen de siete días de 101,4 millones de tokens: las cifras con las que enruta una aplicación, junto a las que el artículo debate. Ese traspaso directo importa específicamente para Qwen3.8-Max, porque un modelo cuyas economías están dominadas por el volumen de tokens de salida es uno cuyo proveedor puede volver a fijarle el precio en cualquier momento, y un medidor de traspaso directo significa que el cambio llega a tu factura el día en que Alibaba lo publica, y no según el calendario de un revendedor.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

El uso más interesante de la capa de enrutamiento aquí es el DSL de enrutamiento, que te permite componer modelos en una sola llamada en lugar de elegir uno para toda la aplicación. Divide el trabajo nocturno: un modelo económico clasifica y extrae, GPT-6.1 Sol se encarga de los pasos de razonamiento y verificación, y Qwen3.8-Max queda reservado para las tareas en las que su larga deliberación y su potencia científica de nivel GPQA realmente cambian la respuesta. La conmutación por error automática cubre el resto: si un proveedor se degrada a mitad de ejecución, la solicitud se traslada en lugar de hacer fallar el lote.

Ninguna de estas dos es una razón para elegir un modelo. Son la razón por la que no tienes que tomar la decisión una sola vez y vivir con ella.

La llamada, y lo que hay que vigilar

Paga las 7,5 veces solo cuando la deliberación lo justifique. En un trabajo nocturno de propósito general, GPT-6.1 Sol a $0,724 por tarea es la opción predeterminada defendible, y los $1.690 al año son reales. Cuando la tarea es ciencia dura o razonamiento ocupacional con una respuesta verificable, el 0,9283 de Qwen.8-Max en GPQA Diamond vale los tokens: eso es lo específico que hace mejor.

Lo que hay que vigilar es si Alibaba ajusta sus precios. Un modelo de 2,8× tokens a $2.00/$6.00 tiene un precio como si los tokens fueran el recurso escaso; el propio comportamiento del modelo hace que los tokens abunden. Si la tarifa de salida se mueve de forma significativa, las cuentas de este artículo se mueven con ella, y el medidor de pass-through te lo mostrará el mismo día en que ocurra.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario