Tarjeta hero titulada Claude Sonnet 5.5 vs Qwen3.8 Max, con subtítulo seis semanas, dos niveles, un veredicto sobre coste, con píldoras que indican entrada $2 en ambos, salida $10 vs $6, e Índice 56 vs 45, y un pie de página que cita Artificial Analysis v4.3.2 y precios de proveedores.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max: Seis semanas, dos niveles, un veredicto sobre el coste

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Haz las cuentas con tres prompts y la comparación queda resuelta en su mayor parte antes de llegar a los benchmarks. Una llamada breve de respuesta de soporte: 2000 tokens de entrada, 500 de salida. Con Qwen3.8 Max a 2 $ por millón de entrada y 6 $ por millón de salida, eso son cuatro décimas de centavo; con Claude Sonnet 5.5 a 2 $ y 10 $, son nueve décimas de centavo. Una refactorización de repositorio: 400.000 de entrada, 30.000 de salida — cuarenta y tres centavos frente a ochenta y tres. Una sesión agéntica larga que de verdad gasta su presupuesto: dos millones de tokens de entrada, 200.000 de salida, así que 5,20 $ frente a 6,30 $ una vez que los números se vuelven lo bastante grandes para que el lado de entrada domine.

La brecha que empieza como una diferencia de 2.25× en el precio de salida se reduce a aproximadamente 1.2× a escala agéntica, y esa escala no es una curiosidad. Qwen3.8 Max y Claude Sonnet 5.5 son ambos modelos de 1M de tokens con techos de salida elevados, ambos con un precio de $2 por millón en la entrada, y ambos lanzados con ocho semanas de diferencia —el del proveedor el 3 de agosto de 2026 con una actualización fechada el 2 de septiembre, el de Anthropic el 28 de septiembre. La diferencia entre ellos no es la tarifa. Es lo que cada uno gasta para terminar.

¿Qué se lanzó, y cuándo?

Qwen3.8 Max es el nivel de mayor capacidad de Alibaba hasta la fecha. Alibaba lo posiciona directamente frente a GPT-5.5, Claude Opus 4.7 y Gemini 3.1 Pro en su propia guía de migración, y lo recomienda siempre que una tarea requiera el razonamiento más potente disponible. Cuenta con una ventana de contexto de 1M de tokens, acepta entrada de texto, imagen y video, y emite texto; la capacidad de entrada de video es la única aquí que Claude Sonnet 5.5 no tiene. El precio es de $2 por millón de tokens de entrada y $6 por millón de tokens de salida, con lecturas de caché a $0.25 y escrituras de caché a $2.50. A la entrada del 3 de agosto en nuestro catálogo se une una actualización del 2 de septiembre listada como Qwen3.8 Max (0902), que mantiene las mismas tarifas destacadas y un límite de salida de 131K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 es el segundo modelo de la generación 5.5 de Anthropic, lanzado el 28 de septiembre de 2026, seis días después de Claude Opus 5.5. Se lanza como claude-sonnet-5-5 en la API de Claude y en Amazon Bedrock, Google Cloud y Microsoft Foundry, con una ventana de 1M de tokens, un límite de salida síncrona de 128K que se amplía a 300K en la API Message Batches con el indicador output-300k-2026-03-24, y las tarifas de Claude Sonnet 5 se mantuvieron exactamente: $2 de entrada, $10 de salida, $0.20 por lecturas de caché, $2.50 por escrituras de caché. Retención de datos cero desde el lanzamiento, retirada no antes del 28 de septiembre de 2027.

Así que la tarifa de entrada es idéntica, las ventanas de contexto son del mismo tamaño, y los dos proveedores actualizaron sus modelos con menos de un mes de diferencia. Todo lo que los separa está del lado de la factura correspondiente a la salida o en los benchmarks.

Comparativas: tabla del proveedor frente a un índice independiente

Aquí existen dos tipos de evidencia y no son intercambiables.

La tabla de lanzamiento de Anthropic está reportada por el proveedor, no ha sido reproducida por ningún tercero y abarca ocho evaluaciones. Las filas que importan

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6 % frente al 10,3 % de Claude Sonnet 5

• CursorBench 4.0 — 55,5 % frente al 34,1 % de Claude Sonnet 5

• GDPval-2.1 — 1844 frente a 1444 para Claude 5, 1846 para 5.5 y 1446 para 6

• Humanity's Last Exam, con herramientas — 64,5 % frente a 54,9 %; Claude Opus 5.5 se sitúa en 67,7 %

• OSWorld 2.1, parcial — 80,1 % frente a 57,0 %

• Cartografía, sin herramientas — 61,6 % frente a 15,6 %

Alibaba no publica una tabla de cuatro columnas directamente equivalente, por lo que las únicas cifras que pueden situarse en el mismo eje son las independientes. Artificial Analysis, revisión v4.3.2

• Índice de Inteligencia Compuesta — Claude Sonnet 5.5 56 en el puesto 3 de 216; Qwen3.8 Max 45 en el puesto 27

• Costo por tarea de Intelligence Index — $7.60 frente a $5.41

• Velocidad de salida — el modelo de Anthropic se ejecuta frente a una línea base de Claude Sonnet 5 medida en 78,7 tokens por segundo; Qwen3.8 Max se mide en 39,1

• Verbosidad — 410M tokens de salida en el Índice frente a 190M

Las puntuaciones por evaluación de Qwen3.8 Max son respetables, más que marginales: 92,8 % en GPQA Diamond, 88,8 % en Terminal-Bench 2.1, 80,3 % en recuperación de contexto largo, 47,8 % en tau-banking. Pierde terreno en el compuesto porque no gana nada de forma decisiva y el nuevo nivel de Anthropic gana varias cosas de manera contundente. Cabe señalar también que el independiente de Qwen3.8 Max lleva una fecha de lanzamiento del 2 de septiembre de 2026 y una ventana de 984K — es la versión (0902), no la compilación de agosto, y mezclar cifras entre ambas sería un

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Lo que falta en ambas columnas es tan importante como lo que contienen. Nadie ha reproducido de forma independiente las cifras de OSWorld o Terminal-Bench de Anthropic. Nadie ha publicado una cifra de Chartography o CursorBench para Qwen3.8 Max. El compuesto es el único número medido de la misma manera en ambos modelos, que es exactamente por lo que la cifra de coste por tarea que aparece debajo hace tanto trabajo.

El número que lo decide, y no está en ninguna de las dos listas de tarifas

Artificial Analysis cobra a ambos modelos de la misma manera: ejecutar las diez evaluaciones del Index, contar los tokens y multiplicar por el precio de lista. Claude Sonnet 5.5 sale a $7.60 por tarea y Qwen3.8 Max a $5.41, un sobreprecio del 40 % para el modelo de Anthropic a pesar de una puntuación compuesta superior. Las lecturas de verbosidad explican la dirección —410M tokens frente a 190M— y las lecturas de velocidad explican el resto: un modelo que emite menos tokens y tarda más por token no es el que paga por la salida al doble de la tarifa.

La propia afirmación de eficiencia de Anthropic encaja en la misma historia en lugar de contradecirla. La empresa dice que Claude Sonnet 5.5 genera salida un 30%+ más rápido que Claude Sonnet 5 y cuesta "hasta un 30% menos por tarea" a precios idénticos —una afirmación sobre tokens por tarea, no sobre tarifas. Que se sostenga frente a un modelo que gasta menos de la mitad de tokens es precisamente lo que pregunta la cifra de $7.60, y una ejecución independiente es un solo punto de datos.

La consecuencia práctica: la tarifa de salida de $6 frente a $10 es el número que tendrá en cuenta el departamento de compras, y es el número menos predictivo del artículo. El que sí es predictivo son los tokens por tarea con tus propios prompts, y ninguno de los dos proveedores te lo dará.

Entradas, video y la trampa de la migración

La diferencia de capacidades que salta a la vista de inmediato es la modalidad. Qwen3.8 Max acepta video junto con texto e imágenes; Claude Sonnet 5.5 acepta texto e imágenes. Para el análisis de grabaciones de pantalla, los pipelines de metraje de reuniones o cualquier cosa que trate el video como una entrada de primera clase, eso no es una brecha de benchmarks: es una cuestión de elegibilidad binaria, y solo uno de estos modelos pasa.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

La diferencia que aparece una semana después es de comportamiento. Claude Sonnet 5.5 introduce cinco cambios que rompen la compatibilidad en el código que se ejecuta en Claude Sonnet 5. Un valor no predeterminado de temperature, top_p o top_k ahora devuelve un 400. Enviar thinking: {"type": "disabled"} devuelve un 400 que apunta a between_tools, el nuevo ajuste de pensamiento más bajo, aceptado con esfuerzo low, medium y high y rechazado con xhigh o max. El uso forzado de herramientas — tool_choice con valor "any" o una herramienta con nombre — devuelve un 400 directamente. La antigua computer_20251124, herramienta de uso de computadora, es rechazada en la Claude API y Google Cloud. Y los bloques de pensamiento están vinculados al modelo y a la cuenta que los produjeron, así que el razonamiento se puede transferir desde Claude Sonnet 5, pero no hacia otra familia, y un prefijo de conversación editado puede convertir una reproducción en un error.

Qwen3.8 Max no pide nada de eso. Es un modelo con formato OpenAI y una superficie de solicitud convencional, y pasar a él desde otro nivel de Qwen es solo un cambio en la cadena del modelo.

Sopesa los dos costos con honestidad. Elegir el modelo Qwen te cuesta la brecha compuesta de once puntos y las cifras del proveedor Anthropic que, de todos modos, no puedes verificar de forma independiente. Elegir el modelo Anthropic te cuesta la entrada de video y una lista de cuatro cambios en la API que cada uno fallará ruidosamente con un 400 la primera vez que se invoque — lo cual es el tipo bueno de fallo, pero un día de trabajo de todos modos.

Dónde encaja OrcaRouter

La razón para enrutar en lugar de elegir es que el número decisivo —el costo por tarea con tu tráfico— no puede calcularse a partir de la documentación de ninguno de los dos proveedores.

OrcaRouter es un único endpoint compatible con OpenAI sobre más de 200 modelos, con el precio de lista del proveedor trasladado sin recargo, de modo que un recorte de tarifas o un cambio de nivel en cualquiera de los dos lados se aplica el mismo día en que se anuncia. Ambas versiones de Qwen3.8 Max están en el catálogo al precio propio de Alibaba de $2 / $6 — la entrada de agosto y la actualización (0902) — junto con Claude Sonnet 5, el modelo en el que aún se ejecuta la mayor parte del tráfico de la API de Claude, enrutable desde el 30 de junio a los $2 / $10 de Anthropic con una velocidad medida de 150 tokens de salida por segundo. Claude Sonnet 5.5 en sí todavía no está en nuestro catálogo; mientras eso siga siendo cierto, la vía honesta hacia él es la propia API del proveedor y las tres nubes que Anthropic enumera, y la forma de probarlo sin mover una carga de trabajo es una porción del tráfico detrás de una conmutación por error automática hacia Claude Sonnet 5 o Qwen3.8 Max.

¿Cuál, para qué trabajo?

Qwen3.8 Max gana en entrada de vídeo, en tasa de salida, en coste medido por tarea de indexación y en esfuerzo de integración. Es la opción predeterminada adecuada para trabajos de gran volumen y bien especificados, donde una brecha compuesta de doce puntos no se refleja en la calidad de los resultados.

Claude Sonnet 5.5 gana en el compuesto independiente, en las evaluaciones de codificación agéntica en las que las cifras de proveedor de Anthropic mostraron un salto de 60 puntos sobre su propio predecesor en Terminal-Bench 4.0, en el techo de salida por lotes de 300K y en una decisión a la medida del trabajo que una lista de tarifas no puede tomar: es el modelo que hay que elegir cuando la tarea es tan difícil que importa más tener razón que ser barato.

Lo que cambiaría la respuesta para cualquiera de los dos es lo mismo, y no es el lanzamiento de un nuevo benchmark. Es un recuento de tokens por tarea en tus propios prompts, con tus propios ajustes de esfuerzo, para ambos modelos. El parámetro de esfuerzo de Anthropic y el techo de salida de Qwen son ambas palancas sobre ese número, y ambos los defines tú, no la lista de precios del proveedor.

Lo único que esta comparación sí deja claro: a 2 $ por millón en la entrada, la parte de entrada de la factura ya no es un factor diferenciador entre un modelo insignia chino y la gama media de Anthropic. Esa carrera se trasladó al lado de la salida y al conteo de tokens hace meses.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario