Una tarjeta de título generada que dice 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next' con el subtítulo 'El modelo de pesos abiertos no es el barato', una barra etiquetada 'Costo por tarea finalizada del Intelligence Index' marcada con $0.21 para Claude Haiku 5.5 y $0.37 para Qwen3.8-Flash-Next, y una línea de pie de página que dice 'Cifras independientes según Artificial Analysis; precios según Anthropic y Alibaba.' El logotipo real de OrcaRouter está compuesto en la parte inferior derecha.
Guides & Insights

Claude Haiku 5.5 vs Qwen3.8-Flash-Next: el modelo de pesos abiertos no es el barato

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El instinto dice que un modelo de pesos abiertos de la gama flash de Alibaba rebajará el precio de un modelo pequeño cerrado de Anthropic, y en las dos cifras de la etiqueta lo hace: Qwen3.8-Flash-Nextse sirve a $0.15 por millón de tokens de entrada y $0.47 por millón de salida en la propia API de Alibaba, frente a $0.10 y $0.50 deClaude Haiku 5.5. Sin embargo, si se comparan ambos con la misma batería de benchmarks, el orden se invierte. Artificial Analysis mide Claude Haiku 5.5 con esfuerzo Max a $0.21 por tarea completada del Intelligence Index; Qwen3.8-Flash-Next cuesta $0.37 en la misma medición, con una puntuación tres puntos inferior. La etiqueta más barata pertenece al modelo con la factura más alta, y la razón es la misma que decide la mayoría de estas comparaciones: la tarifa no es el precio, y el modelo de pesos abiertos se gana el sustento en algún sitio distinto de la factura de una API gestionada. Ese "algún otro sitio" es el verdadero tema de este enfrentamiento.

Lo que es cada uno

Los dos llegaron con seis semanas de diferencia y no son el mismo tipo de artefacto.

• Claude Haiku 5.5 — un modelo de pesos cerrados lanzado el 7 de octubre de 2026, en la API de Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform on AWS. Contexto de 1 M de tokens, hasta 128.000 tokens de salida en la API síncrona de Messages, pensamiento adaptativo con un control de esfuerzo de Bajo a Máximo y un valor predeterminado de medio, un corte de conocimiento de junio de 2026 y una tabla de tarifas que cambia de tramo a los 100.000 tokens.

• Qwen3.8-Flash-Next — un modelo de mezcla de expertos de pesos abiertos publicado el 26 de agosto de 2026 bajo la licencia qwen-community-1.0, descrito por Alibaba como una vista previa experimental de la arquitectura que sustentará Qwen4. Almacena 125B parámetros del modelo principal más una tabla separada de incrustaciones de n-gramas de 51B —aproximadamente 176B antes de un módulo de predicción de múltiples tokens de 4B— y activa 6B por token, con 512 expertos, enrutamiento top-10 y 48 capas. De forma nativa cuenta con 262.144 tokens de contexto, ampliable a 1M con YaRN, y acepta entrada de texto, imagen y vídeo.

• Qwen3.8-Flash — la contraparte comercial servida, también disponible desde el 26 de agosto de 2026 en QwenCloud de Alibaba a $0.16 por millón de tokens de entrada y $0.47 por millón de tokens de salida, con un contexto predeterminado de 1M de tokens. Conviene mantenerla separada de Flash-Next: una es un checkpoint que se puede descargar e inspeccionar, y la otra es un endpoint gestionado con precio.

La diferencia entre los dos últimos es justamente lo que hace que esta comparación sea interesante. Claude Haiku 5.5 y Qwen3.8-Flash-Next compiten en muy pocos aspectos, porque solo uno de ellos se puede ejecutar en tu propio hardware.

El proyecto de ley mesurado, que apunta en la dirección contraria

Todas las siguientes cifras independientes provienen de Artificial Analysis según el Intelligence Index v4.3.2. Las tarifas de Anthropic y Alibaba son los precios publicados por los propios proveedores.

• Índice de Inteligencia — Claude Haiku 5.5 con esfuerzo Máximo 43, segundo de 182 modelos. Qwen3.8-Flash-Next 40, sexto de 117 en su clase. Tres puntos de diferencia, a favor de Anthropic.

• Coste por tarea — 0,21 $ frente a 0,37 $. El modelo más caro por token es un 43 % más barato por tarea finalizada.

• Tokens de salida en la ejecución del Index — 440 millones para Claude Haiku 5.5 y 240 millones para Qwen3.8-Flash-Next, ambos frente a una mediana de 100 millones. El modelo Qwen es el escritor más eficiente y aun así la tarea más costosa, lo que te dice que la diferencia no es solo el volumen de tokens, sino la combinación de entrada y la valoración que aplica el evaluador.

• Velocidad de salida — 241,9 tokens por segundo frente a 56,0. Claude Haiku 5.5 es más de cuatro veces más rápido en la misma medición, y su tiempo de 295 segundos hasta el primer token en esa ejecución es un artefacto de pensar con esfuerzo Máximo, no una cifra de red; el tiempo hasta el primer token de Qwen3.8-Flash-Next es de 2,53 segundos.

• Estructura de la tarjeta de tarifas — Claude Haiku 5.5 pasa de $0.10 y $0.50 a $0.50 y $2.50 a los 100,000 tokens. Qwen3.8-Flash se mantiene fijo en $0.16 y $0.47 independientemente de la longitud, lo cual es una ventaja real en prompts largos y el único punto donde el argumento del precio de etiqueta sobrevive al contacto con un documento largo.

• Tokenizador — Claude Haiku 5.5 utiliza el tokenizador más reciente compartido con Claude 4.7 y posteriores, por lo que el mismo texto cuenta como aproximadamente un 30 % más de tokens que en el Haiku anterior. Eso infla los prompts hacia el tramo de 100.000 tokens; es documentación de la propia Anthropic, y juega en contra del modelo precisamente en el caso de prompts largos donde la tarifa plana de Qwen parece mejor.

Así que la forma del trade-off es esta: pagar más por token, obtener una respuesta más rápida y algo más inteligente que cuesta menos por tarea completada, con un salto de tarifa que hay que vigilar en entradas largas. O pagar menos por token y obtener un modelo más lento que cuesta más por tarea completada, con una tarifa plana y una ventana nativa de 262.144 tokens.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Dónde los pesos abiertos realmente cambian la aritmética

Todo lo anterior compara dos API gestionadas, y esa es la comparación que Qwen3.8-Flash-Next no fue diseñado para ganar. Su argumento es que no tiene que ser alquilado.

• Soporte de servicio desde el primer día. SGLang publicó una página de recetario y una imagen dedicada; vLLM tiene una compilación para ello mientras la solicitud de extracción de soporte de arquitectura sigue abierta. NVIDIA validó ambos, además de TensorRT LLM, en un rack GB300 NVL72, y NeMo cubre el ajuste fino.

• El requisito de hardware es bajo para un checkpoint de 176B. La tabla de embeddings de n-gramas de 51B puede residir en la memoria del host en lugar de la VRAM, porque sus direcciones de búsqueda se conocen de antemano y se pueden precargar. Eso es lo que permite que el modelo se ejecute en clústeres de DGX Spark y estaciones de trabajo con 4×RTX PRO 6000, y las cuantizaciones de la comunidad del mismo día —compilaciones de 1 bit que caben en 75 GB de RAM con aproximadamente el 80 % de la precisión completa— lo ponen en hardware que un equipo pequeño posee.

• El ajuste fino está disponible. No en el sentido de una API de ajuste alojada: los pesos son tuyos, bajo una licencia comunitaria con las condiciones habituales, y la arquitectura está documentada en un informe técnico que publica las ablaciones y los resultados negativos.

• La ventana es más pequeña de lo que parece. 262,144 tokens de forma nativa, ampliable a 1M con YaRN — frente a 1M nativo en Claude Haiku 5.5, sin la salvedad del rope-scaling. En las cargas de trabajo de documentos largos, donde la tarifa plana de Qwen resulta más atractiva, el modelo que de verdad puede sostener el documento es el otro.

• Los benchmarks son reportados por el proveedor. La propia tabla de Alibaba sitúa a Flash-Next por delante de DeepSeek-V4-Flash-0731 en DeepSWE 1.1 (58,7 frente a 54,4), SWE-bench Pro (62,5 frente a 56,0) y GPQA Diamond (91,7 frente a 90,8), y por detrás en NL2Repo-Bench (48,1 frente a 54,2) —generación de código a nivel de repositorio, la única dimensión agéntica en la que el modelo más pequeño no sigue el ritmo. Nada de esto ha sido reproducido por un tercero, y el modelo tiene seis semanas de antigüedad.

Esa es la frontera honesta entre ambos. Claude Haiku 5.5 es un servicio medido con un techo de calidad fijo y sin superficie operativa. Qwen3.8-Flash-Next es un artefacto cuya curva de costos desciende hacia el precio de la electricidad y cuyo techo de calidad es todo lo que puedas servir, más el riesgo de una tabla de benchmarks no reproducida y una arquitectura que aún está siendo absorbida por los entornos de ejecución.

La forma realista de decidir

Tres preguntas lo resuelven, y solo la primera tiene que ver con los benchmarks.

¿Tienes GPUs, o quieres tenerlas? Si no es así, el caso del autoalojamiento es teórico y la comparación con servicios gestionados anterior lo dice todo — y esta se decanta por Claude Haiku 5.5 en coste por tarea, velocidad y puntuación, con la salvedad de que su paso de 100.000 tokens penaliza los prompts largos. Si sí tienes aceleradores por debajo de un objetivo de utilización, Qwen3.8-Flash-Next es uno de los pocos modelos abiertos en los que una decodificación de 6B de parámetros activos resulta realmente barata de ejecutar a escala, y la cifra de 0,37 $ por tarea deja de ser el número relevante.

¿Cuánto mide el prompt promedio? Este es el único caso en el que se sostiene el argumento del precio de etiqueta. Por debajo de 100,000 tokens —tras un tokenizador que infla en aproximadamente un 30%—, Claude Haiku 5.5 es más barato en cada medidor. Por encima, la tarifa plana de $0.16 y $0.47 es la mejor opción, y su ventaja se amplía con la longitud justo hasta la ventana nativa de 262,144 tokens, más allá de la cual la extensión YaRN es un problema de ingeniería distinto.

¿Cuál es la tolerancia de la carga de trabajo a la variación de latencia? 241,9 tokens de salida por segundo frente a 56,0 es una brecha enorme, y un despliegue autoalojado le añade espera en cola. Un agente de soporte en vivo o de control del navegador —las cargas de trabajo que Anthropic menciona para este nivel— notará la diferencia.

Para cualquiera que quiera responder la segunda y la tercera pregunta en lugar de razonar sobre ellas, el instrumento más barato es un endpoint compartido. Qwen3.8-Flash-Next todavía no está en el catálogo de OrcaRouter, y Claude Haiku 5.5 tampoco; el hermano de Qwen que sí enrutamos es Qwen3.8-Flash, al precio de lista del proveedor con un 0 % de margen repercutido, que es el equivalente servido más cercano al modelo de esta comparación y la línea base correcta para una prueba de coste con prompts largos. Del lado de Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5 y Claude Opus 5.5 se pueden llamar hoy con la misma clave, de modo que un experimento de precios de dos generaciones es una configuración y no un segundo contrato, y, dado que los precios se repercuten en lugar de combinarse, un recorte del proveedor en cualquiera de las dos patas se refleja de nuestro lado el mismo día en que se anuncia. La conmutación automática por error es lo que hace que el experimento se pueda ejecutar de forma segura con tráfico real: un modelo en vista previa o una tabla de referencia no reproducida es exactamente el caso para apuntar una ruta a algo nuevo mientras un modelo de confianza queda detrás.

¿Qué cambiaría la respuesta?

Dos cosas, ambas verificables. La primera es la evaluación independiente de Qwen3.8-Flash-Next en un arnés que también ejecuta Claude Haiku 5.5 — la tabla del proveedor es contra DeepSeek, y el 40 del panel independiente es una única posición. Una puntuación de codificación a nivel de repositorio es la fila que hay que vigilar, porque NL2Repo es donde ya se ha demostrado que el modelo va por detrás. La segunda es si el trabajo del runtime llega a buen puerto: el soporte de vLLM todavía se está fusionando mediante pull requests abiertos, y hasta que eso ocurra, el autoalojamiento de esta arquitectura es un ejercicio para equipos a los que les gusta ese tipo de cosas en lugar de una ruta soportada.

Hasta entonces, el resumen es breve. Qwen3.8-Flash-Next es el modelo más interesante de poseer y el más caro de alquilar. Claude Haiku 5.5 es el endpoint gestionado más barato, rápido y con mejor puntuación, con una tarifa que castiga cualquier cosa extensa. Elige según si compras tokens o compras un checkpoint —y si compras tokens, ten en cuenta que el modelo de pesos abiertos no es el descuento que suponías.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.