
Claude Haiku 5.5 vs Ling 3.1 Flash: un modelo de 560 mil millones de parámetros que cuesta cuatro veces más por respuesta
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Los separan seis días. InclusionAI lanzó Ling 3.1 Flash el 1 de octubre de 2026; el proveedor lanzó Claude Haiku 5.5 el 7 de octubre. Ambos se venden como modelos de gama flash, ambos tienen una ventana de contexto de un millón de tokens, y en las filas de razonamiento de la única tabla independiente que ha evaluado ambos están tan cerca que la diferencia queda dentro del ruido. Luego llegas a la fila que mide si un agente realmente termina la tarea, y están separados por 26 puntos — y a la fila que mide cuánto cuesta una tarea terminada, donde el modelo con 560 mil millones de parámetros tiene un precio cuatro veces y media superior al de aquel cuyo número de parámetros nadie ha publicado.
Ninguna de las dos tablas de precios predice eso. Ling 3.1 Flash tiene un precio de lista de $0,30 por millón de tokens de entrada y $0,90 por millón de tokens de salida. Claude Haiku 5.5 tiene precios de lista de $0,10 y $0,50 para prompts de hasta 100.000 tokens, y pasa a $0,50 y $2,50 por encima de esa cifra. Leído como precio por token, Ling cuesta tres veces más en la entrada y un poco menos del doble en la salida, que es el tipo de diferencia que zanja una comparación en una sola línea.
No le pone fin a este, porque la tarifa se fija por token y la decisión se fija por tarea. Esos dos números salen de este enfrentamiento con signos opuestos, y la razón no es la verbosidad.
Lo que cuesta una tarea terminada, no lo que cuesta un token.
En el Artificial Analysis Intelligence Index v4.3.2, el coste medido de completar una tarea completa del índice es de $0,21 para Claude Haiku 5.5 y de $0,99 para Ling 3.1 Flash. Esa es una brecha de 4,6× —más amplia que la proporción de entrada de 3×, y en la misma dirección.
La explicación obvia —que el modelo caro está hablando más— es la incorrecta. Ling 3.1 Flash generó 100.671 tokens de salida por tarea de indexación; Claude Haiku 5.5 generó 162.164. El modelo más barato es el más parlanchín, por más de un 60 %. Así que el dinero tampoco va adonde sugiere el tarifario.
Divide el costo por tarea y este recae justo donde la metodología del índice realmente gasta. De los $0.21 de Claude Haiku 5.5, aproximadamente el 62 % corresponde a la entrada; de los $0.99 de Ling 3.1 Flash, aproximadamente el 91 % corresponde a la entrada. Estas son ejecuciones de razonamiento con uso intensivo de caché, y los dos proveedores cobran de forma muy distinta un token de entrada en caché: $0.01 por millón para Claude Haiku 5.5 frente a $0.06 por millón para Ling 3.1 Flash — una diferencia de 6× en la única línea que domina la factura. La lista de precios publicada compara $0.10 con $0.30. La línea que decide la factura compara $0.01 con $0.06.
Nuestro propio catálogo transfiere los precios de lista de los proveedores con un 0 % de margen, que es como se pueden distinguir las dos situaciones en una factura real en lugar de en una modelada. Ling 3.1 Flash no está en el catálogo bajo ninguna grafía de su ruta de proveedor que hayamos podido resolver —ni bajo InclusionAI, ni bajo Ling, ni bajo ninguna de las ocho formas que probamos—, así que los $0.30 y $0.90 de arriba son las tarifas publicadas por el propio proveedor y nada que podamos enrutar para usted hoy. Claude Haiku 5.5 tampoco está en el catálogo; se ejecuta a través de la propia API de Anthropic.Lo que sí incluye el catálogo del entorno de esta comparación es GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash y Gemini 3.8 Flash, cada uno al precio de lista del proveedor con un 0 % de margen, así que un cambio de tarifa del proveedor llega a nuestro lado el mismo día que llega al suyo. Si la conclusión de abajo es que el perfil agéntico de Ling 3.1 Flash es lo que su carga de trabajo necesita, el siguiente paso práctico esuna comparación cara a cara frente a los modelos con capacidad agéntica que sí enrutamos, en una sola clave con conmutación por error automática por debajo y el DSL de enrutamiento cuando el techo de coste deba estar en la ruta en lugar de en el código de la aplicación.

Siete filas donde ambos fueron medidos
Artificial Analysis es el único tablero que ha ejecutado ambos modelos, y la superposición es estrecha pero informativa. Las filas no coinciden entre sí, y la dirección del desacuerdo no es aleatoria.
• Índice de Inteligencia v4.3.2 — 43,40 para Claude Haiku 5.5 (Max) frente a 41,09 para Ling 3.1 Flash. Una ventaja de 2,31 puntos para Anthropic.
• Costo por tarea de Index finalizada — $0.21 frente a $0.99 en el mismo tablero.
• Tiempo por tarea de Index — 424,6 segundos para Claude Haiku 5.5 frente a 360,4 segundos para Ling 3.1 Flash. Esta es la fila donde la tabla se rompe: el modelo de 560 mil millones de parámetros es el más rápido de los dos en el índice en su conjunto, por alrededor de un 15 %.
• Terminal Bench 4.0 — 0.3283 frente a 0.3333. Ling 3.1 Flash está medio punto por delante, lo que, en un benchmark que ambos proveedores citan, es un empate.
• SciCode — 0.5498 frente a 0.5405. Claude Haiku 5.5 por 0.9 puntos. También un empate.
• Humanity's Last Exam, sin herramientas — 0,4439 frente a 0,3943. Claude Haiku 5.5 por 5 puntos, la primera separación real.
• AutomationBench, puntuación parcial — 0.3541 frente a 0.6174. Ling 3.1 Flash por 26 puntos, y por un margen más amplio que todos los demás márgenes de esta lista combinados.
Existen dos filas más fuera de ese conjunto compartido y vale la pena incluirlas, porque son las que más notan los compradores. En GDPval-AA, que Artificial Analysis ejecuta en 44 ocupaciones, las dos son 1620.05 y 1621.75 — un empate técnico. En AA-Briefcase v1.1, una evaluación de trabajo profesional de formato largo con calificación Elo, Claude Haiku 5.5 registra 1577.72 frente a 1400.35 de Ling 3.1 Flash, una diferencia de 177 puntos a favor de Anthropic. Esa es la separación no agéntica más amplia entre ellos en cualquier parte del tablero.
La única fila que debería decidir la mayoría de estas conversaciones
Los promedios a nivel de índice ocultan a dónde se destinaron realmente el tiempo y el dinero, y este par es el caso más claro de eso en el lote. Los números por evaluación en Terminal Bench 4.0 no están cerca en ninguna dimensión excepto en la puntuación.
• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 a $5,49 por tarea y 1.283 segundos por tarea.
• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 a $0.65 por tarea y 908 segundos por tarea.
Cinco milésimas de punto de puntuación los separan. El costo es 8,4× y el tiempo real es 1,4×. Un equipo que lee la tabla de benchmarks y elige el modelo que puntúa 0,3333 ha optado, según los propios cálculos de Artificial Analysis, por pagar ocho veces más para llegar un tercio de minuto más tarde con la misma respuesta.
Este no es un argumento de que la puntuación carezca de sentido; es un argumento de que una puntuación es una relación entre el trabajo realizado y el trabajo intentado, y no dice nada sobre los recursos consumidos para llegar hasta ahí. Los benchmarks de finalización agéntica son exactamente el contexto en el que esa distinción más duele, porque un agente que reintenta es un agente que paga el precio completo en cada reintento, y un modelo que cuesta ocho veces más por intento convierte un bucle de reintentos en una línea del presupuesto.

Los 560 mil millones de parámetros sin nada que descargar
Esta es la parte de la hoja de especificaciones de Ling 3.1 Flash que es genuinamente inusual, y no es el tamaño.
Ling 3.1 Flash es un modelo de mezcla de expertos dispersa —560 mil millones de parámetros en total, 25 mil millones activos por token— y Artificial Analysis lo clasifica como propietario. No hay pesos, ni archivo de licencia, ni repositorio. Un modelo disperso grande de esas características normalmente llegaría como un lanzamiento abierto, porque eso es lo que hace el resto de este nivel: GLM 5.3 Flash se distribuye con pesos MIT, con 320 mil millones en total y 18 mil millones activos, y DeepSeek V4.1 Flash se distribuye con pesos MIT, con 552 mil millones en total y 16 mil millones activos. Ling 3.1 Flash es de la misma clase de arquitectura y del mismo orden de escala, pero se publica únicamente como API.
Esa elección tiene una consecuencia que las filas del benchmark no muestran. Un modelo de 25 mil millones de parámetros activos tiene que servirse en algún lugar, y si no puedes mantener el checkpoint, no puedes elegir dónde ni con qué margen: alquilas el servicio que el proveedor hace de él. El precio de $5.49 de la tarea de Terminal Bench de arriba no es principalmente un artefacto de la tarifa por token; es lo que cuesta alquilar un modelo disperso grande de la única parte que puede ejecutarlo. Los hermanos de pesos abiertos de este nivel te dan la opción de mover ese número tú mismo.
También ocurre lo contrario, y se aplica la misma honestidad. Un lanzamiento abierto no es automáticamente el mejor producto: heredas la carga de servirlo, las decisiones de cuantización y la rueda de actualizaciones junto con los pesos, y un archivo de licencia no es un contrato de soporte. Anthropic publica un compromiso de retirada para Claude Haiku 5.5, no antes del 7 de octubre de 2027, en una API de primera parte con una tarjeta de sistema. Cuál de esos dos arreglos quieres es una cuestión de tu equipo, no de ninguno de los dos modelos.
Para qué sirve Ling 3.1 Flash
Lee el perfil en su totalidad, y este describe un producto coherente en lugar de uno lleno de concesiones: un modelo grande, disperso y de contexto largo que completa flujos de trabajo autónomos de varios pasos mejor que cualquier otra cosa medida en esta franja de precio, no destaca en razonamiento difícil de un solo intento, y lo hace a una tarifa plana sin una caída abrupta por la longitud del prompt. En AutomationBench está 26 puntos por delante de Claude Haiku 5.5, y su puntuación en AA-Briefcase es el único punto de esta comparación en el que queda por detrás de la mitad del grupo en lugar de a la cabeza de este.
Esa es una descripción defendible de un trabajador agéntico por lotes: apúntalo a una cola de trabajos estructurados que deben completarse uno por uno, acepta que la tarea se mide en minutos, mantén el prompt lo bastante largo como para que un paso de umbral resulte punitivo, y valora la fiabilidad en la línea de meta por encima del coste de cualquier token individual. Para lo que no sirve es para aquello por lo que normalmente se compran los modelos de nivel flash. Solo acepta texto —ninguna entrada de imágenes en absoluto—, mientras que Claude Haiku 5.5 acepta texto e imágenes. Su tiempo por tarea de índice es más corto, pero su tiempo por tarea en Terminal Bench es más largo, y a $0.99 por tarea de índice finalizada frente a $0.21, está gastando cuatro veces y media más para llegar a casi la misma puntuación compuesta.

¿Cuál de los dos, según la evidencia que existe?
Si tu trabajo consiste en texto que entra y texto que sale, con precios por token a escala, Claude Haiku 5.5 gana esta comparación en cada línea que llega a una factura: menor coste por tarea según el índice, menor coste real por tarea en el benchmark que más importa para los agentes, mayor puntuación compuesta, mejores resultados en trabajos profesionales de formato largo, mejor fidelidad, y entrada de imágenes que el otro modelo no ofrece en absoluto.
Si tu trabajo es un agente no atendido que tiene que completar un flujo de trabajo de varios pasos, Ling 3.1 Flash obtiene 26 puntos más que Claude Haiku 5.5 en el único benchmark compartido que mide exactamente eso, y vale la pena probarlo en lugar de descartarlo por el precio. Pruébalo con tu propia traza, no con esta tabla, y calcula el costo de la prueba por trabajo completado, porque ese es el número que cambia cuando un agente reintenta.
Si necesitas tener los pesos, ninguno de estos dos es tu modelo. Ling 3.1 Flash es propietario y tiene 560 mil millones de parámetros; Claude Haiku 5.5 es propietario y no tiene una cifra publicada. Los lanzamientos abiertos de este nivel están en otra parte del tablero, y esa comparación parte de un conjunto de filas totalmente distinto.
El compuesto dice 2,31 puntos. El benchmark agéntico dice 26 en la dirección contraria. La tarjeta de tarifas dice 3× en la entrada; el costo de tareas finalizadas dice 4,6× en la misma dirección que la tarjeta. Cuatro números, dos direcciones — por eso la única forma fiable de resolver esto es ejecutar los dos contra una traza de tu propio trabajo y leer el costo de los trabajos completados en lugar de los tokens.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
