Una tarjeta destacada titulada «Claude Haiku 5.5 vs Ling 3.1 Flash», con la línea «560B parámetros, sin pesos» en la parte superior, un contraste de Index frente a AutomationBench que marca 0,3541 frente a 0,6174, una línea de coste que indica $0,21 por tarea frente a $0,99 por tarea y una línea de tiempo que indica 424,6 s por tarea frente a 360,4 s por tarea.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.1 Flash: un modelo de 560 mil millones de parámetros que cuesta cuatro veces más por respuesta

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Los separan seis días. InclusionAI lanzó Ling 3.1 Flash el 1 de octubre de 2026; el proveedor lanzó Claude Haiku 5.5 el 7 de octubre. Ambos se venden como modelos de gama flash, ambos tienen una ventana de contexto de un millón de tokens, y en las filas de razonamiento de la única tabla independiente que ha evaluado ambos están tan cerca que la diferencia queda dentro del ruido. Luego llegas a la fila que mide si un agente realmente termina la tarea, y están separados por 26 puntos — y a la fila que mide cuánto cuesta una tarea terminada, donde el modelo con 560 mil millones de parámetros tiene un precio cuatro veces y media superior al de aquel cuyo número de parámetros nadie ha publicado.

Ninguna de las dos tablas de precios predice eso. Ling 3.1 Flash tiene un precio de lista de $0,30 por millón de tokens de entrada y $0,90 por millón de tokens de salida. Claude Haiku 5.5 tiene precios de lista de $0,10 y $0,50 para prompts de hasta 100.000 tokens, y pasa a $0,50 y $2,50 por encima de esa cifra. Leído como precio por token, Ling cuesta tres veces más en la entrada y un poco menos del doble en la salida, que es el tipo de diferencia que zanja una comparación en una sola línea.

No le pone fin a este, porque la tarifa se fija por token y la decisión se fija por tarea. Esos dos números salen de este enfrentamiento con signos opuestos, y la razón no es la verbosidad.

Lo que cuesta una tarea terminada, no lo que cuesta un token.

En el Artificial Analysis Intelligence Index v4.3.2, el coste medido de completar una tarea completa del índice es de $0,21 para Claude Haiku 5.5 y de $0,99 para Ling 3.1 Flash. Esa es una brecha de 4,6× —más amplia que la proporción de entrada de 3×, y en la misma dirección.

La explicación obvia —que el modelo caro está hablando más— es la incorrecta. Ling 3.1 Flash generó 100.671 tokens de salida por tarea de indexación; Claude Haiku 5.5 generó 162.164. El modelo más barato es el más parlanchín, por más de un 60 %. Así que el dinero tampoco va adonde sugiere el tarifario.

Divide el costo por tarea y este recae justo donde la metodología del índice realmente gasta. De los $0.21 de Claude Haiku 5.5, aproximadamente el 62 % corresponde a la entrada; de los $0.99 de Ling 3.1 Flash, aproximadamente el 91 % corresponde a la entrada. Estas son ejecuciones de razonamiento con uso intensivo de caché, y los dos proveedores cobran de forma muy distinta un token de entrada en caché: $0.01 por millón para Claude Haiku 5.5 frente a $0.06 por millón para Ling 3.1 Flash — una diferencia de 6× en la única línea que domina la factura. La lista de precios publicada compara $0.10 con $0.30. La línea que decide la factura compara $0.01 con $0.06.

Nuestro propio catálogo transfiere los precios de lista de los proveedores con un 0 % de margen, que es como se pueden distinguir las dos situaciones en una factura real en lugar de en una modelada. Ling 3.1 Flash no está en el catálogo bajo ninguna grafía de su ruta de proveedor que hayamos podido resolver —ni bajo InclusionAI, ni bajo Ling, ni bajo ninguna de las ocho formas que probamos—, así que los $0.30 y $0.90 de arriba son las tarifas publicadas por el propio proveedor y nada que podamos enrutar para usted hoy. Claude Haiku 5.5 tampoco está en el catálogo; se ejecuta a través de la propia API de Anthropic.Lo que sí incluye el catálogo del entorno de esta comparación es GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash y Gemini 3.8 Flash, cada uno al precio de lista del proveedor con un 0 % de margen, así que un cambio de tarifa del proveedor llega a nuestro lado el mismo día que llega al suyo. Si la conclusión de abajo es que el perfil agéntico de Ling 3.1 Flash es lo que su carga de trabajo necesita, el siguiente paso práctico esuna comparación cara a cara frente a los modelos con capacidad agéntica que sí enrutamos, en una sola clave con conmutación por error automática por debajo y el DSL de enrutamiento cuando el techo de coste deba estar en la ruta en lugar de en el código de la aplicación.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

Siete filas donde ambos fueron medidos

Artificial Analysis es el único tablero que ha ejecutado ambos modelos, y la superposición es estrecha pero informativa. Las filas no coinciden entre sí, y la dirección del desacuerdo no es aleatoria.

• Índice de Inteligencia v4.3.2 — 43,40 para Claude Haiku 5.5 (Max) frente a 41,09 para Ling 3.1 Flash. Una ventaja de 2,31 puntos para Anthropic.

• Costo por tarea de Index finalizada — $0.21 frente a $0.99 en el mismo tablero.

• Tiempo por tarea de Index — 424,6 segundos para Claude Haiku 5.5 frente a 360,4 segundos para Ling 3.1 Flash. Esta es la fila donde la tabla se rompe: el modelo de 560 mil millones de parámetros es el más rápido de los dos en el índice en su conjunto, por alrededor de un 15 %.

• Terminal Bench 4.0 — 0.3283 frente a 0.3333. Ling 3.1 Flash está medio punto por delante, lo que, en un benchmark que ambos proveedores citan, es un empate.

• SciCode — 0.5498 frente a 0.5405. Claude Haiku 5.5 por 0.9 puntos. También un empate.

• Humanity's Last Exam, sin herramientas — 0,4439 frente a 0,3943. Claude Haiku 5.5 por 5 puntos, la primera separación real.

• AutomationBench, puntuación parcial — 0.3541 frente a 0.6174. Ling 3.1 Flash por 26 puntos, y por un margen más amplio que todos los demás márgenes de esta lista combinados.

Existen dos filas más fuera de ese conjunto compartido y vale la pena incluirlas, porque son las que más notan los compradores. En GDPval-AA, que Artificial Analysis ejecuta en 44 ocupaciones, las dos son 1620.05 y 1621.75 — un empate técnico. En AA-Briefcase v1.1, una evaluación de trabajo profesional de formato largo con calificación Elo, Claude Haiku 5.5 registra 1577.72 frente a 1400.35 de Ling 3.1 Flash, una diferencia de 177 puntos a favor de Anthropic. Esa es la separación no agéntica más amplia entre ellos en cualquier parte del tablero.

La única fila que debería decidir la mayoría de estas conversaciones

Los promedios a nivel de índice ocultan a dónde se destinaron realmente el tiempo y el dinero, y este par es el caso más claro de eso en el lote. Los números por evaluación en Terminal Bench 4.0 no están cerca en ninguna dimensión excepto en la puntuación.

• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 a $5,49 por tarea y 1.283 segundos por tarea.

• Terminal Bench 4.0, Claude Haiku 5.5 — 0.3283 a $0.65 por tarea y 908 segundos por tarea.

Cinco milésimas de punto de puntuación los separan. El costo es 8,4× y el tiempo real es 1,4×. Un equipo que lee la tabla de benchmarks y elige el modelo que puntúa 0,3333 ha optado, según los propios cálculos de Artificial Analysis, por pagar ocho veces más para llegar un tercio de minuto más tarde con la misma respuesta.

Este no es un argumento de que la puntuación carezca de sentido; es un argumento de que una puntuación es una relación entre el trabajo realizado y el trabajo intentado, y no dice nada sobre los recursos consumidos para llegar hasta ahí. Los benchmarks de finalización agéntica son exactamente el contexto en el que esa distinción más duele, porque un agente que reintenta es un agente que paga el precio completo en cada reintento, y un modelo que cuesta ocho veces más por intento convierte un bucle de reintentos en una línea del presupuesto.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

Los 560 mil millones de parámetros sin nada que descargar

Esta es la parte de la hoja de especificaciones de Ling 3.1 Flash que es genuinamente inusual, y no es el tamaño.

Ling 3.1 Flash es un modelo de mezcla de expertos dispersa —560 mil millones de parámetros en total, 25 mil millones activos por token— y Artificial Analysis lo clasifica como propietario. No hay pesos, ni archivo de licencia, ni repositorio. Un modelo disperso grande de esas características normalmente llegaría como un lanzamiento abierto, porque eso es lo que hace el resto de este nivel: GLM 5.3 Flash se distribuye con pesos MIT, con 320 mil millones en total y 18 mil millones activos, y DeepSeek V4.1 Flash se distribuye con pesos MIT, con 552 mil millones en total y 16 mil millones activos. Ling 3.1 Flash es de la misma clase de arquitectura y del mismo orden de escala, pero se publica únicamente como API.

Esa elección tiene una consecuencia que las filas del benchmark no muestran. Un modelo de 25 mil millones de parámetros activos tiene que servirse en algún lugar, y si no puedes mantener el checkpoint, no puedes elegir dónde ni con qué margen: alquilas el servicio que el proveedor hace de él. El precio de $5.49 de la tarea de Terminal Bench de arriba no es principalmente un artefacto de la tarifa por token; es lo que cuesta alquilar un modelo disperso grande de la única parte que puede ejecutarlo. Los hermanos de pesos abiertos de este nivel te dan la opción de mover ese número tú mismo.

También ocurre lo contrario, y se aplica la misma honestidad. Un lanzamiento abierto no es automáticamente el mejor producto: heredas la carga de servirlo, las decisiones de cuantización y la rueda de actualizaciones junto con los pesos, y un archivo de licencia no es un contrato de soporte. Anthropic publica un compromiso de retirada para Claude Haiku 5.5, no antes del 7 de octubre de 2027, en una API de primera parte con una tarjeta de sistema. Cuál de esos dos arreglos quieres es una cuestión de tu equipo, no de ninguno de los dos modelos.

Para qué sirve Ling 3.1 Flash

Lee el perfil en su totalidad, y este describe un producto coherente en lugar de uno lleno de concesiones: un modelo grande, disperso y de contexto largo que completa flujos de trabajo autónomos de varios pasos mejor que cualquier otra cosa medida en esta franja de precio, no destaca en razonamiento difícil de un solo intento, y lo hace a una tarifa plana sin una caída abrupta por la longitud del prompt. En AutomationBench está 26 puntos por delante de Claude Haiku 5.5, y su puntuación en AA-Briefcase es el único punto de esta comparación en el que queda por detrás de la mitad del grupo en lugar de a la cabeza de este.

Esa es una descripción defendible de un trabajador agéntico por lotes: apúntalo a una cola de trabajos estructurados que deben completarse uno por uno, acepta que la tarea se mide en minutos, mantén el prompt lo bastante largo como para que un paso de umbral resulte punitivo, y valora la fiabilidad en la línea de meta por encima del coste de cualquier token individual. Para lo que no sirve es para aquello por lo que normalmente se compran los modelos de nivel flash. Solo acepta texto —ninguna entrada de imágenes en absoluto—, mientras que Claude Haiku 5.5 acepta texto e imágenes. Su tiempo por tarea de índice es más corto, pero su tiempo por tarea en Terminal Bench es más largo, y a $0.99 por tarea de índice finalizada frente a $0.21, está gastando cuatro veces y media más para llegar a casi la misma puntuación compuesta.

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

¿Cuál de los dos, según la evidencia que existe?

Si tu trabajo consiste en texto que entra y texto que sale, con precios por token a escala, Claude Haiku 5.5 gana esta comparación en cada línea que llega a una factura: menor coste por tarea según el índice, menor coste real por tarea en el benchmark que más importa para los agentes, mayor puntuación compuesta, mejores resultados en trabajos profesionales de formato largo, mejor fidelidad, y entrada de imágenes que el otro modelo no ofrece en absoluto.

Si tu trabajo es un agente no atendido que tiene que completar un flujo de trabajo de varios pasos, Ling 3.1 Flash obtiene 26 puntos más que Claude Haiku 5.5 en el único benchmark compartido que mide exactamente eso, y vale la pena probarlo en lugar de descartarlo por el precio. Pruébalo con tu propia traza, no con esta tabla, y calcula el costo de la prueba por trabajo completado, porque ese es el número que cambia cuando un agente reintenta.

Si necesitas tener los pesos, ninguno de estos dos es tu modelo. Ling 3.1 Flash es propietario y tiene 560 mil millones de parámetros; Claude Haiku 5.5 es propietario y no tiene una cifra publicada. Los lanzamientos abiertos de este nivel están en otra parte del tablero, y esa comparación parte de un conjunto de filas totalmente distinto.

El compuesto dice 2,31 puntos. El benchmark agéntico dice 26 en la dirección contraria. La tarjeta de tarifas dice 3× en la entrada; el costo de tareas finalizadas dice 4,6× en la misma dirección que la tarjeta. Cuatro números, dos direcciones — por eso la única forma fiable de resolver esto es ejecutar los dos contra una traza de tu propio trabajo y leer el costo de los trabajos completados en lugar de los tokens.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario