Una tarjeta destacada generada para 'Claude Haiku 5.5 vs Ling 3.0 Flash' con dos paneles divididos por una línea divisoria fina: el de la izquierda etiquetado 'Claude Haiku 5.5' que muestra 'Índice 43' y 'Actual', el de la derecha etiquetado 'Ling 3.0 Flash' que muestra 'Índice 20' y 'Obsoleto'. Una línea al pie dice 'Puntuaciones según Artificial Analysis'. El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.0 Flash: uno de estos modelos ya tiene un sucesor

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Empieza por el dato curioso, porque es el que debería determinar la decisión. Ling 3.0 Flash —el modelo de pesos abiertos de 124 mil millones de parámetros de Ant Group, publicado en agosto de 2026 bajo MIT— ahora está marcado como obsoleto, y Ling 3.1 Flash ha sido nombrado su reemplazo. Claude Haiku 5.5 llegó el 7 de octubre de 2026, dos días antes de escribir esto, y Anthropic se ha comprometido a no retirarlo antes de octubre de 2027. Dos modelos en la misma banda de precios, y a uno de ellos ya se lo está apuntando hacia su propio sucesor.

Esa asimetría no es un veredicto sobre la calidad. Ling 3.0 Flash es un modelo genuinamente rápido, con pesos abiertos y una arquitectura inusual, y en varios ejes supera directamente a la categoría de Anthropic. Pero sí significa que esta comparación tiene fecha de caducidad, y cualquier artículo que trate a los dos como igualmente duraderos te está vendiendo la parte que expira.

Dos lanzamientos, dos épocas muy diferentes

Las cifras independientes que figuran aquí proceden de Artificial Analysis; las afirmaciones específicas de cada proveedor provienen de las fichas de modelo y la documentación, y están etiquetadas.

• Lanzamiento — Ling 3.0 Flash el 4 de agosto de 2026, con el repositorio de Hugging Face fechado el 2 de agosto. Claude Haiku 5.5 el 7 de octubre de 2026.

• Licencia — MIT para Ling 3.0 Flash, que es aproximadamente tan permisiva como pueden llegar a ser los pesos abiertos. Claude Haiku 5.5 es propietario, solo API.

• Estado — Ling 3.0 Flash lleva una marca de descontinuación que apunta a Ling 3.1 Flash. Claude Haiku 5.5 está vigente, con un compromiso de no retirada hasta octubre de 2027.

• Adopción: el repositorio de Ling 3.0 Flash ha acumulado 11.797 descargas y 427 me gusta. Es una huella real pero modesta, y es una aproximación razonable a cuánto han crecido las herramientas de terceros en torno al modelo.

La diferencia de antigüedad importa más de lo que sugieren las seis semanas. Ling 3.0 Flash se lanzó en un período en el que su propia familia ya estaba evolucionando; Claude Haiku 5.5 se lanzó como el miembro más reciente de una línea que no tiene sucesor anunciado.

La arquitectura es la parte que vale la pena leer dos veces

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash, showing 427 likes, the 'TextGeneration', 'Safetensors', 'conversational' and 'custom_code' tags, and the introduction text describing the model as a native hybrid reasoning model operating with 124B total and 5.1B active parameters (about 12.4% and 8.1% of the previous 1T-class flagship Ring-2.6-1T) built on a native hybrid linear attention architecture.

Ling 3.0 Flash es un modelo de mezcla de expertos con 124 mil millones de parámetros totales y 5.1 mil millones activos por token. Esa proporción es todo el argumento económico: se ajusta la huella de memoria de un modelo grande y se paga el cómputo de uno pequeño. La configuración publicada es específica, y no es una versión reenvasada de un transformer estándar:

• Capas — 35 capas KDA con 7 capas MLA con compuertas en una proporción de 5:1, más 2 capas densas. La receta de entrenamiento publicada mueve la ventana de contexto de 8K a 32K a 256K por etapas en lugar de entrenar la ventana larga desde cero.

• Expertos — 512 expertos enrutados con un experto compartido, 8 activados por token, en un tamaño oculto de 2,560, un tamaño intermedio de experto de 768 y un tamaño intermedio denso de 6,144. El vocabulario es de 157,184 tokens.

• Servicio — el despliegue de referencia de la tarjeta usa SGLang con context-length 262144, y reporta que HiCache con caché de Mooncake reduce el tiempo hasta el primer token en un 60–80% o más en entradas largas. Esa es una cifra reportada por el proveedor y se indica como tal.

Nada de eso es un truco. Una huella activa de 5,1 mil millones es la razón por la que Ling 3.0 Flash puede servirse con el rendimiento que alcanza, y el trabajo de almacenamiento en caché es la razón por la que su latencia del primer token en indicaciones largas sigue siendo utilizable. El enfoque de Claude Haiku 5.5 es el opuesto: un único modelo denso y propietario detrás de una API, con una ventana de 1.000.000 de tokens y pensamiento adaptativo que decide, por solicitud, cuánto trabajo realizar. Dos respuestas coherentes a la misma cuestión de costos.

Los números, uno al lado del otro

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.0 Flash - the scoreboard'. The Claude Haiku 5.5 column reads independent score 43 (AA, #2 of 182), weights Proprietary API, context 1,000,000 tokens, input price $0.10 / 1M, output price $0.50 / 1M and throughput 240.4 tok/s. The Ling 3.0 Flash column reads independent score 20 (AA, #3 of 65), weights MIT open weights, context 262,000 tokens, input price $0.075 / 1M, output price $0.22 / 1M and throughput 333.6 tok/s. A footer line reads 'Independent figures per Artificial Analysis; pricing per each vendor.'

• Puntuación independiente — Claude Haiku 5.5 con 43 en el Índice de Inteligencia, segundo de 182. Ling 3.0 Flash con 20, tercero de 65 en su propia clase.

• Precio de entrada por millón de tokens — Claude Haiku 5.5: $0,10 hasta 100.000 tokens, $0,50 por encima. Ling 3.0 Flash: $0,075, con un 80 % de descuento por caché.

• Precio de salida por millón de tokens — Claude Haiku 5.5 $0.50 hasta 100.000 tokens, $2.50 por encima. Ling 3.0 Flash $0.22.

• Costo combinado — $0.05 por millón de tokens para Ling 3.0 Flash, frente a $0.08 para Claude Haiku 5.5 según la propia combinación del panel.

• Velocidad — 333,6 tokens de salida por segundo para Ling 3.0 Flash, el primero de 65 en su clase, frente a 240,4 de Claude Haiku 5.5. El tiempo hasta el primer token es casi un empate: 2,50 segundos frente a la medición del ranking para el modelo de Anthropic.

• Contexto — 262.000 tokens para Ling 3.0 Flash; 1.000.000 para Claude Haiku 5.5.

• Modalidad de entrada — solo texto para Ling 3.0 Flash. Texto e imágenes para Claude Haiku 5.5.

• Pesos: MIT y descargables para Ling 3.0 Flash. Privativos para Claude Haiku 5.5.

El argumento de Ling es la velocidad y el precio, no la profundidad

La diferencia de 23 puntos en el Index entre 43 y 20 es el titular, y apunta en la misma dirección que en todas las comparaciones de este tipo: Claude Haiku 5.5 es el modelo más fuerte, y la diferencia no es pequeña. Pero la columna de Ling gana dos filas de forma clara, y ambas son del tipo que aparece en una factura o en un presupuesto de latencia.

Primero, el rendimiento. 333,6 tokens por segundo es el más rápido de su clase en la tabla, aproximadamente un 39% por delante de Claude Haiku 5.5, y, combinado con un coste mixto más bajo, significa que la generación masiva —barridos de clasificación, etiquetado de datos, extracción estructurada de gran volumen— es mediblemente más barata de ejecutar en Ling 3.0 Flash. Cuando la tarea está bien especificada y el modo de fallo es obvio, un modelo 23 puntos del Index por detrás todavía puede ser el adecuado.

Segundo, el descuento de caché del 80 %. Para una carga de trabajo con un prefijo grande y estable y una cola variable pequeña, la tarifa de entrada efectiva en Ling 3.0 Flash cae muy por debajo del precio anunciado, y el diseño de caché de la ficha del modelo apunta exactamente a ese patrón. La tarifa de lectura de caché de Claude Haiku 5.5, de $0.01, es más barata en términos absolutos, pero su escritura de caché cuesta $0.125 y el modelo tiene un precio con un escalón a partir de 100,000 tokens de entrada que Ling no tiene.

El contrapeso es la verbosidad, y es el mismo que se aplica al modelo de Anthropic. Artificial Analysis registró 260 millones de tokens de salida al ejecutar el Index en Ling 3.0 Flash frente a una mediana de 100 millones, y lo marca como verboso. En un modelo con precio por token, eso erosiona la ventaja de tarifa: una tarifa de salida 2,3 veces más barata, consumida en parte por un modelo que escribe más tokens, es una ventaja menor de lo que sugiere la ficha.

Lo que afirman los benchmarks de los proveedores, y lo que no

La propia ficha de Ling 3.0 Flash reporta un conjunto sólido: MathArena AIME 2026 con 93,2, HMMT de febrero de 2026 con 87, SWE-Bench Pro con 56,6, SWE-Bench Multilingual Resolved con 72,4 y Humanity's Last Exam con 22,7. Todos ellos son reportados por el proveedor y ninguno se ha reproducido de forma independiente aquí. Tampoco se miden contra Claude Haiku 5.5 en el mismo arnés: Anthropic publica su propio conjunto (GDPval-AA v2.1 con 1620, OSWorld 2.1 con 72,4 %, Terminal-Bench 4.0 con 39,2 %) y los dos proveedores ejecutaron suites diferentes. La única medición compartida es la clasificación independiente, y ahí la respuesta es inequívoca.

Cabe señalar, junto con las puntuaciones de matemáticas: esa cifra de HLE de 22,7 queda muy por debajo del 45,9 sin herramientas que Anthropic reporta para Claude Haiku 5.5. Son arneses distintos, así que no es una comparación directa, pero tampoco es una brecha que la elección de arnés permita explicar y descartar.

A screenshot of the Artificial Analysis page for Ling 3.0 Flash carrying a deprecation notice that the model is deprecated and that only the default 10k-input-token workload is still benchmarked, and that InclusionAI has launched a newer release, Ling 3.1 Flash, which it suggests considering instead. Beneath the notice the page shows the model as an open-weights release from August 2026 with an Intelligence rank of 3 of 65 and a speed rank of 1 of 65.

El problema del sucesor

Esta es la parte que decide la comparación para cualquiera que planifique más allá del trimestre actual, y no tiene nada que ver con los benchmarks.

Ling 3.0 Flash está obsoleto en favor de Ling 3.1 Flash. Eso no significa que deje de funcionar: los pesos abiertos no caducan, y las licencias MIT no se pueden revocar. Pero sí significa que el ecosistema a su alrededor se irá desplazando: el soporte de frameworks de integración, los lanzamientos de cuantización, las correcciones de errores y las herramientas de la comunidad siguen al modelo actual, y uno obsoleto solo recibe la cola de esa atención. Si hoy construyes sobre Ling 3.0 Flash, construyes sobre pesos que están congelados y terminados, lo cual está bien para una carga de trabajo estable y resulta incómodo para cualquier cosa que esperes mejorar.

Claude Haiku 5.5 tiene el conjunto inverso de garantías: no obtienes los pesos, pero obtienes un proveedor cuyo interés comercial es mantener el modelo rápido, parcheado y en servicio, además de un compromiso de no retirada hasta octubre de 2027 y una ruta de migración publicada para cuando eso termine.

Ambos lados de esta ruta, a través de una sola clave

La línea honesta sobre la disponibilidad: OrcaRouter no incluye Ling 3.0 Flash, y tampoco incluye Claude Haiku 5.5. Ling 3.0 Flash se ofrece a través de la distribución propia del proveedor y varias plataformas de terceros; Claude Haiku 5.5 está en la API de A​nthropic y en las principales plataformas en la nube.

Lo que queda es la cuestión de enrutamiento que plantean ambos modelos. Claude Haiku 5.5 a 43 y una ventana de 1M es un objetivo de escalado natural; Ling 3.0 Flash a 333 tokens por segundo es un tramo de gran volumen natural. Una ruta que envía trabajo de gran volumen y bien especificado a un nivel rápido y escala cualquier cosa que no pase una verificación de longitud o calidad a uno más fuerte es exactamente la disposición que compone un enrutador — en OrcaRouter, los Claude Haiku 4.5, Claude Sonnet 5.5 y Claude Opus 5.5 de Anthropic están en el catálogo hoy, junto con grandes opciones de pesos abiertos como DeepSeek V4.1 Flash y GLM 5.3 Flash, por lo que tanto los tramos de escalado como los de gran volumen se pueden construir y probar bajo carga ahora. Una clave, conmutación automática por error subyacente, precios de lista de proveedores transmitidos con un margen del 0%, por lo que un cambio de precio está activo el mismo día.

¿Cuál de los dos, y por cuánto tiempo?

Elige Claude Haiku 5.5 si el trabajo es de final abierto, si necesitas imágenes o una ventana de un millón de tokens, si quieres un proveedor que se responsabilice del tiempo de actividad, o si estás planificando más allá del próximo trimestre. Está 23 puntos de Index por delante, está vigente en lugar de obsoleto, y la diferencia de precio es lo suficientemente pequeña como para que la brecha de puntuación domine.

Elige Ling 3.0 Flash si la carga de trabajo es masiva, está bien especificada y es sensible a la latencia, si la licencia MIT o los pesos abiertos son lo importante, o si un descuento de caché del 80 % en un prefijo estable es donde realmente se concentra tu factura. Es el modelo más rápido y el más barato por token, y es realmente bueno en las tareas que puede manejar un modelo 20-Index. Eso sí, ten claro que estás adoptando un modelo terminado en lugar de uno mantenido, y que el sucesor al que apunta ya existe.