
Ling-3.0-flash: Lo que realmente sabemos sobre el nuevo Fast-Tier MoE de Ant Group (y lo que no)
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 199 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
El laboratorio InclusionAI de Ant Group lanzó Ling-3.0-flash alrededor del 23 de julio de 2026, lo que significa que tiene solo días de antigüedad en el momento de este resumen. Es un modelo de lenguaje de mezcla de expertos (MoE) con 124B de parámetros totales y aproximadamente 5.1B activos por token (una proporción de dispersión de aproximadamente 24:1), diseñado para generación de texto y llamadas a herramientas. Se posiciona como el nivel rápido y económico de la familia Ling; el puesto insignia sigue siendo del mucho más grande Ling-2.6-1T (1T total / 63B activos). El acceso actualmente es solo a través de API: a través del portal de desarrolladores de Ant, a través de OpenRouter como inclusionai/ling-3.0-flash y a través de ZenMux.
Esa es la imagen completa confirmada, y vale la pena ser sinceros sobre por qué este informe suena más cauto que el análisis típico de un modelo. No hay pesos de Hugging Face, no hay repositorio de GitHub para Ling-V3, y no hay una declaración de licencia clara — un verdadero cambio respecto a Ling 2.0 y Ling 2.6, ambos lanzados como pesos abiertos bajo MIT. Tampoco hay datos de referencia independientes de ningún tipo: Artificial Analysis, el evaluador externo más citado para esta clase de modelo, aún no tiene una página para él. Cada número de rendimiento y velocidad que circula en este momento se remonta al propio Ant Group.
Resumen. Ling-3.0-flash es un modelo MoE de 124B/5.1B activos de InclusionAI de Ant Group, lanzado en los últimos días, solo API sin pesos en Hugging Face y una licencia no confirmada. Afirmaciones del proveedor — rendimiento pico de 1000 tokens/seg, tiempo hasta el primer token inferior a 100 ms — aún no tienen verificación independiente, y no hay puntuación de Artificial Analysis para este modelo específico. La generación anterior Ling-2.6-flash obtuvo un Índice de Inteligencia de Artificial Analysis de solo 14 (Ling-2.6-1T obtuvo 26), lo cual es un contexto útil pero no un sustituto de la capacidad real de 3.0-flash. Precios (¥0.40 entrada / ¥1.20 salida por 1M tokens, actualmente gratis durante la semana de lanzamiento con 500k tokens gratis/día) son explícitamente promocionales y probablemente cambiarán. Trate todo esto como una vista previa, no un veredicto.
Conclusiones clave
• Es el nivel rápido/económico, no el modelo insignia.Ling-2.6-1T sigue siendo el modelo más grande de InclusionAI; Ling-3.0-flash es un hermano más pequeño, más barato y más rápido, destinado a un uso de alto volumen.
• No existe aún un benchmark independiente. Artificial Analysis no tiene página para Ling-3.0-flash. Los únicos números públicos son los del propio Ant Group, y la documentación de Ant actualmente no muestra ninguna tabla de benchmarks para este modelo en absoluto.
• Las afirmaciones de velocidad son solo del proveedor. El pico de 1000 tokens/segundo y el tiempo hasta el primer token de menos de 100 ms provienen de Ant Group, sin una prueba de rendimiento de terceros que confirme ninguna de las cifras.
• Sin pesos abiertos, licencia no confirmada. No hay repositorio de Hugging Face ni proyecto GitHub Ling-V3. Las generaciones anteriores de Ling tenían licencia MIT; se desconoce si 3.0-flash seguirá el mismo camino.
• El precio es una promoción de la semana de lanzamiento.¥0.40/¥1.20 por cada 1 millón de tokens en la plataforma de Ant está actualmente exento, con 500k tokens gratuitos por día y un listado gratuito de OpenRouter — nada de lo cual debe suponerse que se mantendrá una vez que termine la promoción.
• Es una pieza de una familia de tres modelos. InclusionAI divide su línea en Ling (MoE de propósito general, este modelo), Ring (centrado en razonamiento) y Ming (multimodal).
Una nota sobre cómo leer este resumen:cada especificación, punto de referencia y precio a continuación está etiquetado por fuente. Cuando Ant Group es la única fuente, lo decimos claramente y matizamos en consecuencia. Cuando los modelos Ling de generaciones anteriores tienen puntuaciones independientes, los citamos para contexto, no como sustituto de datos sobre Ling-3.0-flash en sí, que aún no existen. Esto probablemente necesitará un seguimiento una vez que las pruebas independientes se pongan al día.
Lo que realmente sabemos
Arquitectónicamente, Ling-3.0-flash es un modelo MoE disperso: 124B parámetros en total, con aproximadamente 5.1B activos en cualquier token dado, lo que lo hace económico y rápido de ejecutar en relación con su tamaño total. La ventana de contexto es de 256K tokens según la documentación propia de Ant, con una afirmación del proveedor de que se puede extender a 1M; la lista de OpenRouter muestra 262,144 tokens, lo que coincide con la cifra de 256K. La longitud máxima de salida no se ha divulgado en ningún lugar que hayamos encontrado. El modelo admite generación de texto estándar y llamadas a herramientas, pero no se ha mencionado ninguna entrada o salida multimodal; esa capacidad reside en la línea Ming independiente.
En cuanto a la disponibilidad, la imagen es solo a través de API y es consistente en las tres rutas que encontramos: la plataforma de desarrolladores propia de Ant Group, OpenRouter (listado como inclusionai/ling-3.0-flash) y ZenMux. Ninguna de ellas expone pesos descargables. No hay una página de organización en GitHub para un proyecto "Ling-V3", y la documentación de Ant no indica una licencia para este modelo específico — una brecha significativa, ya que Ling 2.0 y Ling 2.6 fueron lanzados como pesos abiertos bajo MIT. Hasta que InclusionAI aclare esto, no asumas que Ling-3.0-flash terminará siendo abierto, y no asumas que no lo será.

Las lagunas: lo que no está verificado
La mayor brecha son los benchmarks. Al momento de escribir esto, Artificial Analysis — el evaluador independiente más citado precisamente para esta clase de modelo — no tiene una página para Ling-3.0-flash; el patrón de URL que normalmente la alojaría devuelve un 404. Esto significa que actualmente no hay ninguna puntuación de razonamiento, codificación o matemáticas de terceros para este modelo, de Artificial Analysis ni de ningún otro evaluador independiente que hayamos podido localizar. La propia documentación de Ant agrava esto: no publica en absoluto una tabla de benchmarks para 3.0-flash, ni del proveedor ni de ningún otro tipo, lo cual es inusual para el lanzamiento de un modelo y merece ser señalado por sí mismo.
Como contexto general, los modelos Ling de generaciones anteriores sí tienen puntuaciones independientes. Ling-2.6-flash obtuvo un Índice de Inteligencia de Artificial Analysis de 14, y el modelo más grande Ling-2.6-1T obtuvo 26 — ambos muy por detrás de los principales modelos de peso abierto rastreados por Artificial Analysis en ese momento. Las propias cifras de Ant para Ling-2.6-flash afirmaban un 61.2% en SWE-bench Verified y un 73.85% en AIME2026. Ninguno de estos números debe extrapolarse directamente a Ling-3.0-flash; una nueva generación con una nueva arquitectura puede moverse en cualquier dirección, y hasta que un evaluador independiente realmente lo ejecute, cualquier afirmación sobre la capacidad de 3.0-flash es una suposición disfrazada de hecho.
Afirmaciones de velocidad del proveedor: rápido sobre el papel, no verificado en la práctica
El discurso principal de rendimiento de Ant Group para Ling-3.0-flash no es la calidad de razonamiento, sino la velocidad bruta. El proveedor afirma un rendimiento máximo de 1000 tokens por segundo y un tiempo hasta el primer token inferior a 100 milisegundos, ambos serían genuinamente rápidos si se confirman. Pero "si se confirman" hace un trabajo real en esa frase: estos números provienen exclusivamente de los propios materiales de Ant Group, medidos en condiciones que Ant controla y no ha divulgado completamente (hardware, tamaño de lote, longitud del prompt y carga modifican sustancialmente las cifras de rendimiento). Ningún laboratorio independiente ha publicado una nueva medición. Hasta que alguien fuera de Ant ejecute una prueba comparable, trate 1000 tok/s y TTFT inferior a 100 ms como cifras de marketing que vale la pena verificar con su propia carga de trabajo, no como hechos establecidos.

El precio, y por qué es un blanco móvil
En la propia plataforma de Ant Group, el precio de lista para Ling-3.0-flash es de ¥0,40 por 1M de tokens de entrada y ¥1,20 por 1M de tokens de salida — barato por diseño, coherente con su posicionamiento como la opción rápida/económica. Pero ese precio de lista no es lo que nadie está pagando ahora mismo: Ant está realizando una promoción gratuita de lanzamiento de una semana, y además ofrece 500k tokens gratis al día en su plataforma. La ficha de OpenRouter muestra una variante ling-3.0-flash:free a $0/$0. Nada de esto debe confundirse con un precio estable. Las promociones de lanzamiento caducan, los niveles gratuitos tienen límites, y las propias cifras de ¥0,40/¥1,20 podrían cambiar una vez que lleguen los datos de uso reales. Si estás planificando un gasto de producción en torno a este modelo, presupuesta contra el precio de lista, no contra el promocional, y vuelve a verificarlo antes de comprometerte.
La familia Ling / Ring / Ming
Ling-3.0-flash no existe de forma aislada: InclusionAI organiza sus versiones en tres familias con nombre, cada una orientada a una tarea diferente. Ling es la línea MoE de propósito general, que cubre la generación de texto cotidiano y la llamada de herramientas; Ling-3.0-flash se sitúa en el extremo rápido/económico de esta línea, mientras que Ling-2.6-1T sigue siendo el buque insignia más grande. Ring es la línea centrada en el razonamiento de InclusionAI, diseñada para tareas que se apoyan en cadenas de pensamiento de múltiples pasos en lugar de un rendimiento bruto. Ming es la línea multimodal, que maneja imágenes y otras modalidades que no son texto que Ling no toca. Si tu tarea necesita un razonamiento más pesado o entrada multimodal, el modelo correcto de InclusionAI probablemente no sea Ling-3.0-flash; está diseñado para volumen y velocidad dentro del carril de texto y herramientas, no para extenderse al territorio de las otras dos familias.
Para quién es: tres escenarios
1. Canales de texto o de llamada a herramientas de alto volumen y sensibles a la latencia — como piloto, no como compromiso.
Si tu carga de trabajo está dominada por generación de texto sensible al rendimiento o llamadas a herramientas —chat, agentes ligeros, llamadas de API de alta frecuencia—, el posicionamiento de Ling-3.0-flash (pequeño número de parámetros activos, TTFT inferior a 100 ms según lo afirmado, precio de lanzamiento casi gratuito) hace que valga la pena una prueba piloto. El inconveniente es que "vale la pena una prueba piloto" es diferente de "vale la pena migrar el tráfico de producción a él". Sin datos independientes de referencia nulos, tú eres el punto de referencia ahora mismo: ejecuta tu propio conjunto de evaluación en él antes de confiarle algo orientado al cliente, y no construyas modelos de costos basados en el precio promocional actual.
2. Equipos que necesitan un contexto amplio con un presupuesto ajustado
Una ventana de contexto de 256K (con una afirmación del proveedor de que se puede extender a 1M) a un precio de lista genuinamente bajo es una combinación atractiva para casos de uso con mucha recuperación o procesamiento de documentos, siempre que la calidad real del razonamiento del modelo se mantenga en esa longitud de contexto, lo cual, de nuevo, ninguna fuente independiente ha probado. Este es un candidato razonable para preseleccionar junto con opciones económicas de contexto largo establecidas, pero debe evaluarse junto con ellas en lugar de adoptarse solo por la solidez de la hoja de especificaciones de Ant.
3. Observadores que siguen el panorama de MoE en China y la hoja de ruta de InclusionAI
Para equipos que siguen el panorama competitivo de los laboratorios de modelos chinos abiertos y semiabiertos, en lugar de implementar un solo modelo en producción, Ling-3.0-flash es un punto de datos útil: señala que InclusionAI itera rápidamente en su nivel rápido, posiblemente retrocediendo de pesos abiertos (al menos por ahora), y continúa apostando por una estructura de tres familias (Ling/Ring/Ming) en lugar de un modelo general. Vale la pena marcarlo y revisarlo una vez que llegue la claridad sobre los benchmarks y las licencias.
Cuándo no usarlo
Omita Ling-3.0-flash para cualquier cosa en la que necesite citar una afirmación de capacidad verificada — no hay un punto de referencia independiente al que remitirse, por lo que cualquier declaración sobre su razonamiento, codificación o habilidad matemática es actualmente no verificable. Omita si necesita pesos abiertos para autoalojamiento, ajuste fino o razones de cumplimiento; no hay ninguno disponible, y la licencia para este modelo específico ni siquiera ha sido declarada, y mucho menos confirmada como permisiva. Omita para tareas multimodales — ese es el trabajo de la línea Ming, no de Ling. Y tenga cuidado al construir un modelo de costos basado en los precios actuales: la semana de lanzamiento gratuita, los 500k tokens diarios gratuitos y el nivel gratuito de OpenRouter son promocionales, y el precio de lista de ¥0.40/¥1.20 al que probablemente volverá no ha sido probado en sí mismo contra patrones de uso del mundo real.
Preguntas frecuentes
¿Ling-3.0-flash tiene pesos abiertos?
Actualmente no. No hay un repositorio de Hugging Face ni un proyecto de GitHub Ling-V3 hasta la fecha de esta redacción. Las generaciones anteriores de Ling (2.0 y 2.6) se publicaron bajo MIT como pesos abiertos, pero nada confirma que Ling-3.0-flash seguirá ese patrón — o que no lo hará.
¿Cómo se desempeña Ling-3.0-flash en los benchmarks?
Aún no existe un punto de referencia independiente para este modelo — Artificial Analysis no tiene una página para este modelo. La documentación propia de Ant Group tampoco publica una tabla de referencia para él. Como contexto histórico aproximado, el Ling-2.6-flash de la generación anterior obtuvo un Índice de Inteligencia de Artificial Analysis de 14, y el Ling-2.6-1T obtuvo 26, pero no se debe asumir que ninguno de estos números se traslade a esta nueva generación.
¿Qué tan rápido es realmente?
Ant Group afirma un rendimiento máximo de 1000 tokens/segundo y un tiempo hasta el primer token inferior a 100 ms. Ambas son cifras solo del proveedor sin que se haya publicado ninguna medición independiente hasta ahora. Trátelas como afirmaciones que debe verificar en su propia carga de trabajo, no como un rendimiento confirmado.
¿Cuánto cuesta Ling-3.0-flash?
El precio de lista en la plataforma de Ant es de ¥0,40 por cada 1M de tokens de entrada y ¥1,20 por cada 1M de tokens de salida, pero actualmente es gratuito durante una promoción de lanzamiento de una semana, con 500k tokens gratuitos/día también disponibles. OpenRouter también lista una variante gratuita. Espere que estos términos promocionales cambien.
¿Qué tan grande es la ventana de contexto?
256K tokens según la documentación de Ant, con una afirmación del proveedor de que es ampliable a 1M. El listado de OpenRouter muestra 262,144 tokens, consistente con la cifra de 256K. La longitud máxima de salida no se revela.
¿Cuál es la diferencia entre Ling, Ring y Ming?
Ling es la línea MoE de propósito general de InclusionAI para texto y llamada de herramientas, y Ling-3.0-flash se encuentra en su extremo rápido/económico. Ring es la línea centrada en el razonamiento. Ming maneja tareas multimodales. Son familias de modelos separadas, construidas para diferentes trabajos, no niveles del mismo modelo.
¿Es Ling-3.0-flash lo mismo que Ling-2.6-1T?
No. Ling-2.6-1T es la insignia más grande de InclusionAI (1T total / 63B parámetros activos) y sigue siendo un modelo separado y más grande. Ling-3.0-flash (124B total / ~5.1B activos) es el lanzamiento más nuevo, más pequeño y de nivel más rápido.
¿Debería usar Ling-3.0-flash en producción hoy?
Solo después de realizar tu propia evaluación, sin un punto de referencia independiente, una licencia no confirmada y un precio que actualmente es promocional, es razonable probarlo, pero prematuro comprometer cargas de trabajo críticas para la producción o sensibles al cumplimiento normativo sin tus propias pruebas y un plan para cuando finalicen los términos promocionales.
En resumen
Ling-3.0-flash es un lanzamiento genuinamente nuevo que vale la pena seguir: un modelo MoE de 124B/5.1B activos diseñado directamente para trabajo rápido, barato y de alto volumen de texto y llamadas a herramientas, de un laboratorio que ya ha enviado modelos creíbles antes. Pero ahora mismo es una ficha técnica y un conjunto de afirmaciones del proveedor, no un producto verificado: sin puntos de referencia independientes, sin pesos abiertos, sin licencia confirmada, y precios que son explícitamente promocionales. Eso no es una razón para descartarlo — es una razón para pilotarlo con cautela, verificar las afirmaciones que te importan directamente y volver a visitar este breve una vez que Artificial Analysis u otro evaluador independiente publique números reales.

