
Ling-3.1-flash vs DeepSeek V4.1 Flash: dos puntos de índice, el triple de factura
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Ling-3.1-flash y DeepSeek V4.1 Flash (Max) están a dos puntos de distancia en el Artificial Analysis Intelligence Index —41 frente a 39— y en precio no están ni cerca. Ejecuta las diez evaluaciones que componen ese índice con cada modelo y Ling-3.1-flash cuesta aproximadamente $0.99 por tarea frente a los $0.27 de DeepSeek. Ambos son modelos de mezcla de expertos de ~550 mil millones de parámetros con un contexto declarado de 1 millón de tokens. Uno es un modelo cerrado y solo de texto del laboratorio InclusionAI de Ant Group, lanzado el 2026-10-01 y aún sin pesos publicados ni licencia. El otro es de código abierto bajo MIT desde el 2026-09-10, acepta imágenes además de texto, se ejecuta en 23 proveedores y es el modelo que la mayoría de los equipos ya tendría en un archivo de configuración. La comparación no está ni cerca en la mayoría de los aspectos. La pregunta interesante es por qué existen siquiera esos dos puntos.
Donde Ling-3.1-flash está genuinamente por delante
Va por delante en las evaluaciones que miden el manejo de una terminal y la escritura de código que tiene que ejecutarse, y el margen merece mención precisa porque el agregado lo oculta.
• Terminal-Bench 4.0 — Ling-3.1-flash 0,333 frente a DeepSeek V4.1 Flash (Max) 0,268. Ambos son valores modestos en términos absolutos; la diferencia es un cuarto de la puntuación de DeepSeek.
• SciCode — 0,541 vs 0,519.
• Razonamiento de física de CritPt — 0.180 vs 0.143.
• Trabajo agéntico del mundo real de GDPval-AA — 1.621,75 Elo frente a 1.600 Elo.
Dos de esos cuatro son casi empates, uno es una victoria estrecha, y Terminal-Bench 4.0 es la única fila en la que la diferencia sobreviviría a un cambio de semilla. Contrasta eso con donde gana DeepSeek: trabajo de conocimiento agéntico de AA-Briefcase v1.1 con 1.420,47 Elo frente a 1.400,35, AutomationBench-AA con 0,689 frente a 0,617, razonamiento de contexto largo de AA-LCR con 0,84 frente a 0,83, y —la fila que más importa para producción— AA-Omniscience con −5,30 frente al +2,22 de Ling-3.1-flash en una métrica donde una alucinación es peor que un rechazo. La precisión de DeepSeek ahí es del 46,4% con una tasa de alucinación del 96,5% entre las preguntas que responde; Ling-3.1-flash responde correctamente el 29,1% con una tasa de alucinación del 37,9%. Ninguno es un modelo al que apuntes a una base de conocimiento sin recuperación delante.
La brecha de precios es mayor que la brecha del índice, y no se debe solo al tarifario.
Las tarifas principales parecen casi idénticas. Artificial Analysis registra ambos a $0.30 por millón de tokens de entrada. Divergen marcadamente en las otras dos cifras:
• Salida — Ling-3.1-flash 0,90 $ por millón vs. DeepSeek V4.1 Flash (Max) 1,20 $ por millón. Aquí Ling-3.1-flash es directamente el modelo más barato, por un 25 %.
• Lectura de caché — Ling-3.1-flash $0.06 por millón frente a DeepSeek V4.1 Flash (Max) $0.006 por millón, un descuento del 98% frente a uno del 80%. Aquí es donde los dos modelos dejan de ser comparables.
La tarifa combinada con una mezcla de 7:2:1 de aciertos de caché/entrada/salida da $0.192 para Ling-3.1-flash y $0.184 para DeepSeek V4.1 Flash (Max) — casi un empate. Pero la mezcla es una suposición sobre cómo usas un modelo, y esa suposición hace un gran trabajo. Cualquier carga de trabajo con un uso intensivo de la reutilización de prompts — un prompt de sistema largo, un preámbulo de recuperación, un bucle de agente que reenvía el contexto acumulado en cada turno — empuja la mezcla efectiva hacia las lecturas de caché, y ahí la diferencia de 10× en el precio de la caché toma el control. El volumen de tokens se acumula de la misma manera: Ling-3.1-flash es un razonador parlanchín, que genera 220 millones de tokens de salida en las evaluaciones del índice frente a los 250 millones de DeepSeek, y promedia unos 357 segundos por tarea de evaluación frente a los 285 de DeepSeek. Piensa más por cada respuesta y tarda más en hacerlo.

Un ejemplo práctico: el mismo bucle de agente en ambos
Toma un agente que maneja herramientas y que procesa 1M de tokens de entrada por tarea, con el 90 % de ellos servidos desde caché, y devuelve 200,000 tokens de salida. En Ling-3.1-flash, con las cifras anteriores: 900,000 tokens de entrada en caché a $0.06 más 100,000 de entrada nueva a $0.30 más 200,000 de salida a $0.90 asciende a aproximadamente $0.26 por tarea. El mismo bucle en DeepSeek V4.1 Flash (Max) asciende a aproximadamente $0.14 — aproximadamente la mitad.
Ahora aplica el horario de DeepSeek, porque esta es la parte que la mayoría de las comparaciones omite. La tarifa de horas valle de DeepSeek es la de arriba, y las horas valle abarcan los fines de semana y la mayor parte del día; pero durante dos franjas entre semana, 01:00–04:00 y 06:00–10:00 UTC, el precio de entrada y de caché se duplica. Traslada el mismo bucle a una franja de horas punta y el coste de DeepSeek queda cerca de $0.28 — y en ese punto la tarifa plana y más alta de Ling-3.1-flash es la opción más barata para esa hora, y el descuento de caché de 10× ha sido neutralizado por el reloj.
Esa es toda la decisión en un solo par de números. Si tu tráfico de agentes es intensivo en caché y puedes programarlo, DeepSeek V4.1 Flash (Max) cuesta aproximadamente la mitad que Ling-3.1-flash por una diferencia de dos puntos en el índice. Si tu tráfico de agentes es intensivo en caché y cae en las ventanas de máxima demanda de DeepSeek, los dos modelos cuestan casi lo mismo y la fila de agente de terminal marginalmente mejor de Ling-3.1-flash se convierte en el desempate.
Los ejes donde no hay comparación que hacer
Tres dimensiones no están cerca, y son las que suelen decidir una arquitectura antes de que se hable del precio.
• Pesos y licencia — Ling-3.1-flash no ha publicado los pesos, no tiene texto de licencia y Artificial Analysis lo clasifica como propietario. DeepSeek V4.1 Flash (Max) es de pesos abiertos bajo MIT, se puede descargar desde Hugging Face y permite el uso comercial. Uno de ellos puede autoalojarse, ajustarse y aislarse de la red; el otro, no.
• Modalidad — Ling-3.1-flash es texto de entrada, texto de salida. DeepSeek V4.1 Flash (Max) acepta imágenes junto con texto y se evalúa en benchmarks multimodales. Si alguna parte de tu pipeline le entrega al modelo una captura de pantalla, un gráfico o un escaneo, la comparación termina ahí.
• Superficie de servicio — DeepSeek V4.1 Flash (Max) está disponible a través de 23 proveedores, incluido OrcaRouter; Ling-3.1-flash se ejecuta mediante la propia API del proveedor y las plataformas de terceros que distribuyen su lanzamiento. Para una ruta de producción, la cantidad de proveedores es una propiedad de resiliencia, no un concurso de popularidad.
Una asimetría más que no aparece en ninguna de esas listas: DeepSeek V4.1 Flash (Max) expone 384.000 tokens de salida en una sola respuesta. Ant no ha publicado una longitud máxima de salida para Ling-3.1-flash, por lo que todavía no se puede dimensionar una carga de trabajo de generación larga con respecto a ella. La ausencia de un límite publicado no es lo mismo que un límite pequeño, pero tampoco es una cifra con la que se pueda diseñar.
Ejecutando ambos, y cómo se ve eso realmente
Ling-3.1-flash no está hoy en el catálogo de OrcaRouter — una consulta a nuestra API pública de modelos devuelve not-found para el modelo bajo InclusionAI, y este artículo no va a fingir lo contrario. DeepSeek V4.1 Flash es enrutable ahora mismo al precio de lista sin recargo del proveedor, así que un cambio de precio del proveedor está activo en nuestro lado el mismo día en que se produce, y está detrás de la misma clave de API única que el resto del catálogo, con conmutación automática entre proveedores upstream.
Esa asimetría tiene una forma práctica. La manera sensata de plantear una comparación en la que un modelo es cerrado, cuesta aproximadamente cuatro veces más que su predecesor y solo se puede acceder a él a través de un único proveedor es mantener el modelo abierto y ampliamente disponible como ruta predeterminada y tratar al retador como algo que se prueba en lugar de algo con lo que te comprometes. DeepSeek V4.1 Flash (Max) puede sostener hoy el ciclo de producción —pesos abiertos, entrada de imágenes, salida de 384K, un descuento de caché del 98%—, mientras que Ling-3.1-flash se encarga del trabajo específico de agentes donde sus márgenes en Terminal-Bench y SciCode realmente se aplican. Como ambos hablan el formato chat-completions compatible con OpenAI, esa división es una decisión de enrutamiento y no un proyecto de integración: un endpoint, una clave y una regla que envía las tareas en las que cada modelo es mejor de forma medible.
El veredicto
Según la evidencia disponible, DeepSeek V4.1 Flash (Max) gana este enfrentamiento, y lo gana sobre todo por cosas que no tienen nada que ver con dos puntos de Index: pesos abiertos bajo MIT, entrada de imágenes, 384.000 tokens de salida, un descuento de caché del 98 % y 23 proveedores entre los que conmutar por error. El caso de Ling-3.1-flash es más limitado y real: es el mejor agente de terminal y herramientas de los dos, y es el único de la pareja que no ha publicado un esquema de tarifas con un multiplicador de horas pico incorporado.
Dos cosas cambiarían esta evaluación. Si Ant publica los pesos bajo una licencia permisiva, la brecha de apertura se cierra y la comparación se convierte en una conversación directa sobre capacidad y coste. Y si la ventana de contexto largo servida por Ant se valida en el 1M de tokens que ambos modelos declaran, la afirmación de paridad de contexto deja de ser una afirmación. Hasta entonces, el resumen honesto es que un modelo puede ganar una fila de un benchmark agéntico y, aun así, perder la evaluación —y que la brecha de dos puntos en el índice entre estos modelos vale aproximadamente 3,6× el coste por tarea, lo cual es un intercambio que solo debería aceptar una carga de trabajo específica.


