Tarjeta de título principal para «Ling-3.1-flash vs DeepSeek V4.1 Flash», con el subtítulo «Dos puntos de índice, tres veces la factura». Dos tarjetas redondeadas se colocan una al lado de la otra con una separación clara: la de la izquierda, etiquetada «Ling-3.1-flash», muestra «Índice AA: 41», «Costo por tarea: $0.99», «Pesos: cerrados»; la de la derecha, etiquetada «DeepSeek V4.1 Flash (Max)», muestra «Índice AA: 39», «Costo por tarea: $0.27», «Pesos: MIT». Una línea al pie dice «Costos y cifras de índice según Artificial Analysis». El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

Ling-3.1-flash vs DeepSeek V4.1 Flash: dos puntos de índice, el triple de factura

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ling-3.1-flash y DeepSeek V4.1 Flash (Max) están a dos puntos de distancia en el Artificial Analysis Intelligence Index —41 frente a 39— y en precio no están ni cerca. Ejecuta las diez evaluaciones que componen ese índice con cada modelo y Ling-3.1-flash cuesta aproximadamente $0.99 por tarea frente a los $0.27 de DeepSeek. Ambos son modelos de mezcla de expertos de ~550 mil millones de parámetros con un contexto declarado de 1 millón de tokens. Uno es un modelo cerrado y solo de texto del laboratorio InclusionAI de Ant Group, lanzado el 2026-10-01 y aún sin pesos publicados ni licencia. El otro es de código abierto bajo MIT desde el 2026-09-10, acepta imágenes además de texto, se ejecuta en 23 proveedores y es el modelo que la mayoría de los equipos ya tendría en un archivo de configuración. La comparación no está ni cerca en la mayoría de los aspectos. La pregunta interesante es por qué existen siquiera esos dos puntos.

Donde Ling-3.1-flash está genuinamente por delante

Va por delante en las evaluaciones que miden el manejo de una terminal y la escritura de código que tiene que ejecutarse, y el margen merece mención precisa porque el agregado lo oculta.

• Terminal-Bench 4.0 — Ling-3.1-flash 0,333 frente a DeepSeek V4.1 Flash (Max) 0,268. Ambos son valores modestos en términos absolutos; la diferencia es un cuarto de la puntuación de DeepSeek.

• SciCode — 0,541 vs 0,519.

• Razonamiento de física de CritPt — 0.180 vs 0.143.

• Trabajo agéntico del mundo real de GDPval-AA — 1.621,75 Elo frente a 1.600 Elo.

Dos de esos cuatro son casi empates, uno es una victoria estrecha, y Terminal-Bench 4.0 es la única fila en la que la diferencia sobreviviría a un cambio de semilla. Contrasta eso con donde gana DeepSeek: trabajo de conocimiento agéntico de AA-Briefcase v1.1 con 1.420,47 Elo frente a 1.400,35, AutomationBench-AA con 0,689 frente a 0,617, razonamiento de contexto largo de AA-LCR con 0,84 frente a 0,83, y —la fila que más importa para producción— AA-Omniscience con −5,30 frente al +2,22 de Ling-3.1-flash en una métrica donde una alucinación es peor que un rechazo. La precisión de DeepSeek ahí es del 46,4% con una tasa de alucinación del 96,5% entre las preguntas que responde; Ling-3.1-flash responde correctamente el 29,1% con una tasa de alucinación del 37,9%. Ninguno es un modelo al que apuntes a una base de conocimiento sin recuperación delante.

La brecha de precios es mayor que la brecha del índice, y no se debe solo al tarifario.

Las tarifas principales parecen casi idénticas. Artificial Analysis registra ambos a $0.30 por millón de tokens de entrada. Divergen marcadamente en las otras dos cifras:

• Salida — Ling-3.1-flash 0,90 $ por millón vs. DeepSeek V4.1 Flash (Max) 1,20 $ por millón. Aquí Ling-3.1-flash es directamente el modelo más barato, por un 25 %.

• Lectura de caché — Ling-3.1-flash $0.06 por millón frente a DeepSeek V4.1 Flash (Max) $0.006 por millón, un descuento del 98% frente a uno del 80%. Aquí es donde los dos modelos dejan de ser comparables.

La tarifa combinada con una mezcla de 7:2:1 de aciertos de caché/entrada/salida da $0.192 para Ling-3.1-flash y $0.184 para DeepSeek V4.1 Flash (Max) — casi un empate. Pero la mezcla es una suposición sobre cómo usas un modelo, y esa suposición hace un gran trabajo. Cualquier carga de trabajo con un uso intensivo de la reutilización de prompts — un prompt de sistema largo, un preámbulo de recuperación, un bucle de agente que reenvía el contexto acumulado en cada turno — empuja la mezcla efectiva hacia las lecturas de caché, y ahí la diferencia de 10× en el precio de la caché toma el control. El volumen de tokens se acumula de la misma manera: Ling-3.1-flash es un razonador parlanchín, que genera 220 millones de tokens de salida en las evaluaciones del índice frente a los 250 millones de DeepSeek, y promedia unos 357 segundos por tarea de evaluación frente a los 285 de DeepSeek. Piensa más por cada respuesta y tarda más en hacerlo.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Un ejemplo práctico: el mismo bucle de agente en ambos

Toma un agente que maneja herramientas y que procesa 1M de tokens de entrada por tarea, con el 90 % de ellos servidos desde caché, y devuelve 200,000 tokens de salida. En Ling-3.1-flash, con las cifras anteriores: 900,000 tokens de entrada en caché a $0.06 más 100,000 de entrada nueva a $0.30 más 200,000 de salida a $0.90 asciende a aproximadamente $0.26 por tarea. El mismo bucle en DeepSeek V4.1 Flash (Max) asciende a aproximadamente $0.14 — aproximadamente la mitad.

Ahora aplica el horario de DeepSeek, porque esta es la parte que la mayoría de las comparaciones omite. La tarifa de horas valle de DeepSeek es la de arriba, y las horas valle abarcan los fines de semana y la mayor parte del día; pero durante dos franjas entre semana, 01:00–04:00 y 06:00–10:00 UTC, el precio de entrada y de caché se duplica. Traslada el mismo bucle a una franja de horas punta y el coste de DeepSeek queda cerca de $0.28 — y en ese punto la tarifa plana y más alta de Ling-3.1-flash es la opción más barata para esa hora, y el descuento de caché de 10× ha sido neutralizado por el reloj.

Esa es toda la decisión en un solo par de números. Si tu tráfico de agentes es intensivo en caché y puedes programarlo, DeepSeek V4.1 Flash (Max) cuesta aproximadamente la mitad que Ling-3.1-flash por una diferencia de dos puntos en el índice. Si tu tráfico de agentes es intensivo en caché y cae en las ventanas de máxima demanda de DeepSeek, los dos modelos cuestan casi lo mismo y la fila de agente de terminal marginalmente mejor de Ling-3.1-flash se convierte en el desempate.

Los ejes donde no hay comparación que hacer

Tres dimensiones no están cerca, y son las que suelen decidir una arquitectura antes de que se hable del precio.

• Pesos y licencia — Ling-3.1-flash no ha publicado los pesos, no tiene texto de licencia y Artificial Analysis lo clasifica como propietario. DeepSeek V4.1 Flash (Max) es de pesos abiertos bajo MIT, se puede descargar desde Hugging Face y permite el uso comercial. Uno de ellos puede autoalojarse, ajustarse y aislarse de la red; el otro, no.

• Modalidad — Ling-3.1-flash es texto de entrada, texto de salida. DeepSeek V4.1 Flash (Max) acepta imágenes junto con texto y se evalúa en benchmarks multimodales. Si alguna parte de tu pipeline le entrega al modelo una captura de pantalla, un gráfico o un escaneo, la comparación termina ahí.

• Superficie de servicio — DeepSeek V4.1 Flash (Max) está disponible a través de 23 proveedores, incluido OrcaRouter; Ling-3.1-flash se ejecuta mediante la propia API del proveedor y las plataformas de terceros que distribuyen su lanzamiento. Para una ruta de producción, la cantidad de proveedores es una propiedad de resiliencia, no un concurso de popularidad.

Una asimetría más que no aparece en ninguna de esas listas: DeepSeek V4.1 Flash (Max) expone 384.000 tokens de salida en una sola respuesta. Ant no ha publicado una longitud máxima de salida para Ling-3.1-flash, por lo que todavía no se puede dimensionar una carga de trabajo de generación larga con respecto a ella. La ausencia de un límite publicado no es lo mismo que un límite pequeño, pero tampoco es una cifra con la que se pueda diseñar.

Ejecutando ambos, y cómo se ve eso realmente

Ling-3.1-flash no está hoy en el catálogo de OrcaRouter — una consulta a nuestra API pública de modelos devuelve not-found para el modelo bajo InclusionAI, y este artículo no va a fingir lo contrario. DeepSeek V4.1 Flash es enrutable ahora mismo al precio de lista sin recargo del proveedor, así que un cambio de precio del proveedor está activo en nuestro lado el mismo día en que se produce, y está detrás de la misma clave de API única que el resto del catálogo, con conmutación automática entre proveedores upstream.

Esa asimetría tiene una forma práctica. La manera sensata de plantear una comparación en la que un modelo es cerrado, cuesta aproximadamente cuatro veces más que su predecesor y solo se puede acceder a él a través de un único proveedor es mantener el modelo abierto y ampliamente disponible como ruta predeterminada y tratar al retador como algo que se prueba en lugar de algo con lo que te comprometes. DeepSeek V4.1 Flash (Max) puede sostener hoy el ciclo de producción —pesos abiertos, entrada de imágenes, salida de 384K, un descuento de caché del 98%—, mientras que Ling-3.1-flash se encarga del trabajo específico de agentes donde sus márgenes en Terminal-Bench y SciCode realmente se aplican. Como ambos hablan el formato chat-completions compatible con OpenAI, esa división es una decisión de enrutamiento y no un proyecto de integración: un endpoint, una clave y una regla que envía las tareas en las que cada modelo es mejor de forma medible.

El veredicto

Según la evidencia disponible, DeepSeek V4.1 Flash (Max) gana este enfrentamiento, y lo gana sobre todo por cosas que no tienen nada que ver con dos puntos de Index: pesos abiertos bajo MIT, entrada de imágenes, 384.000 tokens de salida, un descuento de caché del 98 % y 23 proveedores entre los que conmutar por error. El caso de Ling-3.1-flash es más limitado y real: es el mejor agente de terminal y herramientas de los dos, y es el único de la pareja que no ha publicado un esquema de tarifas con un multiplicador de horas pico incorporado.

Dos cosas cambiarían esta evaluación. Si Ant publica los pesos bajo una licencia permisiva, la brecha de apertura se cierra y la comparación se convierte en una conversación directa sobre capacidad y coste. Y si la ventana de contexto largo servida por Ant se valida en el 1M de tokens que ambos modelos declaran, la afirmación de paridad de contexto deja de ser una afirmación. Hasta entonces, el resumen honesto es que un modelo puede ganar una fila de un benchmark agéntico y, aun así, perder la evaluación —y que la brecha de dos puntos en el índice entre estos modelos vale aproximadamente 3,6× el coste por tarea, lo cual es un intercambio que solo debería aceptar una carga de trabajo específica.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.