
Ling-3.1-flash vs. Gemini 3.8 Flash: un modelo de prueba de 256K frente a uno en vivo de 1M de tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Pon a Ling-3.1-flash y Gemini 3.8 Flash uno al lado del otro y la discrepancia no se debe a la inteligencia: se debe al estado. Ling-3.1-flash, el modelo de mezcla de expertos de ~560 000 millones de parámetros de Ant Group anunciado del 29 al 30 de septiembre de 2026, es una prueba gratuita de dos semanas con un contexto servido de 256K, un límite de salida de 32 768 tokens, entrada solo de texto y sin pesos, licencia ni precio publicados. Gemini 3.8 Flash, el modelo de razonamiento de la gama Flash de Google lanzado el 2 de septiembre de 2026, es una API de disponibilidad general con una ventana completa de 1 048 576 tokens, salida de 65 536 tokens, entrada multimodal y una lista de precios pública. Sobre el papel, eso es una comparación de dos modelos; en la práctica, es una comparación de un modelo sobre el que puedes construir hoy frente a uno que solo puedes probar este mes.
Eso no es motivo para descartar Ling-3.1-flash. Un MoE gratuito de 560B con una inclinación agéntica vale dos semanas del tiempo de evaluación de cualquiera. Pero cambia para qué sirve un cara a cara: no "¿cuál debería adoptar como estándar?", sino "¿es el modelo de prueba lo suficientemente bueno como para que deba hacer una cobertura sobre la respuesta dentro de quince días?". Son preguntas distintas, y tienen respuestas distintas en cada eje a continuación.
Las tres cosas que lo deciden antes de que lo haga cualquier benchmark
La mayoría de las comparaciones empiezan con las puntuaciones. Esta debería empezar con la disponibilidad, porque la diferencia ahí no es una cuestión de grado.
• Precios — Ling-3.1-flash es gratuito durante la vigencia de su prueba y no cuenta con ninguna tarifa publicada posterior a la prueba. Gemini 3.8 Flash tiene un precio de lista de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida durante su período promocional, y volverá a $1.50 / $7.50 el 1 de enero de 2027. Precios de lista informados por el proveedor; ambos están sujetos a cambios.
• Contexto — Ling-3.1-flash ofrece 262,144 tokens en la prueba, y se citan 1,000,000 como objetivo final. Gemini 3.8 Flash ofrece hoy los 1,048,576 tokens completos. Si tu carga de trabajo depende de la ventana de un millón de tokens, solo uno de estos dos la tiene ahora.
• Pesos — Ling-3.1-flash no tiene ninguno publicado: sin repositorio, sin licencia, sin punto de control, solo una intención declarada de abrir el código fuente después de la prueba. Gemini 3.8 Flash es de código cerrado y siempre lo será, pero es una API gestionada que puedes llamar sin ambigüedad hoy.
Leídos en conjunto, esos tres conforman un solo argumento: las ventajas más destacadas del modelo Ling son o bien promocionales (gratis) o bien prospectivas (contexto de 1M, pesos abiertos), mientras que las ventajas del modelo Gemini son contractuales. Esa asimetría recorre todo lo que sigue.
Donde el modelo Ling realmente gana
Dos lugares, y ambos son reales.
Lo primero es el costo durante la evaluación. Una prueba gratuita de dos semanas en un modelo de este tamaño no es un truco de marketing que se pueda desestimar —es la forma más barata de averiguar si un mixture-of-experts de 560B maneja tus prompts. Gemini 3.8 Flash, sea cual sea su precio, no es gratis, y una evaluación seria que abarque unos miles de llamadas cuesta dinero real.
La segunda es la trayectoria de apertura. Ling-3.1-flash es el sucesor de un modelo que sí distribuyó pesos con licencia MIT, y Ant ha dicho públicamente que también tiene la intención de abrir el código de este. Si eso se concreta con una licencia permisiva, obtienes algo que Gemini 3.8 Flash nunca podrá ofrecer: la opción de autoalojar, afinar o destilar un modelo base de 560B. La pega es la que más importa: estás apostando por una promesa, y la promesa de la generación anterior se cumplió con dos semanas de retraso, no con una garantía.
Donde Gemini 3.8 Flash no está ni cerca de perder
Si dejamos de lado el juicio y la cuestión de la apertura, la comparación operativa está desequilibrada a favor de Google.
• Entrada — Gemini 3.8 Flash acepta texto, imagen, video, archivo, y Ling-3.1-flash texto y devuelve texto. Para flujos de trabajo con documentos, capturas de pantalla o video, esto no es una preferencia, es una capacidad.
• Techo de salida — 65,536 tokens frente a 32,768. Relevante en el momento en que generas informes, archivos de código o resultados estructurados largos en una sola pasada.
• Rendimiento — las pruebas independientes sitúan la velocidad de salida mediana de Gemini 3.8 Flash cerca de 249 tokens por segundo, y la propia telemetría de OrcaRouter de siete días mide 552 tokens por segundo con un p50 de 4,95 segundos hasta el primer token. Se ha informado de que el alojamiento de prueba de Ling-3.1-flash ronda los 63 tokens por segundo. El modelo Gemini está en una clase de velocidad distinta.
• Profundidad de referencia — Gemini 3.8 Flash tiene un conjunto de mediciones independientes que lo respaldan; las cifras de Ling-3.1-flash son todas de primera parte, en un endpoint totalmente nuevo, y aún ninguna tercera parte las ha vuelto a ejecutar.
• Agentes multimodales: cualquier cosa que tenga que leer una captura de pantalla, un PDF o una llamada grabada es una tarea de Gemini por construcción, no por calidad.

Puntos de referencia, y por qué los dos conjuntos en realidad no son comparables
El caso reportado por el proveedor para Ling-3.1-flash es un agregado de 81.0 en cinco benchmarks de agentes, con 40.4% en Terminal-Bench 4.0, 55.9% en SWE-Atlas y 65.35% en HealthBench Professional; la propia cuenta de Ant añade 1,673 Elo en GDPVal-AA v2.1 y 75.16 en FrontierSWE. Cada uno de esos es una medición propia de Ant. No hay ningún arnés publicado y, más importante aún, no hay pesos para que nadie vuelva a ejecutar la suite.
El panorama de Gemini 3.8 Flash es distinto en esencia. En la compilación actual del Intelligence Index de Artificial Analysis (v4.3.2), obtiene 40.9 con esfuerzo de razonamiento alto, 39.8 con medio y 33.5 con bajo —y vale la pena señalar que el índice se ha revisado recientemente, por lo que las cifras publicadas sobre este modelo a principios del otoño se calcularon con una compilación diferente y no son directamente comparables con estas. Las propias afirmaciones de Google sobre el modelo incluyen 54.9 en HLE-Verified y sólidos resultados en Terminal-Bench 2.1 en los 80 altos. Cifras independientes y del proveedor, una al lado de la otra, ambas legítimas, ninguna intercambiable.
Hay una comparación cruzada clara que vale la pena hacer, porque ambas se sitúan en la misma familia de benchmarks. En Terminal-Bench 4.0, la cifra del proveedor para Ling-3.1-flash es 40,4%. Claude Sonnet 5.5 —un modelo de gama media, no un buque insignia— obtiene 70,6% en esa misma versión. Esa única fila es el argumento más fuerte en contra de interpretar la ficha de Ant como "adyacente a la frontera": el modelo es competitivo en las métricas agénticas que Ant eligió destacar y claramente está por detrás en la métrica de codificación en terminal donde existe una cifra externa.

La forma práctica de la elección
Si necesitas construir algo en las próximas dos semanas, no hay comparación posible, y no es una crítica a Ling-3.1-flash. Gemini 3.8 Flash es el único de los dos que te ofrece un endpoint estable, un precio publicado, una ventana completa de un millón de tokens, entrada multimodal y una licencia que puedes leer. Es un modelo de producción de la categoría Flash.
Ling-3.1-flash es un objetivo de evaluación. Su valor ahora mismo es que la evaluación es gratuita y el modelo es interesante: un MoE de 560B con solo ~25B activos por token es una apuesta por la dispersión, y Ant lo posicionó exactamente para las cargas de trabajo de agentes, búsqueda y automatización de oficina por las que compiten los modelos de nivel Flash. Probar tus propios prompts con él durante la ventana de prueba vale la pena precisamente porque nadie fuera de Ant lo ha hecho todavía — serías de los primeros en tener una opinión no sesgada por el proveedor.
El árbol de decisiones que tiene sentido este mes: dirigir la producción a Gemini 3.8 Flash, dedicar la prueba gratuita a ejecutar Ling-3.1-flash con tus prompts más difíciles, y mantener la cuestión de los pesos abiertos como la verdadera bifurcación. Si los pesos llegan con permisos amplios y aparece un precio cercano al nivel de Flash, Ling-3.1-flash se convierte en una segunda opción genuina —una que puedes alojar tú mismo, algo que Gemini nunca será. Si llegan con ataduras, la prueba termina y también la comparación.
Ejecutando ambos desde una sola clave, y siendo honesto sobre lo que falta
Gemini 3.8 Flash ya está hoy en el catálogo de OrcaRouter bajo el ID de modelo google/gemini-3.8-flash, al precio de lista del propio Google sin margen alguno, así que cuando la tarifa promocional vuelva a su valor en enero, el precio que pagas aquí la sigue automáticamente en lugar de requerir un nuevo contrato. DeepSeek-V4.1-Flash, el otro modelo económico de la gama Flash que vale la pena medir en el mismo experimento, se encuentra en ese mismo catálogo al precio de lista de su proveedor, de modo que una prueba de tres vías del modelo de prueba frente a opciones consolidadas de la gama Flash se ejecuta con una sola clave de API con conmutación automática por error entre ellos.
Ling-3.1-flash no está en nuestro catálogo, y una consulta contra nuestra API pública de modelos devuelve no encontrado tanto para él como para la generación anterior, así que el planteamiento honesto es que la prueba se ejecuta donde se ejecuta, a través de la superficie propia del proveedor y de plataformas de inferencia de terceros, y no afirmamos alojarlo. Esa es la parte de esta comparación que podría cambiar más rápido: un modelo en prueba gratuita con un precio no anunciado es precisamente el tipo de cosa que llega a una capa de enrutamiento en el momento en que Ant y sus hosts publiquen un tarifario, y el traspaso sin margen significa que el día que lo haga, el precio de aquí es el precio de allí.
Así que el veredicto es más limitado de lo que sugieren los recuentos de parámetros. Ling-3.1-flash es el modelo más ambicioso y el resultado de investigación más interesante; Gemini 3.8 Flash es el que puedes lanzar. Hasta que existan una licencia y un precio, esa es toda la diferencia, y no es una que vaya a zanjar una fila de benchmark.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
