Tarjeta de título principal para 'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' con el subtítulo 'Gratis no es barato: el titular sigue siendo la apuesta segura' y dos tarjetas de estadísticas: Ling 3.0 Tiny (índice AA 23, muy verboso, gratis hasta el 14 de agosto) y Gemini 3.5 Flash-Lite (índice AA 36, ~490 tok/s, $0.30 / $2.50). Logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: Gratis no es barato, y el actual sigue siendo la apuesta segura

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

"Gratis" es la palabra más cara en el vocabulario del mercado de modelos, porque normalmente significa que alguien está a punto de cobrarte por algo distinto del precio de etiqueta. Esa es la trampa oculta en el enfrentamiento entre Ling 3.0 Tiny, el nuevo modelo de razonamiento MoE de 7.9B parámetros de Ant Group InclusionAI, y Gemini 3.5 Flash-Lite, el nivel Ge​mini actual más barato y rápido de Go​ogle. Ling 3.0 Tiny es gratis de invocar ahora mismo y cuesta $0.06 / $0.18 por millón de tokens después de su promoción del 14 de agosto — pero Artificial Analysis midió que consumió 210M tokens de salida solo para obtener su puntuación en su clase de 56 modelos, frente a una mediana de 63M, y lo señaló como "muy verboso". Gemini 3.5 Flash-Lite cuesta cinco veces más por token, a $0.30 / $2.50, pero tiene un Índice de Inteligencia independiente de 36 — 13 puntos por encima de Ling 3.0 Tiny — y una velocidad de salida de unos 490 tokens por segundo. La etiqueta más barata, el que más rápido habla y la puntuación más baja son todos el mismo modelo. Esa es toda la historia de esta comparación, y toda la razón para pensárselo dos veces antes de optar automáticamente por el recién llegado solo por el precio.

Ambos modelos están en la gama económica, pero en diferentes puntos de su ciclo de vida. Gemini 3.5 Flash-Lite es el veterano consolidado: lanzado el 21 de julio de 2026, remedido continuamente por un tercero, y ampliamente desplegado como el nivel predeterminado para trabajo de agentes de alto volumen y sensible a la latencia. Ling 3.0 Tiny tiene apenas una semana, con un precio orientado a captar usuarios, y ha sido puntuado exactamente una vez. Esta pieza distingue lo que cada modelo realmente es, lo que dicen los números independientes, y por qué el precio "gratis" es el número menos útil en la comparación.

Ling 3.0 Tiny, el recién llegado con un medidor

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, el titular

Gemini 3.5 Flash-Lite es la respuesta de Go​ogle a la misma pregunta, lanzado un nivel más abajo en la línea Gemini 3.5. Es nativamente multimodal en la entrada — texto, imágenes, video, audio y archivos — con salida de texto, una ventana de contexto de 1M de tokens, hasta 64K tokens de salida y un esfuerzo de razonamiento configurable (mínimo, bajo, más alto) para que un pipeline pueda ajustar la profundidad y la factura por solicitud. Su puntuación independiente es un salto generacional real: Artificial Analysis Intelligence Index 36, clasificado #12 de 151 modelos rastreados, frente a 25 para Gemini 3.1 Flash-Lite. En cuanto a velocidad, es el modelo más rápido de la serie 3.5: Go​ogle citó 350 tokens de salida por segundo en el lanzamiento, y la página en vivo de AA ha medido alrededor de 490 tokens por segundo, clasificado en el puesto #2 entre los modelos rastreados. Sus cifras agénticas reportadas por el proveedor — 74.0% en OSWorld-Verified, 54% en Terminal-Bench 2.1, 72.2% en una prueba de recuperación multi-aguja de 128K — son propias de Go​ogle y orientativas, no un evangelio, y una cuestión abierta (computer-use listado como integrado en el blog de Go​ogle pero no soportado en la documentación de la API) conviene comprobarla antes de depender de ella.

También es, por token, no barato para su categoría. El nombre "Lite" describe el lugar del modelo en la gama, no un precio de etiqueta en descenso: Gemini 2.5 Flash-Lite costaba $0.10 / $0.40, 3.1 Flash-Lite costaba $0.25 / $1.50, y 3.5 Flash-Lite cuesta $0.30 / $2.50 por millón de tokens, con entrada en caché a $0.03. La ganancia en eficiencia proviene de la velocidad y la economía de tokens, y las propias mediciones de Artificial Analysis muestran que el costo real por tarea aproximadamente se duplicó de generación en generación, incluso mientras el tiempo por tarea se reducía a la mitad.

El marcador independiente, leído en contexto

Pon los dos modelos en el mismo índice y la diferencia es evidente: Gemini 3.5 Flash-Lite con 36, Ling 3.0 Tiny con 23. Pero esa comparación inicial es solo la mitad del panorama, porque los dos modelos no se puntúan en el mismo campo. AA sitúa a Ling 3.0 Tiny en el puesto 6 de 56 en su clase de modelos diminutos, frente a una mediana de clase de 8 — muy por encima del promedio para un modelo de su tamaño. Gemini 3.5 Flash-Lite ocupa el puesto 12 de 151 en el campo más amplio registrado. Uno es un modelo diminuto excepcional; el otro es un modelo económico sólido en el grupo abierto. Ambas afirmaciones son ciertas y significan cosas distintas. Ling 3.0 Tiny ofrece mejor valor para su clase de tamaño que Gemini 3.5 Flash-Lite para su categoría — y Gemini 3.5 Flash-Lite sigue siendo el modelo más capaz por un amplio margen en la misma escala independiente.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Las dimensiones, una por línea:

• Puntuación independiente — Ling 3.0 Tiny AA Index 23 (#6/56, mediana de clase 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Precio — Ling 3.0 Tiny $0.06 / $0.18 por 1M después de una promoción gratuita vs Gemini 3.5 Flash-Lite $0.30 / $2.50 por 1M (entrada en caché $0.03).

• Verbosidad — Ling 3.0 Tiny produjo 210M tokens de salida durante la ejecución del índice, frente a Gemini 3.5 Flash-Lite, que fue medido pero no resultó verboso según ese indicador.

• Modalidad — Ling 3.0 Tiny solo texto vs Gemini 3.5 Flash-Lite entrada de texto, imagen, video, audio y archivos.

• Contexto — 256K en Ling 3.0 Tiny vs 1M en Gemini 3.5 Flash-Lite, con 64K de salida máxima en ambos.

• Velocidad — Ling 3.0 Tiny ~90–264 tokens/s en los endpoints que han publicado una cifra frente a Gemini 3.5 Flash-Lite ~490 tokens/s en la medición en vivo de AA.

La fila de velocidad es la que tiene más probabilidades de moverse. La velocidad de salida de Ling 3.0 Tiny es un auténtico punto sin resolver: Artificial Analysis la lista como N/A, mientras que Vercel anuncia 264 tokens por segundo. Los ~490 tokens por segundo de Gemini 3.5 Flash-Lite son una medición en vivo de AA tomada bastante después de que la volatilidad de su lanzamiento se estabilizara. Para un nivel sensible a la latencia, esa es la diferencia entre una cantidad conocida y una pregunta abierta.

La economía de la verbosidad: por qué lo gratis no es barato

Aquí está la aritmética que suele decidir este enfrentamiento. Ejecuta la misma tarea de razonamiento intensivo —digamos 4.000 tokens de entrada, 2.000 tokens de salida— en ambos modelos después de que termine la promoción de Ling 3.0 Tiny. Ling 3.0 Tiny factura (4.000 × $0,06 + 2.000 × $0,18) / 1.000.000, unos $0,0006. Gemini 3.5 Flash-Lite factura (4.000 × $0,30 + 2.000 × $2,50) / 1.000.000, unos $0,0062. Con recuentos de tokens idénticos, Ling 3.0 Tiny es 10 veces más barato. Luego añade la verbosidad: un modelo de razonamiento que emite tokens de pensamiento como salida no produce recuentos de tokens idénticos. Si la proporción de verbosidad 210M frente a 63M de Ling 3.0 Tiny se mantiene en tu carga de trabajo, el coste efectivo por tarea se triplica aproximadamente en el lado de la salida, y la ventaja de 10 veces se reduce hacia 3–4 veces. Sigue siendo más barato — pero ya no es gratis, y no está en la misma liga que lo que sugiere la cifra de 210M.

El planteamiento honesto es que los dos modelos no son sustitutos a la misma calidad. El 23 de Ling 3.0 Tiny es una puntuación excepcional para un modelo de 1.3B activos; el 36 de Gemini 3.5 Flash-Lite es otra liga de capacidad, además de visión, contexto de 1M y velocidad consolidada. Pagas por esa diferencia — cinco veces el precio por token, y más por tarea una vez que se tienen en cuenta las diferencias de velocidad —, pero es una brecha de capacidad real, no de marketing. Si tu carga de trabajo puede conformarse con la calidad del modelo más barato, Ling 3.0 Tiny es la mejor relación calidad-precio. Si tu carga de trabajo necesita la capacidad, ninguna ventaja de precio cierra la brecha.

Donde un router demuestra su valía

Este es precisamente el tipo de carga de trabajo donde una capa de enrutamiento supera al compromiso con un solo modelo, y los detalles del alojamiento importan a la hora de construirla. Gemini 3.5 Flash-Lite está disponible en OrcaRouter al precio de lista de su proveedor — $0.30 de entrada / $2.50 de salida por 1M, trasladado sin margen de beneficio, así que el precio en la tarjeta de tarifas de Go​ogle es el precio que aplicamos nosotros, y cualquier futura reducción de precio se refleja el mismo día. Está disponible a través del mismo endpoint compatible con OpenAI que otros 200+ modelos, con conmutación automática entre proveedores para cuando un proveedor base se degrada a mitad de ejecución, y el DSL de enrutamiento puede enviar un prompt a varios modelos y quedarse con la mejor respuesta.

Ling 3.0 Tiny no está en OrcaRouter; se sirve a través de sus propios endpoints, gratis hoy. Esa combinación en realidad fortalece el caso del enrutamiento en lugar de debilitarlo. Aprovecha la ventana gratuita para evaluar Ling 3.0 Tiny con tu propio tráfico antes de que cueste dinero. Luego construye la ruta de producción en el nivel alojado: Gemini 3.5 Flash-Lite para las llamadas que necesitan visión, contexto largo o un perfil de velocidad establecido, con la capa de enrutamiento libre de escalar a un modelo más caro para la minoría difícil. Un nivel gratuito es un gran experimento y una dependencia frágil; el nivel alojado es aquello sobre lo que puedes construir un producto. En OrcaRouter puedes ejecutar ambos en el mismo grafo: Ling 3.0 Tiny por endpoint directo, Gemini 3.5 Flash-Lite por clave, y dejar que el enrutador decida por solicitud.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Veredicto

Si tienes que elegir entre estos dos y no vas a enrutarlos juntos, la decisión es simple de enunciar y difícil de aceptar. Ling 3.0 Tiny es la mejor oferta y el modelo más débil: un nivel de razonamiento de solo texto con una semana de vida, una puntuación excelente para su tamaño, un precio agresivo y un panorama de velocidad y verbosidad sin resolver, que merece una evaluación gratuita inmediata y que sepas que se medirá el 14 de agosto. Gemini 3.5 Flash-Lite es el valor predeterminado de producción más seguro: puntuado de forma independiente 13 puntos más alto, multimodal, con contexto de 1M, cinco veces más rápido según una medición consolidada y con un precio acorde. Gratis no es barato cuando el modelo habla tres veces más para pensar con un techo de capacidad más bajo — y el titular es la apuesta segura por una razón.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube