
Gemini 3.5 Flash-Lite vs Qwen 3.8: Caballo de batalla económico vs buque insignia de 2.4T
- qwenNUEVOQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 por 1M de tokens · 56 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencia69Código
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 200 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
Cuando esta comparación se escribió por primera vez, estaba desequilibrada de una manera inusual: Gemini 3.5 Flash-Lite era un producto real y comprable y Qwen 3.8 era una vista previa con acceso restringido sin precio, sin benchmarks y sin pesos. Había muy poco que comparar.
Ya no es así. Qwen3.8-Max alcanzó la disponibilidad general el 3 de agosto de 2026 con una tarifa publicada de $2 / $6 por millón de tokens, un endpoint compatible con OpenAI y DashScope, y una tabla completa de benchmarks. Es autoservicio, presupuestable y está en vivo, incluso en OrcaRouter. Así que este artículo se ha reescrito desde cero, porque la comparación honesta hoy no es «modelo en producción frente a vapor». Es una auténtica comparación por niveles: el caballo de batalla de alto rendimiento más barato de Google contra el buque insignia más grande de Alibaba.
Una nota para los constructores: estos dos se sitúan en extremos opuestos de la curva de costos, así que la pregunta correcta es en qué nivel pertenece tu carga de trabajo. OrcaRouter pone al frente 200+ modelos detrás de un endpoint compatible con OpenAI, para que puedas probar ambos en la misma tarea sin tener que conectar dos SDK.
Veredicto TL;DR. Estos modelos no compiten realmente: son respuestas a preguntas distintas. Flash-Lite es un modelo de eficiencia: el índice Artificial Analysis 36, $0,30 / $2,50 por 1M, aproximadamente 490 tokens/seg, disponible de forma general. Está diseñado para ejecutarse en cada solicitud con un coste insignificante. Qwen3.8-Max es un modelo insignia: ~2,4T de parámetros, un contexto de tarifa plana de 1M de tokens, entrada nativa de imagen y vídeo, y puntuaciones de nivel frontera autoinformadas (GPQA Diamond 92,6; Terminal-Bench 2.1 86,6) — a $2 / $6, lo que supone 6,7× la tarifa de entrada de Flash-Lite. Flash-Lite es la opción predeterminada adecuada para clasificación, enrutamiento y extracción de gran volumen. Qwen3.8-Max es a lo que se recurre cuando una tarea realmente necesita razonamiento de frontera, un millón de tokens de contexto o entrada no textual. La única advertencia que no ha cambiado: Qwen sigue sin tener una puntuación de referencia independiente.
Conclusiones clave
• Qwen 3.8 ya está disponible de forma general — a partir del 3 de agosto de 2026 ha publicado precios, acceso de autoservicio y una tabla de benchmarks. El enfoque anterior de una vista previa restringida y sin presupuesto está obsoleto.
• Flash-Lite es dramáticamente más barato: $0.30 / $2.50 por 1M frente a los de Qwen $2 / $6 — aproximadamente 6.7× en entrada y 2.4× en salida.
• Flash-Lite es mucho más rápido: aproximadamente 490 tokens/seg, diseñado para trabajos de alto rendimiento. Qwen3.8-Max muestra un tiempo hasta el primer token (p50) de 1,64 s en la telemetría de 7 días de OrcaRouter, pero es un modelo grande y exhaustivo.
• Flash-Lite tiene la única puntuación auditada: Artificial Analysis Index 36. Qwen3.8-Max sigue sin puntuar por todos los evaluadores independientes, aunque Alibaba ahora publica sus propios números.
• Qwen gana decisivamente en el plano de las capacidades: un contexto de 1M tokens con tarifa plana sin recargo por prompts largos, más entrada de texto/imagen/video y OmniDocBench 1.5 92.1 para análisis de documentos. Flash-Lite es un pequeño modelo de eficiencia.
• Pesos abiertos: Los de Qwen se prometen dentro de la semana (aún sin licencia), además de un Qwen3.8-27B que supuestamente corre en ~17GB de VRAM. Flash-Lite está cerrado permanentemente.
Nota de precisión: todas las cifras de calidad de Qwen3.8-Max son las reportadas por Alibaba y no están verificadas por terceros. Las cifras de Gemini 3.5 Flash-Lite provienen de Artificial Analysis. El precio de Qwen corresponde a la tarifa GA de Alibaba Model Studio y sustituye al acceso de la era de vista previa descrito en versiones anteriores de este artículo.
Las especificaciones y el precio, lado a lado
• Fabricante / estado — Flash-Lite: Google; disponible de forma general; Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026)
• Posicionamiento — Flash-Lite: nivel de eficiencia económico y de alto rendimiento; Qwen3.8-Max: ambición insignia / de vanguardia
• Índice de Inteligencia AA — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Aún sin puntuar
• Puntuaciones reportadas por el proveedor — Flash-Lite: la posición es medida por terceros; Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (todo reportado por Alibaba)
• Precio (por 1M, entrada / salida) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, precio fijo en contexto de 1M; entrada en caché $0.25
• Velocidad — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (telemetría de 7 días de OrcaRouter)
• Contexto — Flash-Lite: contexto de nivel de eficiencia; Qwen3.8-Max: 1M tokens (983,616 con razonamiento; salida máxima 131,072)
• Modalidad — Flash-Lite: modelo de eficiencia centrado en texto; Qwen3.8-Max: entrada de texto, imagen y video → salida de texto
• Pesos — Flash-Lite: cerrado, solo API; Qwen3.8-Max: prometido para esta semana, sin licencia aún
• Acceso hoy — Flash-Lite: API estándar, autoservicio; Qwen3.8-Max: API estándar, autoservicio (Model Studio, DashScope, OrcaRouter)
Expuesto así, el hallazgo es completamente diferente de lo que solía ser. La columna de Qwen ya no está en blanco — está llena, y en varias filas es la entrada más fuerte. Lo que reemplaza el antiguo marco de "cantidad conocida versus promesa" es una clara brecha de nivel: Flash-Lite es aproximadamente 6,7× más barato en entrada y unas 13× más rápido en términos de rendimiento, mientras que Qwen ofrece un contexto multimodal de un millón de tokens y un razonamiento presuntamente de nivel fronterizo.Ambos son productos legítimos; solo sirven para trabajos diferentes.
La única fila donde la antigua advertencia sigue aplicándose es la línea de referencia. El Índice 36 de Flash-Lite fue medido por Artificial Analysis en una tabla de clasificación pública. Cada cifra de Qwen —GPQA Diamond 92.6, Terminal-Bench 86.6 y el resto— fue producida por Alibaba con su propio sistema de pruebas. Eso es una mejora real en comparación con no publicar nada, pero no es una verificación de terceros, y los laboratorios publican los puntos de referencia en los que ganan.

Index 36 vs un buque insignia sin puntuar: leyendo esto con honestidad
Es tentador enfrentar el Índice 36 de Flash-Lite contra el GPQA Diamond 92.6 de Qwen y declarar una derrota aplastante. Eso sería un error de categoría por partida doble.
Primero, el Índice de Inteligencia de Artificial Analysis es una medida compuesta de muchas tareas; GPQA Diamond es una única prueba de ciencia de posgrado. No están en la misma escala y no pueden restarse entre sí.
Segundo, y más importante, Flash-Lite nunca fue diseñado para obtener una puntuación alta. Un índice de 36 es lo que cabe esperar de un modelo de eficiencia. El objetivo de ingeniería de Google era un modelo lo suficientemente barato y rápido como para colocarlo frente a cada solicitud entrante — enrutamiento de tickets, clasificación, extracción, resumen a gran escala — donde un modelo de frontera sería económicamente absurdo. Juzgarlo contra un modelo insignia de 2.4T en el techo de razonamiento pierde de vista para qué está hecho.
Lo que podemos decir es más restringido y más útil. Qwen3.8-Max es muy probablemente el modelo sustancialmente más capaz — sus cifras autoinformadas están muy por encima de lo que produciría un modelo Index-36, y el salto de FrontierSWE a 73.5, frente al 40.7 de su predecesor, sugiere un progreso real. Pero «muy probable» sigue siendo una inferencia, porque ningún evaluador independiente lo ha puntuado. Para contexto, el predecesor Qwen3.7-Max obtuvo 46 en el Índice AA — más alto que el 36 de Flash-Lite, pero muy lejos de la frontera — por lo que el salto generacional implícito de Alibaba es grande y no verificado.
La consecuencia práctica: si tu tarea es una que Flash-Lite ya completa correctamente, el techo más alto de Qwen no vale nada para ti y estarías pagando 6,7× por ello. El techo solo importa cuando Flash-Lite realmente está fallando.
Costo en la práctica: la brecha de niveles en números
Considere un trabajo de clasificación de alto volumen: 2,000 tokens de entrada, 200 tokens de salida, ejecutado 500,000 veces al día — una forma realista de triaje de soporte o enrutamiento de contenido.
• Flash-Lite: por llamada, 0.002M × $0.30 = $0.0006, más 0.0002M × $2.50 = $0.0005. ≈ $0.0011 por llamada → ~$550/día.
• Qwen3.8-Max: por llamada, 0.002M × $2 = $0.004, más 0.0002M × $6 = $0.0012. ≈ $0.0052 por llamada → ~$2,600/día.
• Mensual: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — una diferencia de $61,500 para el mismo volumen de tareas.
A esa escala, la elección del nivel es la partida más grande del sistema, y es muy difícil justificar un modelo insignia para un trabajo que maneja un modelo de eficiencia. Este es exactamente el escenario para el que existe Flash-Lite.
Ahora inviértelo. Toma una tarea de documentos largos: 600,000 tokens de contexto, 5,000 tokens de salida, 200 veces al día.
• Qwen3.8-Max: 0.6M × $2 = $1.20, más 0.005M × $6 = $0.03. ≈ $1.23 por llamada, sin recargo por prompt largo — y aproximadamente $0.18 si el contexto está en caché a $0.25/1M.
• Flash-Lite no se le puede asignar un precio para esta configuración en absoluto, porque un contexto de una sola llamada de 600.000 tokens no es lo que un modelo de nivel de eficiencia está diseñado para manejar.
Así que la respuesta cambia por completo con la forma de la carga de trabajo, que es la lección real. Flash-Lite gana por un margen enorme en trabajos de gran volumen y contexto corto. Qwen gana en todo lo que requiera un millón de tokens o entrada no textual, donde Flash-Lite no es una opción más barata, sino simplemente no es una opción.

Escenarios: qué nivel encaja
Triaje y enrutamiento de soporte a gran volumen. Flash-Lite, claramente. El índice 36 es suficiente para la clasificación y, a aproximadamente $0.0011 por llamada, puedes ejecutarlo en cada ticket. Escala solo la minoría de casos ambiguos a un modelo más grande.
Análisis integral de contratos o presentaciones. Qwen3.8-Max. El contexto de tarifa plana de 1M significa que un documento de 400 páginas se procesa en una sola llamada sin recargo ni fragmentación, y su puntuación autodeclarada de 92.1 en OmniDocBench 1.5 apunta exactamente a este trabajo.
Pipelines de capturas de pantalla, gráficos o vídeo. Qwen3.8-Max, por defecto — acepta entrada de imágenes y vídeo y reporta OSWorld-Verified 86.1 al manejar una GUI real. Flash-Lite no es candidato para entrada no textual.
Codificación agéntica. Qwen3.8-Max en las cifras declaradas (Terminal-Bench 2.1 86.6, FrontierSWE 73.5), con la salvedad de que ninguna está verificada de forma independiente y que su puntuación autodeclarada más débil es IFBench 82.8 en seguimiento de instrucciones — un riesgo real para los pipelines que analizan la salida de cada paso.
Una arquitectura de dos niveles.A menudo la respuesta correcta es emplear ambos: Flash-Lite como la primera pasada económica en cada solicitud, Qwen3.8-Max como la ruta de escalada para la pequeña fracción que necesita un millón de tokens, una imagen o razonamiento genuino. Ese patrón captura la mayor parte de la ventaja de coste de Flash-Lite mientras mantiene disponible una opción de vanguardia.
Autoalojamiento y apertura
Flash-Lite es cerrado y solo API de forma permanente — no hay vía de autoalojamiento.
Los pesos de Qwen3.8-Max están prometidos para esta semana, pero el modelo insignia no es un objetivo realista: aproximadamente 1.2TB en 4 bits frente a unos 141GB por H200 implica ocho o más aceleradores de gama alta, y Alibaba todavía no ha revelado el número de parámetros activos, por lo que el rendimiento que esa inversión compraría es imposible de modelar. Tampoco hay aún texto de licencia, lo que significa que la usabilidad comercial está formalmente indeterminada.
El simultáneamente anunciado Qwen3.8-27B es el lanzamiento que realmente importa para los planes on-premise. También con pesos abiertos y, según se informa, ejecutándose en aproximadamente 17GB de VRAM, es una opción genuina de autoalojamiento — y, notablemente, un competidor mucho más cercano al nicho de eficiencia de Flash-Lite de lo que lo es el buque insignia de 2.4T.
Preguntas frecuentes
¿Puedo usar Qwen 3.8 hoy?
Sí. Qwen3.8-Max alcanzó disponibilidad general el 3 de agosto de 2026 con precios publicados de $2 / $6 por 1M de tokens y un endpoint compatible con OpenAI y DashScope. Es de autoservicio a través de Alibaba Model Studio, DashScope y OrcaRouter. Las versiones anteriores de este artículo describían una vista previa restringida; eso está desactualizado.
¿Cuál es más barato?
Gemini 3.5 Flash-Lite, por un amplio margen: $0.30 / $2.50 por 1M frente a los $2 / $6 de Qwen3.8-Max — aproximadamente 6.7× más barato en entrada y 2.4× en salida. En trabajos de alto volumen con contexto corto, esa diferencia prevalece sobre cualquier otra consideración.
¿Cuál es mejor?
Son niveles diferentes. Flash-Lite tiene la única puntuación auditada (AA Index 36), pero fue construido para un alto rendimiento a bajo costo, no para razonamiento. Qwen3.8-Max es muy probablemente mucho más capaz — sus puntuaciones autoinformadas de GPQA Diamond 92.6 y Terminal-Bench 2.1 86.6 son de nivel fronterizo — pero no tiene un benchmark independiente, así que eso sigue siendo una inferencia en lugar de un resultado medido.
¿Cuál es más rápido?
Flash-Lite, sustancialmente. Artificial Analysis mide aproximadamente 490 tokens/seg, que es para lo que está diseñado su nivel de eficiencia. Qwen3.8-Max muestra un tiempo p50 hasta el primer token de 1,64 segundos en la telemetría de 7 días de OrcaRouter, pero es un modelo grande y minucioso, y los revisores de la era de vista previa lo encontraron lento en builds agénticos largos.
¿Qwen 3.8 tiene pesos abiertos ahora?
Todavía no. Alibaba dice que los pesos del modelo insignia llegarán dentro de la semana, pero aún no hay licencia, ficha del modelo ni repositorio. Incluso una vez lanzado, un modelo de 2.4T necesita ocho o más GPU de clase H200. El Qwen3.8-27B, anunciado simultáneamente, con ~17GB de VRAM según se informa, es la opción práctica de autoalojamiento.
¿Debería usar ambos?
A menudo sí. Una configuración de dos niveles — Flash-Lite como primera pasada económica en cada solicitud, Qwen3.8-Max como vía de escalada para tareas de contexto largo, multimodales o realmente difíciles — conserva la mayor parte de la ventaja de costo de Flash-Lite mientras te ofrece una opción frontera donde justifica su precio.
¿Cuál debería elegir para producción hoy?
Flash-Lite para trabajo de alto volumen, contexto corto y solo texto donde Index 36 sea suficiente: es económico, rápido, auditado y probado. Qwen3.8-Max cuando la carga de trabajo necesita un contexto de un millón de tokens, entrada de imágenes o video, o razonamiento que Flash-Lite falla de manera demostrable. Ambos son ahora realmente desplegables, lo cual no era cierto cuando se escribió esta comparación por primera vez.
En resumen
Gemini 3.5 Flash-Lite frente a Qwen 3.8solía ser una comparación entre un producto y un anuncio. Ya no lo es. Desde el 3 de agosto de 2026, Qwen3.8-Max está disponible de forma general, tiene precio, es de autoservicio y está documentado — por lo que el planteamiento honesto es una decisión de nivel, no de disponibilidad.
Flash-Lite sigue siendo la opción predeterminada correcta para el trabajo para el que fue creado: a $0.30 / $2.50 y ~490 tokens/seg, se ejecuta en cada solicitud por un error de redondeo, y su Index 36 auditado es totalmente adecuado para clasificación, enrutamiento y extracción. Qwen3.8-Max es el nivel de escalada — un contexto de tarifa plana de un millón de tokens, entrada nativa de imágenes y video, y supuesto razonamiento de frontera — a aproximadamente 6.7× el costo de entrada. Su única debilidad no resuelta es la misma de antes: ningún evaluador independiente lo ha puntuado, por lo que su caso de calidad descansa en la propia tabla de Alibaba. Esté atento a la primera puntuación independiente del Intelligence Index y a los pesos Qwen3.8-27B, que competirán mucho más directamente con el nicho de Flash-Lite. Mientras tanto, elija según la forma de la carga de trabajo — y considere ejecutar ambos.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
