
Qwen 3.7 Flash: el modelo de visión Cent-Cheap de Alibaba para agentes que realmente miran pantallas
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
El equipo de Qwen de Alibaba ha dedicado los últimos dos años a lanzar una amplia gama de modelos en prácticamente todos los niveles de precio y capacidad imaginables, y el 27 de julio de 2026, otro más aterrizó silenciosamente como una oferta comercial de API: qwen/qwen3.7-flash. No llegó con la fanfarria de un lanzamiento insignia, y Alibaba no ha publicado un informe técnico, un conjunto de pruebas comparativas ni un diagrama de arquitectura para él. Lo que sí trajo consigo es una descripción que importa mucho más para los desarrolladores que otra puntuación en una tabla de clasificación: un modelo de razonamiento de visión-lenguaje, una ventana de contexto de 1 millón de tokens y un precio tan bajo que apenas figura como una partida.
Esa combinación — barato, contexto enorme y "ve" imágenes de forma nativa — sitúa a Qwen 3.7 Flash firmemente en una categoría que se ha convertido en una de las más competitivas y más útiles de todo el mercado de modelos: el caballo de batalla multimodal de bajo costo. Estos no son los modelos que ganan tablas de clasificación. Son los modelos que son llamados diez millones de veces al día dentro de bucles de agentes, tuberías de automatización de navegadores y herramientas de soporte, porque a $0.03 de entrada y $0.13 de salida por millón de tokens, el costo básicamente deja de ser una restricción de diseño.
{{1}}Esta pieza es un explicador de primera impresión: qué es realmente Qwen 3.7 Flash, qué ha revelado Alibaba (y, lo que es importante, qué no ha revelado), cómo funcionan los costos con matemática real de tokens, y dónde encaja junto al resto de la familia Qwen — incluyendo los mucho más grandes Qwen 3.8 y Qwen 3.7 Max — y frente a rivales multimodales económicos como Gemini 3.5 Flash-Lite.{{/1}} {{2}}También analizaremos cómo una capa de enrutamiento como OrcaRouter trata a un modelo como este: no como un modelo héroe, sino como un nivel predeterminado que absorbe silenciosamente la mayor parte del tráfico multimodal.{{/2}}
TL;DR
Qwen 3.7 Flash es un modelo de visión-lenguaje del equipo Qwen de Alibaba, listado bajo el ID del modelo qwen/qwen3.7-flash desde el 27 de julio de 2026. Está diseñado para agentes multimodales, codificación visual, búsqueda e interacción con computadora/interfaz de usuario, con fortalezas declaradas en reconocimiento de objetos y comprensión espacial. Soporta una ventana de contexto de 1,000,000 de tokens y tiene un precio de $0.03 por 1 millón de tokens de entrada y $0.13 por 1 millón de tokens de salida — entre los modelos con capacidades de visión más baratos que existen. La longitud máxima de salida, el número exacto de parámetros y la arquitectura están sin divulgar oficialmente; la especulación de la comunidad apunta a un diseño de mezcla de expertos de pequeño tamaño y a un posible precursor de un lanzamiento de Qwen 3.7 de pesos abiertos, pero eso no está confirmado. Es un modelo distinto, más pequeño y más barato que Qwen 3.8 (el buque insignia de pesos abiertos de 2.4T de parámetros anunciado por separado por Alibaba) y que Qwen 3.7 Max (el buque insignia más grande de esta misma generación). Ningún conjunto de pruebas comparativas independiente — incluido Artificial Analysis — lo ha evaluado todavía, así que considere las afirmaciones de calidad como prematuras y no comprobadas hasta que existan cifras de terceros.

Conclusiones clave
• Qwen 3.7 Flash es visión-lenguaje, no solo texto — está posicionado para agentes multimodales, codificación visual, búsqueda y tareas de uso de computadora, no para chat general.
• Los precios son de $0.03 por cada 1M de tokens de entrada y $0.13 por cada 1M de tokens de salida, aproximadamente en línea con el nivel más económico de los modelos multimodales de frontera adyacente en el mercado actual.
• La ventana de contexto es de 1 millón de tokens, lo cual importa más para sesiones de agente con muchas imágenes y múltiples turnos de lo que parece, ya que las imágenes y capturas de pantalla consumen tokens rápidamente.
Las notas de precios del listado indican que, con el almacenamiento en caché de indicaciones en contextos repetidos, el costo efectivo puede situarse entre un 60 y un 80 % por debajo del precio de lista, una palanca significativa para los bucles de agente que reproducen la misma indicación del sistema o el historial de capturas de pantalla.
• Alibaba no ha publicado la cantidad máxima de tokens de salida, el número de parámetros ni los detalles de arquitectura; cualquier cosa más específica que leas en otro lugar es inferencia de la comunidad, no divulgación del proveedor.
• No es Qwen 3.8 (el buque insignia de peso abierto de 2.4T) ni Qwen 3.7 Max (el buque insignia cerrado más grande en la misma ola de lanzamiento) — dejando de lado la similitud de nombres, estos son tres modelos diferentes con tres trabajos diferentes.
• Ninguna organización independiente de evaluación comparativa, incluida Artificial Analysis, ha publicado puntuaciones para Qwen 3.7 Flash al momento de escribir esto — la calidad es realmente no probada fuera de la descripción del proveedor.
Lo que realmente es Qwen 3.7 Flash
Eliminando la convención de nomenclatura, Qwen 3.7 Flash es la respuesta de Alibaba a una pregunta que todos los grandes laboratorios se han hecho: ¿cómo es un modelo cuando su única premisa de diseño es «manejar tráfico visual, agente y de alto volumen al menor costo posible sin ser inútil»? Google respondió con los niveles Gemini Flash y Flash-Lite. OpenAI respondió con sus líneas mini y nano. La respuesta de Alibaba, en esta generación, es Qwen 3.7 Flash.
La descripción oficial se centra en cuatro casos de uso: agentes multimodales, codificación visual, búsqueda e interacción con computadoras o interfaces de usuario. Esa es una lista muy deliberada. No es "excelente para escritura creativa" ni "razonamiento sólido en problemas de olimpiadas de matemáticas"; es una lista de tareas en las que un modelo necesita mirar una captura de pantalla, una página web, un fragmento de interfaz de usuario o un diff de código renderizado visualmente, y luego actuar sobre ello. Alibaba también destaca el reconocimiento de objetos y la comprensión espacial como fortalezas particulares, lo que se alinea con el marco de uso de computadoras e interacción con interfaces: un agente que va a hacer clic en botones, leer diseños o navegar por una pantalla necesita saber dónde están las cosas, no solo lo que dicen.
Vale la pena ser explícito sobre lo que significa "razonamiento" en este contexto. Qwen 3.7 Flash se describe como un modelo de razonamiento de lenguaje visual, lo que significa que se espera que resuelva tareas visuales de varios pasos, en lugar de simplemente describir una imagen o responder una única pregunta de consulta. Esa es la diferencia entre "describe esta captura de pantalla" y "aquí tienes una captura de pantalla de un formulario con tres errores de validación: descubre qué está mal y dime qué campo corregir primero".
Especificaciones y el enfoque multimodal-agéntico
Aquí está la lista completa de lo que está realmente confirmado, versus lo que no está.
Confirmado: El creador es el equipo Qwen de Alibaba. Está listado bajo el ID de modelo qwen/qwen3.7-flash, disponible desde el 27 de julio de 2026. Acepta entrada multimodal (visión y lenguaje). La ventana de contexto es de 1.000.000 de tokens. El precio es de $0,03 por 1M de tokens de entrada y $0,13 por 1M de tokens de salida. Las notas de precios del propio listado señalan que el almacenamiento en caché de prompts en contexto repetido puede reducir el costo efectivo entre un 60 y un 80 % frente al precio de lista para cargas de trabajo que reutilizan las mismas instrucciones del sistema o imágenes de referencia entre llamadas, un detalle que importa mucho para los bucles de agentes que reenvían el mismo historial de capturas de pantalla o el esquema de herramientas en cada turno.
No revelado: Límite máximo de tokens de salida. Número exacto de parámetros. Arquitectura (densa vs. mezcla de expertos). Composición de los datos de entrenamiento. Cualquier puntuación de benchmarks de primera parte.
Especulación de la comunidad (etiquétenla como tal, porque eso es todo lo que es): Dado el nombre "Flash", los precios agresivos y el patrón que Alibaba ha seguido con generaciones anteriores de Qwen, algunos observadores sospechan que Qwen 3.7 Flash usa una arquitectura pequeña de mezcla de expertos optimizada para un bajo costo de cómputo por token, y que podría ser un avance de previsualización o destilación antes de un eventual lanzamiento de Qwen 3.7 de pesos abiertos, reflejando cómo variantes anteriores de Qwen "flash" o "turbo" a veces precedieron lanzamientos abiertos más amplios. Nada de esto está confirmado por Alibaba. Trátenlo como una suposición informada, no como un hecho, hasta que un informe técnico oficial o una ficha del modelo diga lo contrario.
La ausencia de una cifra máxima de salida publicada es algo que vale la pena señalar para cualquiera que desarrolle con este modelo: si tu caso de uso produce salidas estructuradas largas (grandes cargas útiles JSON, generación de código de múltiples archivos, transcripciones largas), prueba el límite real de salida de forma empírica antes de comprometerte con él en producción, ya que no puedes consultar la documentación para un número que no existe.
Ejemplo práctico de precios: lo que realmente cuesta
Números tan pequeños son fáciles de pasar por alto, así que hagamos la aritmética correctamente.
Con $0.03 por cada 1M de tokens de entrada y $0.13 por cada 1M de tokens de salida, una sola llamada con 2,000 tokens de entrada (una captura de pantalla de tamaño decente más una instrucción corta) y 300 tokens de salida (una respuesta estructurada) cuesta: 2,000/1,000,000 × $0.03 = $0.00006 por entrada, más 300/1,000,000 × $0.13 = $0.000039 por salida. Total: aproximadamente $0.0001 por llamada — una centésima de centavo.
Escala eso a volumen. Ejecuta 1 millón de esas llamadas — una carga diaria plausible para un producto agéntico de tamaño mediano que hace análisis de capturas de pantalla o comprobaciones de estado de la interfaz — y llegas a: 1,000,000 × 2,000 = 2 mil millones de tokens de entrada × $0.03/1M = $60, más 1,000,000 × 300 = 300 millones de tokens de salida × $0.13/1M = $39. Total: aproximadamente $99 por un millón de llamadas de vision-agent. Incluso antes de incorporar el caché de prompts (que las notas del listado sugieren que podría reducir esto en un 60-80% para cargas de trabajo con contexto repetido), es una cifra que la mayoría de los equipos pueden aprobar sin una reunión de presupuesto.
Ahora compare un escenario más pesado: un agente de uso de computadora que mantiene un contexto continuo de 50 000 tokens (capturas de pantalla, historial de acciones, resultados de herramientas) y genera 500 tokens de acción por paso, ejecutado 100 000 veces al día. Costo de entrada: 100 000 × 50 000 = 5 000 millones de tokens × $0.03/1M = $150/día. Costo de salida: 100 000 × 500 = 50 millones de tokens × $0.13/1M = $6.50/día. Eso es aproximadamente $156/día, o alrededor de $4 700/mes, para una carga de trabajo agentiva de contexto largo bastante agresiva — y eso sin contar ningún descuento de caché en las partes repetidas de ese contexto de 50 K, que en un bucle de uso de computadora (mismo prompt del sistema, mismas definiciones de herramientas, estado de pantalla superpuesto) es exactamente el tipo de carga de trabajo para el cual se diseñó el caché de prompts.

Recorridos por Escenarios Reales
Tareas de visión de alto volumen
Imagina una tubería de catalogación de productos que necesita clasificar, etiquetar y extraer atributos de unos cientos de miles de imágenes de productos al día — este es exactamente el tipo de carga de trabajo donde el costo por token se multiplica lo suficientemente rápido como para romper un presupuesto en un modelo de visión de gama media, pero se mantiene cómodamente asequible con el precio de Qwen 3.7 Flash. El reconocimiento de objetos y la comprensión espacial, las dos capacidades que Alibaba destaca explícitamente, se asignan directamente a «qué hay en esta imagen, dónde está y en qué condiciones se encuentra».
Codificación visual
"Visual coding" como un caso de uso nombrado sugiere flujos de trabajo como: alimentar al modelo con una captura de pantalla de una UI renderizada más el código del componente subyacente, y pedirle que identifique la discrepancia, o tomar una exportación de Figma y obtener una implementación de primera pasada. Esta es una categoría de tareas que castiga específicamente a los modelos de código solo de texto — puedes describir un error de diseño en palabras, pero un modelo que realmente pueda ver el padding roto o el botón desalineado lo diagnosticará más rápido y de manera más confiable.
Agente / Uso de computadora
Este es el caso de uso principal. Un agente de uso de computadora debe mirar una pantalla, entender qué es interactivable, decidir una acción y repetir el proceso — a menudo durante docenas de pasos por tarea. La economía aquí es implacable para los modelos costosos: una tarea de automatización de navegador o escritorio de 30 pasos, cada paso con una nueva captura de pantalla, puede acumular cientos de miles de tokens antes de completarse. Con los precios de los modelos de frontera, eso es dinero real por tarea; con los precios de Qwen 3.7 Flash, ejecutar miles de tales sesiones al día sigue estando al alcance del presupuesto de un equipo pequeño.
Buscar
Búsqueda visual — comparar una imagen con un corpus, verificar que un resultado recuperado realmente coincide con una foto de referencia, o fundamentar una consulta de búsqueda en una captura de pantalla de lo que el usuario está viendo — se beneficia de la misma combinación de contexto amplio (para contener múltiples imágenes candidatas o un conjunto largo de documentos recuperados) y bajo costo por llamada (porque los bucles de búsqueda y verificación a menudo implican muchas llamadas al modelo por consulta de usuario, no una sola).
Cómo acceder y usar Qwen 3.7 Flash
Qwen 3.7 Flash se invoca con el identificador de modelo qwen/qwen3.7-flash, y funciona con cualquier herramienta compatible con OpenAI, lo que significa que las integraciones existentes de chat-completions o de estilo responses pueden apuntar a él con solo cambiar el nombre del modelo y sin reescribir el código del cliente. Aquí es también donde una capa de enrutamiento como OrcaRouter se vuelve práctica en lugar de teórica: en lugar de fijar un único modelo en cada servicio, un endpoint unificado compatible con OpenAI te permite configurar un modelo multimodal barato y capaz como nivel predeterminado para el tráfico de visión y de agentes, y reservar los modelos de razonamiento más caros para el subconjunto de solicitudes que realmente los necesitan. Para un modelo cuya propuesta de valor completa es «muy barato, bastante capaz, aún no probado en la frontera», ese tipo de enrutamiento por niveles —barato por defecto, escalar cuando sea necesario— podría decirse que es la forma correcta de desplegarlo en producción, en lugar de apostar todo un pipeline a un único modelo sin verificar.
Se aplica el formato estándar de solicitudes multimodales: entradas de imagen junto con texto en el mismo mensaje, ventanas de contexto amplias para sesiones de múltiples imágenes o de múltiples turnos, y facturación por token que se muestra claramente en los paneles de uso. Pruebe el límite práctico de longitud de salida para su carga de trabajo antes de confiar en él, ya que el máximo no está publicado.
Limitaciones honestas y lo que no está confirmado
Para ser directos sobre lo que es genuinamente desconocido aquí: no hay datos independientes de pruebas comparativas sobre Qwen 3.7 Flash de Artificial Analysis ni de ningún evaluador comparable al momento de escribir esto. Todo acerca de su calidad — qué tan bien se desempeña realmente en razonamiento visual, qué tan confiable es para tareas agénticas de múltiples pasos, cómo se comporta frente a distracciones en escenarios de contexto largo — está respaldado actualmente solo por el propio lenguaje de posicionamiento de Alibaba, no por un tercero que lo ejecute a través de un conjunto de pruebas estandarizado. La descripción del proveedor y la verificación independiente no son lo mismo, y los lectores deberían sopesar las capacidades de este modelo en consecuencia hasta que exista esa verificación.
Más allá de los benchmarks, Alibaba no ha revelado la arquitectura, el número de parámetros ni la longitud máxima de salida. La teoría que circula en la comunidad sobre un "MoE pequeño, posible precursor de un Qwen 3.7 de pesos abiertos" es una suposición razonable basada en los patrones de nomenclatura y los precios, pero es especulación, no algo que Alibaba haya confirmado. Si la transparencia del modelo (arquitectura publicada, pesos abiertos, un informe técnico) es un requisito para tu caso de uso, Qwen 3.7 Flash no cumple actualmente ese estándar: es un modelo cerrado, solo con API, con documentación pública mínima más allá de su ficha en la API.
Comparativa: Qwen 3.8, Qwen 3.7 Max y rivales económicos
La denominación aquí confunde a la gente, por lo que vale la pena ser precisos.Qwen 3.8 es el buque insignia de pesos abiertos anunciado por separado por Alibaba, supuestamente construido alrededor de un diseño de 2,4 billones de parámetros — un modelo fundamentalmente diferente con un propósito diferente: un modelo grande, abierto y de propósito general destinado a competir en la frontera, no un nivel económico de utilidad multimodal.Qwen 3.7 Max es el buque insignia cerrado más grande, presumiblemente más capaz, dentro de la misma oleada de lanzamiento «3.7» — el modelo al que recurrirías cuando una tarea necesita la máxima calidad sin importar el costo.Qwen 3.7 Flash, el tema de este artículo, es el tercer y más económico punto de esa constelación: más pequeño, más rápido, dramáticamente menos costoso, y enfocado específicamente en cargas de trabajo multimodales-agénticas en lugar de la excelencia de propósito general. No asumas que la capacidad o el comportamiento se transfieren entre estos tres solo porque dos de ellos comparten un número de versión — son modelos diferentes con trabajos diferentes.
Frente a la competencia externa, la comparación más cercana es la de Google Gemini 3.5 Flash-Lite, el cual ocupa un nicho similar: un nivel de bajo costo, multimodal y de alto rendimiento diseñado exactamente para el tipo de cargas de trabajo de volumen descritas anteriormente. Ambos modelos compiten principalmente en los mismos ejes — precio por token, longitud de contexto y manejo multimodal — en lugar de en puntos de referencia de razonamiento puro, ya que ninguno está posicionado como un modelo de razonamiento fronterizo. Sin datos de referencia independientes para Qwen 3.7 Flash, una afirmación de calidad comparativa directa frente a Gemini 3.5 Flash-Lite no es algo que este artículo pueda hacer de manera responsable; lo que se puede decir es que el precio de Qwen 3.7 Flash es competitivo con o por debajo de ese nivel, y su ventana de contexto de 1M es generosa para un modelo en este rango de costo, que es exactamente el tipo de brecha que hace que valga la pena probar empíricamente los niveles multimodales baratos contra tu propia carga de trabajo en lugar de elegir solo por precio.
Preguntas frecuentes
¿Qué es Qwen 3.7 Flash?
Es un modelo de razonamiento de visión-lenguaje del equipo Qwen de Alibaba, diseñado para agentes multimodales, codificación visual, búsqueda e interacción con computadora/interfaz de usuario, listado bajo el ID de modelo qwen/qwen3.7-flash desde el 27 de julio de 2026.
¿Cuánto cuesta Qwen 3.7 Flash?
$0.03 por 1 millón de tokens de entrada y $0.13 por 1 millón de tokens de salida — entre los modelos con capacidad de visión más económicos disponibles actualmente, y el listado señala que es posible obtener descuentos adicionales del 60-80% mediante el almacenamiento en caché de indicaciones en contextos repetidos.
¿Qué es la ventana de contexto?
1.000.000 tokens.
¿Es Qwen 3.7 Flash lo mismo que Qwen 3.8?
No. Qwen 3.8 es el modelo insignia de pesos abiertos con 2.4 billones de parámetros anunciado por separado por Alibaba. Qwen 3.7 Flash es un modelo multimodal cerrado mucho más pequeño y económico con un propósito diferente. No deben confundirse a pesar de que ambos son de la línea Qwen de Alibaba.
¿Es Qwen 3.7 Flash lo mismo que Qwen 3.7 Max?
No. Qwen 3.7 Max es el modelo insignia más grande dentro de la misma oleada de lanzamiento "3.7". Qwen 3.7 Flash es el nivel más pequeño, rápido y mucho más económico, orientado a tareas multimodales y agentivas de alto volumen, en lugar de a una salida de máxima calidad.
¿Admite Qwen 3.7 Flash imágenes?
Sí, es un modelo de visión-lenguaje — acepta entrada multimodal (imagen y texto) y está específicamente posicionado en tareas visuales como reconocimiento de objetos, comprensión espacial, codificación visual e interacción con computadora/UI.
¿Cuál es la longitud máxima de salida?
No divulgado oficialmente por Alibaba. Cualquiera que esté construyendo una carga de trabajo de producción debería probar directamente el límite de salida práctico en lugar de asumir un número.
¿Es Qwen 3.7 Flash un modelo de mezcla de expertos?
Sin confirmar. Algunos en la comunidad especulan que utiliza una pequeña arquitectura MoE basada en su precio y patrón de nombres, pero Alibaba no ha publicado detalles de la arquitectura, por lo que esto sigue siendo especulación más que un hecho.
¿Cómo se compara con Gemini 3.5 Flash-Lite?
Ambos ocupan un nivel multimodal similar de bajo costo y alto rendimiento, y compiten principalmente en precio y longitud de contexto, más que en puntos de referencia de razonamiento puro. Aún no hay datos de referencia independientes para hacer una comparación de calidad definitiva para Qwen 3.7 Flash.
¿Dónde puedo acceder a Qwen 3.7 Flash?
Usando el ID de modelo qwen/qwen3.7-flash a través de cualquier cliente compatible con OpenAI, o mediante una capa de enrutamiento como OrcaRouter que pueda configurarlo como un nivel multimodal económico predeterminado junto a otros modelos.
¿Es bueno Qwen 3.7 Flash?
No comprobado de forma independiente hasta la fecha de redacción de este texto — ninguna organización de evaluación comparativa externa, incluida Artificial Analysis, ha publicado puntuaciones para ello. Su propuesta de valor es el precio y el tamaño del contexto, no una ventaja de calidad demostrada, por lo que vale la pena probarlo empíricamente con su carga de trabajo específica antes de comprometerse.

Conclusión
Qwen 3.7 Flash no busca ganar una tabla de clasificación, y Alibaba no le ha dado a nadie la documentación para verificarlo aunque quisiera. Lo que intenta es que las cargas de trabajo de visión y agentes —análisis de capturas de pantalla, revisiones visuales de código, bucles de uso informático, búsqueda visual— sean lo suficientemente baratas como para que el costo deje de ser el motivo por el que no implementas la funcionalidad. A $0,03/$0,13 por millón de tokens con un contexto de 1 millón de tokens, la economía realmente respalda el tráfico de agentes multimodales de alto volumen y siempre activo de una manera que pocos modelos en cualquier nivel de calidad pueden igualar. La pega es la honestidad sobre las carencias: sin puntos de referencia independientes, sin arquitectura ni longitud máxima de salida reveladas, y una incertidumbre real sobre cómo se sostiene frente a rivales económicos consolidados como Gemini 3.5 Flash-Lite. Tómalo como una opción prometedora y extremadamente asequible para cargas de trabajo multimodales de agentes que vale la pena probar ahora —y mantenlo claramente separado en tu mente tanto de Qwen 3.8 como de Qwen 3.7 Max, que son modelos diferentes que resuelven problemas completamente distintos.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
