Tarjeta de título generada titulada «Union Alpha vs Qwen3.8 Flash» con el subtítulo «Separados por un solo punto en la única prueba que ejecutó ambos», sobre tres tarjetas redondeadas que muestran «Official A: 136/157 vs 137/157», «Contexto: 262.144 vs 1.000.000 tokens» y «Tiempo hasta el primer token: 10,00 s vs 6,62 s». El pie de página indica Official A según SMF Clearinghouse, con latencia según OrcaRouter durante los últimos 7 días.
Guides & Insights

Union Alpha vs Qwen3.8 Flash: Un punto lo es todo

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Union Alpha y Qwen3.8 Flash están a un punto de distancia en la única prueba que ha medido a ambos. En la suite SMF Clearinghouse Official A —157 pruebas, razonamiento desactivado—, Union Alpha obtuvo 136 y una ejecución local de Qwen3.8-Flash-Next obtuvo 137. Ese es el resultado cara a cara más reñido que ha tenido cualquiera de los dos modelos, y también es la cifra más engañosa de esta comparación, porque las dos entradas no se ejecutaron en las mismas condiciones y solo una de ellas es un modelo que realmente puedes alquilar ahora mismo.

Lo que la diferencia de un punto te dice y no te dice

Empieza por lo que establece. Union Alpha no es un farol en el sentido trivial — una amplia batería de 157 pruebas con cero errores, razonamiento perfecto (30/30) y uso perfecto de herramientas (2/2) no es algo que produzca un endpoint vacío. Su resultado en programación de 26/30 y en matemáticas de 24/30 lo sitúan en terreno creíble, y su puntuación en escritura de 2/5 lo deja muy lejos del trabajo de prosa de propósito general.

Ahora bien, las salvedades, que soportan la carga.

La entrada de Qwen3.8 Flash fue una ejecución local de Qwen3.8-Flash-Next —el checkpoint de pesos abiertos—, no la API alojada de Qwen3.8 Flash. El servicio local implica tu propia cuantización, tu propia pila de inferencia, tu propio analizador de llamadas a herramientas. Nada de eso garantiza que coincida con lo que devuelve el endpoint alojado, y las personas que ejecutaron la prueba señalaron la comparación como no concluyente precisamente por ese motivo.

Una suite no es un perfil. Official A es amplia pero superficial por categoría: herramientas son 2 pruebas. Una categoría de herramientas de dos pruebas que obtiene 2/2 es una buena señal, no evidencia de fiabilidad agéntica, y Union Alpha se posiciona explícitamente como un modelo agéntico y de codificación. El instrumento está midiendo algo adyacente a la afirmación.

Y el punto en sí está dentro del ruido de una suite de 157 pruebas. Trata 136 y 137 como «estos están en la misma banda», no como una clasificación.

Lado a lado

• Ventana de contexto — Union Alpha 262.144 tokens vs. Qwen3.8 Flash 1.000.000 de tokens servidos (262.144 nativos, ampliados mediante YaRN).

Salida máxima — Union Alpha 131.072 tokens frente a Qwen3.8 Flash 131.000 tokens. En la práctica, el mismo nivel.

• Entradas — texto e imagen en Union Alpha frente a texto, imagen y video en Qwen3.8 Flash.

• Precios — $0 durante la vista previa de Union Alpha frente a Qwen3.8 Flash, con $0,150/M de entrada, $0,470/M de salida, $0,018/M de lectura en caché y $0,230/M de escritura en caché.

• Controles de razonamiento — ninguno en Union Alpha frente a un modo de pensamiento en Qwen3.8 Flash que está activado por defecto y se puede desactivar.

• Tiempo hasta el primer token — Union Alpha 10,00 s p50 frente a Qwen3.8 Flash 6,62 s p50, ambos medidos en nuestro endpoint durante la misma ventana de siete días. La velocidad de decodificación bruta es más parecida de lo que sugiere la reputación: 170 tokens por segundo frente a 103.

• Procedencia — operador anónimo, sin pesos frente a Alibaba/Qwen, con los pesos de Qwen3.8-Flash-Next publicados como código abierto en Hugging Face y ModelScope.

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash: una apuesta por la eficiencia con 6B activos

Qwen3.8 Flash se lanzó el 26 de agosto de 2026 como la versión de producción gestionada del checkpoint de pesos abiertos Qwen3.8-Flash-Next, que Alibaba publicó simultáneamente. Es un modelo de mezcla de expertos de 125B de parámetros que activa aproximadamente 6B de parámetros por token, además de 51B de parámetros de embedding de N-gramas, construido sobre atención híbrida que combina Gated DeltaNet con un indexador de atención dispersa.

El enfoque del proveedor tiene que ver con la economía del entrenamiento: Alibaba informa que el coste de ejecución es aproximadamente una novena parte del de Qwen3.7-Plus, con un prefill declarado hasta 7,6× más rápido y una decodificación hasta 4,9× más rápida en cargas de trabajo de 1 M de tokens con altos aciertos de caché. Esas son cifras del proveedor y no se han reproducido de forma independiente.

Su tabla de benchmarks también está reportada por el proveedor y no ha sido reproducida: SWE-bench Pro 62.5, DeepSWE v1.1 58.7, SWE-bench Multilingual 81.0, NL2Repo 48.1, CoWorkBench 73.9, JobBench 55.7, RealWorldQA 88.5, LVBench 76.6, AndroidWorld 84.5. La cifra que vale la pena citar de vuelta al marketing es la de Humanity's Last Exam con 35.9, que se sitúa por debajo del 40.0 de Claude Opus 4.6 en la misma comparación.

En nuestra propia página del modelo, la sección de benchmarks públicos todavía dice «pendiente»: ninguna tercera parte lo ha evaluado aún. Lo que sí tenemos son nuestros propios datos de tráfico: una mediana de 6,62 segundos hasta el primer token, una velocidad de salida de 103 tokens por segundo y una tasa de error del 4,5 %. Esa tasa de error es lo bastante alta como para merecer atención, y es el tipo de cifra que solo aparece cuando se mide un endpoint en producción en lugar de basarse en una publicación de lanzamiento.

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: el modelo sin dueño

Union Alpha apareció en catálogos de terceros el 16 de septiembre de 2026 y se ofrece en el plan gratuito de OrcaRouter. No tiene laboratorio nombrado, ni pesos, ni licencia, ni número de parámetros, ni nota de arquitectura. Su campo de proveedor dice "Stealth".

Su endpoint, al menos, es legible: contexto de 262.144 tokens, salida máxima de 131.072 tokens, entrada de texto e imágenes con salida solo de texto, llamada a herramientas, salida JSON, temperature, top_p y max_tokens, y ningún control de razonamiento en absoluto. La elección de herramienta, en la práctica, solo admite "auto". Su ventana gratuita se ha descrito como de aproximadamente una semana, con límite de tasa, y sin que se haya anunciado ningún precio posterior a la vista previa.

La afirmación declarada —«rendimiento de nivel frontera en una amplia gama de tareas de propósito general»— es reportada por el operador y no ha sido auditada. El resultado 136/157 de Official A es la única medición independiente que existe.

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

La velocidad es donde dejan de parecerse

Los números principales de rendimiento no los separan de la forma en que cabría esperar, y la razón merece la pena entenderla.

Según nuestros propios datos de telemetría de enrutamiento de los últimos siete días, Qwen3.8 Flash emite a 103 tokens de salida por segundo, con un tiempo hasta el primer token (p50) de 6,62 segundos y una tasa de error del 4,5 %. Union Alpha, medido de la misma manera, emite a 170 tokens por segundo. En cuanto a la velocidad de decodificación en bruto, el modelo anónimo es el más rápido de los dos.

Lo que no hace es arrancar. El p50 y el p95 del tiempo hasta el primer token de Union Alpha están ambos fijados en 10,00 segundos, lo que significa que al menos la mitad de todas las solicitudes esperan diez segundos o más antes de que aparezca el primer token, y su tasa de error en la misma ventana es del 7,7 % —aproximadamente 1,7 veces la de Qwen—. La ejecución Official A de 157 pruebas en la que se apoyan las secciones anteriores tomó 4,6 horas de tiempo de reloj, con una latencia mediana de 91,9 segundos y una media de 104,8 segundos por prueba, y cuatro pruebas alcanzaron el tiempo de espera de 300 segundos del entorno de pruebas. Los evaluadores independientes que lo ejecutaron el día del lanzamiento informaron de un rendimiento muy inferior al que muestra nuestro endpoint, que es lo que cabría esperar de un servicio que aún está absorbiendo una enorme carga del primer día.

Así que la diferencia práctica no es la velocidad de decodificación. Es el tiempo hasta el primer token y la fiabilidad. Union Alpha no es utilizable para nada interactivo —ni autocompletado, ni asistencia en línea, ni un bucle de agente ajustado— porque diez segundos de silencio son indistinguibles de un cuelgue. Encaja en trabajos asíncronos: trabajos por lotes nocturnos, procesamientos largos de documentos, ejecuciones de evaluación sin conexión en las que nada espera el primer token y una tasa de fallos del 7,7 % se absorbe con un reintento.

Qwen3.8 Flash a 103 tokens por segundo con una mediana de 6,62 segundos hasta el primer token tampoco es rápido. La forma honesta de decirlo es que ambos son lentos, y solo uno de ellos falla aproximadamente una de cada trece solicitudes.

El argumento de la eficiencia, y quién tiene derecho a hacerlo

Alibaba plantea un argumento sobre el coste de entrenamiento: una novena parte del coste de Qwen3.7-Plus para entrenar, seis mil millones de parámetros activos por token, así que es barato de servir. Eso es una afirmación sobre un modelo cuyos pesos existen y cuyo linaje está documentado.

La historia de eficiencia de Union Alpha se insinúa en lugar de declararse: un modelo anónimo de 256K que es gratis de llamar. Gratis no es lo mismo que barato. Alguien está pagando por esas GPU, la vista previa tiene un final declarado, y la propia admisión del operador de que estaban ajustando para la velocidad sugiere que la economía del servicio aún no está resuelta. Un modelo que es gratis durante una semana y que después no se puede tarifar tiene un argumento de eficiencia que expira con la ventana.

Probar lo desconocido sin apostar por ello

La razón por la que merece la pena retener este enfrentamiento en concreto en la cabeza es que es la prueba más barata posible de un modelo sin probar. Qwen3.8 Flash es la cantidad conocida: proveedor identificado, pesos abiertos, benchmarks publicados (aunque con el sesgo del proveedor), un precio real por token de $0.150/$0.470. Union Alpha es la incógnita, con un precio de cero, cuya entera pretensión competitiva se basa en un único resultado de 157 pruebas.

En lugar de elegir, coloca lo desconocido detrás de una regla de conmutación por error. OrcaRouter traslada el precio de lista del proveedor sin recargo (0 % de margen) y admite la conmutación por error automática entre proveedores, de modo que un endpoint de Union Alpha con límite de tasa o desaparecido recae en un modelo que sigue respondiendo en lugar de aparecer como un trabajo fallido a las 3 a. m. Ambos modelos están bajo la misma clave, así que el experimento cuesta un cambio de configuración en lugar de una segunda integración, y ninguna de las dos tiene que ser una decisión que defiendas, porque puedes cambiar el enrutamiento cuando se cierre la ventana gratuita.

Veredicto

Qwen3.8 Flash es el modelo sobre el que construir. Seis mil millones de parámetros activos, pesos hermanos de código abierto, una ventana de 1M de tokens, entrada de video, un rendimiento funcional de 103 tokens por segundo y un precio publicado que puedes pronosticar. Sus benchmarks los reporta el proveedor y vale la pena monitorear su tasa de error, pero pertenece a alguien, y ese alguien está lanzando producto.

Union Alpha es el modelo a medir. La diferencia de un punto en Official A es genuinamente interesante — sugiere que, sea lo que sea esta cosa, no es un juguete — y a $0 con un techo de salida de 131K y entrada de visión, vale una semana de tu atención. Pero una diferencia de un punto en una suite, producida por un operador anónimo con una tasa de error del 7.7%, es una razón para investigar en lugar de una razón para cambiar.

Lo que hay que vigilar es lo mismo que siempre ha zanjado esto: un nombre. Ox Alpha, la entrada anterior de esta serie, se reveló seis días después de aparecer como GLM-5.3-Flash de Zhipu. Si Union Alpha recibe uno, la comparación deja de ser cuestión de un punto y empieza a ser cuestión de un precio.

Lo conocido tiene precio y está documentado: página del modelo Qwen3.8 Flashmuestra las tarifas de $0.150/$0.470, el contexto servido de 1M de tokens y el límite de salida de 131K, con los benchmarks públicos aún pendientes.