Tarjeta de título generada titulada "Union Alpha vs Gemini 3.8 Flash" con el subtítulo "Uno tiene una puntuación, el otro tiene una afirmación", sobre tres tarjetas redondeadas que dicen "Gemini 3.8 Flash: tabla de evaluación fechada, precio publicado", "Union Alpha: sin benchmarks de su operador" y "Salida máxima: 131.072 vs 65.536 tokens". El pie de página dice que las cifras de Union Alpha no están auditadas, con las cifras de Gemini según Google y Artificial Analysis.
Guides & Insights

Union Alpha vs Gemini 3.8 Flash: Uno tiene una puntuación, el otro tiene una afirmación

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Union Alpha y Gemini 3.8 Flash son la misma propuesta presentada en dos niveles completamente distintos de prueba. El operador de Union Alpha lo describe como con «rendimiento de nivel frontera en una amplia gama de tareas de propósito general» y no ha publicado ningún benchmark, ni número de parámetros, ni licencia, ni nombre. Gemini 3.8 Flash se lanzó con una tabla de evaluación fechada, un Artificial Analysis Intelligence Index, cifras de coste por tarea de evaluadores independientes y un calendario de precios documentado que se extiende hasta 2027. Si eliges entre ellos por cualquier cosa que no sea el precio, estás eligiendo entre un número que puedes comprobar y una frase que no.

Lado a lado, antes de la discusión

• Ventana de contexto — Union Alpha 262,144 tokens vs Gemini 3.8 Flash 1,048,576 tokens.

• Salida máxima — 131.072 tokens frente a 65.536 tokens. Union Alpha gana esta, y es el único eje estructural donde lo hace.

• Entradas — texto e imagen en ambos, pero Gemini 3.8 Flash además acepta video, audio y archivos.

• Precios — Union Alpha $0 durante su vista previa frente a Gemini 3.8 Flash: $0,75/M de entrada, $3,75/M de salida, $0,075/M de entrada en caché, y se duplicarán a $1,50/$7,50 el 1 de enero de 2027.

• Controles de razonamiento: ninguno expuesto en Union Alpha frente a los niveles de pensamiento de Gemini 3.8 Flash que afectan directamente tanto a la calidad como al coste.

• Evaluación publicada — ninguna por parte del operador de Union Alpha frente a una tabla completa con fechas sobre Gemini 3.8 Flash.

• Procedencia — operador anónimo, sin pesos frente al lanzamiento fechado y el linaje documentado de Gemini 3.8 Flash.

Generated two-column comparison scoreboard for Union Alpha and Gemini 3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published evals from its operator, 10.00 s p50 time to first token. Gemini 3.8 Flash column: context window 1,048,576 tokens, max output 65,536 tokens, text, image, video and audio input, $0.75 input and $3.75 output per 1M tokens, a full dated evaluator table, 3.46 s p50 time to first token. Footer reads latency per OrcaRouter over the last 7 days with Union Alpha benchmarks unaudited.

Lo que realmente dicen los números de Gemini 3.8 Flash

Gemini 3.8 Flash se lanzó el 2 de septiembre de 2026 —el tercer lanzamiento de Flash de Google en unas seis semanas, lo que da una idea de hasta qué punto la historia de este modelo es cuestión de cadencia más que de un gran avance. La tabla de evaluación publicada atribuye el crédito conjuntamente a artificialanalysis.ai y a deepmind.google, así que léela como una mezcla de cifras independientes y del proveedor, más que como una auditoría limpia de terceros.

• AA Coding — 76.3, que es una puntuación de programación genuinamente sólida.

• AA Intelligence — 41.2. Ten en cuenta que Artificial Analysis reporta por separado 59 en el Índice de Inteligencia con esfuerzo de razonamiento alto, así que la cifra varía mucho según la configuración de esfuerzo; cita la configuración o el número no significa nada.

• GPQA Diamond — 95,3, la cifra individual más alta de esta comparación por un amplio margen.

• HLE-Verified — 54.9, con el Humanity's Last Exam estándar en 47.8.

• Terminal-Bench 2.1 — 89,4 en la propia tabla de Google, ligeramente por delante del 89,1 de Claude Opus 5.

• Recuerdo de contexto largo — 81,3; SciCode 56,6; tau_banking 44,9.

• Rendimiento observado — 323 tokens de salida por segundo durante una ventana reciente de siete días, con una tasa de error del 0.63%, una mediana de tiempo hasta el primer token de 3.46 segundos y 498.5 M tokens de tráfico medido.

Las debilidades están tan documentadas como las fortalezas. En Terminal-Bench 4.0 obtiene 19,1 frente a los 51,8 de Claude Opus 5. En OSWorld 2.0 logra un 59,0% frente al 75,4%. En GDPVal-AA v2 se queda atrás con 1545 Elo frente a 1824. Gemini 3.8 Flash es excelente en una franja específica de trabajo y cae en picado en las evaluaciones de agentes generales más difíciles —que es exactamente el tipo de perfil que una tabla publicada te permite ver.

El giro de precios que sorprende a la gente

Google dejó sin cambios el precio por token respecto a Gemini 3.7 Flash. La factura igual subió.

El modelo trabaja más duro: más pasos de razonamiento, más llamadas iterativas a herramientas. Las pruebas independientes de Artificial Analysis midieron aproximadamente un 30 % más de tokens de salida por tarea y un costo por tarea alrededor de un 40 % mayor que 3.7 Flash. Con razonamiento alto, eso se sitúa alrededor de $0,58 por tarea; el nivel medio ronda los $0,41 y el bajo, los $0,24.

Esto es lo más útil de la comparación para cualquiera que esté haciendo un presupuesto, y se generaliza mucho más allá de estos dos modelos: el precio unitario y el costo por tarea son cifras diferentes, y solo una de ellas aparece en una página de precios. Google ha mantenido 3.7 Flash disponible como la opción más barata, lo cual es un reconocimiento tácito del cambio.

Lo que Union Alpha ofrece en su lugar

Union Alpha apareció en catálogos de terceros el 16 de septiembre de 2026 y funciona en el nivel gratuito de OrcaRouter. Es anónimo —sin laboratorio, sin pesos, sin licencia, sin fecha de corte de conocimiento— y es gratuito durante una ventana declarada de aproximadamente una semana, con límite de frecuencia, y sin que se haya anunciado un precio posterior a la vista previa.

Su endpoint es verificable incluso donde su procedencia no lo es: contexto de 262.144 tokens, salida máxima de 131.072 tokens, entrada de texto e imagen con salida solo de texto, llamadas a herramientas y salida JSON, temperature, top_p, max_tokens, y ningún control de razonamiento de ningún tipo. La elección de herramienta, en la práctica, solo admite "auto".

Existe exactamente una medición independiente. SMF Clearinghouse ejecutó 157 pruebas Official A con el razonamiento desactivado y le dio una puntuación de 136/157 — 86,6%, cero errores, décimo de veintiséis. El razonamiento fue perfecto con 30/30, herramientas 2/2, programación 26/30, matemáticas 24/30. La escritura quedó en 2/5.

Eso no es un mal resultado. Simplemente no es comparable. Official A es una amplia suite general de 157 pruebas; AA Coding y GPQA Diamond son instrumentos distintos que miden cosas distintas con dificultades distintas. Poner 136/157 junto a 95.3 en GPQA Diamond y declarar un ganador sería exactamente el tipo de lavado que vuelve inútiles los números de los proveedores.

The OrcaRouter model page for Gemini 3.8 Flash, showing a 1M-token context window, a 65K max output, text plus image, video, file and audio input, $0.75 per million input tokens and $3.75 per million output tokens, a p50 time to first token of 3.46 s, and 498.5M tokens of traffic over seven days.The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

La comparación de costos que nadie puede terminar de verdad

Aquí está el ejemplo resuelto, y es deliberadamente incompleto.

Toma una tarea que ejecutes mil veces al mes. En Gemini 3.8 Flash con razonamiento alto, la cifra publicada por tarea de alrededor de $0.58 lo sitúa en aproximadamente $580 al mes. Esa es una cifra real y defendible, construida a partir del consumo de tokens medido.

En Union Alpha, esas mismas mil tareas cuestan $0 hoy. Lo que cuesten dentro de tres semanas es una incógnita, porque no existe un precio posterior a la vista previa. Lo que cuesten en fiabilidad también es una incógnita, porque el modelo tiene límite de tasa, se ejecuta en un único endpoint sin proveedor de respaldo y responde con HTTP 429 en cuanto superas un límite que nadie ha publicado.

Así que la respuesta honesta es que Union Alpha gana la única comparación de costos disponible y pierde la capacidad de pronosticar el costo. Para una prueba comparativa puntual, está bien. Para una partida presupuestaria, no es un número: es una esperanza con una URL.

Donde cada uno pertenece

Gemini 3.8 Flash encaja dondequiera que necesites una base medida: trabajo con documentos de contexto largo con entrada de vídeo o audio, tareas de programación en las que la puntuación AA Coding de 76.3 es el instrumento relevante, y cualquier carga de trabajo con un presupuesto asociado, porque puedes calcular el coste antes de comprometerte y sabes que se duplicará el 1 de enero de 2027.

Union Alpha pertenece a la ranura exploratoria: probar un modelo de 256K con capacidad de visión cuyo techo de salida duplica el de Gemini, en trabajos donde un endpoint desaparecido no te cuesta nada.

La razón para ejecutarlos detrás de un único endpoint en lugar de dos integraciones es que esta comparación va a cambiar de forma repetidamente. Un DSL de enrutamiento te permite componer las dos en una sola llamada —Gemini 3.8 Flash como la ruta medida, Union Alpha como la rama experimental— en lugar de codificar de forma rígida una decisión que querrás revisar cuando se cierre la ventana gratuita o cuando expire el precio de introducción de Google. Ninguna de esas fechas está lejos, y ambas cambiarán la aritmética.

¿Qué lo resolvería?

Una entrada con fecha para Union Alpha en una tabla de clasificación que también incluye a Gemini 3.8 Flash. Esa es toda la pieza que falta. Hasta entonces, la posición defendible no es "Union Alpha es tan bueno como Gemini 3.8 Flash", sino "Union Alpha es gratis durante una semana y nadie lo ha medido contra nada que Google publique". Son frases muy diferentes, y solo una de ellas es cierta actualmente.

La mitad medida del par está documentada aquí: página del modelo Gemini 3.8 Flashincluye las tarifas de $0,75/$3,75, el descuento del 90 % en la entrada en caché y el límite de salida de 65.536 tokens que determina el trabajo de informes largos.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario