
AREX-2 vs Gemma 4 12B: Uno de estos es un modelo
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 397 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Una comparación entre Gemma 4 12B y AREX-2 tiene una propiedad que ninguna otra confrontación de este blog posee: una de las dos columnas está vacía porque el modelo de ese lado aún no existe. Gemma 4 12B es un artefacto ya publicado: Google DeepMind lo publicó el 3 de junio de 2026 como un modelo denso de pesos abiertos de 11,95 mil millones de parámetros bajo Apache 2.0, con una ficha de modelo completa, una ventana de contexto de 256K tokens, entrada nativa de audio e imagen, y tres meses y medio de pruebas independientes a sus espaldas. AREX-2 es un repositorio de Hugging Face que BAAI creó el 29 de septiembre de 2026 a las 17:56 UTC y en el que todavía no ha puesto nada: ni pesos, ni ficha, ni etiqueta de licencia, ni evaluación, ni anuncio.
Esa asimetría no es una razón para saltarse la comparación. Es la comparación. La pregunta que vale la pena responder no es cuál de estos es mejor —nada puede responder eso hasta que AREX-2 tenga archivos en él—, sino si un agente de investigación BAAI de segunda generación siquiera competiría con un modelo de borde de 12B, o si estos dos ocupan posiciones en un stack que nunca se tocan. Equivocarse en eso es el error costoso, porque es el error que lleva a un equipo a presupuestar para lo incorrecto.
El lado enviado, en sus propios términos
Gemma 4 12B es el miembro pequeño de la cuarta generación de la familia abierta de Google, y su elección de diseño definitoria es arquitectónica: elimina por completo el codificador de visión independiente y alimenta directamente al transformer con parches de imagen sin procesar y formas de onda de audio. Eso no es un truco de benchmark. Es lo que hace que el modelo sea verdaderamente portátil: aproximadamente 27 GB de pesos BF16 que se cuantizan por debajo de 7 GB, y una tarjeta que indica 16 GB de VRAM como objetivo de despliegue. En un portátil o una sola tarjeta de gama media, este es un modelo que realmente puedes tener.
El perfil de capacidades se deriva de eso. La propia ficha de Google —reportada por el proveedor, y merece la pena etiquetarla como tal— enumera DocVQA 94.9 e InfoVQA 88.4 para comprensión de documentos, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 y LiveCodeBench v6 72.0 en modo de pensamiento. Artificial Analysis, que es independiente, puntúa la configuración de razonamiento con un Intelligence Index de 14, la mide en 114 tokens por segundo y fija el precio de una llamada típica servida en $0.10 por millón de tokens de entrada y $0.30 por millón de salida. Nuestra propia entrada de catálogo para el Gemma 4 31B más grande registra 85.7 en GPQA Diamond. La forma de eso es la de un generalista pequeño que es inusualmente fuerte en documentos e imágenes, razonable en razonamiento, y que no se acerca ni de lejos a un modelo de frontera en trabajo difícil de varios pasos.
Su descripción de funciones, por tanto, es concreta: inferencia local o para un solo inquilino, comprensión de documentos y capturas de pantalla, bucles agénticos modestos y cualquier cosa en la que los datos no puedan salir del edificio. No es un motor de investigación profunda y Google no lo vende como tal.

El otro lado, que son un nombre y una marca de tiempo
Todo lo confirmable sobre AREX-2 esta semana cabe en una frase. Es un repositorio bajo la organización BAAI en Hugging Face, creado el 29 de septiembre de 2026, que contiene un .gitattributes archivo y nada más — cero bytes de datos de modelo almacenados, cero descargas, sin tarjeta de modelo, sin declaración de licencia, sin despliegue de proveedor. La propia BAAI no ha anunciado nada.
Lo que hace que valga la pena escribirlo es la familia de la que recibe su nombre. La línea AREX de BAAI se lanzó el 23 de julio de 2026 con dos modelos: AREX-Base, una mezcla de expertos de 122.000 millones de parámetros con 10.000 millones de parámetros activos basada en Qwen3.5-122B-A10B, y AREX-Turbo, un modelo denso de 4B construido sobre Qwen3.5-4B. Ambos son Apache 2.0. Ambos son agentes de investigación profunda en lugar de modelos de chat: un bucle interno que reúne evidencia y produce una respuesta candidata con una cifra de confianza, y un bucle externo que verifica esa respuesta contra las restricciones originales y puede refinar o reiniciar toda la trayectoria. Según las cifras publicadas por BAAI, AREX-Base alcanza 82,5 en BrowseComp, 85,4 en GAIA y 89,9 en DeepSearch QA; AREX-Turbo alcanza 70,7, 81,6 y 78,5 en esas mismas tres.
Todas esas cifras son del propio proveedor y ninguna ha sido reproducida de forma independiente. Además, se refieren a un modelo diferente. AREX-2 no tiene cifras, y el "2" no te dice nada sobre tamaño, backbone o arquitectura: una segunda generación en esta línea podría ser un agente más grande, una destilación más pequeña o un framework reentrenado con el backbone cambiado.
¿Estos dos siquiera se encuentran?
Aquí es donde la comparación se vuelve más útil de lo que parece. Tomemos las dos interpretaciones plausibles de lo que llega a ser AREX-2.
Si es un agente de investigación de segunda generación a una escala aunque sea parecida a la de Base, entonces ni él ni Gemma 4 12B compiten jamás. Una mezcla de expertos de 122B que impulsa búsquedas multifuente es un servicio alojado, facturado por token y limitado por la red; Gemma 4 12B es un checkpoint que uno descarga y ejecuta por su cuenta. La decisión entre ambos no es una comparación de calidad, sino una decisión sobre si tu carga de trabajo es un bucle de investigación o un endpoint de inferencia.
Si AREX-2 resulta ser la variante pequeña —el sucesor del 4B Turbo y no del 122B Base—, entonces ambos sí comparten estantería, y la comparación pasa a ser real. Esa versión de AREX-2 tendría aproximadamente un tercio del número de parámetros de Gemma 4 12B, estaría especializada en búsqueda impulsada por herramientas más que en amplitud multimodal, y se mediría con BrowseComp y GAIA en lugar de con DocVQA. Dos modelos pequeños: uno optimizado para sostener una trayectoria de investigación prolongada, y el otro para ver y leer en hardware modesto. A un equipo que construye un pipeline de documentación no debería importarle el primero; a un equipo que construye un agente de investigación no debería importarle el segundo.
• Lo que existe — Gemma 4 12B se puede descargar hoy con una ficha completa. AREX-2 es un repositorio sin ningún archivo.
• Parámetros — 11,95B denso para Gemma 4 12B. No se indica, y solo puede inferirse a partir del nombre de un producto, para AREX-2.
• Contexto — 256K tokens (262.144 posiciones) para Gemma 4 12B. Desconocido para AREX-2.
• Modalidad — texto, imagen y audio de entrada para Gemma 4 12B. Se desconoce para AREX-2; la primera generación de AREX era texto más uso de herramientas.
• Licencia — Apache 2.0 para Gemma 4 12B, indicada en la ficha. No se indica para AREX-2; AREX-Base y AREX-Turbo tenían licencia Apache 2.0.
•Para qué sirve — inferencia multimodal desplegable en tu propio hardware frente a, a juzgar por la evidencia de la familia, búsqueda de horizonte largo y agregación de evidencia contra un endpoint alojado.

La parte que es realmente comparable: dónde se ejecuta cada uno
Dado que la comparación de capacidades no está disponible, la comparación de despliegues es la que se puede hacer con honestidad, y no está ni cerca.
Gemma 4 12B se ejecuta donde lo pongas. No hay tabla de tarifas, ni medidor por token, ni proveedor entre tú y el modelo: el costo es el hardware y la electricidad, y el modo de fallo es tu propia planificación de capacidad. Cuando AREX-Base se lanzó en julio, en cambio, era una mezcla de expertos de 122B: un modelo que se sirve en un clúster o se alquila por token, y el propio 4B Turbo de la familia existe precisamente porque esa elección tiene un precio. Si la segunda generación sigue la misma forma, la economía de AREX-2 será una función de los tokens consumidos por consulta multiplicados por el número de pasos de búsqueda que toma una trayectoria, un número mucho mayor para un agente de investigación profunda que para un modelo de lectura de documentos, porque el agente relee un contexto creciente en cada iteración.
Ahí es donde una capa de enrutamiento deja de ser una abstracción y empieza a ser una partida de gasto. Si acabas ejecutando un agente de investigación contra un modelo alojado mientras mantienes un Gemma 4 12B local para el trabajo con documentos, en el caso normal esas son dos integraciones. A través de una sola API frente a más de 200 modelos —con el precio de lista del proveedor repercutido y sin ningún margen añadido, de modo que un cambio de precio de un proveedor llega el mismo día— son una sola clave, una sola factura y un solo cliente, y una regla de conmutación por error puede sacar una solicitud de un proveedor que está teniendo una mala hora sin que el bucle de tu agente se entere. Hoy enrutamos Gemma 4 26B-A4B y Gemma 4 31B; no enrutamos el 12B, y nada de la línea AREX está tampoco en nuestro catálogo, así que si alguno de esos es el modelo que necesitas, viene de la propia distribución de su proveedor.
Qué hacer esta semana
Si necesitas un modelo multimodal compacto que puedas ejecutar tú mismo, la decisión nunca estuvo pendiente de AREX-2. Gemma 4 12B ya se ha lanzado, está documentado, ha sido evaluado de forma independiente y se puede desplegar, y la columna de comparación del otro lado está vacía. No compres nada basándote en un nombre reservado.
Si estás creando un agente de investigación profunda y la línea AREX es lo que realmente quieres, lo que hay que vigilar no es el nombre, sino el árbol: si aparecen safetensors en ese repositorio, qué dice la tarjeta que es el recuento de parámetros y qué etiqueta de licencia le corresponde. La primera generación se lanzó con Apache 2.0, y si la segunda también lo hace, la cuestión pasa a ser de alojamiento en lugar de licencia. Hasta entonces, AREX-Base es el modelo AREX que realmente puedes ejecutar, y está disponible desde julio.
Lo único que vale la pena decir sin rodeos sobre la comparación de la que, nominalmente, trata este artículo: una página de VS en la que un lado es un commit de repositorio y el otro es un modelo ya lanzado no es un enfrentamiento, es un calendario. El calendario dice que Gemma 4 12B está disponible ahora y que AREX-2 no está disponible en absoluto.
