
AREX-2 vs Gemma 4 12B: Um destes é um modelo
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 507 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 194 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
A comparison between Gemma 4 12B and AREX-2 has a property no other matchup on this blog has: one of the two columns is empty because the model on that side does not exist yet. Gemma 4 12B is a shipped artifact — Google DeepMind published it on June 3, 2026 as an 11.95-billion-parameter dense open-weights model under Apache 2.0, with a full model card, a 256K-token context window, native audio and image input, and three and a half months of independent testing behind it. AREX-2 is a Hugging Face repository that BAAI created on September 29, 2026 at 17:56 UTC and has not yet put anything into: no weights, no card, no licence tag, no evaluation, no announcement.
Essa assimetria não é razão para pular a comparação. Ela é a comparação. A pergunta que vale a pena responder não é qual destes é melhor — nada pode responder isso até que o AREX-2 tenha arquivos nele —, mas sim se um agente de pesquisa da BAAI de segunda geração estaria sequer competindo com um modelo de borda de 12B para começar, ou se esses dois ocupam posições em uma pilha que nunca se tocam. Errar nisso é o erro caro, porque é o erro que leva uma equipe a alocar orçamento para a coisa errada.
O lado enviado, nos seus próprios termos
Gemma 4 12B is the small member of Google's fourth-generation open family, and its defining design choice is architectural: it drops the separate vision encoder entirely and feeds raw image patches and audio waveforms straight into the transformer. That is not a benchmark trick. It is what makes the model genuinely portable — roughly 27 GB of BF16 weights that quantise below 7 GB, and a card that names 16 GB of VRAM as the deployment target. On a laptop or a single mid-range card, this is a model you can actually hold.
The capability profile follows from that. Google's own card — vendor-reported, and worth labelling as such — lists DocVQA 94.9 and InfoVQA 88.4 for document understanding, MMLU-Pro 77.2, GPQA Diamond 78.8, AIME 2026 77.5 and LiveCodeBench v6 72.0 in thinking mode. Artificial Analysis, which is independent, scores the reasoning configuration at an Intelligence Index of 14, measures it at 114 tokens per second, and prices a typical served call at $0.10 per million input tokens and $0.30 per million output. Our own catalogue entry for the larger Gemma 4 31B carries 85.7 on GPQA Diamond. The shape of that is a small generalist that is unusually strong on documents and images, reasonable on reasoning, and nowhere near a frontier model on hard multi-step work.
Its job description is therefore concrete: local or single-tenant inference, document and screenshot understanding, modest agentic loops, and anything where the data cannot leave the building. It is not a deep-research engine and Google does not sell it as one.

O outro lado, que é um nome e um carimbo de data e hora
Tudo o que é confirmável sobre o AREX-2 esta semana cabe em uma frase. É um repositório sob a organização BAAI no Hugging Face, criado em 29 de setembro de 2026, contendo um arquivo .gitattributes e nada mais — zero bytes de dados de modelo armazenados, zero downloads, nenhum cartão de modelo, nenhuma declaração de licença, nenhuma implantação de provedor. A própria BAAI não anunciou nada.
O que faz valer a pena anotar é a família que lhe dá o nome. A linha AREX da BAAI foi lançada em 23 de julho de 2026 com dois modelos: AREX-Base, um modelo de mistura de especialistas de 122 bilhões de parâmetros com 10 bilhões de parâmetros ativos, baseado no Qwen3.5-122B-A10B, e AREX-Turbo, um modelo denso de 4B construído sobre o Qwen3.5-4B. Ambos são licenciados sob Apache 2.0. Ambos são agentes de pesquisa profunda, e não modelos de chat — um ciclo interno que reúne evidências e produz uma resposta candidata com um valor de confiança, e um ciclo externo que verifica essa resposta em relação às restrições originais e pode refinar ou reiniciar toda a trajetória. Nos números publicados pela BAAI, o AREX-Base atinge 82,5 no BrowseComp, 85,4 no GAIA e 89,9 no DeepSearch QA; o AREX-Turbo atinge 70,7, 81,6 e 78,5 nos mesmos três.
Todos esses números são do próprio fornecedor e nenhum foi reproduzido de forma independente. Também dizem respeito a um modelo diferente. O AREX-2 não tem números, e o "2" não diz nada sobre tamanho, backbone ou arquitetura — uma segunda geração nesta linha pode ser um agente maior, uma destilação menor, ou um framework retreinado com o backbone trocado.
Será que esses dois chegam a se encontrar?
É aqui que a comparação se torna mais útil do que parece. Considere as duas leituras plausíveis do que o AREX-2 se torna.
Se for um agente de pesquisa de segunda geração em uma escala minimamente parecida com a da Base, então ele e o Gemma 4 12B nunca competem. Um mixture-of-experts de 122B que impulsiona busca em múltiplas fontes é um serviço hospedado, cobrado por token e limitado pela rede; o Gemma 4 12B é um checkpoint que você baixa e executa por conta própria. A decisão entre eles não é uma comparação de qualidade, é uma decisão sobre se sua carga de trabalho é um loop de pesquisa ou um endpoint de inferência.
Se o AREX-2 acabar sendo a categoria pequena — o sucessor do 4B Turbo, e não do 122B Base —, então os dois de fato dividem uma prateleira, e a comparação se torna real. Essa versão do AREX-2 teria aproximadamente um terço do número de parâmetros do Gemma 4 12B, especializada em busca orientada por ferramentas, e não em amplitude multimodal, e seria avaliada no BrowseComp e no GAIA, e não no DocVQA. Dois modelos pequenos, um otimizado para manter uma longa trajetória de pesquisa, o outro para ver e ler em hardware modesto. Uma equipe que constrói um pipeline de documentação não deveria se importar com o primeiro; uma equipe que constrói um agente de pesquisa não deveria se importar com o segundo.
• O que existe — O Gemma 4 12B está disponível para download hoje, com um card completo. O AREX-2 é um repositório sem nenhum arquivo dentro.
• Parâmetros — 11,95B denso para Gemma 4 12B. Não declarado, e inferível apenas a partir de um nome de produto, para o AREX-2.
• Contexto — 256K tokens (262.144 posições) para Gemma 4 12B. Desconhecido para AREX-2.
• Modalidade — texto, imagem e áudio no Gemma 4 12B. Desconhecido para o AREX-2; a primeira geração do AREX era texto mais uso de ferramentas.
• Licença — Apache 2.0 para o Gemma 4 12B, declarado na ficha. Não declarado para o AREX-2; o AREX-Base e o AREX-Turbo eram Apache 2.0.
• Para que serve — inferência multimodal implantável no seu próprio hardware versus, com base nas evidências da família, busca de longo horizonte e agregação de evidências contra um endpoint hospedado.

A parte que é realmente comparável: onde cada um é executado
Como a comparação de capacidades não está disponível, a comparação de implantação é a honesta a se fazer, e está longe de ser equilibrada.
Gemma 4 12B roda onde você o coloca. Não há tabela de preços, nem medidor por token, nem provedor entre você e o modelo — o custo é o hardware e a eletricidade, e o modo de falha é o seu próprio planejamento de capacidade. Quando o AREX-Base foi lançado em julho, por outro lado, era um modelo de mistura de especialistas de 122B: um modelo que você executa em um cluster ou aluga por token, e o 4B Turbo da própria família existe justamente porque essa escolha tem um preço. Se a segunda geração seguir o mesmo formato, a economia do AREX-2 será uma função dos tokens consumidos por consulta multiplicados pelo número de etapas de busca que uma trajetória percorre — um número muito maior para um agente de pesquisa profunda do que para um modelo de leitura de documentos, porque o agente relê um contexto crescente a cada iteração.
É aí que uma camada de encaminhamento deixa de ser uma abstração e passa a ser um item de linha. Se você acabar executando um agente de pesquisa contra um modelo hospedado enquanto mantém um Gemma 4 12B local para o trabalho com documentos, essas são duas integrações no caso comum. Por meio de uma API à frente de mais de 200 modelos — com o preço de tabela do fornecedor repassado e sem nenhuma margem adicionada por cima, de modo que uma mudança de preço de um fornecedor chega no mesmo dia — eles são uma chave, uma fatura e um cliente, e uma regra de failover pode mover uma requisição para fora de um fornecedor que está tendo uma hora ruim sem que o loop do seu agente saiba. Hoje encaminhamos Gemma 4 26B-A4B e Gemma 4 31B; não encaminhamos o 12B, e nada da linha AREX está em nosso catálogo também, então, se qualquer um desses for o modelo de que você precisa, ele vem da distribuição do próprio fornecedor.
O que fazer esta semana
Se você precisar de um modelo multimodal compacto que você mesmo possa executar, a decisão nunca precisou esperar pelo AREX-2. O Gemma 4 12B já foi lançado, documentado, avaliado de forma independente e pode ser implantado, e a coluna de comparação do outro lado está vazia. Não compre nada com base em um nome reservado.
Se estás a construir um agente de investigação profunda e a linha AREX é o que realmente queres, o que deves observar não é o nome, mas a árvore: se aparecem safetensors nesse repositório, o que o cartão diz sobre o número de parâmetros e que etiqueta de licença lhe é atribuída. A primeira geração foi lançada com Apache 2.0, e se a segunda também for, a questão passa a ser uma questão de alojamento e não de licenciamento. Até lá, o AREX-Base é o modelo AREX que consegues realmente executar, e está disponível desde julho.
A única coisa que vale a pena dizer sem rodeios sobre a comparação que este artigo, nominalmente, aborda: uma página VS em que um lado é um commit de repositório e o outro é um modelo já lançado não é um confronto, é um cronograma. O cronograma diz que o Gemma 4 12B está disponível agora e o AREX-2 não está disponível de forma alguma.
