
AstaBrief 8B vs Gemma 4 12B: Um Escritor Especialista Contra um Generalista Que Faz Tudo
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 220 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
AstaBrief 8B e Gemma 4 12B pertencem à mesma classe de tamanho e têm a mesma licença, e além disso são respostas a perguntas diferentes. O AstaBrief 8B é o modelo de pesos abertos de 8B da Ai2, lançado em 2026-10-02 e ajustado a partir do Qwen3-8B, que faz uma coisa: transformar uma pergunta de pesquisa e trechos de literatura recuperados em um relatório com citações, em uma única passada, em cerca de 51 segundos de ponta a ponta. O Gemma 4 12B é o modelo multimodal unificado de 11,95B do DeepMind, um generalista Apache-2.0 que aceita texto, imagens, áudio e vídeo nativamente e lida com 256.000 tokens de contexto. Um é um bisturi que faz um único trabalho mais rápido que o pipeline de uso geral que substituiu; o outro é a caixa de ferramentas inteira, no dispositivo.
A tentação é declarar que o especialista é melhor naquilo que faz e seguir em frente. A pergunta mais útil, se você estiver implantando em uma única GPU de consumidor, é se a vantagem do modelo restrito é grande o suficiente para justificar executar duas pilhas em vez de uma — e a resposta depende de números que nenhum dos laboratórios teve verificados de forma independente.
As partes que realmente se sobrepõem
Ambos são modelos densos de pesos abertos que você consegue manter em uma única placa, ambos são Apache-2.0, e ambos estão disponíveis para download em vez de atrás de uma API. Isso já é uma sobreposição real, e é a razão pela qual vale a pena fazer a comparação.
Para além disso, a divergência é total, e duas linhas fazem a maior parte do trabalho.
• Parâmetros — AstaBrief 8B: aproximadamente 8B denso, pesos BF16 na categoria de GPU única. Gemma 4 12B: 11,95B denso, arquitetura unificada sem encoder.
• Modalidades de entrada — AstaBrief 8B: apenas texto, e especificamente uma pergunta mais excertos. Gemma 4 12B: texto, imagem, áudio e vídeo, com áudio e visão projetados diretamente no espaço de embeddings do decodificador por meio de camadas lineares leves, em vez de codificadores separados.
• Modalidades de saída — Ambos: texto. AstaBrief 8B emite um relatório com citações; Gemma 4 12B emite texto simples na forma que você pedir.
• Contexto — AstaBrief 8B: o teto de posição de 40.960 tokens do modelo base, treinado em 32K. Gemma 4 12B: 256.000 tokens, com um esquema de atenção híbrida que intercala atenção local de janela deslizante (janela de 1024 tokens) com atenção global, e RoPE proporcional nas camadas globais para manter a memória de contexto longo sob controle.
• Treinamento — AstaBrief 8B: ajuste fino supervisionado em 47 mil exemplos de relatórios e, em seguida, cerca de 6 mil pares DPO, em oito H100s. Gemma 4 12B: pré-treinamento geral do Google DeepMind mais ajuste de instrução, documentado em um relatório técnico.
• Tarefa — AstaBrief 8B: uma tarefa, geração de relatórios com citações. Gemma 4 12B: raciocínio, programação, fluxos de trabalho agênticos, chat multilíngue em mais de 140 idiomas.
• Pontuações independentes — Nenhuma para o AstaBrief 8B além das tabelas da própria Ai2. O Gemma 4 12B aparece em rankings públicos, incluindo o Artificial Analysis, onde a família de lançamento é avaliada; esses são números de terceiros e são os únicos neste artigo não fornecidos por um fornecedor.
Leia a linha de contexto como a diferença estrutural, e não como um ponto de ficha técnica. O teto de 40K do AstaBrief 8B não é uma limitação que a Ai2 esteja contornando; é uma consequência do projeto. O modelo nunca mantém um corpus, apenas trechos que outra pessoa selecionou e dimensionou. A janela de 256K do Gemma 4 12B significa que a mesma tarefa pode ser abordada sem nenhuma camada de recuperação — cole um grande volume de material e pergunte —, o que é uma arquitetura genuinamente diferente para o mesmo resultado, e que colapsa dois sistemas em um.
Onde o especialista vence, e por quanto
O argumento da Ai2 em favor do AstaBrief é o relógio, e é um bom argumento. Seu pipeline Thinking com tecnologia Claude teve uma média de 178,5 segundos por relatório; o AstaBrief, ao escrever o relatório inteiro em uma única passagem, tem uma média de 51,1 segundos, cerca de 3,5x mais rápido, e a Ai2 afirma que a simplificação não custou qualidade em suas métricas monitoradas.
A empresa que importa aqui não é a Claude. É a própria estrutura de várias etapas — resumo de snippets, agrupamento temático e escrita seção por seção —, tudo o que a AstaBrief elimina. E essa estrutura é o mesmo trabalho que você, de outro modo, teria de construir por cima de qualquer generalista, incluindo o Gemma 4 12B, se quisesse obter dele um relatório estruturado e com citações. Um generalista a quem se pede "um relatório com citações" produzirá um; conseguir que produza um segundo um esquema fixo, com chaves de citação que correspondam à lista de fontes, é engenharia de prompt que você possui e mantém.
É na alegação de qualidade que você precisa desacelerar.
• Média do SQABench-CS2, divisão de teste (relatada pelo fornecedor) — AstaBrief 8B 87,0, seu próprio checkpoint SFT 83,7, base Qwen3-8B 77,3. 100 perguntas de ciência da computação escritas por usuários.
• DeepScholarBench (reportado pelo fornecedor) — AstaBrief 8B 53,50, atrás do Asta ScholarQA da própria Ai2, com 60,25, e do DR-Tulu-8B, com 56,26.
• Comparação pareada com o pipeline da Ai2 baseado em Claude (relatado pelo fornecedor) — 55% de vitórias no conjunto de desenvolvimento, 72% no de teste.
• Estudo humano (relatado pelo fornecedor) — 14 perguntas de três pesquisadores, DR-Tulu preferido no geral, com dois dos três citando a precisão das citações do AstaBrief.
Não existe pontuação equivalente para o Gemma 4 12B no SQABench-CS2, em nenhuma direção. Essa ausência é o centro honesto desta comparação: você não pode atribuir um número à qualidade dos relatórios do Gemma 4 12B em comparação com a do AstaBrief 8B, porque ninguém submeteu o generalista ao harness da Ai2 e ninguém finge que submeteu. Quem lhe disser que o especialista é "26 pontos melhor" está comparando um número de fornecedor com nada.

Onde o generalista vence de forma decisiva
As vantagens do Gemma 4 12B não são marginais e são fáceis de subestimar.
A primeira é a amplitude. O AstaBrief 8B é um componente que espera receber evidências. O Gemma 4 12B lê capturas de tela, ouve áudio, assiste a vídeos, escreve código e mantém uma conversa de 256K. Se o seu trabalho envolve figuras em artigos, palestras gravadas ou material de origem multimodal, o especialista não pode participar de forma alguma, e a questão está encerrada.
A segunda é que a ampla exposição pública é, em si mesma, uma forma de evidência. O Gemma 4 12B está em rankings de terceiros; a família abrange cinco tamanhos, de E2B a 31B; as variantes ajustadas por instruções e pré-treinadas são ambas publicadas, juntamente com um relatório técnico. Essa é uma proveniência normal, entediante e verificável — que é exatamente o que faltam tanto ao AstaBrief 8B quanto à classe mais ampla de modelos de pesquisa especializados.
O terceiro é o custo prático de uma segunda pilha. Executar o AstaBrief 8B para escrever relatórios, mais um generalista para todo o resto, significa dois modelos residentes, dois formatos de prompt, dois harnesses de avaliação e dois caminhos de atualização. Em uma única placa de 24 GB em BF16, isso não sai de graça — e a ficha do AstaBrief adverte que ele foi ajustado com base em um formato de prompt específico, publicado como um arquivo de conjunto de dados, e que usar um formato diferente pode degradar o comportamento. Um generalista não tem esse tipo de aprisionamento.
• Gemma 4 12B (informado pelo fornecedor) — índice de inteligência 9 na configuração Reasoning; não há um valor comparável para o Gemma nos benchmarks do relatório da Ai2.
• Família Gemma 4 — cinco tamanhos, de E2B a 31B, Apache-2.0, relatório técnico publicado, presença em rankings de terceiros.
• Gemma 4 26B A4B, disponibilizado no nosso catálogo — $0,06 por milhão de tokens de entrada, $0,33 por milhão de saída, janela de contexto de 262.144 tokens. O Gemma 4 31B também está encaminhado, a $0,13 / $0,38.
• Gemma 4 12B, local — 11,95B denso, contexto de 256K, atenção híbrida de janela deslizante e global, janela local de 1024 tokens.
Quanto à disponibilidade, os modelos Gemma 4 são hospedados comercialmente: O Gemma 4 26B A4B é uma rota ativa no nosso catálogo a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de tokens de saída, com uma janela de contexto de 262.144 tokens, e o Gemma 4 31B também está roteado. Isso importa porque significa que você pode avaliar a vertente generalista sem possuir uma GPU. Nenhum provedor no nosso catálogo atende o AstaBrief 8B, incluindo nós — ele é um modelo para baixar e executar, e a maneira honesta de usá-lo é em hardware que você controla, ou dentro do próprio produto Asta da Ai2.
Fazendo a comparação você mesmo, a baixo custo
A decisão que este artigo não pode tomar por você é aquela que você pode tomar em uma tarde, porque o experimento é assimétrico em custo. O AstaBrief 8B precisa de pesos locais e de seu formato de prompt publicado; você pode colocá-lo de pé em uma única placa com vLLM na configuração documentada pela Ai2, temperatura 0,7 e top-p 0,95. O braço generalista pode ser uma chamada hospedada — Gemma 4 26B A4B a US$ 0,06 de entrada e US$ 0,33 de saída por milhão de tokens está suficientemente próximo, em espírito, para calibrar, e você pode apontar sua própria estrutura de avaliação para ambos sem possuir a segunda GPU.
Então meça aquilo que as tabelas dos fornecedores não medem: com as suas perguntas, com os seus trechos, quantos relatórios voltam com a citação correta e quanto tempo toda a cadeia leva depois que você adicionar a cola do esquema de citação ao lado generalista. O 3,5x da Ai2 é medido em relação ao próprio pipeline da Ai2, não em relação ao Gemma 4 12B, e essa diferença vai parecer diferente na sua stack.
Manter o braço generalista atrás de um único endpoint é o que torna isto barato de repetir, em vez de um projeto isolado: uma API para mais de 200 modelos, preço de tabela do provedor repassado com 0% de markup, para que um corte de preço do fornecedor chegue à sua fatura no mesmo dia, failover automático quando um provedor apresenta degradação, e uma DSL de roteamento se você quiser que vários modelos respondam em conjunto. O ponto não é lealdade a um ou outro modelo; é que refazer a comparação no próximo trimestre deve ser uma mudança de configuração, porque estes dois modelos serão substituídos.

Qual deles você deveria realmente baixar
Escolha o AstaBrief 8B se o entregável for um relatório de pesquisa com citações e você tiver uma camada de recuperação alimentando-o. O design de passagem única é uma verdadeira conquista de engenharia, a redução de 3,5x no tempo de geração é a razão pela qual ele existe, o Apache-2.0, além dos dados de treinamento publicados, o torna auditável, e nenhum generalista igualará sua estrutura de saída sem que você mesmo construa e mantenha a estrutura de suporte.
Escolha o Gemma 4 12B se o seu trabalho for mais amplo do que relatórios, se as suas fontes forem multimodais, se 256K de contexto permitir que você pule completamente a criação de uma camada de recuperação, ou se você quiser o modelo que tem pontuações de terceiros atreladas ao seu nome e uma rota hospedada que você pode chamar hoje.
E note a assimetria honesta nas evidências, porque ela pesa contra o especialista: os números do AstaBrief 8B, incluindo os que mais soam bem, vêm da Ai2, descrevem um conjunto de comparação de 2025 que o laboratório diz não ter refeito, e incluem um estudo humano de quatorze perguntas. Os números do Gemma 4 12B vêm de pessoas que não trabalham no Google. Essa diferença de proveniência vale mais do que alguns pontos em um benchmark que ninguém rodou nos dois.
