Um cartão de título de destaque para o artigo 'AstaBrief 8B: O gerador de relatórios aberto da Ai2 é 3,5x mais rápido que o pipeline que substitui', identificado com o tempo de 51,1 s versus 178,5 s, a licença Apache-2.0 e a base Qwen3-8B, com o logotipo da OrcaRouter no canto.
Guides & Insights

AstaBrief 8B: o Open Report Writer da Ai2 roda 3,5x mais rápido que o pipeline que substitui

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O número de destaque do anúncio do AstaBrief 8B da Ai2 é uma medição de cronômetro, não uma pontuação de benchmark: em todo o pipeline Asta, o novo modelo leva, em média, 51,1 segundos para gerar um relatório de pesquisa com citações, contra 178,5 segundos do caminho baseado em Claude ao lado do qual agora se encontra. Isso é cerca de 3,5 vezes mais rápido, e decorre de uma única decisão arquitetural — escrever o relatório inteiro em uma única passada, em vez de resumir, agrupar e depois escrever seção por seção. O AstaBrief 8B é um modelo de pesos abertos de 8B, licenciado sob Apache-2.0, com fine-tuning a partir do Qwen3-8B, que recebe uma pergunta de pesquisa mais trechos de literatura recuperados e retorna um relatório com citações embutidas. Ele foi lançado na plataforma Asta da Ai2 como “Fast mode” em 2026-10-02, e os pesos, os dados de treinamento e um exemplo de fluxo de trabalho local se tornaram públicos no mesmo dia.

O repositório é mais antigo que o anúncio, e isso importa.

Um detalhe neste lançamento vale ser dito sem rodeios, porque muda a forma como você deve ler todo o resto: o repositório do Hugging Face em allenai/AstaBrief_8B carrega um carimbo de data e hora interno de criação de 2026-02-09, e o conjunto de dados DPO associado é de novembro de 2025. O anúncio de 2 de outubro é real — a postagem no blog, o tuíte da AI2 e o model card foram publicados naquele dia —, mas o histórico do repositório é mais longo do que o ciclo de notícias sugere.

O que aconteceu em 2 de outubro foi que a Ai2 lançou e documentou o item, e mexeu no repositório para ficar de acordo: três commits chegaram ao cartão do modelo entre 16:18:06 e 16:18:20 UTC no dia do lançamento, adicionando um template de resposta ao template de chat e removendo um token no-op. Isso é manutenção no cartão, não um novo treinamento. A Ai2 também deixa explícito no blog que "a maior parte do treinamento e da avaliação descritos foi concluída em 2025" e que os modelos proprietários usados para gerar dados de treinamento e como pontos de comparação "refletem a fronteira da época". O laboratório afirma que não executou novamente a avaliação completa contra os modelos de fronteira atuais.

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

Portanto, esta é uma versão GA de um trabalho que ficou em grande parte concluído em 2025 — um lançamento, com a documentação de um lançamento e a integração de plataforma de um lançamento, sobre um checkpoint que existe na conta do laboratório há meses. Nada nisso é desonesto, e o modelo é novo para todos fora da Ai2. Mas isso significa que os números de comparação abaixo descrevem uma fronteira de 2025, e a própria Ai2 o afirma.

O que AstaBrief 8B realmente faz

A plataforma Asta da Ai2 tem um recurso de geração de relatórios em que pesquisadores trazem uma pergunta substancial e um conjunto de literatura e recebem de volta uma síntese com citações que tratam como um artefato de trabalho. Esse recurso antes era executado inteiramente no que a Ai2 chama de Thinking mode: um pipeline de várias etapas que resume trechos recuperados, agrupa-os por tema e escreve a resposta seção por seção, com suporte de modelos Claude. O Thinking mode é minucioso e lento.

AstaBrief 8B é o modo Fast. Dada a mesma pergunta e os mesmos trechos recuperados, ele escreve o relatório final em uma única passagem direta. A afirmação da Ai2 é a parte interessante: ignorar a sumarização de trechos, o agrupamento e o loop seção por seção não custou qualidade ao relatório, pelo menos nas métricas que o laboratório acompanhou. O modelo não é um mecanismo de busca e não recupera — ele é o redator no fim de um pipeline de recuperação, e espera receber as evidências.

Isso o torna um componente em vez de um produto. É também por isso que a Ai2 disponibilizou um fluxo de trabalho de exemplo junto com os pesos: uma pequena biblioteca que transforma seus próprios PDFs em relatórios, no repositório ai2-scholarqa-lib, oferece um ponto de partida para a geração local.

A receita de treinamento é deliberadamente entediante, e é exatamente essa a questão.

O trabalho anterior da própria Ai2, DR Tulu, mostrou que o aprendizado por reforço pode melhorar a geração de relatórios de formato longo em modelos de pesos abertos. Para o AstaBrief, a equipe considerou esse caminho e optou por não segui-lo, com base no fato de que o RL é instável e caro, e eles queriam algo mais fácil de depurar. O que eles construíram, em vez disso, é ajuste fino supervisionado seguido de otimização direta de preferência offline. Duas etapas, ambas convencionais.

A etapa de SFT começou a partir de consultas reais enviadas por meio do sistema Asta da Ai2, em vez de prompts sintéticos. A partir dos logs coletados, a equipe filtrou por qualidade, relevância e privacidade — removendo tráfego de bots e de testadores beta, descartando consultas curtas demais para serem significativas e executando uma passagem de LLM para capturar consultas que não estavam em inglês, solicitações não científicas e prompts contendo informações pessoais. Isso deixou um conjunto de 90.000 consultas com foco em pesquisa. Os alvos de relatório completo para essas consultas foram gerados com o pipeline ScholarQA de várias etapas, usando Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT-4.1 como modelos de suporte. Após a filtragem de qualidade: 47.000 exemplos de treinamento utilizáveis.

A etapa de DPO precisava de algo diferente — pares de relatórios com uma preferência entre eles. Um relatório por consulta vinha do pipeline do ScholarQA; o relatório concorrente vinha de alimentar os trechos recuperados pelo ScholarQA a um modelo diferente, escolhido entre o3, o4-mini, DeepSeek-V3 ou DeepSeek-R1. Dois juízes, GPT-4.1 e DeepSeek-R1, escolhiam um vencedor para cada par, e só sobreviviam os pares em que ambos os juízes concordavam. A Ai2 relata 95% de concordância entre os juízes LLM e as preferências humanas. O conjunto final de preferências chegou a aproximadamente 6.000 exemplos. Tanto a mistura de SFT quanto a de DPO estão no Hugging Face para inspeção.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

A descoberta mais transferível também é a menos glamorosa. As primeiras execuções de SFT produziram relatórios melhores, mas ficaram atrás na precisão das respostas e na qualidade das citações, então a equipe testou quatro filtros baseados em estatísticas nos dados de treinamento sintéticos: proporção de tokens entre saída e entrada, relevância média de recuperação dos artigos citados, densidade de citações (a proporção de declarações que contêm pelo menos uma citação) e diversidade de citações. Os ganhos mais fortes vieram de filtrar relatórios sintéticos com baixa densidade de citações — e filtragem mais agressiva, combinações de filtros e varreduras de taxa de aprendizado não acrescentaram ganhos significativos. A conclusão da Ai2 vale a pena levar além deste modelo: a especialização não foi uma questão de despejar mais texto científico no pré-treinamento, mas sim da composição e qualidade dos dados de pós-treinamento.

O placar que a Ai2 publicou, e como interpretá-lo

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

Todos os números abaixo são informados pelo fornecedor. Eles vêm do model card e do blog da Ai2, produzidos pelo próprio harness de avaliação do laboratório, e nada disso foi reproduzido de forma independente. O principal alvo era o SQABench-CS2, um conjunto de 100 perguntas de pesquisa em ciência da computação escritas por usuários, avaliado por quatro métricas: recall de ingredientes (cobertura do conteúdo necessário), precisão da resposta (se cada parágrafo é relevante), precisão das citações (se cada citação sustenta sua afirmação) e recall das citações (se as afirmações são totalmente sustentadas pelas citações fornecidas).

• Média geral — AstaBrief 8B 87,0, seu próprio checkpoint SFT 83,7, Qwen3-8B base 77,3

• Recall de ingredientes — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8

• Precisão da resposta — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6

• Precisão de citação — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2

• Recall de citações — AstaBrief 8B 78,2, SFT 71,3, Qwen3-8B 64,6

Leia as linhas em conjunto e a etapa DPO parece direcionada, em vez de uniformemente melhor. A média geral aumenta, o recall de ingredientes e ambas as métricas de citação sobem acentuadamente, e a precisão das respostas fica ligeiramente abaixo tanto do checkpoint SFT quanto do modelo base. Se o seu caso de uso for relevância por parágrafo acima de tudo, o ajuste fino não é automaticamente a sua resposta.

Em avaliações secundárias, a Ai2 testou o modelo final contra seu próprio pipeline ScholarQA e contra o DR-Tulu-8B. No dev do SQABench-CS2, o Asta ScholarQA marcou 87,6, o DR-Tulu-8B 86,5 e o AstaBrief 8B 86,3; na divisão de teste, o ScholarQA 86,2, o DR-Tulu-8B 88,8 e o AstaBrief 87,0. No DeepScholarBench, um benchmark de síntese de formato longo com 63 consultas, o ScholarQA marcou 60,25, o DR-Tulu-8B 56,26 e o AstaBrief 53,50 — a única linha em que o redator de relatórios aberto fica atrás das duas alternativas. Em duas comparações pareadas julgadas por LLM contra o pipeline baseado em Claude, o AstaBrief ficou com 55% das comparações de dev e 72% das comparações de teste. Um estudo humano separado abrangeu apenas 14 perguntas de três pesquisadores e, na preferência geral, o DR-Tulu venceu, embora dois dos três pesquisadores tenham preferido o AstaBrief em precisão de citações. Quatorze perguntas de três pessoas são um sinal, não um veredito, e a Ai2 apresenta isso dessa forma.

O laboratório também publicou dados iniciais de uso da integração Asta: entre 374 usuários que experimentaram o modo Fast, 29,1% o usaram em dois ou mais dias, os usuários geraram em média 3,67 threads de relatório, 23% nunca voltaram ao modo Thinking, e 18% alternaram entre os dois modos dependendo da tarefa. O feedback positivo chegou a 84,2% para o modo Fast, contra 85,2% para o modo Thinking — próximo o suficiente para que a Ai2 caracterize o feedback como esparso demais para se tirar conclusões fortes. Esse é o enquadramento honesto, então mantenha-o.

Executando você mesmo

AstaBrief 8B é Apache-2.0 e baseado em Qwen/Qwen3-8B, então fica na classe de GPU única, e não na classe de datacenter: um modelo denso de 8B na arquitetura Qwen3, 36 camadas, tamanho oculto 4096, 32 cabeças de atenção com 8 cabeças de chave-valor, um vocabulário de 151.936 tokens e o limite de posição de 40.960 tokens da base. Em BF16, cabe confortavelmente em uma placa de 24 GB, e o próprio exemplo da placa usa vLLM com temperatura 0,7, top-p 0,95 e um limite de saída de 4096 tokens.

Um aviso operacional está impresso em negrito no cartão do modelo e é fácil de passar despercebido: o checkpoint passou por fine-tuning para um formato de prompt específico, publicado como sft_prompt.txt no conjunto de dados AstaBrief_prompts. Use um prompt ou formato de interação diferente e a Ai2 espera comportamento degradado ou inconsistente. Se você avaliar este modelo com seu próprio harness e obtiver resultados ruins, verifique o prompt antes de concluir qualquer coisa sobre os pesos.

O cartão também é franco quanto ao escopo. O AstaBrief destina-se a pesquisa e uso educacional, não como um assistente de propósito geral, e não há endpoint de inferência hospedado da Ai2 — você o baixa ou o utiliza dentro do Asta. Nenhum provedor em nosso catálogo o oferece, inclusive nós, portanto não há rota para a qual apontar; a maneira honesta de usá-lo é em seu próprio hardware ou atrás de seu próprio firewall, que é precisamente o argumento que a Ai2 defende para pesos abertos desde o princípio.

Onde um roteador se encaixa em um pipeline de relatórios

O AstaBrief ocupa um único slot numa cadeia mais longa. Algo recupera a literatura, algo decide quais trechos vale a pena transmitir e algo pode julgar ou verificar o relatório final. Essas chamadas são chamadas comuns a modelos hospedados, e são a parte da stack em que você realmente quer poder escolher fornecedores: uma API que abrange mais de 200 modelos, preço de tabela do fornecedor repassado com 0% de margem para que um corte de preço de um fornecedor apareça na sua fatura no mesmo dia, failover automático se um fornecedor degradar, e uma DSL de roteamento se você quiser compor vários modelos numa única chamada. Faça auto-hospedagem do gerador, porque é essa a parte com implicações de sensibilidade de dados e custo fixo; encaminhe a orquestração, porque é essa a parte em que a flexibilidade vale mais do que a propriedade.

Há também um experimento barato aqui. O próprio conjunto de comparação da Ai2 é Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT-4.1 — deliberadamente uma fronteira de 2025, e o laboratório diz que não o reexecutou. Colocar a saída do AstaBrief ao lado dos modelos hospedados atuais nas suas próprias perguntas é um exercício de uma tecla se ambos os braços forem acessíveis pelo mesmo endpoint, e responde à pergunta que o post do blog deixa em aberto.

O que mudaria o cenário?

Três coisas transformariam isto de um lançamento bem documentado em um resultado consolidado. Uma reprodução independente dos números do SQABench-CS2, já que todos os números acima são autorrelatados. Uma nova execução contra modelos de fronteira atuais, já que o conjunto de comparação está desatualizado há um ano, por admissão do próprio laboratório. E uma avaliação humana maior do que catorze perguntas de três pesquisadores — o próprio blog da Ai2 termina argumentando que o campo precisa de avaliações que vão além do suporte de citações para perguntar se um modelo preserva o escopo probatório de suas fontes, inclusive se ele silenciosamente transforma achados específicos de amostras em generalizações amplas. Essa é uma crítica justa a toda a categoria de avaliação, e também se aplica a este lançamento.

Por ora, a leitura prática é simples. Se você gera relatórios com citações a partir da literatura e quer o modelo de escrita no seu próprio hardware, sob uma licença Apache-2.0, com os dados de treinamento abertos, o AstaBrief 8B é a opção aberta mais diretamente concebida para esse fim já publicada por alguém, e a redução de 3,5x no tempo de execução é a razão de sua existência. Se o seu trabalho depende da síntese mais precisa possível, note que a própria tabela da Ai2 coloca o DR-Tulu à frente na preferência humana geral e o ScholarQA à frente no DeepScholarBench — e que o modo Thinking continua lá, no mesmo produto, exatamente por esse motivo.