Um cartão de título principal para 'AstaBrief 8B vs Qwen3-8B: O que um ajuste fino da Ai2 acrescenta ao seu próprio modelo base', nomeando a arquitetura Qwen3 compartilhada e as médias de 87,0 versus 77,3 no SQABench-CS2, com o logotipo da OrcaRouter no canto.
Guides & Insights

AstaBrief 8B vs Qwen3-8B: O que um ajuste fino da Ai2 acrescenta ao seu próprio modelo base

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Não há aqui nenhuma história de arquitetura, e é exatamente esse o ponto. O AstaBrief 8B é um ajuste fino do Qwen/Qwen3-8B, e os dois modelos compartilham uma configuração até a última cabeça de atenção: Qwen3ForCausalLM, 36 camadas, tamanho oculto 4096, 32 cabeças de atenção com 8 cabeças de chave-valor, um vocabulário de 151.936 tokens e um teto de posição de 40.960 tokens. Tudo o que separa o lançamento da Ai2 de 2 de outubro de 2026 da base de abril de 2025 é pós-treinamento. A pergunta interessante, portanto, não é qual é melhor em geral — é o que uma execução de pós-treinamento específica e bem financiada traz para você em cima de um modelo base que você já pode baixar de graça, e o que ela custa em troca.

A resposta da Ai2 é um redator de relatórios que produz uma síntese citada com várias seções em cerca de 51 segundos, contra 178,5 segundos do pipeline baseado em Claude que ela substituiu dentro da plataforma Asta — aproximadamente 3,5x mais rápido, com a Ai2 afirmando que a qualidade dos relatórios se manteve nas métricas que monitorou. A resposta do Qwen3-8B é a de um generalista com modos híbridos de raciocínio e de não raciocínio, mais de cem idiomas e um ano e meio de uso downstream. Ambos são Apache-2.0. A troca é capacidade restrita mais velocidade contra capacidade ampla mais flexibilidade, e os dados abaixo tornam a forma disso bastante concreta.

A linha de arquitetura é um no-op, então o prompt não é.

Como a geometria do checkpoint é idêntica, toda intuição de serving que você tem sobre o Qwen3-8B se transfere inalterada para o AstaBrief 8B. É um 8B denso em BF16, cabe em uma placa de 24GB, serve em vLLM ou Transformers sem kernels personalizados e herda o teto de posição de 40K do modelo base — nenhum dos modelos é um modelo de contexto longo, e a janela treinada de 32K se estende com YaRN exatamente como o modelo base faz. O planejamento de implantação para o fine-tune é o planejamento de implantação para o modelo base. Vale a pena dizer isso claramente porque nem sempre é verdade para fine-tunes, e significa que a única coisa que você está avaliando é o comportamento.

O comportamento é onde mora o lock-in. O card da AstaBrief traz um aviso em negrito: o modelo foi ajustado para um formato específico de prompt, publicado como sft_prompt.txt no conjunto de dados AstaBrief_prompts, e a Ai2 afirma que usar um prompt ou formato de interação diferente pode levar a um comportamento degradado ou inconsistente. Esse prompt não é um template de chat casual. Leia-o e você encontra um contrato rígido — um slot de consulta entre colchetes, um bloco section_references de citações indexadas por identificador, sintaxe explícita de citação que exige que a chave de referência siga a frase à qual dá suporte, um marcador designado para o conhecimento do modelo que não deve ser combinado com outra fonte, e uma instrução para abrir cada seção com um TLDR de duas frases. O Qwen3-8B aceitará qualquer coisa que você digitar. O AstaBrief 8B é ajustado para um formato de entrada e terá desempenho inferior se você lhe fornecer outro.

O que 47.000 exemplos e 6.000 preferências compraram

O ajuste fino é inteiramente pós-treinamento, e a receita é deliberadamente convencional: ajuste fino supervisionado seguido de otimização direta de preferência offline, sem aprendizado por reforço. A Ai2 começou com consultas reais enviadas por meio de seu sistema Asta, filtrou 90.000 prompts voltados à pesquisa por qualidade, relevância e privacidade, gerou alvos de relatório com o pipeline multi-etapas ScholarQA usando Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini e GPT-4.1, e manteve 47.000 exemplos. A etapa de preferência então construiu cerca de 6.000 pares, com GPT-4.1 e DeepSeek-R1 julgando e apenas os pares acordados sobrevivendo.

Medido no SQABench-CS2 — 100 perguntas de pesquisa em ciência da computação escritas por usuários — em comparação com o modelo base, eis o que isso rendeu, com todos os números reportados pelo fornecedor e nenhum reproduzido de forma independente:

• Média geral — AstaBrief 8B 87,0 vs. Qwen3-8B 77,3, um ganho de 9,7 pontos.

• Recall de ingredientes — 90,2 vs 77,8.

• Precisão das citações — 90,5 vs 76,2.

• Recall de citação — 78,2 vs 64,6.

• Precisão das respostas — 89,0 vs 90,6, uma perda de 1,6 ponto em relação à base.

A última linha é a que deve moldar as expectativas. O ajuste fino para a qualidade do relatório não melhorou tudo de forma uniforme; ele trocou um pouco de relevância por parágrafo por grandes ganhos em cobertura e fundamentação em citações. Se sua tarefa recompensa parágrafos relevantes acima de tudo, o modelo base não é obviamente a pior escolha, e o ajuste fino não é automaticamente sua resposta.

Duas outras coisas que o dinheiro não comprou. O AstaBrief 8B não tem pontuação relatada no DeepScholarBench acima das próprias alternativas da Ai2 — seus 53,50 ficam atrás do Asta ScholarQA, com 60,25, e do DR-Tulu-8B, com 56,26 — e sua validação humana é composta por catorze perguntas de três pesquisadores, nas quais o DR-Tulu venceu em preferência geral. Um modelo especializado pode perder para um modelo de pesquisa de propósito geral no próprio benchmark do especialista, e a Ai2 publicou isso.

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

O que a base ainda faz melhor

A comparação não é unidirecional, e é fácil subestimar o seu lado generalista.

O Qwen3-8B vem com modos híbridos de pensamento e não-pensamento, portanto pode gastar tokens em raciocínio quando um problema justifica isso e responder diretamente quando não justifica. O AstaBrief 8B foi treinado para escrita de relatórios em uma única tentativa e não herda nenhum desse comportamento de raciocínio deliberado como um recurso do produto. O Qwen3-8B também carrega a cobertura multilíngue da base — mais de cem idiomas — enquanto o AstaBrief foi treinado em um corpus explicitamente filtrado para consultas científicas em inglês, então sua competência fora dessa área é desconhecida em vez de meramente não testada.

Depois, há a superfície de instrução. Um generalista é o que você quer quando a tarefa vai mudar na próxima semana, quando você precisa de chamada de ferramentas, quando o esquema de saída é seu, e não da Ai2, ou quando você está fazendo um protótipo e ainda não sabe como será o prompt final. E, sobre a questão crua da procedência — aquela que importa quando alguém pergunta por que você confia no modelo —, o Qwen3-8B teve mais de onze milhões de downloads e um ano e meio de uso independente. O AstaBrief 8B teve uma semana de lançamento.

O que o AstaBrief 8B tem que o modelo base não consegue igualar é a disciplina de citações. Precisão e recall de citações são as duas métricas em que a vantagem do ajuste fino é maior e mais consistente com a história de treinamento — o filtro único mais forte no pipeline de dados da Ai2 era a densidade de citações, a proporção de afirmações que continham pelo menos uma citação, e o modelo resultante reflete essa prioridade. Fazer um generalista citar em linha num formato de chave fixo, de forma confiável, sem abandonar o suporte às afirmações, é engenharia de prompt que você escreve e mantém. O ajuste fino da Ai2 faz disso o comportamento padrão do modelo.

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

A linha Qwen evoluiu desde abril de 2025.

Mais uma complicação, e é uma complicação prática: o Qwen3-8B tem um ano e meio, e comparar um novo ajuste fino com ele não é o mesmo que compará-lo com um incumbente viável.

A linha do Qwen agora passa por Qwen3.5, Qwen3.6, Qwen3.7 e Qwen3.8, e a geração atual pode ser acessada sem baixar nada. O Qwen3.8 27B é uma rota ativa em nosso catálogo com uma janela de contexto de 262.144 tokens a $0,33 por milhão de tokens de entrada e $2,40 por milhão de saída; o Qwen3.8 Flash traz uma janela de um milhão de tokens a $0,15 e $0,47; o Qwen3 VL 8B Instruct cobre o caso multimodal a $0,18 e $0,70 por milhão com uma janela de 131.072 tokens e está roteado desde outubro de 2025. O próprio Qwen3-8B não é uma rota que servimos, e o AstaBrief 8B também não — ambos são pesos de baixar e executar, e a colocação honesta é que a base pertence ao seu hardware e a geração moderna do Qwen não precisa.

Isso te dá um terceiro braço para a avaliação que a Ai2 não conseguiu executar. Coloque o AstaBrief 8B na sua própria GPU, suba a base Qwen3-8B ao lado dele para confirmar os deltas relatados e aponte o mesmo harness para um modelo Qwen3.8 hospedado, para ganhar escala. Os três braços estão a um endpoint de distância, e é isso que faz disso um exercício de configuração, e não um projeto de aquisição — uma única API para mais de 200 modelos, preço de tabela do provedor repassado com 0% de markup, para que um corte de preço do fornecedor esteja ativo do seu lado no mesmo dia, failover automático, e uma DSL de roteamento caso você queira vários modelos respondendo a uma mesma pergunta em conjunto. Os braços auto-hospedados permanecem auto-hospedados pelos motivos de sensibilidade de dados; tudo o que é hospedado permanece intercambiável, o que importa quando a próxima geração do Qwen for lançada em um trimestre.

Como decidir

Escolha o AstaBrief 8B se o seu produto for síntese de literatura com citações e você quiser que o comportamento de citação seja o padrão do modelo, em vez de responsabilidade do seu prompt. A geometria do modelo base significa zero surpresas de serving, a licença Apache-2.0 e as misturas SFT e DPO publicadas tornam-no auditável, e sua liderança em precisão e recall de citações é o maior e mais explicável resultado nas tabelas da Ai2.

Fique no Qwen3-8B, ou mude para um Qwen3.x atual, se suas tarefas forem variadas, se você precisar de modo de pensamento ou ferramentas ou cobertura multilíngue, se ainda estiver explorando o prompt, ou se preferir não ficar preso a um bloco de instruções de dezesseis mil caracteres que você não escreveu. A base perdeu em cobertura e fundamentação em citações, não em relevância, e manteve algo de que o ajuste fino abriu mão.

O que se deve evitar é tratar a média de 87,0 contra 77,3 como a história completa. A própria tabela da Ai2 mostra que o ajuste fino abre mão da precisão das respostas para ganhar disciplina de citações, as próprias notas de laboratório dela observam que a maior parte do treinamento e da avaliação foi concluída em 2025 e não foi executada novamente contra a fronteira atual, e o modelo base que ele aprimora já não é a geração que você escolheria para qualquer coisa, exceto para esta comparação. O que o ajuste fino comprovadamente acrescenta é um formato de saída; se esse formato vale a estreiteza depende inteiramente de ele corresponder ao formato do seu produto.