Une carte de titre principale pour l'article « AstaBrief 8B : le rédacteur de rapports open source d'Ai2 fonctionne 3,5 fois plus vite que le pipeline qu'il remplace », annotée avec les temps de 51,1 s contre 178,5 s, la licence Apache-2.0 et la base Qwen3-8B, avec le logo OrcaRouter dans le coin.
Guides & Insights

AstaBrief 8B : l’Open Report Writer d’Ai2 s’exécute 3,5 fois plus vite que le pipeline qu’il remplace.

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le chiffre phare de l'annonce d'AstaBrief 8B par Ai2 est un temps au chronomètre, pas un score de benchmark : sur l'ensemble du pipeline Asta, le nouveau modèle génère un rapport de recherche cité en 51,1 secondes en moyenne, contre 178,5 secondes pour la voie propulsée par Claude à côté de laquelle il se trouve désormais. C'est environ 3,5 fois plus rapide, et cela découle d'une seule décision architecturale — rédiger le rapport entier en une seule passe au lieu de résumer, regrouper, puis écrire section par section. AstaBrief 8B est un modèle open-weights de 8B, sous licence Apache-2.0, affiné à partir de Qwen3-8B, qui prend une question de recherche ainsi que des extraits de littérature récupérés et renvoie un rapport avec des citations en ligne. Il a été intégré à la plateforme Asta d'Ai2 sous le nom de « Fast mode » le 2 octobre 2026, et les poids, les données d'entraînement ainsi qu'un exemple de workflow local ont été rendus publics le jour même.

Le dépôt est plus ancien que l'annonce, et cela compte

Un détail dans cette version mérite d’être dit clairement, car il change la façon dont vous devriez lire tout le reste : le dépôt Hugging Face à allenai/AstaBrief_8B porte un horodatage de création interne du 2026-02-09, et le jeu de données DPO associé date de novembre 2025. L’annonce du 2 octobre est réelle — l’article de blog, le tweet d’AI2 et la fiche du modèle ont tous été publiés ce jour-là — mais l’historique du dépôt est plus long que ne le suggère le cycle médiatique.

Ce qui s'est passé le 2 octobre, c'est qu'Ai2 a livré et documenté la chose, et a modifié le dépôt en conséquence : trois commits ont été appliqués à la fiche du modèle entre 16:18:06 et 16:18:20 UTC le jour de la sortie, ajoutant un gabarit de réponse au gabarit de chat et supprimant un jeton sans effet. Il s'agit d'entretien courant sur une fiche, pas d'un réentraînement. Ai2 précise aussi explicitement dans le blog que « la majeure partie de l'entraînement et de l'évaluation décrits a été réalisée en 2025 », et que les modèles propriétaires utilisés pour générer les données d'entraînement et comme points de comparaison « reflètent la frontière de l'époque ». Le laboratoire indique qu'il n'a pas relancé l'évaluation complète face aux modèles de frontière actuels.

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

Il s'agit donc d'une version GA d'un travail largement achevé en 2025 — un lancement, avec la documentation d'un lancement et l'intégration à la plateforme d'un lancement, par-dessus un checkpoint qui existe dans le compte du laboratoire depuis des mois. Rien là-dedans n'est malhonnête, et le modèle est nouveau pour tout le monde en dehors d'Ai2. Mais cela signifie que les chiffres de comparaison ci-dessous décrivent une frontière de 2025, et Ai2 le dit elle-même.

Ce que fait réellement AstaBrief 8B

La plateforme Asta d'Ai2 propose une fonctionnalité de génération de rapports dans laquelle les chercheurs apportent une question substantielle et un corpus de littérature, et reçoivent en retour une synthèse qu'ils considèrent comme un document de travail. Cette fonctionnalité s'appuyait auparavant entièrement sur ce qu'Ai2 appelle le mode Thinking : un pipeline multi-étapes qui résume les extraits récupérés, les regroupe par thème et rédige la réponse section par section, avec le soutien des modèles Claude. Le mode Thinking est minutieux et lent.

AstaBrief 8B est le mode Fast. Face à la même question et aux mêmes extraits récupérés, il rédige le rapport final en une seule passe avant. La revendication d’Ai2 est la partie intéressante : contourner le résumé des extraits, le clustering et la boucle section par section n’a pas nui à la qualité du rapport, du moins selon les mesures suivies par le laboratoire. Le modèle n’est pas un moteur de recherche et il n’effectue pas de récupération — il est le rédacteur à la fin d’un pipeline de récupération, et il s’attend à ce qu’on lui remette les preuves.

Cela en fait un composant plutôt qu'un produit. C'est aussi pourquoi Ai2 a livré un exemple de workflow aux côtés des poids : une petite bibliothèque qui transforme vos propres PDF en rapports, dans le dépôt ai2-scholarqa-lib, vous donne un point de départ pour la génération locale.

La recette d'entraînement est volontairement ennuyeuse, et c'est tout l'intérêt.

Les travaux antérieurs d’Ai2, DR Tulu, ont montré que l’apprentissage par renforcement peut améliorer la génération de rapports longs dans les modèles à poids ouverts. Pour AstaBrief, l’équipe a envisagé cette voie et a choisi de ne pas la suivre, au motif que l’apprentissage par renforcement est instable et coûteux et qu’elle voulait quelque chose de plus facile à déboguer. Ce qu’elle a construit à la place est un affinage supervisé suivi d’une optimisation directe des préférences hors ligne. Deux étapes, toutes deux conventionnelles.

L’étape SFT a démarré à partir de requêtes réelles soumises via le système Asta d’Ai2 plutôt que de prompts synthétiques. À partir des journaux collectés, l’équipe a appliqué un filtrage fondé sur la qualité, la pertinence et la confidentialité — en supprimant le trafic des bots et des bêta-testeurs, en écartant les requêtes trop courtes pour être significatives, et en exécutant une passe LLM pour repérer les requêtes non anglaises, les demandes non scientifiques et les prompts contenant des informations personnelles. Il en est resté un ensemble de 90 000 requêtes axées sur la recherche. Les cibles de rapports complets pour ces requêtes ont été générées avec le pipeline ScholarQA à plusieurs étapes, en utilisant Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini et GPT-4.1 comme modèles de base. Après filtrage qualité : 47 000 exemples d’entraînement utilisables.

L'étape DPO nécessitait quelque chose de différent — des paires de rapports avec une préférence entre eux. Un rapport par requête provenait du pipeline ScholarQA ; le rapport concurrent provenait de l'alimentation d'un modèle différent avec les extraits récupérés par ScholarQA, choisi parmi o3, o4-mini, DeepSeek-V3 ou DeepSeek-R1. Deux juges, GPT-4.1 et DeepSeek-R1, ont choisi un gagnant pour chaque paire, et seules les paires pour lesquelles les deux juges étaient d'accord ont survécu. Ai2 rapporte un taux d'accord de 95 % entre les juges LLM et les préférences humaines. L'ensemble de préférences final totalisait environ 6 000 exemples. Le mélange SFT et le mélange DPO sont tous deux disponibles sur Hugging Face pour inspection.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

Le résultat le plus transférable est aussi le moins spectaculaire. Les premières exécutions de SFT rédigeaient de meilleurs rapports, mais étaient à la traîne sur la précision des réponses et la qualité des citations ; l’équipe a donc testé quatre filtres statistiques sur les données d’entraînement synthétiques : le ratio de tokens entre sortie et entrée, la pertinence moyenne de récupération des articles cités, la densité de citations (la part des affirmations comportant au moins une citation) et la diversité des citations. Les gains les plus forts sont venus de l’élimination des rapports synthétiques à faible densité de citations — et un filtrage plus agressif, des combinaisons de filtres et des balayages de taux d’apprentissage n’ont pas apporté de gains notables. La conclusion d’Ai2 mérite d’être reprise au-delà de ce modèle : la spécialisation ne consistait pas à déverser davantage de texte scientifique dans le pré-entraînement, mais relevait de la composition et de la qualité des données de post-entraînement.

Le tableau des scores publié par Ai2, et comment le lire

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

Chaque chiffre ci-dessous est déclaré par le fournisseur. Il provient de la fiche modèle et du blog d’Ai2, produits par le propre harnais d’évaluation du laboratoire, et aucun n’a été reproduit indépendamment. La cible principale était SQABench-CS2, un ensemble de 100 questions de recherche en informatique rédigées par des utilisateurs, évalué selon quatre métriques : le rappel des ingrédients (couverture du contenu nécessaire), la précision des réponses (pertinence de chaque paragraphe), la précision des citations (si chaque citation étaye son affirmation) et le rappel des citations (si les affirmations sont pleinement étayées par les citations fournies).

• Moyenne globale — AstaBrief 8B 87,0, son propre checkpoint SFT 83,7, Qwen3-8B de base 77,3

• Rappel des ingrédients — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8

• Précision des réponses — AstaBrief 8B 89,0, SFT 90,4, Qwen3-8B 90,6

• Précision des citations — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2

• Rappel des citations — AstaBrief 8B 78,2, SFT 71,3, Qwen3-8B 64,6

Lisez les lignes ensemble et l’étape DPO apparaît ciblée plutôt qu’uniformément meilleure. La moyenne globale augmente, le rappel des ingrédients et les deux métriques de citation augmentent fortement, tandis que la précision des réponses tombe légèrement en dessous à la fois du checkpoint SFT et du modèle de base. Si votre cas d’usage est la pertinence par paragraphe avant tout, le fine-tune n’est pas automatiquement votre réponse.

Lors d'évaluations secondaires, Ai2 a testé le modèle final par rapport à son propre pipeline ScholarQA et à DR-Tulu-8B. Sur SQABench-CS2 dev, Asta ScholarQA a obtenu 87,6, DR-Tulu-8B 86,5, et AstaBrief 8B 86,3 ; sur le split de test, ScholarQA 86,2, DR-Tulu-8B 88,8, AstaBrief 87,0. Sur DeepScholarBench, un benchmark de synthèse de forme longue de 63 requêtes, ScholarQA a obtenu 60,25, DR-Tulu-8B 56,26, et AstaBrief 53,50 — la seule ligne où le rédacteur de rapports ouverts est en retrait par rapport aux deux alternatives. Dans deux comparaisons par paires jugées par LLM face au pipeline propulsé par Claude, AstaBrief a remporté 55 % des comparaisons sur le dev et 72 % des comparaisons sur le test. Une étude humaine distincte n’a couvert que 14 questions de trois chercheurs, et pour la préférence globale, DR-Tulu l’a emporté, bien que deux des trois chercheurs aient préféré AstaBrief pour l’exactitude des citations. Quatorze questions émanant de trois personnes, c’est un signal, pas un verdict, et Ai2 le présente comme tel.

Le laboratoire a aussi publié les premières données d'usage de l'intégration Asta : parmi les 374 utilisateurs ayant essayé Fast mode, 29,1 % l'ont utilisé au moins deux jours, les utilisateurs ont généré en moyenne 3,67 fils de rapports, 23 % ne sont jamais revenus à Thinking mode, et 18 % passaient d'un mode à l'autre selon la tâche. Les retours positifs atteignent 84,2 % pour Fast mode contre 85,2 % pour Thinking mode — des chiffres assez proches pour qu'Ai2 qualifie ces retours de trop rares pour en tirer des conclusions solides. C'est le cadrage honnête, donc à conserver.

L'exécuter vous-même

AstaBrief 8B est sous licence Apache-2.0 et repose sur Qwen/Qwen3-8B, ce qui le place dans la catégorie des modèles à GPU unique plutôt que dans celle des modèles de centre de données : un modèle dense de 8B sur l’architecture Qwen3, 36 couches, une taille cachée de 4096, 32 têtes d’attention avec 8 têtes clé-valeur, un vocabulaire de 151 936 jetons et le plafond de position de 40 960 jetons du modèle de base. En BF16, il tient confortablement sur une carte de 24 Go, et l’exemple propre à la carte utilise vLLM avec une température de 0,7, un top-p de 0,95 et un plafond de sortie de 4096 jetons.

Un avertissement opérationnel est imprimé en gras sur la fiche du modèle et est facile à négliger : le checkpoint a été affiné sur un format de prompt spécifique, publié sous le nom sft_prompt.txt dans le jeu de données AstaBrief_prompts. Utilisez un autre prompt ou un autre format d'interaction, et Ai2 s'attend à un comportement dégradé ou incohérent. Si vous évaluez ce modèle avec votre propre harnais et obtenez de mauvais résultats, vérifiez le prompt avant de conclure quoi que ce soit sur les poids.

La fiche est également franche sur son périmètre. AstaBrief est destiné à des fins de recherche et d’éducation, et non à servir d’assistant polyvalent, et il n’existe aucun point de terminaison d’inférence hébergé par Ai2 — vous le téléchargez, ou vous l’utilisez dans Asta. Aucun fournisseur de notre catalogue ne le sert, y compris nous, donc il n’y a aucune route vers laquelle pointer ; la façon honnête de l’utiliser est sur votre propre matériel ou derrière votre propre pare-feu, ce qui est précisément l’argument qu’Ai2 avance en faveur des poids ouverts depuis le début.

Où un routeur s’intègre dans un pipeline de rapports

AstaBrief occupe un emplacement dans une chaîne plus longue. Quelque chose récupère la littérature, quelque chose décide quels extraits méritent d'être transmis, et quelque chose peut évaluer ou vérifier le rapport final. Ces appels sont des appels ordinaires à des modèles hébergés, et c'est la partie de la pile où vous voulez vraiment pouvoir choisir vos fournisseurs : une API couvrant plus de 200 modèles, le prix catalogue du fournisseur répercuté avec 0 % de marge afin qu'une baisse de prix d'un fournisseur apparaisse sur votre facture le jour même, un basculement automatique en cas de dégradation d'un fournisseur, et un DSL de routage si vous souhaitez composer plusieurs modèles en un seul appel. Hébergez vous-même le rédacteur, car c'est la partie qui comporte des implications en matière de sensibilité des données et un coût fixe ; routez l'orchestration, car c'est la partie où la flexibilité vaut plus que la propriété.

Il y a aussi une expérience peu coûteuse à faire ici. L'ensemble de comparaison d'Ai2 est composé de Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini et GPT-4.1 — délibérément des modèles de pointe de 2025 — et le laboratoire indique qu'il ne l'a pas relancé. Mettre la sortie d'AstaBrief à côté des modèles hébergés actuels sur vos propres questions est un exercice en une seule touche si les deux bras sont accessibles via le même point de terminaison, et cela répond à la question que l'article de blog laisse ouverte.

Qu'est-ce qui changerait la donne

Trois choses permettraient de faire passer cela d'un lancement bien documenté à un résultat établi. Une reproduction indépendante des chiffres de SQABench-CS2, puisque chaque chiffre ci-dessus est auto-déclaré. Une nouvelle exécution face aux modèles de pointe actuels, puisque l'ensemble de comparaison a un an de retard, de l'aveu même du laboratoire. Et une évaluation humaine plus vaste que quatorze questions posées par trois chercheurs — le blog d'Ai2 lui-même se termine en soutenant que le domaine a besoin d'évaluations qui vont au-delà du simple appui des citations pour demander si un modèle préserve la portée probatoire de ses sources, y compris s'il transforme discrètement des résultats propres à un échantillon en généralisations larges. C'est une critique juste de toute la catégorie des évaluations, et elle s'applique aussi à cette publication.

Pour le moment, le constat pratique est simple. Si vous générez des rapports cités à partir de la littérature et que vous voulez le rédacteur sur votre propre matériel, sous licence Apache-2.0, avec les données d'entraînement ouvertes, AstaBrief 8B est l'option ouverte la plus directement conçue pour cet usage que quiconque ait publiée, et la réduction de 3,5x du temps réel est la raison de son existence. Si votre travail dépend de la synthèse la plus pointue possible, notez que le tableau d'Ai2 lui-même place DR-Tulu en tête sur la préférence humaine globale et ScholarQA en tête sur DeepScholarBench — et que le mode Thinking est toujours là, dans le même produit, exactement pour cette raison.