Une carte de titre principale pour « AstaBrief 8B vs Qwen3-8B : ce qu'un fine-tuning Ai2 apporte à son propre modèle de base », nommant l'architecture Qwen3 partagée et les moyennes SQABench-CS2 de 87,0 contre 77,3, avec le logo OrcaRouter dans le coin.
Guides & Insights

AstaBrief 8B vs Qwen3-8B : ce qu'un fine-tuning d'Ai2 ajoute à son propre modèle de base

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il n'y a pas d'histoire d'architecture ici, et c'est justement là l'essentiel. AstaBrief 8B est un fine-tuning de Qwen/Qwen3-8B, et les deux modèles partagent une configuration jusque dans la dernière tête d'attention : Qwen3ForCausalLM, 36 couches, une taille cachée de 4096, 32 têtes d'attention avec 8 têtes clé-valeur, un vocabulaire de 151 936 tokens et un plafond de positions de 40 960 tokens. Tout ce qui sépare la version d'Ai2 du 2026-10-02 de la base d'avril 2025 relève du post-entraînement. La question intéressante n'est donc pas de savoir lequel est meilleur en général — mais ce qu'une campagne de post-entraînement spécifique et bien financée vous apporte par-dessus un modèle de base que vous pouvez déjà télécharger gratuitement, et ce qu'elle vous coûte en retour.

La réponse d’Ai2 est un rédacteur de rapports qui produit une synthèse multi-sections avec citations en environ 51 secondes, contre 178,5 secondes pour le pipeline basé sur Claude qu’il a remplacé au sein de la plateforme Asta — environ 3,5 fois plus rapide, Ai2 affirmant que la qualité des rapports s’est maintenue sur les métriques suivies. La réponse de Qwen3-8B est un généraliste doté de modes hybrides de réflexion et de non-réflexion, de plus d’une centaine de langues et d’un an et demi d’utilisation en aval. Les deux sont sous licence Apache-2.0. Le compromis oppose une capacité étroite alliée à la vitesse à une capacité large alliée à la flexibilité, et les données ci-dessous en rendent la forme assez concrète.

La ligne Architecture est sans effet, donc l'invite ne l'est pas.

Comme la géométrie du checkpoint est identique, toutes vos intuitions de serving concernant Qwen3-8B se transposent telles quelles à AstaBrief 8B. C'est un modèle dense de 8B en BF16, il tient sur une carte de 24 Go, il est servi sur vLLM ou Transformers sans noyaux personnalisés, et il hérite du plafond de positions de 40K du modèle de base — aucun des deux modèles n'est un modèle à contexte long, et la fenêtre d'entraînement de 32K s'étend avec YaRN exactement comme celle de la base. Planifier le déploiement du fine-tune revient à planifier celui de la base. Cela mérite d'être dit sans détour, car ce n'est pas toujours vrai des fine-tunes, et cela signifie que la seule chose que vous évaluez est le comportement.

Le comportement, c’est là que réside l’enfermement. La fiche d’AstaBrief porte un avertissement en gras : le modèle a été affiné sur un format de prompt spécifique, publié sous le nom sft_prompt.txt dans le jeu de données AstaBrief_prompts, et Ai2 indique que l’utilisation d’un autre prompt ou format d’interaction peut entraîner un comportement dégradé ou incohérent. Ce prompt n’est pas un modèle de discussion informel. Lisez-le et vous y découvrez un contrat rigide : un emplacement de requête entre crochets, un bloc section_references de citations indexées par identifiant, une syntaxe de citation explicite exigeant que la clé de référence suive la phrase qu’elle étaye, un marqueur désigné pour les connaissances du modèle qui ne doit pas être combiné à une autre source, et une instruction d’ouvrir chaque section par un TLDR en deux phrases. Qwen3-8B acceptera tout ce que vous tapez. AstaBrief 8B est ajusté à une seule forme d’entrée et sera moins performant si vous lui en fournissez une autre.

Ce que 47 000 exemples et 6 000 préférences ont acheté

Le fine-tuning relève entièrement du post-entraînement, et la recette est délibérément conventionnelle : affinage supervisé suivi d'une optimisation directe des préférences hors ligne, sans apprentissage par renforcement. Ai2 est parti de requêtes réelles soumises via son système Asta, a filtré 90 000 invites axées sur la recherche selon la qualité, la pertinence et la confidentialité, a généré des cibles de rapport avec le pipeline multi-étapes ScholarQA en utilisant Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini et GPT-4.1, et a conservé 47 000 exemples. L'étape de préférence a ensuite construit environ 6 000 paires, avec GPT-4.1 et DeepSeek-R1 comme juges et seules les paires sur lesquelles les deux étaient d'accord ont été conservées.

Mesuré sur SQABench-CS2 — 100 questions de recherche en informatique rédigées par des utilisateurs — par rapport au modèle de base, voici ce que cela a apporté, chaque chiffre étant rapporté par le fournisseur et aucun reproduit indépendamment :

• Moyenne globale — AstaBrief 8B 87,0 vs Qwen3-8B 77,3, un gain de 9,7 points.

• Rappel des ingrédients — 90,2 contre 77,8.

• Précision des citations — 90,5 vs 76,2.

• Rappel des citations — 78,2 vs 64,6.

• Précision des réponses — 89.0 contre 90.6, une perte de 1.6 point par rapport à la base.

La dernière ligne est celle qui devrait guider les attentes. Le réglage fin pour la qualité des rapports n’a pas tout amélioré de manière uniforme ; il a échangé un peu de pertinence par paragraphe contre d’importants gains de couverture et d’ancrage des citations. Si votre tâche récompense les paragraphes pertinents par-dessus tout, le modèle de base n’est pas de toute évidence le moins bon choix, et le modèle affiné n’est pas automatiquement votre solution.

Deux autres choses que l’argent n’a pas achetées. AstaBrief 8B n’a pas de score rapporté sur DeepScholarBench supérieur aux propres alternatives d’Ai2 — ses 53,50 se situent derrière Asta ScholarQA à 60,25 et DR-Tulu-8B à 56,26 — et sa validation humaine se limite à quatorze questions provenant de trois chercheurs, sur lesquelles DR-Tulu a remporté la préférence globale. Un modèle spécialisé peut perdre face à un modèle de recherche généraliste sur le propre benchmark du spécialiste, et Ai2 l’a publié.

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

Ce que la base fait encore mieux

La comparaison n'est pas unidirectionnelle, et le versant généraliste de celle-ci est facile à sous-estimer.

Qwen3-8B est livré avec des modes hybrides de réflexion et de non-réflexion : il peut ainsi consacrer des tokens au raisonnement lorsqu’un problème le justifie, et répondre directement lorsque ce n’est pas le cas. AstaBrief 8B a été entraîné pour la rédaction de rapports en une seule passe et n’hérite d’aucun de ces comportements de raisonnement délibéré en tant que fonctionnalité produit. Qwen3-8B bénéficie également de la couverture multilingue du modèle de base — plus d’une centaine de langues —, tandis qu’AstaBrief a été entraîné sur un corpus explicitement filtré sur des requêtes scientifiques en anglais ; sa compétence en dehors de ce créneau est donc inconnue, plutôt que simplement non testée.

Ensuite, il y a la surface d'instruction. Un généraliste est ce que vous voulez quand la tâche changera la semaine prochaine, quand vous avez besoin d'appel d'outils, quand le schéma de sortie est le vôtre plutôt que celui d'Ai2, ou quand vous faites du prototypage et que vous ne savez pas encore à quoi ressemblera le prompt final. Et sur la question de la provenance brute — celle qui compte quand quelqu'un demande pourquoi vous faites confiance au modèle — Qwen3-8B a plus de onze millions de téléchargements et un an et demi d'utilisation indépendante. AstaBrief 8B a eu une semaine de lancement.

Ce qu’AstaBrief 8B possède et que la version de base ne peut égaler, c’est la discipline de citation. La précision et le rappel des citations sont les deux métriques où l’avance du modèle affiné est la plus grande et la plus cohérente avec l’histoire de l’entraînement — le filtre unique le plus puissant du pipeline de données d’Ai2 était la densité de citations, la proportion d’affirmations comportant au moins une citation, et le modèle qui en résulte reflète cette priorité. Amener un modèle généraliste à citer en ligne dans un format de clé fixe, de manière fiable, sans omettre de soutien pour les affirmations, relève de l’ingénierie de prompt que vous écrivez et maintenez. Le fine-tuning d’Ai2 fait de ce comportement le comportement par défaut du modèle.

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

La gamme Qwen a évolué depuis avril 2025.

Une complication supplémentaire, et d’ordre pratique : Qwen3-8B a un an et demi, et comparer un nouveau fine-tune à celui-ci n’est pas la même chose que de le comparer à un modèle en place viable.

La gamme Qwen passe désormais par Qwen3.5, Qwen3.6, Qwen3.7 et Qwen3.8, et la génération actuelle est accessible sans rien télécharger. Qwen3.8 27B est une route active dans notre catalogue avec une fenêtre de contexte de 262 144 tokens à 0,33 $ par million de tokens d'entrée et 2,40 $ par million de tokens de sortie ; Qwen3.8 Flash embarque une fenêtre d'un million de tokens à 0,15 $ et 0,47 $ ; Qwen3 VL 8B Instruct couvre le cas multimodal à 0,18 $ et 0,70 $ par million avec une fenêtre de 131 072 tokens, et est routé depuis octobre 2025. Qwen3-8B lui-même n'est pas une route que nous proposons, et AstaBrief 8B non plus — ce sont des poids à télécharger et à exécuter, et la présentation honnête consiste à dire que la base a sa place sur votre matériel et que la génération Qwen moderne n'a pas besoin d'y être.

Cela vous donne un troisième bras pour l'évaluation qu'Ai2 n'a pas pu exécuter. Placez AstaBrief 8B sur votre propre GPU, déployez la base Qwen3-8B à côté pour confirmer les deltas rapportés, et pointez le même harnais vers un modèle Qwen3.8 hébergé pour passer à l'échelle. Les trois bras ne sont qu'à un endpoint près, ce qui en fait un exercice de configuration plutôt qu'un projet d'approvisionnement — une API pour plus de 200 modèles, le prix catalogue du fournisseur répercuté à 0 % de marge, afin qu'une baisse de prix d'un fournisseur soit active de votre côté le jour même, un basculement automatique, et un DSL de routage si vous voulez que plusieurs modèles répondent ensemble à une même question. Les bras auto-hébergés restent auto-hébergés pour des raisons de sensibilité des données ; tout ce qui est hébergé reste interchangeable, ce qui compte quand la prochaine génération de Qwen sortira dans un trimestre.

Comment décider

Prenez AstaBrief 8B si votre produit est la synthèse de littérature citée et que vous voulez que le comportement en matière de citations soit celui par défaut du modèle plutôt que de relever de la responsabilité de votre prompt. La géométrie du modèle de base garantit zéro surprise de serving, la licence Apache-2.0 et les mélanges SFT et DPO publiés le rendent auditable, et son avance en précision et en rappel des citations est le résultat le plus important et le plus explicable des tableaux d’Ai2.

Restez sur Qwen3-8B, ou passez à un Qwen3.x actuel, si vos tâches sont variées, si vous avez besoin du mode de réflexion, d’outils ou d’une couverture multilingue, si vous explorez encore le prompt, ou si vous préférez ne pas être enfermé dans un bloc d’instructions de seize mille caractères que vous n’avez pas écrit. Le modèle de base a perdu sur la couverture et l’ancrage des citations, pas sur la pertinence, et il a conservé quelque chose que le fine-tune a abandonné.

Ce qu'il faut éviter, c'est de considérer la moyenne de 87,0 contre 77,3 comme si elle racontait toute l'histoire. Le tableau d'Ai2 lui-même montre que le fine-tuning renonce à la précision des réponses pour gagner en discipline des citations, les notes de laboratoire d'Ai2 elles-mêmes indiquent que l'essentiel de l'entraînement et de l'évaluation a été réalisé en 2025 et n'a pas été réexécuté face à la frontière actuelle, et le modèle de base dont il est une amélioration n'est plus la génération que vous choisiriez pour autre chose que cette comparaison. Ce que le fine-tuning ajoute de manière démontrable, c'est une forme de sortie ; savoir si cette forme vaut la peine malgré l'étroitesse dépend entièrement du fait qu'elle corresponde ou non à la forme de votre produit.