Une carte de titre principale pour « AstaBrief 8B vs Gemma 4 12B : un rédacteur spécialisé face à un généraliste qui fait tout », mettant en contraste le rédacteur de rapports à tâche unique avec le généraliste multimodal de 11,95 B, avec le logo OrcaRouter dans le coin.
Guides & Insights

AstaBrief 8B vs Gemma 4 12B : un rédacteur spécialisé face à un généraliste qui fait tout

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

AstaBrief 8B et Gemma 4 12B appartiennent à la même classe de taille et relèvent de la même licence, mais au-delà de cela, ils répondent à des questions différentes. AstaBrief 8B est le modèle à poids ouverts de 8B d'Ai2, publié le 2026-10-02 et affiné à partir de Qwen3-8B, qui fait une seule chose : transformer une question de recherche et des extraits de littérature récupérés en un rapport cité, en une seule passe, en environ 51 secondes de bout en bout. Gemma 4 12B est le modèle multimodal unifié de 11,95B de DeepMind, un généraliste sous Apache-2.0 qui prend nativement en charge le texte, les images, l'audio et la vidéo et gère 256 000 tokens de contexte. L'un est un scalpel qui accomplit une tâche unique plus vite que le pipeline polyvalent qu'il a remplacé ; l'autre est la boîte à outils complète, sur l'appareil.

La tentation est de déclarer le spécialiste meilleur dans son travail et de passer à autre chose. La question plus utile, si vous déployez sur un seul GPU grand public, est de savoir si l’avantage du modèle étroit est assez important pour justifier de faire tourner deux piles au lieu d’une — et la réponse dépend de chiffres qu’aucun des deux laboratoires n’a fait vérifier de façon indépendante.

Les parties qui se recoupent véritablement

Tous deux sont des modèles denses à poids ouverts que l’on peut faire tenir sur une seule carte, tous deux sont sous Apache-2.0, et tous deux sont disponibles en téléchargement plutôt que derrière une API. Voilà qui constitue un véritable recoupement, et c’est la raison pour laquelle la comparaison mérite d’être faite.

Au-delà de cela, la divergence est totale, et ce sont deux lignes qui font le travail.

• Paramètres — AstaBrief 8B : environ 8B dense, poids BF16 dans la classe mono-GPU. Gemma 4 12B : 11,95B dense, architecture unifiée sans encodeur.

• Modalités en entrée — AstaBrief 8B : texte uniquement, et plus précisément une question plus des extraits. Gemma 4 12B : texte, image, audio et vidéo, l'audio et la vision étant projetés directement dans l'espace de plongement du décodeur via des couches linéaires légères plutôt que des encodeurs séparés.

• Modalités de sortie — Les deux : texte. AstaBrief 8B génère un rapport avec citations ; Gemma 4 12B génère du texte brut sous la forme que vous demandez.

• Contexte — AstaBrief 8B : le plafond de position de 40 960 jetons du modèle de base, entraîné à 32 K. Gemma 4 12B : 256 000 jetons, avec un schéma d’attention hybride qui alterne attention locale à fenêtre glissante (fenêtre de 1 024 jetons) et attention globale, ainsi qu’un RoPE proportionnel sur les couches globales pour contenir la mémoire en contexte long.

• Entraînement — AstaBrief 8B : fine-tuning supervisé sur 47 K exemples de rapports puis environ 6 K paires DPO, sur huit H100. Gemma 4 12B : préentraînement général de Google DeepMind plus ajustement par instructions, documenté dans un rapport technique.

• Tâche — AstaBrief 8B : une seule tâche, génération de rapports avec citations. Gemma 4 12B : raisonnement, programmation, workflows agentiques, chat multilingue dans plus de 140 langues.

• Scores indépendants — Aucun pour AstaBrief 8B au-delà des propres tableaux d’Ai2. Gemma 4 12B apparaît sur des classements publics, notamment Artificial Analysis, où la famille de modèles est évaluée ; ce sont des chiffres tiers et les seuls de cet article qui ne sont pas fournis par un fournisseur.

Lisez la ligne de contexte comme la différence structurelle plutôt que comme un point de fiche technique. Le plafond de 40K d'AstaBrief 8B n'est pas une limitation que Ai2 contourne ; c'est une conséquence de la conception. Le modèle ne détient jamais un corpus, seulement des extraits que quelqu'un d'autre a sélectionnés et dimensionnés. La fenêtre de 256K de Gemma 4 12B signifie que la même tâche peut être abordée sans aucune couche de récupération — collez un grand volume de contenu et posez votre question — ce qui constitue une architecture véritablement différente pour un résultat identique, et qui fusionne deux systèmes en un seul.

Là où le spécialiste gagne, et de combien

L’argument d’Ai2 en faveur d’AstaBrief est une affaire de chronomètre, et c’est un bon argument. Son pipeline Thinking propulsé par Claude prenait en moyenne 178,5 secondes pour chaque rapport ; AstaBrief, qui rédige l’intégralité du rapport en une seule passe, prend en moyenne 51,1 secondes, soit environ 3,5 fois plus rapide, et Ai2 affirme que cette simplification n’a pas nui à la qualité sur les métriques qu’il suit.

La société qui compte ici n’est pas Claude. C’est l’échafaudage multi-étapes lui-même — résumé de snippets, regroupement thématique et rédaction section par section — tout ce qu’AstaBrief supprime. Et cet échafaudage représente le même travail que vous auriez sinon à construire par-dessus n’importe quel généraliste, y compris Gemma 4 12B, si vous vouliez en tirer un rapport structuré et cité. Un généraliste à qui l’on demande « un rapport cité » en produira un ; lui faire produire un rapport selon un schéma fixe, avec des clés de citation qui correspondent à la liste des sources, relève de l’ingénierie de prompt qui vous incombe et que vous devez maintenir.

C'est au niveau de l'allégation de qualité qu'il faut ralentir.

• Moyenne de SQABench-CS2, partition de test (selon le fournisseur) — AstaBrief 8B 87,0, son propre checkpoint SFT 83,7, base Qwen3-8B 77,3. 100 questions d’informatique rédigées par des utilisateurs.

• DeepScholarBench (déclaré par le fournisseur) — AstaBrief 8B 53,50, derrière l’Asta ScholarQA d’Ai2 lui-même à 60,25 et DR-Tulu-8B à 56,26.

• En comparaison par paires avec le pipeline d’Ai2 propulsé par Claude (rapporté par le fournisseur) — 55 % de victoires sur l’ensemble de développement, 72 % sur l’ensemble de test.

• Étude humaine (rapportée par le fournisseur) — 14 questions posées par trois chercheurs, DR-Tulu préféré dans l'ensemble, deux des trois citant la précision des citations d'AstaBrief.

Aucun score équivalent n'existe pour Gemma 4 12B sur SQABench-CS2, dans un sens comme dans l'autre. Cette absence est le cœur honnête de cette comparaison : on ne peut pas attribuer un chiffre à la qualité des rapports de Gemma 4 12B face à celle d'AstaBrief 8B, parce que personne n'a fait passer le généraliste par le harnais d'Ai2 et personne ne prétend l'avoir fait. Quiconque vous dit que le spécialiste est « 26 points meilleur » compare un chiffre de fournisseur à rien.

A screenshot of the Hugging Face model card for google/gemma-4-12B-it showing the 'Any-to-Any' pipeline tag, the Apache 2.0 licence line, the gemma4_unified and image-text-to-text tags, the arXiv identifier 2607.02770, the 12B parameter size and a downloads-last-month figure of 1,902,430.

Là où le généraliste gagne haut la main

Les avantages de Gemma 4 12B ne sont pas marginaux et ils sont faciles à sous-estimer.

Le premier point est l’étendue. AstaBrief 8B est un composant auquel il faut fournir des preuves. Gemma 4 12B lit des captures d’écran, écoute de l’audio, regarde des vidéos, écrit du code et tient une conversation de 256 K. Si votre travail implique des figures dans des articles, des exposés enregistrés ou des sources multimodales, le spécialiste ne peut pas participer du tout et la question est close.

Le deuxième point est que une large exposition publique constitue en soi une forme de preuve. Gemma 4 12B figure sur des classements tiers ; la famille couvre cinq tailles, d’E2B à 31B ; les variantes affinées par instructions et pré-entraînées sont toutes deux publiées, accompagnées d’un rapport technique. C’est une provenance normale, banale et vérifiable — exactement ce qui manque à AstaBrief 8B comme à l’ensemble plus large des modèles de recherche spécialisés.

Le troisième, c'est le coût pratique d'une seconde pile. Faire tourner AstaBrief 8B pour la rédaction de rapports, plus un généraliste pour tout le reste, implique deux modèles résidents, deux formats de prompt, deux harnais d'évaluation et deux chemins de mise à niveau. Sur une seule carte de 24 Go en BF16, ce n'est pas gratuit — et la fiche d'AstaBrief avertit qu'il a été affiné sur un format de prompt spécifique, publié sous forme de fichier de jeu de données, et qu'en utiliser un autre peut dégrader le comportement. Un généraliste n'a pas ce genre de verrouillage.

• Gemma 4 12B (rapporté par le fournisseur) — indice d’intelligence de 9 sur la configuration Reasoning ; aucun chiffre comparable pour Gemma dans les benchmarks du rapport d’Ai2.

• Famille Gemma 4 — cinq tailles, de E2B à 31B, Apache-2.0, rapport technique publié, présence dans des classements tiers.

• Gemma 4 26B A4B, proposé dans notre catalogue — 0,06 $ par million de jetons d’entrée, 0,33 $ par million de jetons de sortie, fenêtre de contexte de 262 144 jetons. Gemma 4 31B est également routé, à 0,13 $ / 0,38 $.

• Gemma 4 12B, local — 11,95B dense, contexte de 256K, attention hybride à fenêtre glissante et globale, fenêtre locale de 1024 jetons.

Côté disponibilité, les modèles Gemma 4 sont hébergés commercialement : Gemma 4 26B A4B est une route active dans notre catalogue à 0,06 $ par million de jetons d'entrée et 0,33 $ par million de jetons de sortie, avec une fenêtre de contexte de 262 144 jetons, et Gemma 4 31B est également routé. C'est important, car cela signifie que vous pouvez évaluer la branche généraliste sans posséder le moindre GPU. Aucun fournisseur de notre catalogue ne propose AstaBrief 8B, y compris nous — c'est un modèle à télécharger et à exécuter, et la façon honnête de l'utiliser est sur du matériel que vous contrôlez, ou dans le produit Asta d'Ai2 lui-même.

Effectuer la comparaison vous-même, à moindre coût

La décision que cet article ne peut pas prendre pour vous est celle que vous pouvez prendre en un après-midi, car l’expérience est asymétrique en termes de coût. AstaBrief 8B a besoin de poids locaux et de son format de prompt publié ; vous pouvez le déployer sur une seule carte avec vLLM dans la configuration documentée par Ai2, température 0,7 et top-p 0,95. Le bras généraliste peut être un appel hébergé — Gemma 4 26B A4B à 0,06 $ en entrée et 0,33 $ en sortie par million de tokens est suffisamment proche dans l’esprit pour servir de référence d’étalonnage, et vous pouvez diriger votre propre harnais vers les deux sans posséder le second GPU.

Ensuite, mesurez ce que les tableaux des fournisseurs ne mesurent pas : sur vos questions, avec vos extraits, combien de rapports reviennent correctement cités et combien de temps prend toute la chaîne une fois que vous avez ajouté la glue du schéma de citation côté généraliste. Le 3,5x d’Ai2 est mesuré par rapport au pipeline propre d’Ai2, et non par rapport à Gemma 4 12B, et cet écart aura un aspect différent dans votre stack.

Garder la branche généraliste derrière un point de terminaison unique, c'est ce qui rend l'opération peu coûteuse à répéter plutôt qu'un projet ponctuel : une seule API pour plus de 200 modèles, le prix catalogue du fournisseur répercuté avec 0 % de marge, pour qu'une baisse de prix du fournisseur se retrouve sur votre facture le jour même, un basculement automatique en cas de dégradation d'un fournisseur, et un DSL de routage si vous voulez que plusieurs modèles répondent ensemble. L'important n'est pas de rester fidèle à l'un ou l'autre modèle ; c'est que relancer la comparaison le trimestre prochain devrait se résumer à un changement de configuration, car ces deux modèles seront tôt ou tard supplantés.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration tag, the apache-2.0 licence, the qwen3 and deep-research tags and the role descriptor for Ai2, as the reference point for the specialist arm of the comparison.

Lequel vous devriez réellement télécharger

Choisissez AstaBrief 8B si le livrable est un rapport de recherche avec citations et que vous disposez d’une couche de récupération qui l’alimente. L’architecture en une seule passe est une véritable prouesse d’ingénierie, la réduction de 3,5x du temps de génération est la raison de son existence, Apache-2.0 ainsi que des données d’entraînement publiées le rendent auditable, et aucun généraliste n’égalera sa structure de sortie sans que vous construisiez et mainteniez vous-même l’échafaudage.

Choisissez Gemma 4 12B si votre travail est plus large que les rapports, si vos sources sont multimodales, si 256K de contexte vous permet d’éviter complètement de construire une couche de récupération, ou si vous voulez le modèle auquel sont attachés des scores tiers et une route hébergée que vous pouvez appeler dès aujourd’hui.

Et notez l’asymétrie honnête dans les preuves, car elle joue contre le spécialiste : les chiffres d’AstaBrief 8B, y compris ceux qui sonnent le mieux, proviennent d’Ai2, décrivent un ensemble de comparaison de 2025 que le laboratoire dit ne pas avoir réexécuté, et incluent une étude humaine de quatorze questions. Les chiffres de Gemma 4 12B proviennent de personnes qui ne travaillent pas chez Google. Cette différence de provenance vaut plus que quelques points sur un benchmark que personne n’a exécuté sur les deux.