Une carte de titre générée affichant « AREX-2 vs Gemma 4 12B - L'un d'eux est un modèle », avec deux panneaux. Le panneau de gauche, intitulé Gemma 4 12B, liste : publié le 3 juin 2026 ; 11,95 milliards de paramètres, dense ; contexte de 256 K, Apache 2.0 ; téléchargez-le dès aujourd'hui. Le panneau de droite, intitulé AREX-2, liste : dépôt créé le 29 septembre 2026 ; aucun poids téléversé ; aucune fiche, aucune étiquette de licence ; non téléchargeable. Un pied de page indique « Une colonne est un modèle. L'autre est un horodatage. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

AREX-2 vs Gemma 4 12B : L'un de ces deux est un modèle

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Une comparaison entre Gemma 4 12B et AREX-2 présente une propriété qu'aucune autre confrontation sur ce blog ne possède : l'une des deux colonnes est vide, car le modèle de ce côté n'existe pas encore. Gemma 4 12B est un artefact livré — Google DeepMind l'a publié le 3 juin 2026 comme un modèle dense à poids ouverts de 11,95 milliards de paramètres sous Apache 2.0, avec une fiche de modèle complète, une fenêtre de contexte de 256 K jetons, une entrée audio et image native, et trois mois et demi de tests indépendants derrière lui. AREX-2 est un dépôt Hugging Face que BAAI a créé le 29 septembre 2026 à 17:56 UTC et dans lequel BAAI n'a encore rien déposé : aucun poids, aucune fiche, aucune balise de licence, aucune évaluation, aucune annonce.

Cette asymétrie n'est pas une raison d'éviter la comparaison. C'est la comparaison. La question qui vaut la peine d'être posée n'est pas de savoir lequel d'entre eux est meilleur — rien ne peut y répondre tant qu'AREX-2 n'a pas de fichiers — mais de savoir si un agent de recherche BAAI de deuxième génération entrerait même en concurrence avec un modèle edge de 12B, dès le départ, ou si ces deux-là occupent des positions dans une pile qui ne se touchent jamais. Se tromper là-dessus, c'est l'erreur coûteuse, car c'est celle qui pousse une équipe à prévoir un budget pour la mauvaise chose.

Le côté livré, selon ses propres termes

Gemma 4 12B est le petit membre de la quatrième génération de la famille ouverte de Google, et son choix de conception déterminant est architectural : il abandonne entièrement l'encodeur visuel séparé et injecte directement les patchs d'image bruts et les formes d'onde audio dans le transformer. Ce n'est pas une astuce de benchmark. C'est ce qui rend le modèle véritablement portable — environ 27 Go de poids BF16 qui se quantifient en dessous de 7 Go, et une carte qui désigne 16 Go de VRAM comme cible de déploiement. Sur un ordinateur portable ou une seule carte de milieu de gamme, c'est un modèle que vous pouvez réellement avoir en main.

Le profil de capacités en découle. La propre fiche de Google — rapportée par le fournisseur, et il convient de le signaler comme tel — indique DocVQA 94,9 et InfoVQA 88,4 pour la compréhension de documents, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 et LiveCodeBench v6 72,0 en mode réflexion. Artificial Analysis, qui est indépendant, attribue à la configuration de raisonnement un score de 14 à l’Intelligence Index, la mesure à 114 jetons par seconde, et fixe le prix d’un appel servi typique à 0,10 $ par million de jetons d’entrée et 0,30 $ par million de jetons de sortie. Notre propre entrée de catalogue pour le plus grand Gemma 4 31B affiche 85,7 sur GPQA Diamond. La forme de tout cela est celle d’un petit généraliste inhabituellement solide sur les documents et les images, raisonnable en raisonnement, et très loin d’un modèle de frontière sur les travaux difficiles à plusieurs étapes.

Sa description de poste est donc concrète : inférence locale ou mono-locataire, compréhension de documents et de captures d’écran, boucles agentiques modestes, et tout ce pour quoi les données ne peuvent pas quitter le bâtiment. Ce n’est pas un moteur de recherche approfondie et Google ne le vend pas comme tel.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

L'autre côté, qui est un nom et un horodatage

Tout ce qui peut être confirmé au sujet d’AREX-2 cette semaine tient en une phrase. Il s’agit d’un dépôt sous l’organisation BAAI sur Hugging Face, créé le 29 septembre 2026, contenant un .gitattributes en tant que fichier et rien d’autre — zéro octet de données de modèle stockées, zéro téléchargement, aucune fiche de modèle, aucune déclaration de licence, aucun déploiement par un fournisseur. BAAI elle-même n’a rien annoncé.

Ce qui le rend digne d’être consigné par écrit, c’est la famille dont il tire son nom. La gamme AREX de BAAI a été lancée le 23 juillet 2026 avec deux modèles : AREX-Base, un mélange d’experts de 122 milliards de paramètres avec 10 milliards de paramètres actifs, basé sur Qwen3.5-122B-A10B, et AREX-Turbo, un modèle dense de 4B construit sur Qwen3.5-4B. Les deux sont sous Apache 2.0. Tous deux sont des agents de recherche approfondie plutôt que des modèles de discussion — une boucle interne qui rassemble des preuves et produit une réponse candidate avec un indice de confiance, et une boucle externe qui confronte cette réponse aux contraintes d’origine et peut l’affiner ou relancer toute la trajectoire. Selon les chiffres publiés par BAAI, AREX-Base atteint 82,5 sur BrowseComp, 85,4 sur GAIA et 89,9 sur DeepSearch QA ; AREX-Turbo atteint 70,7, 81,6 et 78,5 sur les trois mêmes.

Tous ces chiffres proviennent du fournisseur lui-même et aucun n’a été reproduit de manière indépendante. Ils concernent en plus un modèle différent. AREX-2 n’a aucun chiffre, et le « 2 » ne vous dit rien sur la taille, le backbone ou l’architecture — une deuxième génération dans cette gamme pourrait être un agent plus grand, une distillation plus petite, ou un framework réentraîné avec le backbone remplacé.

Est-ce que ces deux-là se rencontrent même ?

C’est ici que la comparaison devient plus utile qu’elle n’en a l’air. Prenez les deux lectures plausibles de ce que devient AREX-2.

Si c'est un agent de recherche de deuxième génération à une échelle ne serait-ce qu'approchant celle de Base, alors lui et Gemma 4 12B ne se font jamais concurrence. Un mélange d'experts de 122B pilotant une recherche multi-source est un service hébergé, facturé au token et dépendant du réseau ; Gemma 4 12B est un checkpoint que vous téléchargez et exécutez vous-même. Le choix entre eux n'est pas une comparaison de qualité, c'est une décision quant à savoir si votre charge de travail est une boucle de recherche ou un point de terminaison d'inférence.

Si AREX-2 s'avère être la petite gamme — le successeur du 4B Turbo plutôt que du 122B Base — alors les deux partagent bien le même rayon, et la comparaison devient réelle. Cette version d'AREX-2 représenterait environ un tiers du nombre de paramètres de Gemma 4 12B, spécialisée pour la recherche pilotée par des outils plutôt que pour l'étendue multimodale, et serait évaluée sur BrowseComp et GAIA plutôt que sur DocVQA. Deux petits modèles, l'un optimisé pour maintenir une longue trajectoire de recherche, l'autre pour voir et lire sur du matériel modeste. Une équipe qui construit un pipeline de documentation ne devrait pas se soucier du premier ; une équipe qui construit un agent de recherche ne devrait pas se soucier du second.

• Ce qui existe — Gemma 4 12B est téléchargeable dès aujourd'hui avec une fiche complète. AREX-2 est un dépôt qui ne contient aucun fichier.

• Paramètres — 11,95 B denses pour Gemma 4 12B. Non précisé, et déductible uniquement à partir d'un nom de produit, pour AREX-2.

• Contexte — 256 K jetons (262 144 positions) pour Gemma 4 12B. Inconnu pour AREX-2.

• Modalité — texte, image et audio en entrée pour Gemma 4 12B. Inconnue pour AREX-2 ; la première génération d'AREX était texte plus utilisation d'outils.

• Licence — Apache 2.0 pour Gemma 4 12B, mentionné sur la fiche. Non mentionné pour AREX-2 ; AREX-Base et AREX-Turbo étaient sous Apache 2.0.

• À quoi cela sert — inférence multimodale déployable sur votre propre matériel, par opposition, au vu des preuves de la famille, à la recherche à long horizon et à l’agrégation de preuves face à un point de terminaison hébergé.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

La partie réellement comparable : où chacun s'exécute

Comme la comparaison des capacités n’est pas disponible, la comparaison des déploiements est celle qu’il est honnête de faire, et elle n’est pas serrée.

Gemma 4 12B s'exécute là où vous le placez. Il n'y a pas de grille tarifaire, pas de compteur par jeton et aucun fournisseur entre vous et le modèle — le coût, c'est le matériel et l'électricité, et le mode de défaillance, c'est votre propre planification de capacité. Quand AREX-Base est sorti en juillet, en revanche, c'était un mélange d'experts de 122B : un modèle que l'on sert sur un cluster ou que l'on loue au jeton, et le 4B Turbo de la même famille existe précisément parce que ce choix a un prix. Si la deuxième génération suit la même forme, l'économie d'AREX-2 sera une fonction du nombre de jetons consommés par requête, multiplié par le nombre d'étapes de recherche que suit une trajectoire — un nombre bien plus élevé pour un agent de recherche approfondie que pour un modèle de lecture de documents, car l'agent relit un contexte croissant à chaque itération.

C'est là qu'une couche de routage cesse d'être une abstraction et devient une ligne de facturation. Si vous finissez par exécuter un agent de recherche sur un modèle hébergé tout en conservant un Gemma 4 12B local pour le travail documentaire, ce sont deux intégrations dans le cas ordinaire. Grâce à une API unique devant plus de 200 modèles — avec le prix catalogue du fournisseur répercuté et sans marge ajoutée par-dessus, si bien qu'un changement de prix d'un fournisseur est répercuté le jour même — ce n'est plus qu'une clé, une facture et un client, et une règle de basculement peut déplacer une requête d'un fournisseur qui passe un mauvais moment sans que votre boucle d'agent ne le sache. Nous routons Gemma 4 26B-A4B et Gemma 4 31B aujourd'hui ; nous ne routons pas le 12B, et rien de la gamme AREX ne figure non plus à notre catalogue, donc si l'un ou l'autre est le modèle dont vous avez besoin, il provient de la distribution propre de son fournisseur.

Que faire cette semaine

Si vous avez besoin d’un modèle multimodal compact que vous pouvez exécuter vous-même, la décision n’a jamais dépendu d’AREX-2. Gemma 4 12B est livré, documenté, évalué indépendamment et déployable, et la colonne de comparaison d’en face est vide. N’achetez rien sur la foi d’un nom réservé.

Si vous développez un agent de recherche approfondie et que c’est bien la gamme AREX que vous voulez, ce qu’il faut surveiller, ce n’est pas le nom, mais l’arborescence : la présence ou non de safetensors dans ce dépôt, ce que la carte indique quant au nombre de paramètres, et quelle étiquette de licence y est associée. La première génération a été publiée sous Apache 2.0, et si la deuxième aussi, la question devient une question d’hébergement plutôt qu’une question de licence. D’ici là, AREX-Base est le modèle AREX que vous pouvez réellement exécuter, et il est disponible depuis juillet.

La seule chose qu'il vaut la peine de dire sans détour à propos de la comparaison dont cet article traite nominalement : une page VS où un côté est un commit de dépôt et l'autre un modèle livré n'est pas une confrontation, c'est un calendrier. Le calendrier dit que Gemma 4 12B est disponible dès maintenant et qu'AREX-2 n'est pas disponible du tout.