Une carte-titre générée indiquant « AREX-2 vs Qwen3.8-Max — Un substrat et ce qui s'y exécute », avec deux panneaux. Le panneau de gauche, intitulé Qwen3.8-Max, liste : en service depuis le 3 août 2026 ; contexte de 1M de tokens, multimodal ; 2 $ en entrée / 6 $ en sortie par 1M ; appelable dès aujourd'hui. Le panneau de droite, intitulé AREX-2, liste : dépôt créé le 29 sept. 2026 ; aucun poids, aucune fiche de modèle ; aucune grille tarifaire nulle part ; non appelable nulle part. Un pied de page indique « La première génération d'AREX a été post-entraînée sur un socle Qwen. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

AREX-2 vs Qwen 3.8 : l’un est un substrat sur lequel l’autre est probablement construit

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La confrontation entre AREX-2 et Qwen3.8-Max ressemble à un combat direct entre les systèmes phares de deux laboratoires chinois, et ce n'en est pas un — non pas parce qu'AREX-2 n'a pas fait ses preuves, même si c'est le cas, mais parce que les deux se situent à des couches différentes de la même pile. Qwen3.8-Max est en service depuis le 3 août 2026, à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, avec une fenêtre de contexte de 1 M de jetons ; ses homologues à poids ouverts, Qwen3.8-27B et Qwen3.8-Flash, ont été livrés les 13 et 26 août avec des benchmarks publiés et des tarifs publiés. AREX-2 est un dépôt que BAAI a créé sur Hugging Face le 29 septembre 2026 à 17:56 UTC, contenant un .gitattributes et rien d'autre. Et la raison pour laquelle les deux ne sont pas des rivaux tient au fait sous-jacent qu'aucun des deux fournisseurs ne proclame haut et fort : chaque modèle AREX que BAAI a livré jusqu'à présent est construit sur un socle Qwe​n.

Ce n'est pas une spéculation sur AREX-2. C'est documenté pour la génération qui existe. AREX-Base est un mélange d'experts de 122 milliards de paramètres avec 10 milliards de paramètres actifs, construit sur Qwen3.5-122B-A10B, et AREX-Turbo est un modèle dense de 4B construit sur Qwen3.5-4B ; les deux ont été publiés le 23 juillet 2026 sous Apache 2.0. Ainsi, la forme honnête de cette comparaison n'est pas « agent contre modèle phare ». Elle est la suivante : qu'est-ce que le substrat Alibaba vous apporte aujourd'hui, qu'ajoute par-dessus la couche d'agents de BAAI, et quelle part de la deuxième question peut recevoir une réponse avant que BAAI ne téléverse un fichier ?

Qu'est-ce qui est en production du côté de Qwen, et ce que cela coûte

La génération Qwen3.8 est inhabituellement facile à appréhender, car elle est entièrement spécifiée et tarifée publiquement, en trois paliers distincts.

• Qwen3.8-Max — sorti le 3 août 2026. Une fenêtre de contexte d'un million de jetons, la prise en charge native du texte, des images et des vidéos, le mode réflexion, l'appel de fonctions et les sorties structurées, ainsi que trois formats de protocole (compatible OpenAI, compatible Anthropic et DashScope natif) dans cinq régions. 2,00 $ par million de jetons en entrée et 6,00 $ par million en sortie, les lectures de cache à 0,25 $.

• Qwen3.8-27B — sorti le 13 août 2026. Dense, 27 milliards de paramètres, contexte de 256K (262 144 positions), entrées texte, image et vidéo, poids Apache 2.0. Publié sur la carte de Qwe​n à 90,3 sur LiveCodeBench v6, 89,2 sur GPQA Diamond, 84,3 sur OSWorld-Verified et 79,0 sur QwenSWEBench — rapporté par le fournisseur, non reproduit indépendamment. Une mesure indépendante le place à 33,7 sur l'Artificial Analysis Intelligence Index et à 68,1 sur l'indice AA Coding.

• Qwen3.8-Flash — sorti le 26 août 2026. Même fenêtre de 1 M de tokens et mêmes entrées multimodales, à 0,15 $ par million de tokens d'entrée et 0,47 $ en sortie. Le niveau le moins cher de la famille, celui qui rend abordable le trafic agentique à fort volume.

Il existe également une entrée non étiquetée Qwen3.8 : le modèle phare de 2,4 billions de paramètres dont Alibaba a annoncé l'arrivée des poids, et qui n'est encore appelable nulle part. Si vous cherchez « Qwen 3.8 » en vous attendant à un seul modèle, voilà pourquoi la réponse est une famille de quatre, et non un seul.

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

Face à tout cela, la spécification d’AREX-2 tient en une seule ligne : un dépôt, un horodatage, et un nom qui laisse entendre une seconde génération de quelque chose que BAAI a déjà construit une fois.

Le détail qui recadre toute la comparaison

AREX n'est pas un concurrent de Qwen ; il en est un consommateur. Les deux modèles AREX de première génération sont post-entraînés sur des backbones Qwen3.5, puis enveloppés dans le framework qui en fait des agents plutôt que des modèles de chat : une boucle interne qui recherche, navigue et intègre des preuves dans une réponse candidate portant un indice de confiance, et une boucle externe qui vérifie cette réponse par rapport aux contraintes d'origine et soit l'accepte, soit l'affine, soit rejette la trajectoire et recommence. L'ingénierie intéressante dans AREX n'est pas le réseau. C'est la boucle, le mécanisme de mise à jour du contexte qui garde distincts les résultats vérifiés, les candidats ouverts et les contraintes non résolues sur un long horizon, et l'interface d'outils qui expose la recherche et la navigation au modèle comme des actions de premier ordre.

C'est pourquoi les chiffres publiés par la famille elle-même — 82,5 sur BrowseComp, 85,4 sur GAIA, 71,0 sur xbench-2510, 89,9 sur DeepSearch QA et 82,0 sur WideSearch-en pour le 122B Base, avec 70,7 / 81,6 / 57,0 / 78,5 / 68,5 pour le 4B Turbo — ne sont pas comparables aux scores de codage et d'agentique de Qwen3.8-27B, même si les deux partagent une lignée architecturale. Ils mesurent des choses différentes. QwenSWEBench demande si un modèle peut résoudre un problème de dépôt. BrowseComp demande si un agent peut trouver un fait volontairement difficile à trouver, au fil de nombreuses recherches, sans perdre la question. Un point de contrôle Qwen3.5 brut obtient de mauvais scores sur le second et de bons sur le premier, ce qui est précisément l'écart que le post-entraînement et le harnais de BAAI ont pour but de combler.

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

Ce que serait le plus vraisemblablement une deuxième génération

Si AREX-2 suit le même schéma, l’interprétation la plus probable — une déduction, pas un fait — est celle d’un agent de recherche de deuxième génération post-entraîné sur un backbone Qwen plus récent que la génération 3.5 utilisée par les modèles AREX actuels. Qwen3.8-27B est dense, multimodal et sous licence Apache 2.0, ce qui en fait un candidat naturel pour un agent haut de gamme ; Qwen3.8-Flash est bon marché par token, ce qui compte énormément lorsque votre agent effectue des dizaines d’appels par requête et relit un contexte croissant à chaque étape.

Rien de tout cela n’est confirmé. Le nom ne porte ni taille, ni backbone, ni date, et un « 2 » dans une gamme de produits relève d’une convention de nommage plutôt que d’une spécification. Ce qui est confirmé est bien plus restreint et devrait être présenté comme tel : BAAI a créé le dépôt le 29 septembre 2026, n’y a rien mis et n’a rien annoncé. Aucun poids, aucune fiche, aucun décompte de paramètres, aucune balise de licence, aucun benchmark, aucun fournisseur ne le sert. Si vous voyez des chiffres d’AREX-2 cités quelque part cette semaine, ce ne sont pas des mesures.

Ce que vous pouvez réellement acheter cet après-midi

L’asymétrie pratique entre ces deux éléments ne tient pas à la qualité : elle tient à ce que l’un dispose d’une grille tarifaire et l’autre, d’une simple entrée d’annuaire.

Si votre travail est agentique et que vous voulez le substrat sur lequel la famille AREX a été construite, le backbone exact est appelable : Qwen3.5-122B-A10B est au catalogue d'OrcaRouter à 0,115 $ par million de tokens d'entrée et 0,917 $ par million de tokens de sortie jusqu'à 128K tokens, passant à 0,287 $ / 2,294 $ au-delà, avec la vision, l'utilisation d'outils et le raisonnement activés. C'est le modèle que AREX-Base post-entraîne, disponible sans attendre quoi que ce soit.

Si vous voulez la génération actuelle, les deux paliers ouverts de Qwen3.8 figurent au catalogue : Qwen3.8-27B à 0,33 $ par million de tokens en entrée et 2,40 $ en sortie, exécuté sur notre propre infrastructure parce que les poids sont ouverts et qu'il n'y a aucun coût par token d'un fournisseur à répercuter, et Qwen3.8-Flash à 0,15 $ / 0,47 $ pour le palier de volume. Une seule API couvre les deux, le prix catalogue du fournisseur est répercuté sans rien ajouter par token, donc quand Alibaba modifie un prix, le chiffre ici change le jour même.

Et lorsque AREX-2 sortira effectivement, la raison pour laquelle il a sa place derrière cette même couche est structurelle plutôt que promotionnelle. Une boucle d'agent qui effectue vingt appels par requête multiplie par vingt le taux d'échec de chaque fournisseur ; une règle de routage avec basculement automatique qui décide à l'exécution fait la différence entre un délai d'attente qui devient une nouvelle tentative et un délai d'attente qui devient une réponse erronée mais affirmée avec assurance. Cet argument s'applique à tout agent de recherche, et il s'appliquera à AREX-2 dès qu'il y aura un AREX-2 à router.

Qui devrait agir, et sur quoi ?

Si vous avez besoin aujourd'hui d'un agent de recherche, AREX-Base est le modèle AREX qui existe, il a été publié en juillet sous Apache 2.0, et ses benchmarks d'agents sont ceux du fournisseur, mais au moins ils sont associés à un modèle téléchargeable. Si vous avez besoin aujourd'hui de raisonnement multimodal de pointe ou d'un trafic agentique à haut volume, les gammes Qwen3.8 sont disponibles, tarifées et en partie évaluées de manière indépendante, et rien dans l'existence d'AREX-2 ne change cette décision.

Le seul scénario dans lequel AREX-2 compte pour une décision que vous prenez cette semaine est celui où vous choisissez un backbone pour un fine-tune. Et là, la réponse est déjà visible dans le catalogue : les backbones 3.5 qu’AREX utilisait sont encore bon marché et disponibles, la génération 3.8 est meilleure et également disponible, et un AREX de deuxième génération — quand il arrivera — sera presque certainement une indication de la base Qwe​n sur laquelle BAAI estime qu’il vaut la peine de construire, et non un remplacement de celle-ci.

Trois choses suffiraient à régler le reste : des fichiers dans l’arborescence, une fiche avec un nombre de paramètres et un champ de modèle de base, et une étiquette de licence. La première d’entre elles est celle qui compte, car tant qu’elle n’est pas en place, cette comparaison se fait entre une famille tarifée et un simple espace réservé.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement