
AREX-2 vs Qwen 3.8 : l’un est un substrat sur lequel l’autre est probablement construit
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 507 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 194 tok/s
- OrcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- xAISpaceXAI: Grok 4.62026-08-1244Intelligence77Code
La confrontation entre AREX-2 et Qwen3.8-Max ressemble à un combat direct entre les systèmes phares de deux laboratoires chinois, et ce n'en est pas un — non pas parce qu'AREX-2 n'a pas fait ses preuves, même si c'est le cas, mais parce que les deux se situent à des couches différentes de la même pile. Qwen3.8-Max est en service depuis le 3 août 2026, à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, avec une fenêtre de contexte de 1 M de jetons ; ses homologues à poids ouverts, Qwen3.8-27B et Qwen3.8-Flash, ont été livrés les 13 et 26 août avec des benchmarks publiés et des tarifs publiés. AREX-2 est un dépôt que BAAI a créé sur Hugging Face le 29 septembre 2026 à 17:56 UTC, contenant un .gitattributes et rien d'autre. Et la raison pour laquelle les deux ne sont pas des rivaux tient au fait sous-jacent qu'aucun des deux fournisseurs ne proclame haut et fort : chaque modèle AREX que BAAI a livré jusqu'à présent est construit sur un socle Qwen.
Ce n'est pas une spéculation sur AREX-2. C'est documenté pour la génération qui existe. AREX-Base est un mélange d'experts de 122 milliards de paramètres avec 10 milliards de paramètres actifs, construit sur Qwen3.5-122B-A10B, et AREX-Turbo est un modèle dense de 4B construit sur Qwen3.5-4B ; les deux ont été publiés le 23 juillet 2026 sous Apache 2.0. Ainsi, la forme honnête de cette comparaison n'est pas « agent contre modèle phare ». Elle est la suivante : qu'est-ce que le substrat Alibaba vous apporte aujourd'hui, qu'ajoute par-dessus la couche d'agents de BAAI, et quelle part de la deuxième question peut recevoir une réponse avant que BAAI ne téléverse un fichier ?
Qu'est-ce qui est en production du côté de Qwen, et ce que cela coûte
La génération Qwen3.8 est inhabituellement facile à appréhender, car elle est entièrement spécifiée et tarifée publiquement, en trois paliers distincts.
• Qwen3.8-Max — sorti le 3 août 2026. Une fenêtre de contexte d'un million de jetons, la prise en charge native du texte, des images et des vidéos, le mode réflexion, l'appel de fonctions et les sorties structurées, ainsi que trois formats de protocole (compatible OpenAI, compatible Anthropic et DashScope natif) dans cinq régions. 2,00 $ par million de jetons en entrée et 6,00 $ par million en sortie, les lectures de cache à 0,25 $.
• Qwen3.8-27B — sorti le 13 août 2026. Dense, 27 milliards de paramètres, contexte de 256K (262 144 positions), entrées texte, image et vidéo, poids Apache 2.0. Publié sur la carte de Qwen à 90,3 sur LiveCodeBench v6, 89,2 sur GPQA Diamond, 84,3 sur OSWorld-Verified et 79,0 sur QwenSWEBench — rapporté par le fournisseur, non reproduit indépendamment. Une mesure indépendante le place à 33,7 sur l'Artificial Analysis Intelligence Index et à 68,1 sur l'indice AA Coding.
• Qwen3.8-Flash — sorti le 26 août 2026. Même fenêtre de 1 M de tokens et mêmes entrées multimodales, à 0,15 $ par million de tokens d'entrée et 0,47 $ en sortie. Le niveau le moins cher de la famille, celui qui rend abordable le trafic agentique à fort volume.
Il existe également une entrée non étiquetée Qwen3.8 : le modèle phare de 2,4 billions de paramètres dont Alibaba a annoncé l'arrivée des poids, et qui n'est encore appelable nulle part. Si vous cherchez « Qwen 3.8 » en vous attendant à un seul modèle, voilà pourquoi la réponse est une famille de quatre, et non un seul.

Face à tout cela, la spécification d’AREX-2 tient en une seule ligne : un dépôt, un horodatage, et un nom qui laisse entendre une seconde génération de quelque chose que BAAI a déjà construit une fois.
Le détail qui recadre toute la comparaison
AREX n'est pas un concurrent de Qwen ; il en est un consommateur. Les deux modèles AREX de première génération sont post-entraînés sur des backbones Qwen3.5, puis enveloppés dans le framework qui en fait des agents plutôt que des modèles de chat : une boucle interne qui recherche, navigue et intègre des preuves dans une réponse candidate portant un indice de confiance, et une boucle externe qui vérifie cette réponse par rapport aux contraintes d'origine et soit l'accepte, soit l'affine, soit rejette la trajectoire et recommence. L'ingénierie intéressante dans AREX n'est pas le réseau. C'est la boucle, le mécanisme de mise à jour du contexte qui garde distincts les résultats vérifiés, les candidats ouverts et les contraintes non résolues sur un long horizon, et l'interface d'outils qui expose la recherche et la navigation au modèle comme des actions de premier ordre.
C'est pourquoi les chiffres publiés par la famille elle-même — 82,5 sur BrowseComp, 85,4 sur GAIA, 71,0 sur xbench-2510, 89,9 sur DeepSearch QA et 82,0 sur WideSearch-en pour le 122B Base, avec 70,7 / 81,6 / 57,0 / 78,5 / 68,5 pour le 4B Turbo — ne sont pas comparables aux scores de codage et d'agentique de Qwen3.8-27B, même si les deux partagent une lignée architecturale. Ils mesurent des choses différentes. QwenSWEBench demande si un modèle peut résoudre un problème de dépôt. BrowseComp demande si un agent peut trouver un fait volontairement difficile à trouver, au fil de nombreuses recherches, sans perdre la question. Un point de contrôle Qwen3.5 brut obtient de mauvais scores sur le second et de bons sur le premier, ce qui est précisément l'écart que le post-entraînement et le harnais de BAAI ont pour but de combler.

Ce que serait le plus vraisemblablement une deuxième génération
Si AREX-2 suit le même schéma, l’interprétation la plus probable — une déduction, pas un fait — est celle d’un agent de recherche de deuxième génération post-entraîné sur un backbone Qwen plus récent que la génération 3.5 utilisée par les modèles AREX actuels. Qwen3.8-27B est dense, multimodal et sous licence Apache 2.0, ce qui en fait un candidat naturel pour un agent haut de gamme ; Qwen3.8-Flash est bon marché par token, ce qui compte énormément lorsque votre agent effectue des dizaines d’appels par requête et relit un contexte croissant à chaque étape.
Rien de tout cela n’est confirmé. Le nom ne porte ni taille, ni backbone, ni date, et un « 2 » dans une gamme de produits relève d’une convention de nommage plutôt que d’une spécification. Ce qui est confirmé est bien plus restreint et devrait être présenté comme tel : BAAI a créé le dépôt le 29 septembre 2026, n’y a rien mis et n’a rien annoncé. Aucun poids, aucune fiche, aucun décompte de paramètres, aucune balise de licence, aucun benchmark, aucun fournisseur ne le sert. Si vous voyez des chiffres d’AREX-2 cités quelque part cette semaine, ce ne sont pas des mesures.
Ce que vous pouvez réellement acheter cet après-midi
L’asymétrie pratique entre ces deux éléments ne tient pas à la qualité : elle tient à ce que l’un dispose d’une grille tarifaire et l’autre, d’une simple entrée d’annuaire.
Si votre travail est agentique et que vous voulez le substrat sur lequel la famille AREX a été construite, le backbone exact est appelable : Qwen3.5-122B-A10B est au catalogue d'OrcaRouter à 0,115 $ par million de tokens d'entrée et 0,917 $ par million de tokens de sortie jusqu'à 128K tokens, passant à 0,287 $ / 2,294 $ au-delà, avec la vision, l'utilisation d'outils et le raisonnement activés. C'est le modèle que AREX-Base post-entraîne, disponible sans attendre quoi que ce soit.
Si vous voulez la génération actuelle, les deux paliers ouverts de Qwen3.8 figurent au catalogue : Qwen3.8-27B à 0,33 $ par million de tokens en entrée et 2,40 $ en sortie, exécuté sur notre propre infrastructure parce que les poids sont ouverts et qu'il n'y a aucun coût par token d'un fournisseur à répercuter, et Qwen3.8-Flash à 0,15 $ / 0,47 $ pour le palier de volume. Une seule API couvre les deux, le prix catalogue du fournisseur est répercuté sans rien ajouter par token, donc quand Alibaba modifie un prix, le chiffre ici change le jour même.
Et lorsque AREX-2 sortira effectivement, la raison pour laquelle il a sa place derrière cette même couche est structurelle plutôt que promotionnelle. Une boucle d'agent qui effectue vingt appels par requête multiplie par vingt le taux d'échec de chaque fournisseur ; une règle de routage avec basculement automatique qui décide à l'exécution fait la différence entre un délai d'attente qui devient une nouvelle tentative et un délai d'attente qui devient une réponse erronée mais affirmée avec assurance. Cet argument s'applique à tout agent de recherche, et il s'appliquera à AREX-2 dès qu'il y aura un AREX-2 à router.
Qui devrait agir, et sur quoi ?
Si vous avez besoin aujourd'hui d'un agent de recherche, AREX-Base est le modèle AREX qui existe, il a été publié en juillet sous Apache 2.0, et ses benchmarks d'agents sont ceux du fournisseur, mais au moins ils sont associés à un modèle téléchargeable. Si vous avez besoin aujourd'hui de raisonnement multimodal de pointe ou d'un trafic agentique à haut volume, les gammes Qwen3.8 sont disponibles, tarifées et en partie évaluées de manière indépendante, et rien dans l'existence d'AREX-2 ne change cette décision.
Le seul scénario dans lequel AREX-2 compte pour une décision que vous prenez cette semaine est celui où vous choisissez un backbone pour un fine-tune. Et là, la réponse est déjà visible dans le catalogue : les backbones 3.5 qu’AREX utilisait sont encore bon marché et disponibles, la génération 3.8 est meilleure et également disponible, et un AREX de deuxième génération — quand il arrivera — sera presque certainement une indication de la base Qwen sur laquelle BAAI estime qu’il vaut la peine de construire, et non un remplacement de celle-ci.
Trois choses suffiraient à régler le reste : des fichiers dans l’arborescence, une fiche avec un nombre de paramètres et un champ de modèle de base, et une étiquette de licence. La première d’entre elles est celle qui compte, car tant qu’elle n’est pas en place, cette comparaison se fait entre une famille tarifée et un simple espace réservé.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
