Une carte de titre principale pour « Qwen 4 Max vs Gemini 3.1 Pro » avec le sous-titre « Le modèle phare non annoncé face à l’aperçu qui n’a jamais pris fin », trois badges en forme de pilule indiquant « Aperçu depuis le 19 février 2026 », « Contexte de 1 048 576 jetons » et « 26,3 % de récupération à 1 M », une ligne de pied de page indiquant « Alibaba a annoncé le 22 septembre 2026 ; Google a présenté un aperçu le 19 février 2026 », et le logo OrcaRouter dans le coin inférieur droit.
Engineering & Research

Qwen 4 Max vs Gemini 3.1 Pro : le modèle phare non annoncé face à l’aperçu qui n’a jamais pris fin

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La plupart des comparaisons opposent un produit commercialisé à un autre produit commercialisé. Celle-ci est inhabituelle : Qwen 4 Max a été présenté en avant-première lors de la conférence Yunqi à Hangzhou le 22 septembre 2026, sans date de sortie, sans prix ni poids, et Gemini 3.1 Pro est en préversion depuis le 19 février 2026 et l’est encore — sept mois plus tard, sans date de disponibilité générale annoncée ni date d’arrêt dans son tableau de dépréciation. Aucun des deux modèles de cette confrontation n’est un produit établi. Ce n’est pas une raison pour passer la comparaison sous silence. C’est la comparaison, et c’est la seule chose à son sujet qui soit véritablement informative.

Sept mois d'aperçu

Une étiquette d’aperçu est censée correspondre à un état de courte durée. Gemini 3.1 Pro la conserve désormais au fil de trois sorties de Flash du même laboratoire, y compris Gemini 3.8 Flash, le 2 septembre 2026, que Google décrit comme son modèle Flash le plus intelligent. Dans les composites indépendants, ce modèle obtient désormais un score supérieur à celui de 3.1 Pro. La gamme Pro de Google ne compte aucun membre plus récent : il n’existe pas de Gemini 3.8 Pro, et la génération 3.5 Pro a été retardée puis, selon les informations rapportées, mise de côté. L’effet concret est que le modèle qui porte le nom Pro n’est plus le modèle le mieux classé de son propre fournisseur.

Le texte de limitation de Google lui-même sur la fiche catalogue conseille de prévoir la dépréciation de la preview, ce qui est la manière honnête d’interpréter le statut. Une preview sans date de GA et sans date d’arrêt est un modèle sur lequel on peut bâtir, mais autour duquel on ne peut pas planifier.

Le côté Qwen est une image miroir avec le signe inversé. Qwen 4 Max n’est pas dans un long aperçu ; il est en pré-aperçu, avec rien de publié du tout. Les deux modes de défaillance sont opposés : Gemini 3.1 Pro est un point de terminaison réel dont l’existence à long terme n’est pas spécifiée, et Qwen 4 Max est un élément de feuille de route spécifié sans point de terminaison.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

La comparaison, et le chiffre de contexte long qui la détermine

La spécification de Gemini 3.1 Pro est publique et précise. Celle de Qwen 4 Max est vide. Ce sur quoi il vaut la peine de s'attarder, c'est une ligne de la colonne Gemini, car c'est le genre de chiffre qui se retrouve cité et qui ne devrait pas l'être :

• Statut — Gemini 3.1 Pro en aperçu depuis le 19 février 2026, face à Qwen 4 Max annoncé le 22 septembre 2026 sans date

• Prix d’entrée — Gemini 3.1 Pro : 2,00 $ par million de tokens jusqu’à un prompt de 200 K, et 4,00 $ au-delà, contre Qwen 4 Max non publié

• Prix de sortie — Gemini 3.1 Pro 12,00 $ par million jusqu'à 200 K et 18,00 $ au-delà, contre Qwen 4 Max non publié

• Entrée mise en cache — Gemini 3.1 Pro 0,20 $ par million pour une lecture de cache, contre Qwen 4 Max non publié

• Contexte — Gemini 3.1 Pro 1 048 576 jetons, contre Qwen 4 Max non publié

• Plafond de sortie — Gemini 3.1 Pro 65 536 jetons, contre Qwen 4 Max non publié

• Modalité — Gemini 3.1 Pro : entrée texte, image, vidéo, audio et PDF avec sortie texte, contre Qwen 4 Max non publié

• Contrôle du raisonnement — niveaux de réflexion faible, moyen et élevé de Gemini 3.1 Pro, face à Qwen 4 Max non publié

• Récupération à long contexte — MRCR v2 rapporté par le fournisseur de Gemini 3.1 Pro à 84,9 % en moyenne sur huit aiguilles à 128K, mais 26,3 % à la configuration ponctuelle à un million de tokens, contre Qwen 4 Max, pour lequel rien n’a été rapporté

• Scores rapportés par les fournisseurs — Gemini 3.1 Pro SWE-bench Verified 80,6 pour cent, GPQA Diamond 94,3 pour cent, ARC-AGI-2 77,1 pour cent, Humanity's Last Exam 44,4 pour cent sans outils, contre Qwen 4 Max, rien de rapporté

• Score indépendant — Gemini 3.1 Pro 30 sur l'Artificial Analysis Intelligence Index v4.3.2, contre Qwen 4 Max, pour lequel aucune évaluation indépendante n'existe

C’est cette ligne sur le contexte long qu’il faut retenir. Une fenêtre de contexte de 1 048 576 jetons est un chiffre marketing ; 26,3 % de récupération dans la configuration à un million de jetons, voilà ce que le même fournisseur rapporte lorsqu’il mesure l’extrémité de cette fenêtre. Les deux chiffres viennent de Google, ce qui fait de cet écart un constat sur le modèle plutôt que sur l’évaluateur. Si votre charge de travail dépend de la recherche d’un fait enfoui près de la fin d’un prompt d’un million de jetons, le chiffre de contexte phare ne vous dit rien d’utile et cette ligne vous dit presque tout.

L’indice a bougé, le modèle non.

Gemini 3.1 Pro a été lancé le 19 février 2026 avec un score de 57 à l'Artificial Analysis Intelligence Index, en tête du secteur. Selon la révision v4.3.2 de l'indice, publiée le 19 septembre 2026, il affiche 30. Rien n'a changé dans le modèle entre ces deux dates. La règle de mesure a été reconstruite, et elle l'a été quatre jours avant l'annonce du Qwen 4 d'Alibaba.

Cette coïncidence vaut plus que les chiffres eux-mêmes. Trois des quatre modèles de cette série de comparaisons — Gemini 3.1 Pro, Claude Opus 5 et le modèle phare Qwen 3.8 — ont des scores indépendants qui ont évolué sous la même révision, et dans chaque cas, ce changement était suffisamment important pour inverser un classement. Toute comparaison rédigée ce mois-ci qui cite une seule valeur d’indice sans nommer la révision compare des scores obtenus avec des règles différentes, et l’erreur ne sera pas visible pour un lecteur.

Pour Qwen 4 Max, la conséquence est que la cible ne cesse de bouger. Quand Alibaba finira par publier, le score à battre sur cet indice sera ce que la révision actuelle indiquera ce jour-là, et la révision a changé au moins une fois au cours de la dernière semaine.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Ce que disent les chiffres opérationnels, y compris celui qui dérange

Gemini 3.1 Pro est routable sur OrcaRouter en tant que google/gemini-3.1-pro-preview, portant les badges Flagship et Featured, sans bannière de pré-lancement, au prix catalogue de Google de 2,00 $ et 12,00 $ par million de jetons, avec 0 % de marge. Le routage lui-même est honnête — le tarif indiqué sur la page est celui que Google publie. Les chiffres opérationnels des sept jours précédant le 22 septembre méritent eux aussi d'être imprimés plutôt que passés sous silence : un p50 de temps jusqu'au premier jeton de 10,00 secondes, une vitesse de sortie d'environ 632 jetons par seconde et un taux d'erreur de 77,5 pour cent sur la période. Ce taux d'erreur n'est pas une note de bas de page. Pour un modèle de niveau preview sans date de disponibilité générale, c'est le chiffre le plus déterminant pour la décision sur la page, et une comparaison qui cite le prix sans le mentionner fait de la promotion plutôt que de l'information.

Le même catalogue propose près de 200 modèles sur un seul point de terminaison compatible OpenAI, avec bascule automatique et un DSL de routage, ce qui est le mécanisme qui rend un taux d'erreur de ce niveau survivable plutôt que fatal : un chemin de fournisseur dégradé peut faire l'objet d'une bascule au lieu d'être mis hors service. La famille Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash et Qwen3.8-27B — se trouve sur le même point de terminaison que Gemini 3.1 Pro Preview, de sorte que la substitution dont cet article traite réellement, celle que vous pouvez effectuer dès aujourd'hui, relève d'un changement de politique de routage plutôt que d'un projet de migration. Qwen 4 Max ne figure pas au catalogue, et aucun palier Qwen 4 non plus ; le jour où l'un sortira, c'est là qu'il apparaîtrait.

La décision, telle qu’elle est.

Aucun des deux modèles présentés ici n'est un produit sur lequel vous pouvez vous engager, et le conseil honnête est de traiter les deux en conséquence. Gemini 3.1 Pro est appelable aujourd'hui à un tarif publié, avec une fenêtre de contexte publiée et un historique d'évaluation public, y compris la faiblesse de récupération à l'extrémité de cette fenêtre ; c'est aussi un aperçu dont le fournisseur vous invite à anticiper la dépréciation, avec un taux d'erreur qui serait inacceptable pour une dépendance en production. Qwen 4 Max n'a aucun de ces problèmes, parce qu'il n'a aucune de ces propriétés.

Si vous avez besoin d'un modèle maintenant, le choix ne se situe pas entre ces deux-là. Il se situe entre Gemini 3.1 Pro et le fleuron Qwen actuellement disponible, et au vu des éléments disponibles, il s'agit d'un choix entre la qualité de récupération en contexte long et un tarif d'entrée de 2,00 $ avec des poids publiés. Si vous pouvez attendre, surveillez deux choses plutôt qu'une : une fiche modèle Qwen 4 Max, et une date de disponibilité générale pour Gemini 3.1 Pro. Ce qui arrivera en premier vous indiquera laquelle de ces deux feuilles de route Alibaba et Google privilégient réellement.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement