Une carte de titre héro générée portant « Gemini 3.1 Pro vs Qwen3.8-27B », sous-titrée « Un aperçu de sept mois face à un checkpoint que vous pouvez télécharger », avec deux cartes : Gemini 3.1 Pro, en aperçu depuis le 19 février 2026, à 2,00 $ en entrée et 12,00 $ en sortie par million de tokens et un indice d'intelligence Artificial Analysis de 29,7, contre Qwen3.8-27B, aux poids ouverts depuis le 14 août 2026, à 0,50 $ en entrée et 3,00 $ en sortie par million de tokens et un indice de 33,7, avec un médaillon VS entre elles et le logo OrcaRouter en bas à droite. Pied de page : « Artificial Analysis Intelligence Index v4.3.2, relevé le 2026-09-23 ; les prix correspondent aux tarifs catalogue des fournisseurs. »
Guides & Insights

Gemini 3.1 Pro vs Qwen3.8-27B : un aperçu de sept mois contre un checkpoint que vous pouvez télécharger

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 18 septembre 2026, des utilisateurs sur le forum de développeurs IA du fournisseur lui-même ont commencé à signaler que Gemini 3.1 Pro avait disparu du sélecteur de modèles d'AI Studio — y compris pour les comptes payants, malgré les vidages de cache et les fenêtres de navigation privée. Le fil demandant au fournisseur de dire s'il s'agissait d'un bug ou d'une action intentionnelle était toujours en ligne le 21 septembre. Il n'y a ni avis de dépréciation, ni chemin de migration, ni réponse du personnel. Pendant ce temps Qwen3.8-27B, que le laboratoire a publié en open source le 14 août sous Apache 2.0, ne peut être retiré à quiconque l'a téléchargé. C'est cette asymétrie — et non l'écart de benchmark, qui est réel mais modeste — qui détermine réellement cette confrontation, et c'est pourquoi les deux modèles ne sont pas vraiment en concurrence pour la même place, même si les tableaux comparatifs les placent côte à côte.

Ce qui suit est la comparaison directe des chiffres qui existent, chacun étant étiqueté : les chiffres d’Artificial Analysis issus de relevés effectués le 23 septembre 2026, la fiche modèle d’Alibaba, l’article de lancement de Google, et notre propre télémétrie de routage, maintenus séparés tout au long. Là où rien n’a été mesuré, cette page le dit plutôt que de deviner.

Ce qui s'est passé cette semaine, et ce que cela signifie et ne signifie pas

Les signalements sont précis et proviennent du propre forum de Google plutôt que du blog d'un concurrent. Un fil intitulé « Gemini 3.1 Pro absent d'AI Studio depuis le 18/09/2026 — bug ou intentionnel ? » décrit des utilisateurs payants perdant le modèle sans aucune annonce, le support Google One proposant des étapes de dépannage sans rapport, et la page de statut de Google n'indiquant aucun problème. Un deuxième fil, « Modèle Gemini 3.1 Pro Preview non disponible dans AI Studio pour créer une application », recueille la même plainte, y compris celle d'un utilisateur dont l'assistant de codage avait été développé sur la preview pendant des mois et qui affirme que Flash « produit de la bouillie » sur sa base de code.

Trois mises en garde honnêtes. Il s'agit d'une disparition dans la console développeur, et non d'une panne d'API confirmée : Gemini 3.1 Pro est toujours répertorié et routable sur notre propre catalogue, où il a traité 94,7 M de tokens au cours des sept derniers jours. C'est signalé par les utilisateurs — Google n'a rien dit, donc personne en dehors de Google ne peut distinguer une « dépréciation silencieuse » d'un « problème de capacité » ou d'un « bug de console ». Et le moment n'est pas flatteur étant donné que ce modèle est en aperçu depuis le 19 février 2026 — sept mois, sans date de disponibilité générale publiée, tandis que Google a livré une série de modèles Flash en dessous. Par ailleurs, GitHub Copilot a retiré Gemini 3.1 Pro le 1er septembre 2026 avec un préavis de 30 jours, ce qui est un événement différent et sans rapport, mais cela pointe dans la même direction : un point de terminaison d'aperçu sans engagement de disponibilité générale est une dépendance à propos de laquelle on a le droit d'être inquiet.

Un chiffre de notre côté mérite d’être mis en regard de ce contexte, car nous ne pouvons pas l’expliquer et préférons le dire. Notre télémétrie sur sept jours concernant l’entrée de catalogue Gemini 3.1 Pro affiche un taux d’erreur de 80,5 % ; les modèles voisins que nous avons vérifiés le même matin — Qwen3.8-Max, Claude Fable 5.1 — se situent à 5,9 % et 6,9 %. Nous ne savons pas s’il s’agit du même problème que celui signalé sur le forum, d’une mauvaise semaine pour un fournisseur amont, ou d’un artefact d’instrumentation. Considérez-le comme une raison de lancer un canari avant de vous engager, non comme un verdict sur le modèle.

Même règle, deux scores différents

C’est la partie que la plupart des pages de comparaison ratent, alors cela vaut la peine de la traiter avec soin. Artificial Analysis évalue ces deux modèles sur l’Intelligence Index v4.3.2. Nous avons capturé les deux pages le 23 septembre 2026, et toutes deux portent la même révision — ainsi, contrairement à la plupart des affirmations d’indice entre modèles, celle-ci repose sur un même instantané et l’écart est réel.

• Qwen3.8-27B (xhigh) — Indice d'intelligence 33,7

• Gemini 3.1 Pro Preview — Indice d’intelligence 29,7

Qwen a quatre points d'avance sur l'étalon actuel. La question plus difficile est ce que cela signifie, car l'étalon lui-même a bougé au moins trois fois cette année. En février, Artificial Analysis a publié un article qualifiant Gemini 3.1 Pro Preview de « nouveau leader de l'IA », avec quatre points d'avance sur Claude Opus 4.6, et les articles de presse de l'époque rapportaient un score de 57 sur ce qui était alors l'Index v4.0. Sur v4.3.2, il est de 29,7. Artificial Analysis a annoncé v4.3 le 7 septembre 2026, quatre jours après v4.2, et cette révision a remplacé Terminal-Bench 2.1 par le bien plus difficile Terminal-Bench 4.0 à 66 tâches, et a remplacé τ³-Banking par AutomationBench-AA. Les points forts de Gemini 3.1 Pro en février se situaient dans des évaluations que le nouvel index a retirées ou repondérées. Donc : ce n'est pas le modèle qui a empiré, c'est l'examen. Mais si vous choisissez un modèle aujourd'hui, le chiffre d'aujourd'hui est celui sur lequel vous pouvez réellement agir, et le chiffre d'aujourd'hui favorise Qwen.

Là où les deux divergent véritablement

Les scores agrégés masquent la forme de la différence, et c’est la forme qui est utile. Chaque chiffre ci-dessous provient de la même capture du 23 septembre des pages v4.3.2 d’Artificial Analysis pour les deux modèles, sur la même révision.

• Raisonnement et connaissances — Gemini est nettement en tête. GPQA Diamond 94,1 vs 90,5 ; Humanity's Last Exam 47,0 vs 33,9 ; SciCode 58,7 vs 46,6 ; CritPt 17,7 vs 5,4.

• Tâches professionnelles du monde réel — Qwen mène, et de loin. GDPval normalisé 45,4 % vs 13,8 %.

• Banque et transactions agentiques — Qwen en tête. τ-Banking 48,0 vs 21,4 pour Gemini.

• Utilisation d’outils agentiques sur un benchmark général — Gemini est en tête là où Qwen n’a pas été mesuré. τ²-Bench 95,6 pour Gemini ; aucun chiffre n’existe pour Qwen3.8-27B.

• Travail sur le terminal — proches, et tous les deux mauvais sur le nouveau benchmark. Terminal-Bench 2.1 : Qwen 79,8, Gemini 73,8. Terminal-Bench 4.0 : Qwen 5,6 %, Gemini 4,0 % — tous les deux à un seul chiffre.

• Calibration — la divergence la plus marquée sur l’une ou l’autre page. Sur AA-Omniscience, Gemini obtient 31,9 avec une exactitude de 54,9 % et un taux d’hallucination de 50,9 % ; Qwen obtient −10,0 avec une exactitude de 15,6 % et un taux d’hallucination de 30,3 %. Gemini en sait plus et l’invente plus de la moitié du temps ; Qwen refuse fréquemment de répondre et hallucine sur environ un tiers de ce à quoi il répond.

• Contexte long — strictement à égalité sur le rappel en contexte long, 82,0 chacun. Sur le rappel multimodal en contexte long, Qwen 21,7 % contre Gemini 15,6 %.

Lisez les entrées « non mesuré » pour ce qu’elles sont. Gemini n’a aucun chiffre normalisé GDPval-AA publié face aux 45,4 % de Qwen, et Qwen n’a aucun chiffre pour τ²-Bench, IFBench, Terminal-Bench Hard ou ITBench-SRE face aux 77,1, 53,8 et 30,3 de Gemini. Chacun de ces blancs est un endroit où un tableau récapitulatif aurait discrètement planté un vainqueur.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

La divergence qui décide des budgets : même coût pour faire tourner l'index

Qwen3.8-27B est nettement moins cher par token. Selon les chiffres du marché publiés par Artificial Analysis, il coûte 0,50 $ par million de tokens d'entrée et 3,00 $ par million de tokens de sortie, avec une remise de 80 % sur le cache et un tarif mixte 7:2:1 de 0,47 $. Gemini 3.1 Pro Preview coûte 2,00 $ et 12,00 $ — soit quatre fois le prix d'entrée et quatre fois le prix de sortie — avec une remise de 90 % sur le cache et un tarif mixte de 1,74 $.

Puis le chiffre que personne n'imprime : la comptabilité propre d'Artificial Analysis chiffre le coût d'exécution de l'ensemble de l'Intelligence Index à 1 310,21 $ pour Gemini 3.1 Pro Preview et 1 335,92 $ pour Qwen3.8-27B. Qwen n'est pas moins cher à faire tourner. Il est très légèrement plus cher, parce qu'il met plus de temps à y parvenir. Sur la facture de sortie de Qwen, 512,36 $ correspondaient à des tokens de raisonnement, contre 82,51 $ de réponse proprement dite ; pour Gemini, 691,82 $ correspondaient au raisonnement, contre 113,08 $ de réponse. Le prix par token est un tarif, pas une facture.

Deux autres données tarifaires que les tableaux comparatifs omettent. Premièrement, le prix de Gemini 3.1 Pro est dégressif selon la taille de l’entrée de chaque requête : 2,00 $/12,00 $ jusqu’à 200 K tokens d’entrée, puis 4,00 $/18,00 $ au-delà, avec les lectures de cache qui doublent de 0,20 $ à 0,40 $. La fenêtre de contexte d’un million de tokens est réelle, mais les 800 000 derniers tokens de celle-ci coûtent le double. Deuxièmement, notre propre entrée de catalogue pour Qwen3.8-27B — servi en block-FP8, tour de vision en pleine précision — affiche 0,40 $ en entrée et 4,21 $ en sortie, ce qui est moins cher en entrée et plus cher en sortie que le chiffre du marché ci-dessus, et ne publie aucun tarif de tokens mis en cache. Fournisseurs différents, découpage différent. Vérifiez le tarif qui vous sera réellement facturé.

Les deux modèles sont accessibles via une seule clé OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge, de sorte qu’un changement de prix du fournisseur se répercute de notre côté le jour même plutôt qu’après un cycle de réévaluation tarifaire — ce qui compte plus que d’habitude lorsque l’un des deux a un seuil de palier à 200K tokens.

Latence : le premier token le plus rapide appartient au modèle plus lent

C'est la paire de chiffres la plus trompeuse de toute la comparaison, et c'est celle sur laquelle un lecteur risque le plus d'agir à tort.

• Temps jusqu’au premier chunk — Qwen 4,04 s contre Gemini 28,37 s. Qwen semble sept fois plus rapide.

• Temps jusqu’à la réponse réelle — Gemini 28,37 s contre Qwen 52,52 s. Gemini gagne d’environ 1,8 fois, car Qwen passe 48,48 secondes à réfléchir entre le premier segment et le premier token de réponse.

• Vitesse de sortie — Gemini 116,5 jetons par seconde contre Qwen 41,3. Gemini est 2,8 fois plus rapide une fois qu'il commence à écrire, contre une médiane des comparateurs qu'Artificial Analysis situe à 95,4 jetons par seconde. La page de Qwen elle-même le qualifie de « notablement lent ».

Si votre produit diffuse un premier token à un utilisateur, la latence mise en avant de Qwen est un mensonge que vous vous raconterez une fois. Si votre produit attend une réponse complète, Gemini est le modèle le plus rapide. Les deux chiffres sont des mesures d'Artificial Analysis ; toutes deux ont été relevées au réglage d'effort xhigh de Qwen, qui est la valeur par défaut de la fiche du modèle.

Cette valeur par défaut est une plainte récurrente parmi les praticiens, et la fiche du modèle l'admet à moitié. Qwen3.8-27B expose un paramètre reasoning_effort avec trois niveaux — xhigh (le défaut, « pour les tâches complexes exigeant une analyse approfondie »), medium, et low. Les comptes rendus de la communauté jusqu'en septembre rapportent que xhigh produit de très longues phases de réflexion et recommandent de passer à medium ou low et de plafonner le budget de raisonnement. La propre fiche d'Alibaba avertit que dans le travail agentique multi-tours, réduire l'effort « ne réduit pas toujours le temps total d'achèvement de la tâche » — ce qui est une chose franche à dire pour une fiche de modèle et un avertissement que le correctif évident n'est pas toujours le correctif.

Contexte : 1M vs 262K, et ce qui convient vraiment

Gemini 3.1 Pro dispose d'une fenêtre de contexte de 1 000 000 de tokens avec une sortie maximale de 65 536 tokens. Qwen3.8-27B dispose nativement de 262 144 tokens, extensible à 1 000 000 grâce à la mise à l'échelle YaRN, avec des budgets distincts recommandés en son sein : un contenu de raisonnement allant jusqu'à 262 144 tokens et une réponse finale allant jusqu'à 131 072.

Deux notes de bas de page honnêtes. Le tableau de spécifications d'Artificial Analysis indique une fenêtre de 256 000 pour Qwen, tandis que le texte de sa propre FAQ parle de 260 K et que la fiche du modèle indique 262 144 — ce sont des différences d'arrondi sur un même nombre, mais citez 262 144, car c'est ce qu'indique la fiche. Et l'extension à 1 M est une technique de mise à l'échelle, ce n'est pas la même chose qu'une fenêtre native d'un million de tokens : le rappel en contexte long à 1 M sur un modèle étendu par YaRN n'est pas ce que mesure le chiffre de 82,0 AA-LCR. Personne n'a publié de score de rappel en contexte de 1 M pour Qwen3.8-27B. Considérez la fenêtre de Gemini comme celle dont le comportement a été mesuré à pleine longueur, et celle de Qwen comme celle que vous devriez tester vous-même avant de concevoir quoi que ce soit autour d'elle — et rappelez-vous qu'au-delà de 200 K tokens d'entrée, le prix de Gemini double.

Travail agentique et appel d'outils

Voici où la confrontation est véritablement indécise, et où désigner un vainqueur artificiel serait facile et faux. Qwen3.8-27B affiche des scores agentiques mesurés qui manquent à Gemini, et inversement.

Le dossier de Qwen repose sur un chiffre indépendant solide et sur un chiffre fourni par le vendeur. Le chiffre indépendant, c'est τ-Banking à 48,0 contre 21,4 pour Gemini — plus du double, sur la même révision, sur un benchmark portant sur l'utilisation d'outils en plusieurs étapes dans un environnement bancaire. Le chiffre du vendeur provient de la propre fiche d'Alibaba, qui affiche OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 et Agents' Last Exam 20,4 en Pass@1. Ce sont là des évaluations d'Alibaba, que personne d'autre n'a refaites, et elles tombent exactement dans les catégories où le résultat GDPval mesuré de façon indépendante (45,4 % normalisé contre 13,8 %) pointe dans la même direction.

L'argument de Gemini, c'est qu'il possède le seul score agentique absolu élevé de la comparaison — τ²-Bench 95,6 — et que Qwen n'a aucun score τ²-Bench. Il affiche en outre 77,1 à IFBench pour le suivi d'instructions, une autre case vide du côté de Qwen. Et il dispose de sept mois d'historique de production, ce qui n'est pas le cas d'une version à poids ouverts de cinq semaines.

Le départage n'est pas un score, c'est votre topologie. L'avantage agentique de Qwen est mesuré sur des benchmarks où le modèle opère à l'intérieur d'un grand système logiciel préexistant qu'il n'a pas conçu. Celui de Gemini est mesuré sur des benchmarks où le modèle doit suivre précisément des instructions pendant longtemps. Ce sont des compétences différentes, et les deux sont réelles.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Codage

Le codage se divise de la même manière, c’est pourquoi la question « lequel est meilleur en code » n’a pas de réponse nette ici. Gemini mène sur le versant du calcul scientifique — SciCode 58,7 vs 46,6 — et son AA Coding Index de 68,8 sur notre page catalogue est à une erreur d’arrondi près de celui de Qwen, 68,1, soit bien à l’intérieur de tout intervalle de confiance digne d’être cité. Sur le travail en terminal agentique, les deux sont proches sur le benchmark plus ancien, Qwen 79,8 vs Gemini 73,8 sur Terminal-Bench 2.1, et indiscernables sur le plus récent, où tous deux tombent à un chiffre.

La fiche d'Alibaba revendique bien plus — SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 — mais ces chiffres sont déclarés par le fournisseur, et la fiche indique en note que SWE-bench Pro et QwenSWEBench ont été exécutés dans le harnais Claude Code, qui n'est pas le harnais qu'aurait utilisé un concurrent. L'affirmation prudente est que, sur le seul benchmark de codage sur lequel les modèles des deux laboratoires ont été mesurés par un tiers, les deux sont séparés de quatre points sur Terminal-Bench 2.1 et de 1,6 point sur Terminal-Bench 4.0, et que tous deux sont mauvais sur le plus difficile.

Poids ouverts versus un point de terminaison de prévisualisation

C'est l'axe sur lequel les deux ne sont absolument pas comparables, et c'est celui qui a la plus grande conséquence pratique.

Qwen3.8-27B est sous Apache 2.0, 27B paramètres denses, 64 couches, avec un hybride d’attention linéaire Gated DeltaNet et d’attention complète selon un rapport d’environ 3:1 — la conception qui rend une fenêtre de 262K abordable à servir. Il tourne. Quantifié en 4 bits, il tient dans environ 17 Go, soit un seul GPU grand public ; tout un écosystème de compression a vu le jour autour de lui en cinq semaines, depuis les quants Dynamic V3 d’Unsloth, y compris une version 1 bit qui, selon Unsloth, tourne dans 8 Go à environ 77 % de la précision d’origine, jusqu’au Ternary Bonsai 2 27B de PrismML à la mi-septembre. Vous pouvez l’affiner, l’auditer et l’exécuter sur un ordinateur portable avec le réseau débranché.

Gemini 3.1 Pro est un point de terminaison d’aperçu fermé, vieux de sept mois, sans date de GA, avec une fiche de modèle qui avertit explicitement que les aperçus peuvent ne pas offrir la stabilité, la disponibilité et le support d’une version stable, et — depuis cette semaine — une console de développement qu’il semble avoir discrètement quittée. Vous ne pouvez pas le télécharger, vous ne pouvez pas épingler une version, et vous ne pouvez pas basculer vers vous-même.

Si vous voulez la réponse honnête en matière de routage plutôt qu’un verdict : c’est l’existence du point de contrôle ouvert qui rend la dépendance à Gemini survivable. Placez Qwen3.8-27B derrière un chemin local ou auto-hébergé comme solution de repli, gardez Gemini 3.1 Pro sur le chemin principal pour le travail à forte intensité de raisonnement pour lequel il est mesurablement meilleur, et placez les deux derrière un seul point de terminaison avec basculement automatique, afin qu’une disparition silencieuse depuis la console de quelqu’un d’autre soit un incident que votre couche de routage absorbe plutôt qu’une panne que vos utilisateurs voient. Ce n’est pas un argumentaire pour un produit — c’est la seule configuration dans laquelle les nouvelles de cette semaine ne vous coûtent pas un week-end.

Choisissez Gemini 3.1 Pro si

• Votre travail le plus difficile est le raisonnement à forte intensité de connaissances plutôt que l'utilisation d'outils à long horizon — il fait passer GPQA Diamond de 94,1 à 90,5, Humanity's Last Exam de 47,0 à 33,9, SciCode de 58,7 à 46,6 et CritPt de 17,7 à 5,4.

• Vous avez besoin d’entrées véritablement longues. Une fenêtre d’un million de tokens réellement mesurée, dont le comportement de rappel a été testé sur la durée, bat une fenêtre de 262K étendue par une technique — à condition de pouvoir accepter que le prix double au-delà de 200K tokens d’entrée.

• Le temps nécessaire pour obtenir une réponse complète compte plus que le temps jusqu’au premier token, et vous voulez 116,5 tokens par seconde plutôt que 41,3.

• Vous avez aujourd’hui besoin d’une large multimodalité : des entrées audio, fichier, image, texte et vidéo face aux entrées texte, image et vidéo de Qwen.

• Vous êtes prêt à accepter le risque lié à l’aperçu, et vous disposez d’une solution de repli que vous contrôlez.

Choisissez Qwen3.8-27B si

• Vos agents opèrent au sein de vastes systèmes existants — τ-Banking, de 48,0 à 21,4, et GDPval, de 45,4 % à 13,8 % en valeurs normalisées, constituent les deux plus grands avantages d'un modèle unique de toute cette comparaison.

• Vous avez besoin que la réponse soit honnête plutôt qu’assurée. Un taux d’hallucination de 30,3 % contre les 50,9 % de Gemini, c’est un produit d’un autre genre.

• Les contraintes de licence ou de résidence des données excluent une API fermée, ou vous devez effectuer un fine-tuning sur vos propres données.

• Vous voulez une facture par token égale à un quart de celle de Gemini et acceptez de dépenser la différence en tokens de réflexion — l’index coûte la même chose à exécuter sur les deux.

• Vous êtes prêt à régler reasoning_effort à la baisse par rapport à son xhigh par défaut plutôt que de le livrer tel quel.

Ce que nous n’avons pas pu vérifier

Pour mémoire, et parce qu'une page comparative ne vaut que par ses blancs : aucune évaluation indépendante n'a été publiée pour Qwen3.8-27B avec un effort de raisonnement réduit, si bien que son compromis vitesse-qualité à effort moyen et faible n'est pas mesuré. Aucun score de rappel en contexte long n'existe pour la configuration 1M étendue par YaRN. Gemini 3.1 Pro n'a aucun score normalisé GDPval-AA publié, et Qwen3.8-27B n'en a aucun pour τ²-Bench, IFBench ou ITBench-SRE. Et personne — y compris Google — n'a dit pourquoi Gemini 3.1 Pro a quitté le sélecteur d'AI Studio le 18 septembre. Nous mettrons à jour cette page dès que l'un de ces éléments changera.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement