Une carte de titre générée avec le grand titre « GPT-6 Astra Ultrafast vs MiMo v2.6 Pro Ultraspeed », le sous-titre « Même manœuvre, deux offres différentes », et deux cartes indiquant « Multiple de prix : 6x vs 10x » et « Vitesse annoncée : 8x vs 20x », avec un pied de page indiquant « Chiffres déclarés par le fournisseur, septembre-octobre 2026 ».
Guides & Insights

GPT-6 Astra Ultrafast vs Xiaomi MiMo v2.6 Pro Ultraspeed : même manœuvre, deux accords différents

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux laboratoires ont réalisé la même manœuvre au cours de la même quinzaine, et le plus intéressant est qu’ils l’ont réalisée à partir d’hypothèses opposées sur ce qu’un client achète. GPT-6 Astra Ultrafast est le produit phare du fournisseur, vendu via le palier de service Ultrafast — le modèle publié le 3 septembre 2026, le palier largement disponible depuis le 29 septembre 2026, et cité dans la publication NVIDIA du 1er octobre comme fonctionnant sur des GPU Blackwell. Xiaomi MiMo v2.6 Pro Ultraspeed est la version de Xiaomi, publiée le 22 septembre 2026 : le même point de contrôle de 1,02 billion de paramètres que MiMo-V2.6-Pro, servi plus rapidement, à un rythme environ dix fois supérieur au rythme standard.

L’un d’eux est le moyen le plus rapide d’appeler un modèle de pointe. L’autre est le palier rapide le moins cher qui existe. Ils ne sont pas concurrents au sens ordinaire — il faudrait écrire une application très étrange pour choisir entre un modèle phare fermé à 300 $ par million de tokens et un modèle à poids ouverts à 8,70 $ par million de tokens. Ce qui rend ce duo digne d’une page, c’est que tous deux sont des paliers de vitesse plutôt que des modèles, si bien que les comparer isole l’unique question que pose un palier de vitesse : pour quoi exactement payez-vous le multiple ?

Les deux niveaux vendent la même non-chose

Aucun des deux noms n’est un point de contrôle. C’est la partie que la couverture du lancement a tendance à brouiller, il vaut donc la peine de l’aborder de manière mécanique.

• Ce que le nom désigne — GPT-6 Astra Ultrafast est GPT-6 Astra avec le champ de requête service_tier: "ultrafast" défini ; l'identifiant du modèle dans la requête est toujours gpt-6-astra. Xiaomi MiMo v2.6 Pro Ultraspeed est le checkpoint MiMo-V2.6-Pro servi sur un chemin plus rapide, facturé comme une ligne distincte.

• Ce qui change — le traitement par lots, le décodage spéculatif, l’allocation matérielle, les limites de concurrence, la gestion des connexions. Tout ce qui se trouve entre les poids et votre requête HTTP, et rien à l’intérieur des poids.

• Ce qui ne change pas — les réponses. Le même checkpoint aux mêmes réglages devrait produire le même contenu à un rythme différent. Si deux voies du même modèle divergent sur une entrée identique, c'est un défaut à signaler, pas une capacité que vous avez achetée.

• Pourquoi cela compte pour cette comparaison — étant donné qu'aucun des deux niveaux ne revendique une amélioration de benchmark par rapport à sa propre gamme standard, toute la décision d'achat se résume à un rapport entre le prix par token et les secondes gagnées. Ce qui signifie que les deux offres se décident par l'arithmétique, et non par l'évaluation.

Il y a toutefois une asymétrie dans la présentation, et elle ne se situe pas dans les paliers. L’UltraSpeed de Xiaomi repose sur un modèle sous licence ouverte — les poids de MiMo-V2.6 sont sous licence MIT, d’après les fiches de modèle de Xiaomi elles-mêmes, et la famille a été publiée avec son environnement d’entraînement RL. L’Ultrafast d’OpenAI repose sur un fleuron fermé auquel on ne peut accéder que via une API. Payer un multiple de vitesse pour des poids ouverts est une décision réversible ; vous pouvez toujours servir le checkpoint vous-même. Payer ce multiple pour un fleuron fermé ne l’est pas.

A screenshot of the XiaomiMiMo/MiMo-V2.6-Pro-RL model card on Hugging Face, showing 64 likes, the TextGeneration, Transformers, Safetensors, English, Chinese, conversational, custom_code, 8-bit precision and fp8 tags, an MIT licence tag, a Safetensors model size of 524B params and the model card's opening description of MiMo-V2.6-Pro-RL as the flagship checkpoint of the MiMo-V2.6 series, covering native omnimodal input and 1M-token context.

Les deux multiples de prix, et ce qu’ils achètent

C'est ici que la paire cesse d'être symétrique, et les chiffres sont inhabituellement nets des deux côtés parce que chaque fournisseur a facturé un multiple plutôt qu'un montant absolu.

• GPT-6 Astra Ultrafast — 60,00 $ par million de jetons d'entrée, 6,00 $ pour l'entrée en cache, 75,00 $ pour l'écriture en cache et 300,00 $ pour la sortie, contre 10,00 $ et 50,00 $ pour le niveau standard. Uniformément 6,00x sur toutes les colonnes, passant à 120,00 $ et 450,00 $ au-delà de 272 000 jetons d'entrée. Le niveau standard est disponible dans notre catalogue au prix catalogue d'OpenAI, soit la façon la moins chère d'accéder au modèle phare.

• Xiaomi MiMo v2.6 Pro Ultraspeed — 4,35 $ en entrée et 8,70 $ en sortie par million de tokens, par rapport à la voie Pro standard à 0,44 $ et 0,87 $. Cela représente environ 9,9x en entrée et exactement 10x en sortie.

• Les affirmations de vitesse associées à ces multiples — OpenAI et NVIDIA plafonnent tous deux Astra Ultrafast à « jusqu'à 8x » plus rapide que le mode standard Astra pour la génération de tokens. La documentation de Xiaomi elle-même annonce une vitesse de sortie jusqu'à 20x supérieure à celle du service Pro standard ; des fiches de catalogue tierces décrivant le même modèle le même jour indiquent environ 10x. Aucune mesure permettant de concilier ces deux chiffres n'a été publiée.

• Le ratio multiple/vitesse — Le prix 6x d'OpenAI permet d'obtenir un plafond annoncé de 8x, donc ce palier est facturé en dessous de son propre scénario optimal. Selon le chiffre auquel vous croyez, le prix 10x de Xiaomi permet d'obtenir un plafond annoncé de 10x à 20x, donc au plafond du fournisseur, l'opération est favorable et, au chiffre inférieur, c'est une opération blanche.

C'est la différence la plus déterminante entre les deux, et elle est plus étroite que ne le suggèrent les prix affichés. Par unité de latence supprimée selon les propres chiffres des fournisseurs, Astra Ultrafast est la meilleure des deux offres. Par jeton traité, Xiaomi UltraSpeed est environ quatorze fois moins cher en entrée et trente-quatre fois moins cher en sortie que les tarifs d'Ultrafast, et entre deux et six fois moins cher que la voie standard d'Astra — mais c'est un modèle différent, et nettement moins capable, ce qui est le compromis que vous faites réellement. Les propres fiches de modèle de Xiaomi pour la famille publient des informations factuelles sur l'architecture et l'entraînement plutôt qu'un score agrégé indépendant, et aucun relevé de l'indice sur lequel est mesuré le modèle phare d'OpenAI n'a été publié pour lui, absolument aucun.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes on the 10% regional-processing uplift and on GPT-5.6 Sol's promotional pricing running at least through November 21, 2026.

Ce que les deux fournisseurs ont choisi de divulguer

Les paliers de vitesse relèvent davantage d'un test de divulgation que d'un test de performance, car l'élément qui serait nécessaire pour vérifier l'affirmation — une distribution de latence à une concurrence déclarée — est entièrement entre les mains du fournisseur.

Le post du 1er octobre de NVIDIA est la déclaration publique la plus précise derrière le palier Astra, et ce qu'il apporte relève de l'attribution plutôt que de la mesure : des GPU Blackwell, une disponibilité dans l'API OpenAI et pour les utilisateurs éligibles de ChatGPT Work et Codex, et deux ingénieurs d'OpenAI décrivant la boucle. Philippe Tillet, responsable de l'inférence chez OpenAI, déclare qu'Astra peut « transformer ces connaissances en noyaux haute performance qui rendent le matériel NVIDIA convaincant » ; Uday Ruddarraju, directeur technique du calcul chez OpenAI, déclare : « nous avons utilisé nos modèles internes pour optimiser l'inférence sur les GPU NVIDIA ». Aucune de ces deux phrases n'est accompagnée d'un chiffre de débit pour le palier. Le 8x tient tout seul, sans autre qualification que « jusqu'à ».

La divulgation de Xiaomi a pris la direction opposée — elle a publié les données économiques de l’entraînement, y compris l’environnement et le code d’apprentissage par renforcement, et ses fiches de modèle contiennent des informations d’architecture plutôt que des informations de service. Le palier UltraSpeed lui-même était assorti d’une affirmation de 20x et d’aucune courbe de latence publiée. Ce qui signifie que, sur la question à laquelle un palier de vitesse est censé répondre, les deux fournisseurs sont tout aussi peu utiles, et cette égalité est le constat honnête.

Choisir, si vous devez vraiment le faire

Les deux niveaux ne se chevauchent pas beaucoup, de sorte que la décision consiste moins à choisir un gagnant qu'à reconnaître auquel des deux achats correspond le vôtre.

Choisissez Astra Ultrafast si le travail est agentique et que le choix du modèle est déjà arrêté. Une tâche de 40 000 jetons en sortie passe de 2,00 $ à 12,00 $, et ce palier est le seul moyen d'obtenir la qualité d'un modèle de frontière à un rythme plus rapide. La documentation d'OpenAI elle-même est explicite sur la condition opérationnelle préalable : elle recommande les WebSockets « en particulier pour les applications agentiques qui effectuent de nombreux appels d'outils en succession rapide », en avertissant que « sans connexion persistante, la surcharge réseau peut réduire les gains de latence ». Activez le palier tout en laissant du HTTP par requête en dessous, et vous avez payé 6 fois plus cher pour une fraction de l'accélération. À savoir aussi avant de l'intégrer : ce palier ne prend en charge que la résidence des données aux États-Unis et le traitement mondial, sans point de terminaison de traitement régional dans l'UE ni ailleurs hors États-Unis, et il a été lancé avec des limites de débit initiales faibles, même pour les comptes qui seraient autrement admissibles à davantage.

Choisissez MiMo v2.6 Pro Ultraspeed si le modèle est un intrant banalisé pour un pipeline que vous pourriez héberger vous-même. La licence MIT signifie que la voie Pro standard n'est pas votre seul repli — l'auto-hébergement en est un. À 4,35 $ et 8,70 $, il est assez bon marché pour qu'un palier plus rapide mérite d'être activé à titre spéculatif plutôt que d'être justifié tâche par tâche, et son contexte de 1 M de tokens correspond à celui du modèle phare. Comprenez toutefois ce que vous achetez : un débit environ dix fois supérieur pour un modèle qui est en retrait par rapport à la frontière, ce qui est le bon compromis pour l'extraction à grand volume et le mauvais choix pour tout usage où la qualité des réponses conditionne le flux de travail.

Aucun des deux niveaux rapides n'est sur OrcaRouter, et cela mérite d'être dit plutôt que sous-entendu. Ce qui se trouve sur OrcaRouter, c'est openai/gpt-6-astra — le fleuron du niveau standard, à 10,00 $ et 50,00 $ par million de tokens, avec le palier de contexte long à 20,00 $ et 75,00 $, un contexte de 1 050 000 tokens et une sortie maximale de 128 000 tokens, via un point de terminaison compatible OpenAI. Aucun modèle Xiaomi n'est hébergé ici, de sorte que MiMo-V2.6-Pro et sa voie UltraSpeed ne sont accessibles que via l'API propre à Xiaomi et plusieurs plateformes tierces. L'utilité pratique d'un point de terminaison de plus de 200 modèles dans cette comparaison n'est pas l'accès aux niveaux rapides. Elle réside dans le fait que, lorsque vous voulez savoir si la voie coûteuse justifie son multiple, vous pouvez envoyer le même prompt à un modèle moins cher avec les mêmes identifiants et la même clé, dans la requête suivante, et le découvrir. C'est l'expérience la moins chère disponible, et c'est celle qui répond à la question — car aucun fournisseur n'a publié la courbe de latence qui vous permettrait d'y répondre sans mesurer.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

La lecture honnête

Les deux fournisseurs ont publié une grille tarifaire pour la latence au cours des trois dernières semaines, et aucun n’a fourni de mesure. Cette symétrie est tout le sujet, et elle a une conséquence pratique : les seuls chiffres sur lesquels vous pouvez agir aujourd’hui sont les prix, et ceux-ci sont inhabituellement instructifs parce que les deux parties ont appliqué un multiple simple plutôt qu’un chiffre sur mesure.

L'offre rapide d'OpenAI coûte six fois son propre tarif standard et revendique un plafond de huit. Celle de Xiaomi coûte dix fois son propre tarif standard et revendique un plafond situé quelque part entre dix et vingt, selon le chiffre auquel on choisit de croire. Si on les lit comme une arithmétique sur les chiffres des fournisseurs eux-mêmes, les deux sont quasiment du pareil au même : l'offre d'OpenAI achète un plafond revendiqué valant 1,33 unité de vitesse par unité de prix, celle de Xiaomi en achète entre 1,0 et 2,0 selon le même calcul — et si les deux peuvent être défendables, c'est parce que les deux niveaux s'adressent à des acheteurs différents qui n'envisageront jamais sérieusement l'option de l'autre. Les prix sont aussi la seule partie de l'un ou l'autre accord qui soit auditable aujourd'hui, car une grille tarifaire est un fait publié, et une affirmation de latence ne l'est pas.