
GPT-6 Sol vs MiniMax M3 : ce que huit fois le prix de sortie ne permet toujours pas d’acheter
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La première chose à dire au sujet de GPT-6 Sol face à MiniMax M3, c'est que la ligne des prix n'est pas proche et que celle des scores ne l'est pas non plus, et qu'elles pointent dans des directions opposées. MiniMax M3 est un modèle à poids ouverts que vous pouvez télécharger et exécuter vous-même, et il est affiché à 0,30 $ par million de jetons d'entrée et 1,20 $ par million de jetons de sortie ; GPT-6 Sol, le palier intermédiaire de la génération GPT-6 sortie le 22 septembre 2026, est à 2,00 $ et 10,00 $ pour les mêmes unités. Cela représente un peu plus de huit fois le tarif de sortie. MiniMax M3 accepte aussi la vidéo comme modalité d'entrée, ce que GPT-6 Sol ne fait pas — le modèle Sol prend en charge le texte, l'image et les fichiers. Ce que M3 n'a pas, c'est un score qui s'approche ne serait-ce que de loin de celui de Sol : 29,2 contre 47,6 à l'Indice d'intelligence d'Artificial Analysis, sur la même révision du tableau v4.3.2.
Cette asymétrie, c’est toute l’histoire, et elle est plus intéressante qu’un simple compromis prix-qualité, parce que la colonne open-weight peut conserver quelque chose que la colonne fermée ne peut vendre à aucun prix : les checkpoints de M3 sont sur Hugging Face et le modèle peut être exécuté à l’intérieur d’un périmètre réseau. Si vous hésitez entre ces deux options, la question utile n’est pas de savoir laquelle est meilleure. C’est de savoir à laquelle des quatre choses distinctes que vous achetez — prix, débit, contrôle ou capacité — vous pouvez vous permettre de renoncer.
Quatre dimensions, et elles ne se classent pas de la même manière
• Prix de sortie — GPT-6 Sol 10,00 $ par million vs MiniMax M3 1,20 $ par million
• Prix d'entrée — GPT-6 Sol 2,00 $ par million vs MiniMax M3 0,30 $ par million
• Entrée mise en cache — GPT-6 Sol 0,20 $ par million vs MiniMax M3 0,06 $ par million
• Poids — GPT-6 Sol fermé, API uniquement vs MiniMax M3 à poids ouverts et auto-hébergeable
• Modalités d'entrée — GPT-6 Sol texte, image et fichier vs MiniMax M3 texte, image et vidéo
• Fenêtre de contexte — GPT-6 Sol 1 050 000 jetons vs MiniMax M3 1 048 576 jetons
• Sortie maximale — GPT-6 Sol 128 000 jetons vs MiniMax M3 512 000 jetons
• Indice d'intelligence — GPT-6 Sol 47,6 vs MiniMax M3 29,2
• Indice de codage — GPT-6 Sol non publié pour cette révision vs MiniMax M3 58,6
• Palier pour requêtes longues — GPT-6 Sol réévalue l'ensemble de la requête au-delà de 272 000 jetons d'entrée vs MiniMax M3 aucun palier sur sa fiche
Deux de ces lignes méritent plus qu’une simple ligne. Le plafond de sortie maximale va à l’inverse de tout le reste : M3 émettra jusqu’à 512 000 tokens en une seule réponse, soit quatre fois les 128 000 de GPT-6 Sol. Pour une charge de travail qui génère un fichier entier ou un long rapport en un seul appel, c’est un avantage structurel, et non une erreur d’arrondi. Et le palier de requête longue est un coût bien réel de GPT-6 Sol que M3 n’a pas du tout — au-delà de 272 000 tokens d’entrée, Sol applique à l’intégralité de la requête un nouveau tarif de 4,00 $ / 15,00 $, tandis que la fiche tarifaire de M3 ne comporte aucune clause équivalente. Sur une invite de 300 000 tokens, la comparaison des tarifs de sortie n’est pas de huit fois, mais de douze fois et demie.
Donc le classement honnête dépend entièrement de la charge de travail. Pour de la classification ou de l’extraction à grand volume, où une mauvaise réponse coûte peu et où une réponse lente coûte cher, M3 à 0,30 $ / 1,20 $ sans pénalité de contexte long est le choix par défaut sensé, et Sol, c’est de l’argent jeté par les fenêtres. Pour une tâche où la première réponse doit être juste — un plan de migration, un audit de sécurité, un raisonnement qui sera lu par une personne qui agira en conséquence — un écart de 18,4 points sur l’indice à huit fois le prix de sortie est un compromis que la plupart des équipes acceptent, parce que l’alternative consiste à payer un humain pour le corriger.

Là où les chiffres publiés de M3 sont exceptionnellement bons, et là où ils sont maigres
Les chiffres indépendants les plus solides de MiniMax M3 ne se trouvent pas là où on les attendrait d'un modèle à ce prix. Le rappel en contexte long atteint 83,0, soit 0,7 point en dessous des 83,7 de GPT-6 Sol — pratiquement une égalité — sur une fenêtre d'un million de tokens, pour un sixième du prix d'entrée. GPQA Diamond atteint 92,9, assez proche de la bande de pointe pour que l'écart reste dans la fourchette que l'on attendrait de réglages d'effort de raisonnement plutôt que de la capacité elle-même. Ces deux lignes expliquent pourquoi M3 mérite d'être pris au sérieux plutôt que classé dans la catégorie « bon marché ».
Les points faibles sont tout aussi clairs et devraient être énoncés plutôt que passés sous silence. L’utilisation d’outils de type retail est médiocre : sur tau-banking, M3 obtient 15,3, et sur la révision plus récente de Terminal-Bench 4.0, il obtient 2,0. Ces deux mesures sont des mesures tierces, et toutes deux suggèrent un modèle dont la moyenne aux benchmarks masque une faiblesse importante et spécifique dans l’appel d’outils agentiques face à un service simulé. Les chiffres rapportés par le fournisseur lui-même brossent un tableau bien meilleur — SWE-Bench Pro 59, BrowseComp 83,5, MCP Atlas 74,2, Terminal-Bench 2.1 à 66 — et ce sont des chiffres du fournisseur sur son propre harnais, ce qui constitue une affirmation plutôt qu’une mesure. Tout déploiement qui repose sur l’utilisation d’outils devrait considérer ces deux chiffres ensemble et tester cela directement.
Il y a un point de second ordre concernant la comparaison de benchmarks elle-même. GPT-6 Sol est mesuré sur un ensemble de benchmarks plus restreint dans notre catalogue que ne l'est M3 — cinq scores contre vingt-trois pour M3 — parce que l'éditeur publie moins de résultats et que des tiers ont exécuté moins de tests sur ce modèle. Un modèle avec vingt-trois chiffres publiés paraîtra toujours plus minutieusement évalué qu'un autre qui n'en a que cinq, et la différence tient à la documentation, non aux capacités.
Ce que les poids ouverts vous apportent réellement, au-delà d’une facture moins élevée
L'auto-hébergement de M3 est l'option que GPT-6 Sol ne peut pas égaler, et sa valeur n'est pas principalement financière. À 0,30 $ / 1,20 $, l'API est moins chère que le coût d'exploitation du matériel pour la plupart des équipes, donc la raison de le télécharger tient à une contrainte plutôt qu'à un tableur : des données qui ne peuvent pas franchir une frontière, une charge de travail sans dépendance externe acceptable, un fine-tuning, ou un budget de latence qu'un point de terminaison partagé ne peut pas respecter. Les poids ouverts sont le seul de ces quatre points auquel le modèle fermé peut répondre, et il y répond en n'étant pas disponible. La réponse de GPT-6 Sol est que vous n'avez pas besoin de l'exécuter — ce qui est un argument différent, et vrai pour un ensemble différent d'équipes.
Le débit mérite sa propre ligne, car c'est le chiffre qu'une démo ne montre jamais. MiniMax M3 est mesuré à environ 495 jetons de sortie par seconde dans notre fenêtre glissante de sept jours, et GPT-6 Sol à environ 244. M3 n'est pas seulement le modèle le moins cher de cette comparaison, c'est aussi le plus rapide sur nos routes, d'environ un facteur deux, ce qui change le coût d'une tâche par lots en temps d'horloge comme en dollars. La réserve, c'est qu'il s'agit de fenêtres glissantes sur un espace partagé, et non d'un benchmark contrôlé, et qu'elles évoluent.

Faire fonctionner la paire comme un seul système
Les deux modèles se trouvent derrière une seule clé OrcaRouter, aux côtés de plus de 200 autres, ce qui fait de la configuration intéressante ici une cascade privilégiant le moins cher plutôt qu’un choix. Acheminez le volume vers MiniMax M3, gardez GPT-6 Sol derrière lui pour les requêtes qui échouent à un contrôle ou déclenchent un signal de difficulté, et le coût mixte atterrit bien plus près du tarif des modèles à poids ouverts que de celui de Sol, tandis que les appels difficiles obtiennent toujours le modèle qui obtient 47,6. C’est dans le DSL de routage d’OrcaRouter que s’exprime cette composition — un appel peut nommer plusieurs modèles et les conditions entre eux au lieu de coder en dur un point de terminaison par tâche.
Pour les équipes qui n’arrivent vraiment pas à se décider, la fusion de modèles est la version brute de la même idée : un panel de modèles répond ensemble et les réponses sont combinées. Elle convient mal au travail volumineux et convient raisonnablement à une invite rarement exécutée et à forts enjeux, où la différence entre une réponse de 29,2 et de 47,6 est la seule chose sur la page.
Le basculement compte davantage avec un modèle à poids ouverts qu'avec un modèle fermé, et pour une raison précise : M3 est servi par plus d'un fournisseur d'infrastructure, et les points de terminaison diffèrent. Une route configurée à l'avance signifie qu'un hôte lent ou dégradé donne lieu à une nouvelle tentative plutôt qu'à une panne. Et comme notre catalogue répercute les prix catalogue des fournisseurs sans marge, un changement de tarif d'un fournisseur est effectif de notre côté le jour même — ce qui compte sur une ligne de sortie à 1,20 $, où le déplacement par un fournisseur d'un seul tarif d'entrée mis en cache modifie visiblement une facture.

Lequel devriez-vous réellement appeler ?
Prenez MiniMax M3 pour le volume, pour tout ce qui demande une entrée vidéo, pour tout ce qui doit produire plus de 128 000 tokens en une seule réponse, et pour tout ce qui doit s’exécuter à l’intérieur de votre propre périmètre. Prenez GPT-6 Sol pour les requêtes dont la réponse est le produit, pour les boucles agentiques riches en outils où les scores tau-banking et Terminal-Bench 4.0 de M3 sont un avertissement plutôt qu’une note de bas de page, et pour tout ce où une différence d’indice de 18 points vaut pour vous huit fois le débit de sortie. Prenez les deux, et laissez un routeur décider, si aucun de ces deux cas ne décrit l’ensemble de votre trafic.
Une chose à vérifier avant l'un ou l'autre, et c'est le même point de contrôle que ce blog ne cesse de rencontrer : M3 est le fleuron de la gamme M-series depuis mai 2026 et reste le modèle M-series le plus récent de notre catalogue, il est donc véritablement actuel — mais GPT-6 Sol a déjà été remplacé par GPT-6.1 Sol aux mêmes tarifs de contexte court, avec une entrée mise en cache moins chère, et sa propre page GPT-6 Sol comporte un renvoi vers ce dernier. Si la raison pour laquelle vous regardez Sol ici est la capacité plutôt que l'intégration vieille de huit jours, regardez d'abord le successeur.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
