Une carte hero générée intitulée « GPT-6.1 Sol vs MiniMax M3 » avec deux panneaux arrondis : à gauche « GPT-6.1 Sol » listant « OpenAI - sorti le 29 sept. 2026 », « 2,00 $ en entrée / 10,00 $ en sortie par million », « Indice AA 51,8 » et « 0,72 $ par tâche » ; à droite « MiniMax M3 » listant « MiniMax - sorti le 31 mai 2026 », « 0,30 $ en entrée / 1,20 $ en sortie par million », « Indice AA 29,2 » et « 0,51 $ par tâche » ; entre les deux, la ligne « Carte moins chère, facture allégée - écart de 22,6 points d'indice » ; en pied de page « Chiffres : Artificial Analysis v4.3.2. » et le logo OrcaRouter en bas à droite.
Guides & Insights

GPT-6.1 Sol vs MiniMax M3 : la grille tarifaire moins chère perd sur l'Armor

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

MiniMax M3 asks for a fraction of what GPT-6.1 Sol asks — $0.30 per million input tokens against $2.00, $1.20 per million output against $10.00 — and by the meter that actually runs, it is cheaper: $0.508 per task against $0.724 on Artificial Analysis's v4.3.2 evaluation. That is a genuine win, and it is also the whole of the argument, because the same measurement that hands M3 the lower bill hands GPT-6.1 Sol a 22.6-point index lead, and the benchmark set that measures whether a model can finish agentic work rather than describe it turns the gap into a wall. The vendor shipped GPT-6.1 Sol on 29 September 2026. The company released M3, its 428-billion-parameter open-weight model, on 31 May 2026.

Les deux sont en production, les deux ont un tarif, et les deux ne sont qu'à un appel d'API. Ce qui suit, c'est l'arithmétique qui tranche entre les deux, ainsi que les deux endroits où l'arithmétique ne raconte pas toute l'histoire.

Ce qu'est réellement chaque modèle

GPT-6.1 Sol est le modèle phare actuel d’OpenAI pour le raisonnement et l’ingénierie logicielle — un modèle fermé, publié une seule semaine après le GPT-6 Sol qu’il remplace, et vendu au même prix catalogue de 2,00 $ / 10,00 $ que son prédécesseur. Il applique un tarif d’entrée mise en cache de 0,10 $, soit la moitié de ce que GPT-6 Sol facturait pour les accès au cache, et c’est le modèle qu’OpenAI met en avant lorsqu’elle parle de codage agentique plutôt que de chat.

MiniMax M3 est un modèle à mélange d'experts comptant 428 milliards de paramètres au total et 23 milliards actifs par token, publié sous la MiniMax Community License — une publication à poids ouverts assortie d'une licence personnalisée à consonance non commerciale, non approuvée par l'OSI. Il est servi par un large éventail de fournisseurs d'inférence : Artificial Analysis recense quinze hébergeurs pour M3, contre huit pour GPT-6.1 Sol. Cette diversité constitue l'avantage pratique des poids ouverts, et c'est aussi pourquoi la concurrence sur les prix autour de M3 a été plus rapide que sur le modèle fermé.

La grille tarifaire, et le compteur qui la supplante

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Mettez les deux grilles tarifaires publiées côte à côte : il n'y a pas photo.

• Entrée — GPT-6.1 Sol 2,00 $ par million vs MiniMax M3 0,30 $ par million ; M3 est 85 % moins cher
• Sortie — 10,00 $ par million vs 1,20 $ par million ; M3 est 88 % moins cher
• Entrée mise en cache — 0,10 $ par million vs 0,06 $ par million
• Coût par tâche AA — 0,724 $ vs 0,508 $ ; M3 est 30 % moins cher, et non 85 %
• Jetons de sortie par tâche — 38 128 vs 48 192 ; M3 écrit 26 % de plus
• Temps par tâche — 640 s vs 486 s
• Fenêtre de contexte — 1 050 000 vs 1 048 576 jetons ; pratiquement au même niveau
• Sortie maximale — 128 000 jetons vs 512 000 ; M3 écrira une réponse très longue
• Entrées acceptées — texte, image et fichier vs texte, image et vidéo
• Rang dans l’index — GPT-6.1 Sol 10e sur 147 modèles vs MiniMax M3 62e

Les deux lignes bon marché du haut sont celles que voit une feuille de calcul des achats. La troisième ligne est celle qui paie la facture, et elle dit qu'un avantage de 85–88 % sur la grille tarifaire devient un avantage réel de 30 %, parce que M3 émet plus de tokens par tâche et parce qu'une tâche n'est pas une quantité de travail fixe. Les grilles tarifaires facturent des tokens ; le travail se facture en tâches. Toute comparaison qui s'arrête aux deux premières lignes compare les mauvais chiffres, dans la mauvaise unité.

Là où les trente pour cent cessent de compter

Le coût de la tâche est suffisamment proche pour que l’écart d’indice tranche pour tout ce qui dépasse le texte en masse. Artificial Analysis situe GPT-6.1 Sol à 51,83 et MiniMax M3 à 29,22 — un écart de 22,6 points, et un écart qui n’est pas réparti uniformément dans l’ensemble des évaluations. Sur les évaluations qui demandent à un modèle d’utiliser un terminal, de modifier un dépôt et de vérifier son propre travail, les deux modèles ne sont pas dans la même catégorie :

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 vs MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 vs 0.0048
• AA-Omniscience — 41.53 vs 1.35
• MMLU-Pro — 0.8595 vs 0.7856
• AutomationBench — 0.6487 vs 0.2125
• τ²-bench — non publié pour GPT-6.1 Sol dans cette exécution vs 0.8889 pour M3
• GPQA Diamond — non publié pour GPT-6.1 Sol dans cette exécution vs 0.9293 pour M3
• CritPT — 0.3171 vs 0.0371

Lisez cela attentivement, car ce n'est pas un sans-faute, et ce sont les exceptions qui sont intéressantes. MiniMax M3 obtient 0,8889 sur τ²-bench, l'évaluation de dialogue portant sur l'usage d'outils et le service client, et 0,9293 sur GPQA Diamond — un score en sciences de niveau troisième cycle qui dépasse tous les chiffres d'OpenAI publiés dans cette campagne-ci. M3 est un raisonneur compétent et un bon utilisateur d'outils en conversation. Sur Terminal-Bench 4.0, il obtient 0,0202. Ce n'est pas « moins bien » ; c'est un modèle totalement incapable de tenir une tâche multi-étapes sur un dépôt, et aucune réduction sur les tokens ne rend une tâche que le modèle échoue moins chère que la tâche que le modèle termine.

Il y a un coût de second ordre que le chiffre par tâche dissimule. M3 enregistre 48 192 jetons de sortie par tâche et un temps jusqu'à la première réponse de 23,0 secondes, contre 332,0 secondes pour GPT-6.1 Sol — le petit modèle commence à parler presque immédiatement, puis raisonne longuement. Si votre charge de travail est sensible à la latence mais superficielle, c'est un point en faveur de M3. Si elle est agentique, le nombre de jetons est ce que vous payez et le score final est ce que vous obtenez.

Notre propre fiche de modèle pour GPT-6.1 Sol présente les mêmes chiffres sous la forme que vous utiliseriez réellement pour le routage : le tarif de 2,00 $ / 10,00 $, une fenêtre de contexte de 1 050 000 jetons, un temps p50 jusqu'au premier jeton de 4,54 secondes, ainsi que l'indice et le bloc de benchmarks d'Artificial Analysis figurant sur la même page.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Ce que valent les poids ouverts ici

Le fait que M3 soit téléchargeable est son meilleur argument, et il vaut la peine d’être précis sur ce que cela apporte. Cela apporte des conditions de licence qui vous permettent d’exécuter le modèle à l’intérieur de votre propre périmètre — utile si les données ne peuvent pas sortir — et cela apporte la concurrence sur les prix qui découle de quinze hébergeurs indépendants. Cela ne vous offre pas pour autant un déploiement bon marché : 428 milliards de paramètres dont 23 milliards actifs nécessitent toujours du matériel d’inférence sérieux, et la MiniMax Community License est une licence personnalisée assortie de conditions, et non une licence sans restriction. Pour la plupart des équipes, « open weights » signifie un meilleur prix sur l’inférence hébergée, et non une machine dans la baie.

La carte OrcaRouter pour MiniMax M3 est l'endroit où résident les chiffres servis : le tarif de 0,30 $ / 1,20 $, la fenêtre de contexte de 1 048 576 jetons, la sortie maximale de 512 000 jetons, l'entrée texte/image/vidéo, et un volume de 56,4 millions de jetons sur sept jours auprès des fournisseurs qui l'acheminent.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Tous les deux derrière une seule touche

La raison pratique pour laquelle cette comparaison relève d'un changement de configuration plutôt que d'une migration, c'est que les deux modèles sont accessibles depuis un seul point de terminaison OrcaRouter — une API unique pour plus de 200 modèles, avec le prix catalogue du fournisseur répercuté à 0 % de marge, ce qui signifie qu'une modification du tarif MiniMax atterrit sur votre facture le jour même où le fournisseur la publie, plutôt qu'au moment où un revendeur la renégocie. Cela compte davantage pour M3 que pour son rival : la raison même de router vers un modèle à poids ouverts est que son prix et sa liste d'hébergeurs évoluent, et un compteur en répercussion est le seul type qui suive une cible mouvante.

Le basculement automatique est l'autre moitié. M3 est servi par de nombreux fournisseurs dont la fiabilité varie, et la couche de routage peut déplacer une requête vers un autre hôte lorsqu'un fournisseur se dégrade, sans que l'appelant sache sur quel hôte elle a atterri. C'est la manière honnête d'adopter un modèle dont le score Terminal-Bench dit « pas pour le chemin critique » — le placer là où une nouvelle tentative coûte peu.

Lequel, si vous devez choisir aujourd'hui

Si le travail porte sur du texte en volume — extraction, synthèse, classification, dialogue, tout ce dont la sortie est de la prose et où le mode de défaillance est une phrase erronée plutôt qu’un build cassé — MiniMax M3 est le choix par défaut correct, et les trente pour cent représentent de l’argent bien réel. Utilisez les chiffres de GPQA et de τ²-bench comme preuve : c’est un modèle performant qui se trouve être bon marché.

Si le travail est agentique — dépôts, terminaux, chaînes d'outils, tout ce qui comporte une étape de vérification —, le 0,0202 sur Terminal-Bench 4.0 est disqualifiant, et GPT-6.1 Sol à 0,5606 pour 0,724 $ la tâche est la meilleure affaire, même à 85 % de plus par token. Le tarif n'a jamais été ce que vous achetiez.

La réponse utile, c'est que vous n'avez pas à choisir une fois pour toutes. Routez le palier superficiel vers M3, routez le palier agentique vers GPT-6.1 Sol, et gardez les deux derrière un seul identifiant — le DSL de routage compose les deux en un seul appel lorsqu'une tâche commence comme une extraction et se transforme en travail de réparation.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement