Ett genererat herokort med titeln 'GPT-6.1 Sol vs MiniMax M3' med två rundade paneler: till vänster 'GPT-6.1 Sol' som listar 'OpenAI – släppt 29 sep 2026', '$2.00 in / $10.00 ut per 1M', 'AA Index 51.8' och '$0.72 per uppgift'; till höger 'MiniMax M3' som listar 'MiniMax – släppt 31 maj 2026', '$0.30 in / $1.20 ut per 1M', 'AA Index 29.2' och '$0.51 per uppgift'; mellan dem raden 'Billigare kort, lägre räkning – 22.6 indexpunkter ifrån varandra'; sidfot 'Uppgifter: Artificial Analysis v4.3.2.' och OrcaRouter-logotypen längst ner till höger.
Guides & Insights

GPT-6.1 Sol vs MiniMax M3: Den billigare prislistan förlorar på fakturan

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiniMax M3 begär en bråkdel av vad GPT-6.1 Sol begär — $0,30 per miljon indatatoken mot $2,00, $1,20 per miljon utdatatoken mot $10,00 — och enligt den mätare som faktiskt körs är den billigare: $0,508 per uppgift mot $0,724 i Artificial Analysis v4.3.2-utvärdering. Det är en riktig vinst, och det är också hela argumentet, eftersom samma mätning som ger M3 den lägre räkningen ger GPT-6.1 Sol ett indexförsprång på 22,6 punkter, och den uppsättning benchmarks som mäter huruvida en modell kan slutföra agentiskt arbete snarare än beskriva det förvandlar gapet till en mur. Leverantören släppte GPT-6.1 Sol den 29 september 2026. Företaget släppte M3, sin modell med öppna vikter och 428 miljarder parametrar, den 31 maj 2026.

Båda är i drift, båda är prissatta och båda är ett API-anrop bort. Det som följer är aritmetiken som avgör mellan dem, och de två ställena där aritmetiken inte är hela historien.

Vad varje modell faktiskt är

GPT-6.1 Sol är OpenAI:s nuvarande flaggskepp för resonemang och mjukvaruutveckling — en sluten modell, släppt bara en vecka efter GPT-6 Sol som den ersätter, och säljs till samma listpris på $2,00 / $10,00 som sin föregångare. Den har en taxa på $0,10 för cachad indata, hälften av vad GPT-6 Sol tog för cache-träffar, och det är modellen som OpenAI pekar på när de pratar om agentisk kodning snarare än chatt.

MiniMax M3 är en mixture-of-experts-modell med 428 miljarder totala parametrar och 23 miljarder aktiva per token, publicerad under MiniMax Community License — ett släpp med öppna vikter under en anpassad licens med icke-kommersiell prägel, inte en OSI-godkänd sådan. Den tillhandahålls av ett brett fält av inferensleverantörer: Artificial Analysis registrerar femton värdar för M3 mot åtta för GPT-6.1 Sol. Den bredden är den praktiska fördelen med öppna vikter, och det är också därför priskonkurrensen på M3 har varit snabbare än på den slutna modellen.

Prislistan, och mätaren som övertrumfar den

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Ställer man de två publicerade prislistorna sida vid sida är det inte ens nära.

• Indata — GPT-6.1 Sol $2,00 per 1M mot MiniMax M3 $0,30 per 1M; M3 är 85 % billigare
• Utdata — $10,00 per 1M mot $1,20 per 1M; M3 är 88 % billigare
• Cachad indata — $0,10 per 1M mot $0,06 per 1M
• Kostnad per AA-uppgift — $0,724 mot $0,508; M3 är 30 % billigare, inte 85 %
• Utdatatokens per uppgift — 38 128 mot 48 192; M3 skriver 26 % mer
• Tid per uppgift — 640 s mot 486 s
• Kontextfönster — 1 050 000 mot 1 048 576 tokens; i praktiken lika
• Maximal utdata — 128 000 tokens mot 512 000; M3 skriver ett mycket långt svar
• Indata som accepteras — text, bild och fil mot text, bild och video
• Indexplacering — GPT-6.1 Sol 10:e av 147 modeller mot MiniMax M3 62:a

De två billiga raderna högst upp är de som ett inköpsblad ser. Den tredje raden är den som betalar notan, och den säger att en fördel på 85–88 % i prislistan blir en verklig fördel på 30 %, eftersom M3 genererar fler tokens per uppgift och eftersom en uppgift inte är en fast mängd arbete. Prislistor prissätter tokens; arbete prissätts i uppgifter. Varje jämförelse som stannar vid de två första raderna jämför fel siffror, i fel enhet.

Där de trettio procenten slutar spela roll

Kostnaden per uppgift ligger tillräckligt nära för att indexgapet ska avgöra saken för allt utöver stora textmängder. Artificial Analysis sätter GPT-6.1 Sol till 51,83 och MiniMax M3 till 29,22 – en spridning på 22,6 punkter, och en som inte är jämnt fördelad över testsviten. I de utvärderingar som ber en modell att använda en terminal, redigera ett kodförråd och verifiera sitt eget arbete, är de två modellerna inte i samma kategori:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 mot MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 mot 0.0048
• AA-Omniscience — 41.53 mot 1.35
• MMLU-Pro — 0.8595 mot 0.7856
• AutomationBench — 0.6487 mot 0.2125
• τ²-bench — inte publicerat för GPT-6.1 Sol i den här körningen mot 0.8889 för M3
• GPQA Diamond — inte publicerat för GPT-6.1 Sol i den här körningen mot 0.9293 för M3
• CritPT — 0.3171 mot 0.0371

Läs det noga, för det är inte ett rent svep och undantagen är det intressanta. MiniMax M3 får 0,8889 på τ²-bench, utvärderingen av verktygsanvändning och kundservicedialog, och 0,9293 på GPQA Diamond – ett naturvetenskapligt resultat på avancerad nivå som slår varje OpenAI-siffra som publicerats i just den här körningen. M3 är en kompetent resonerare och en bra verktygsanvändare i samtal. På Terminal-Bench 4.0 får den 0,0202. Det är inte ”sämre”; det är en modell som inte alls kan hålla ihop en flerstegsuppgift i ett kodförråd, och ingen rabatt på tokens gör en uppgift som modellen misslyckas med billigare än den uppgift som modellen slutför.

Det finns en andra ordningens kostnad som siffran per uppgift döljer. M3 registrerar 48 192 utdatatoken per uppgift och en tid till första svar på 23,0 sekunder, jämfört med 332,0 sekunder för GPT-6.1 Sol – den lilla modellen börjar prata nästan omedelbart och resonerar sedan utförligt. Om din arbetsbelastning är latenskänslig men ytlig, talar det till M3:s fördel. Om den är agentisk är antalet token det du betalar för och slutpoängen det du får.

Vårt eget modellkort för GPT-6.1 Sol har samma siffror i den form du faktiskt skulle routa mot: priset 2,00 $ / 10,00 $, ett kontextfönster på 1 050 000 tokens, en p50-tid på 4,54 sekunder till första token, och Artificial Analysis-indexet och benchmarkblocket på samma sida.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Vad de öppna vikterna är värda här

Att M3 går att ladda ner är det starkaste argumentet för det, och det är värt att vara precis om vad det ger. Det ger licensvillkor som låter dig köra modellen inom din egen gräns – användbart om data inte får lämna den – och det ger den priskonkurrens som kommer från femton oberoende värdar. Det ger dig inte en billig driftsättning: 428 miljarder parametrar vid 23 miljarder aktiva kräver fortfarande seriös inferenshårdvara, och MiniMax Community License är en skräddarsydd licens med villkor, inte en obegränsad. För de flesta team betyder "open weights" ett bättre pris på hostad inferens, inte en låda i racket.

OrcaRouter-kortet för MiniMax M3 är där de levererade siffrorna finns: taxan 0,30 $ / 1,20 $, kontextfönstret på 1 048 576 tokens, maximal utdata på 512 000 tokens, inmatning av text/bild/video och en sjudagarsvolym på 56,4 miljoner tokens hos de leverantörer som routar den.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Båda bakom en och samma knapp

Det praktiska skälet till att den här jämförelsen är en konfigurationsändring och inte en migrering är att båda modellerna går att nå från en enda OrcaRouter-endpoint — ett API för 200+ modeller, där leverantörens listpris förs vidare med 0 % påslag, vilket innebär att en ändring av MiniMax taxor slår igenom på din faktura samma dag som leverantören publicerar den, i stället för närhelst en återförsäljare omförhandlar. Det spelar större roll för M3 än för dess rival: hela anledningen till att routa till en modell med öppna vikter är att dess pris och dess värdlista rör på sig, och en mätare som förs vidare utan påslag är den enda sorten som följer ett rörligt mål.

Automatisk redundansväxling är den andra halvan. M3 betjänas av många leverantörer med varierande tillförlitlighet, och routningslagret kan flytta en begäran till en annan värd när en av dem försämras, utan att anroparen vet vilken värd den hamnade på. Det är det ärliga sättet att införa en modell vars Terminal-Bench-poäng säger "inte för den kritiska vägen" — placera den där ett återförsök är billigt.

Vilken av dem, om du måste välja idag

Om arbetet är masstext – extrahering, sammanfattning, klassificering, dialog, vad som helst där resultatet är prosa och felmoden är en felaktig mening snarare än en trasig build – är MiniMax M3 rätt standardval och de trettio procenten är riktiga pengar. Använd siffrorna från GPQA och τ²-bench som ditt bevis: detta är en kapabel modell som råkar vara billig.

Om arbetet är agentiskt — repositorier, terminaler, verktygskedjor, allt med ett verifieringssteg — är 0.0202 på Terminal-Bench 4.0 diskvalificerande, och GPT-6.1 Sol på 0.5606 för $0.724 per uppgift är den bättre affären även vid 85 % mer per token. Prislistan var aldrig det du köpte.

Det användbara svaret är att du inte behöver välja en gång för alla. Dirigera den ytliga nivån till M3, dirigera den agentiska nivån till GPT-6.1 Sol och håll båda bakom en och samma autentiseringsuppgift — routing-DSL:en sammanfogar de två till ett enda anrop när en uppgift börjar som extrahering och övergår till ett reparationsjobb.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen