Ett hero-rubrikkort för en artikel som jämför GPT-6 Sol Pro med Grok 4.7, med texten "GPT-6 Sol Pro vs Grok 4.7" och underrubriken "Dubbelt så mycket ordrikedom, en tredjedel av priset".
Guides & Insights

GPT-6 Sol Pro vs Grok 4.7: Dubbelt så många ord, en tredjedel av priset

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De två billigaste frontier-angränsande modellerna i september 2026 lanserades med en dags mellanrum, och det intressanta med dem är inte vilken som är smartare. GPT-6 Sol — modellen som folk tar till när de söker GPT-6 Sol Pro, vilket är samma modell med dess reasoning.mode inställt på pro snarare än en separat produkt — lanserades den 22 september 2026 för $2.00 per miljon indatatokens och $10.00 per miljon utdatatokens. Grok 4.7 från leverantören lanserades den 21 september till samma $2.00 för indata och $6.00 för utdata. I Artificial Analysis' neutrala testbänk hamnar de två modellerna två indexpoäng ifrån varandra och ungefär två dollar per slutförd uppgift ifrån varandra, och anledningen till den klyftan är inte förmåga. Det är hur många tokens var och en bränner för att komma dit.

Sol genererade 77 miljoner output-tokens när den körde Intelligence Index. Grok 4.7 genererade 240 miljoner. Det förhållandet – drygt tre till ett – är hela jämförelsen, och det inverterar slutsatsen som en pristabell per token ger dig.

De två prislistorna, och där den billiga inte är billig

Båda leverantörerna publicerar dessa siffror själva; ingen av dem har oberoende omprissatts.

• Indata — GPT-6 Sol 2,00 USD per miljon tokens vs Grok 4.7 2,00 USD per miljon tokens

• Utdata — GPT-6 Sol $10.00 per miljon tokens mot Grok 4.7 $6.00 per miljon tokens

Cachad indata — GPT-6 Sol $0,20 per miljon tokens mot Grok 4.7 $0,50 per miljon tokens; Sols cacheläsning är billigare med en faktor två och en halv, vilket är motsatsen till vad den framträdande utdatataxan antyder

• Kontextfönster — GPT-6 Sol 1 050 000 tokens vs Grok 4.7 500 000 tokens

• Tilläggsavgift för lång kontext – GPT-6 Sol prissätter om en begäran över 272 000 indatatoken till 2× indata- och cacheavgifter samt 1,5× utdata för hela begäran, jämfört med Grok 4.7 som fördubblar alla avgifter vid 200 000 indatatoken, också det för hela begäran

• Kunskapsgräns — GPT-6 Sol 20 april 2026 vs Grok 4.7, en förträningsgräns som uppges vara i juni 2026 med kompletterande träning till och med augusti

• Resonemangsansträngning — GPT-6 Sol ingen, låg, medel (standard), hög, xhög, max mot Grok 4.7 låg, medel (standard), hög, xhög

• Modalitet — båda accepterar text- och bildinmatning och returnerar text

Raden för cacheläsning är den som en köpare bör ta till sig. Grok 4.7:s outputpris är 40 % lägre, men dess cachade input är 150 % högre, och cachad input är där långa agenthistoriker och upprepade systempromptar hör hemma. En arbetsbelastning som till största delen återläser en stor stabil kontext kommer att finna att de två modellerna ligger mycket närmare varandra än vad $6 mot $10 antyder.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

Det oberoende rekordet, och det enda numret som avgör det

Artificial Analysis är den enda testramen som har mätt båda modellerna, och dess siffror är värda att ställa upp sida vid sida eftersom divergensen är lärorik.

• Intelligensindex — GPT-6 Sol 48 vid maximal insats vs Grok 4.7 46 vid xhigh; båda ligger väl över medianen på 25 för jämförbara modeller

• Kostnad per indexeringsuppgift — GPT-6 Sol 1,06 $ mot Grok 4.7 3,74 $

• Utdatatokens för indexkörningen – GPT-6 Sol 77M mot Grok 4.7 240M, jämfört med en median på 88M

• Utdatashastighet — Grok 4.7 uppmättes till 39 tokens per sekund, vilket testramverket självt betecknar som anmärkningsvärt långsamt; Sols siffra på samma resultattavla publiceras inte på samma sammanfattningsrad

• Coding Agent Index — GPT-6 Sol 57 till $2,99 per uppgift mot Grok 4.7 56 med sitt förstaparts Grok Build-testramverk, nio poäng upp från Grok 4.6

Två punkters skillnad i index, tre och en halv gånger kostnaden per uppgift. Det är ingen prissättningsanomali – det är aritmetiken bakom mångordighet. Grok 4.7 är en modell som tänker högt och länge; testramverket flaggar den som "mycket mångordig" mot en median på 88M tokens, och kostnaden följer antalet tokens, inte prislistan.

Jämförelsen av kodningsagenter har en hake som resultattavlan döljer. Grok 4.7:s 56 mäts i xAI:s egen Grok Build-testrigg, vilket är den konfiguration som xAI levererar och benchmarkar mot. Sols 57 mäts i en neutral testrigg. En fördel på en eller två poäng för en egen testrigg ligger väl inom det spann som valet av testrigg förklarar, vilket innebär att den ärliga tolkningen är att dessa två är jämbördiga när det gäller agentisk kodning – inte att Sol ligger en poäng före.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

Vad varje leverantör hävdar, och vad ingen av dem har visat

xAI:s lanseringsmaterial är konkret och det är en historia med lång tidshorisont: Grok 4.7 är byggd på en större basmodell än Grok 4.6 och fick en längre körning med förstärkningsinlärning inriktad på uppgifter som ”kan ta timmar att slutföra”, vilket skärpte självverifiering, hantering av långa kontexter och beteende i Grok Bot-miljön. Leverantörsrapporterade siffror inkluderar Terminal-Bench 4.0 på 38,0 % mot Grok 4.6:s 20,3 %, CursorBench 4.0 på 46,3 % och DeepSWE v1.1 på 71,0 %. Var och en av dessa är xAI:s egen mätning och ingen av dem har oberoende reproducerats; den oberoende Terminal-Bench 4.0-siffran som cirkulerar är betydligt lägre än leverantörens, vilket är den vanliga formen på den klyftan.

OpenAIs påståenden för GPT-6 Sol är de som redan behandlats ovan, och de bär samma etikett. De leverantörsrapporterade siffrorna är 33,2 % på AutomationBench vid xhigh-ansträngning mot Claude Opus 5:s 26,9 % vid max, till ungefär 9 % av kostnaden per uppgift, och 68,8 % på DeepSWE v1.1 vid maxansträngning – inom 1,1 punkter från Claude Fable 5 vid xhigh, till omkring 80 % lägre kostnad per uppgift. Notera jämförelsemålet: OpenAIs egna diagram ställer Sol mot Anthropics modeller, inte mot Grok 4.7. Ingen av leverantörerna har publicerat en direkt jämförelse mot den andra.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Där routinglagret förtjänar sin plats

OrcaRouter har ingen av modellerna i den här matchningen – Grok 4.7 och GPT-6 Sol saknas båda i vår katalog, så inget här är ett påstående om deras pris hos oss. Vad ett routinglager är värt i just den här kombinationen handlar om felbeteendet snarare än prislistan. Anledningen att välja Grok 4.7 är dess långsiktiga agentbeteende; anledningen att inte välja den är att en utdatahastighet på 39 tokens per sekund gör en lång agentkörning tillräckligt långsam för att spela roll, och en långsam körning är en körning som kan timea ut. Automatisk failover mellan leverantörer innebär att ett långt jobb kan routas till vilken modell som helst som faktiskt är tillgänglig, utan att den hastigheten blir en enskild felpunkt, och routing-DSL:en uttrycker modellvalet som en regel inuti anropet snarare än som en migrering – vilket spelar roll här, eftersom det korrekta svaret för det här paret beror på om uppgiften är tokenhungrig eller latenskänslig, och det är en egenskap hos förfrågan, inte hos kvartalet.

Beslutsregeln

• Agentisk kodning vid en fast budget — GPT-6 Sol. Kapacitet på samma nivå på det neutrala kodningsindexet, till ungefär en tredjedel av kostnaden per uppgift, eftersom den når dit med en tredjedel av tokens.

• Långsiktiga uppgifter där körlängden är själva poängen — Grok 4.7. Släppet tränades specifikt för arbete över flera timmar, och leverantörssiffrorna för SWE-Marathon och CursorBench pekar i exakt den riktningen.

• Latenskänslig volym — ingen av dem, enligt nuvarande underlag. Sols kostnad per uppgift är den bättre siffran, men Grok 4.7:s uppmätta 39 tokens per sekund är en verklig begränsning för allt interaktivt.

• Mestadels cachade långkontextsarbetsbelastningar — GPT-6 Sol, på cache-läslinjen snarare än utdatalinjen. Till $0.20 mot $0.50 per miljon cachade tokens, och med ett fönster dubbelt så stort, blir argumentet starkare ju mer av din prompt som är stabil.

• Om din jämförelse byggdes utifrån per-token-prislistan — bygg om den utifrån kostnad per uppgift. $6,00 mot $10,00 för utdata är det minst informativa paret siffror i den här artikeln, och det är paret som varje befintlig sida inleder med.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen