Ett genererat hero-kort för en jämförelse mellan GPT-6.1 Sol och Grok 4.7, med rubriken ”40 % billigare per token, 5,2 gånger räkningen”, med tre märken som lyder ”Grok 4.7-utdata: 6,00 USD per 1M”, ”GPT-6.1 Sol-utdata: 10,00 USD per 1M” och ”Utdatatoken i indexkörningen: 67M mot 240M”, samt OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

GPT-6.1 Sol vs Grok 4.7: Det billigaste utmatningspriset i rummet, och den dyraste konversationen

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Grok 4.7, xAI:s efterträdare till Grok 4.6, lanserades den 21 september 2026 till 2,00 dollar per miljon indatatoken och 6,00 dollar per miljon utdatatoken. GPT-6.1 Sol, OpenAIs uppdatering i mellanklassen, lanserades åtta dagar senare, den 29 september, till 2,00 dollar för indata och 10,00 dollar för utdata. Indatapriserna är identiska, utdatapriset är 40 % lägre för Grok 4.7, och det är där de flesta jämförelser slutar. Det är fel ställe att sluta på, för samma oberoende nämnd har nu mätt båda modellerna från början till slut: Grok 4.7 gjorde av med ungefär 240 miljoner utdatatoken för att slutföra Artificial Analysis Intelligence Index; GPT-6.1 Sol gjorde av med 67 miljoner. Multiplicera det lägre priset med tre och en halv gånger volymen och modellen med lägst pris per token kostar 3,74 dollar per slutförd uppgift mot 0,72 dollar.

Två modeller, åtta dagar isär, och en prislista som inverteras

Grok 4.7 är xAIs starkaste modell för kodning och kunskapsarbete: ett kontextfönster på 500 000 token, upp till 450 000 utdatatoken i ett enda svar enligt leverantörens egen specifikation, text-, bild- och filinmatning samt resonemangsansträngning som kan konfigureras mellan låg, medel (standard), hög och xhigh. xAI har inte offentliggjort något parameterantal, och dess förträningsavskärning rapporteras vara juni 2026 med kompletterande träning fram till augusti.

GPT-6.1 Sol är Open​AI:s uppdatering med ett steg av nivån GPT-6 Sol, placerad under GPT-6 Astra och över GPT-6 Luna: 1 050 000 tokens kontext – ungefär dubbelt så mycket som Groks – med ett tak för utdata på 128 000 tokens, vilket är ungefär en tredjedel av Groks, en kunskapsgräns den 30 april 2026, och samma inmatning av text, bild och fil. Dess resonemangstrappa sträcker sig low till max med standardvärdet medium, och den accepterar inte längre none alls.

En rad per dimension, båda sidorna på varje:

• Indata — GPT-6.1 Sol $2.00 per 1M mot Grok 4.7 $2.00 per 1M; identiska
• Utdata — GPT-6.1 Sol $10.00 per 1M mot Grok 4.7 $6.00 per 1M; Grok är 40 % billigare
• Cachad indata — GPT-6.1 Sol $0.10 per 1M mot Grok 4.7 $0.50 per 1M; Sol är fem gånger billigare, motsatsen till vad utdataraden antyder
• Kontextfönster — 1 050 000 tokens mot 500 000
• Maximal utdata i ett svar — 128 000 tokens mot 450 000 uppgivna
• Steg för lång kontext — hela begäran omprissätts över 272 000 indata-tokens till 2× indata och cache och 1,5× utdata mot att varje taxa fördubblas över 200 000 indata-tokens, även för hela begäran
• Resonemangsansträngning — låg, medel (standard), hög, xhigh, max mot låg, medel (standard), hög, xhigh
• Vikter och parametrar — stängda, ej offentliggjorda mot stängda, ej offentliggjorda; ingen av dem ger dig en checkpoint
• Intelligence Index vid högsta publicerade ansträngning — GPT-6.1 Sol 51.8 vid max mot Grok 4.7 46.4 vid xhigh
• Kostnad per indexuppgift, oberoende — $0.72 mot $3.74
• Utdata-tokens i indexkörningen — 67 miljoner mot 240 miljoner, mot en median på resultattavlan nära 81 miljoner

Två rader i den listan utgör hela jämförelsen. Grok 4.7:s output-pris är verkligen lägre och dess cache-rad är verkligen fem gånger högre; och den genererade tre och en halv gånger så många token för att mätas. Prislistan, läst för sig, pekar i en riktning. Mätningen pekar i den andra, med en faktor fem.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Där Grok 4.7 faktiskt ligger före

Det vore oärligt att framställa den här artikeln som en utklassning, eftersom Grok 4.7 vinner på verkliga utvärderingar. Bedömda sida vid sida vid högsta publicerade ansträngningsnivå på Artificial Analysis v4.3.2 — Grok vid xhigh, Sol vid max, en konfigurationsskillnad som är värd att ha i åtanke genomgående:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 mot GPT-6.1 Sol Elo 1575,1. En 140-poängsledning inom ekonomiskt värdefullt kunskapsarbete, och den största enskilda oberoende segern för modellen med lägre prislista.
• AutomationBench-AA — Grok 4.7 0,6556 mot GPT-6.1 Sol 0,6487. I praktiken oavgjort, nominellt Groks.
• SciCode — Grok 4.7 0,5741 mot GPT-6.1 Sol 0,5417. En 3,2-poängsledning inom vetenskaplig kodning.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 mot GPT-6.1 Sol 0,5606. Ett 30-poängsunderskott, och det största gapet i paret.
• Humanity's Last Exam — Grok 4.7 0,4314 mot GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, resonemang över lång kontext — Grok 4.7 0,7667 mot GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 mot GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 mot GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 mot GPT-6.1 Sol 0,3171.

Tre av nio utvärderingar går till Grok 4.7 eller slutar oavgjort, inklusive den som är svårast att argumentera emot: GDPval-AA är utformat för att prissätta ekonomiskt värdefullt professionellt arbete, och en Elo-ledning på 140 poäng är inte brus. Om din arbetsbelastning är av det slag som GDPval byggdes för att representera — dokumenttung analys, professionella leverabler, bedömningsfrågor med ett korrekt svar — är modellen med den billigare prislistan också den bättre modellen på den neutrala resultattavlan, och straffet i kostnad per uppgift är vad du betalar för det.

xAI:s egna lanseringssiffror är stora och, liksom alla leverantörers lanseringssiffror, inte reproducerade. CursorBench 4.0 på 46,3 % vid xhigh mot Grok 4.6:s 40,4 %; Terminal-Bench 4.0 på 38,0 % mot 20,3 %, den största enskilda påstådda ökningen i utgåvan; DeepSWE v1.1 på 71,0 % vid high mot 65,2 %; EEBench på 64,0 % mot 53,0 %. Det är xAI:s utvärderingsramverk, xAI:s inställningar, xAI:s rapportering – och notera att påståendet om 38,0 % på Terminal-Bench 4.0 står mot den oberoende resultattavlans 0,2576 för samma modell på samma benchmark, vilket är den typ av avvikelse man bör förvänta sig mellan en leverantörs trimmade konfiguration och en neutral körning med maximal ansträngning.

OpenAIs siffror för GPT-6.1 Sol förtjänar samma rabatt och har samma svaghet. Den enda siffran i den här jämförelsen som ingen av leverantörerna tog fram är kostnaden per slutförd uppgift, eftersom den beräknas utifrån uppmätt tokenförbrukning i stället för från en poängtabell. Det är den siffran som står kvar.

Varför 240 miljoner tokens avgör saken

Artificial Analysis beskriver Grok 4.7:s ordrikedom i sin egen sammanfattning, och tokenantalet bakom indexkörningen är beviset: 240 miljoner uttoken mot en median i resultattabellen på nära 81 miljoner, ungefär tre gånger vad en typisk modell i samma svit producerar. GPT-6.1 Sols 67 miljoner ligger väl under medianen. Lägg ihop de två kvoterna – 3,6× volymen till 0,6× priset – och den billigare utmatningstaxan köper fler token i stället för en mindre räkning, vilket är exakt vad en kostnadsskillnad per uppgift på $3,74 mot $0,72 ser ut som.

Cachning ändrar storleken på effekten men inte dess riktning, och det är den här detaljen som får folk att snubbla. Grok 4.7:s cachade indata kostar $0.50 per miljon mot Sols $0.10 — fem gånger dyrare på den post där långa agenthistoriker och upprepade systemprompter hör hemma. En arbetsbelastning som domineras av att läsa om ett stort stabilt prefix upplever därför att de två modellerna ligger närmare varandra än $6 mot $10 antyder, och när Groks ordrikhet läggs ovanpå det, längre ifrån varandra än indatapriserna antyder. Cacheraden och tokenraden pekar åt samma håll här, vilket är ovanligt och gör den här kombinationen renare än priskorten antyder.

De långa kontextklausulerna är värda att prissätta separat eftersom de utlöses vid olika punkter. GPT-6.1 Sol prissätter om en hel förfrågan över 272 000 indatatoken; Grok 4.7 gör samma sak över 200 000. Vid ett anrop på 250 000 token har Grok redan fördubblat – 4,00 $ och 12,00 $ med en cacheläsning på 1,00 $ – medan Sol fortfarande ligger på sina standardpriser 2,00 $ och 10,00 $. Mellan 200 000 och 272 000 token är modellen med den billigare prislistan den dyrare, med stor marginal, och det intervallet är vanligt i dokumentarbete.

Där Grok verkligen vinner strukturen snarare än poängen är utdatataket. Ett maximalt svar på 450 000 tokens mot Sols 128 000 är en annan klass av artefakt: en hel genererad kodbas, en lång avskrift, en boklång syntes i ett enda anrop. Om du i dag slår i utdatatak avgör den raden jämförelsen och inget i kostnadsräkningen ovan gäller – du kan inte köpa en förmåga som den andra modellen inte har, oavsett pris.

Båda ligger på en och samma tangent, vilket är det användbara.

Grok 4.7 finns på OrcaRouter till xAI:s eget listpris – $2.00 och $6.00 per miljon tokens, med $0.50 för cacheläsning och 200 000-tokensteget till $4.00 och $12.00 förs vidare exakt som xAI listar det – och GPT-6.1 Sol landade på våra rutter på releasedagen till OpenAI:s pris, $2.00 och $10.00 med cachad indata på $0.10 och 272 000-tokensteget oförändrat. Inget läggs till på någon av dem: plattformen för vidare leverantörens listpris i stället för att lägga på ett påslag, vilket innebär att en leverantörs prissänkning på endera sidan gäller här samma dag som den gäller där, utan någon andra faktura och utan återförsäljare i mellanledet.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

För just detta par är det värt mer än bekvämlighet. De två modellerna är oense om vad de är bra på — Grok 4.7 leder inom Elo för yrkesarbete och inom vetenskaplig kodning, GPT-6.1 Sol leder inom terminalexekvering, faktamässig tillförlitlighet och lång kontext-hämtning — och gränsen mellan dessa arbetsbelastningar är synlig i din egen trafik innan den är synlig i ett benchmark. Att skicka GDPval-formade förfrågningar åt ena hållet och långsiktiga agentkörningar åt det andra, bakom en enda slutpunkt, med automatisk failover över båda och en routningsregel som du ändrar i konfigurationen i stället för i en driftsättning, är ett billigare sätt att hitta den gränsen än ett utvärderingsprojekt. Modellfusion, där en panel av modeller svarar tillsammans, är det andra alternativet som plattformen erbjuder om du helst inte vill välja per förfrågan alls.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

Samtalet

• Agentiskt och terminalbaserat arbete med långa utdata, cachade prefix-loopar — GPT-6.1 Sol. Trettio poäng på Terminal-Bench 4.0, en cachelinje fem gånger billigare och en femtedel av kostnaden per slutförd uppgift.
• Professionellt kunskapsarbete, dokumentanalys, bedömningsuppgifter — Grok 4.7 tack vare ett försprång på 140 poäng i GDPval-AA Elo, med tokenräkningen budgeterad i stället för antagen.
• Vetenskaplig kodning — Grok 4.7, med knapp marginal, på resultattavlans SciCode-del. Kontrollera det mot din egen svit; 3,2 poäng ligger inom intervallet som en annan uppsättning prompter kan förskjuta.
• Enskilda svar över 128 000 utdatatokens — Grok 4.7, och det finns ingen aritmetik som kan ersätta det.
• Förfrågningar mellan 200 000 och 272 000 indatatokens — GPT-6.1 Sol, eftersom Grok 4.7 redan har fördubblat hela sin förfrågan och Sol inte har gjort det.
• Billigaste möjliga konversation — ingen av dessa två. Båda är modeller med prissättning i framkant och aptit på tokens i framkant; jämförelsen handlar om vilken som slutför din uppgift, inte om vilken som är billig i abstrakt mening.
• Om en jämförelse avslutas med "Grok är billigare per token" — avslutades den ett steg för tidigt. Nästa steg är antalet tokens, och det är 240 miljoner mot 67.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen