Ett genererat hero-titelkort för en artikel med titeln 'Grok 4.7 vs Qwen 3.8 Max — en slantsingling på papper', med underrubriken 'Identiskt pris, en indexpunkt isär, motsatta former' och statistikchips som visar AA Index 46 vs 45, pris $2/$6 på båda, och kontext 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: Identiskt pris, en poäng isär, motsatta former

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två stängda flaggskeppsmodeller, båda till priset $2 per miljon indatatokens och $6 per miljon utdatatokens, båda med resultat inom en enda poäng från varandra på samma oberoende benchmark, släppta med nitton dagars mellanrum. Grok 4.7 lanserades den 21 september 2026 av SpaceXAI; Qwen 3.8 Max släpptes av leverantören den 3 augusti 2026 och uppdaterades den 2 september 2026. I det aktuella Artificial Analysis Intelligence Index, version v4.3.2, får Grok 4.7 46 poäng och Qwen 3.8 Max 45 poäng. Vad gäller pris och uppmätt förmåga är dessa två modeller samma köp. I allt annat – kontext, modalitet, serveringshastighet, öppenhet och vad respektive leverantör valde att optimera – kunde de inte vara mer olika, och det är just därför den här jämförelsen är värd att genomföra i stället för att hoppa över.

Först tidslinjen, eftersom Qwen 3.8 Max har två datum

Detta ställer till det för en hel del bevakning, så det är värt att reda ut redan från början. Qwen 3.8 Max lanserades den 3 augusti 2026 som Alibabas största och mest kapabla modell, byggd från Qwen 3.5:s vision-språk-arkitektur på en sparse mixture-of-experts-design som uppges ha 2,4 biljoner parametrar totalt med 95 miljarder aktiva per token. Den 2 september 2026 släppte Alibaba en uppdaterad version – 0902-revisionen, som är den version som bär aktuella modell-ID:n och den version som Artificial Analysis daterar sin sida till. Om du har sett både ett augustidatum och ett septemberdatum för Qwen 3.8 Max är det därför: det ena är lanseringen, det andra är den revision som de flesta faktiskt syftar på idag.

Grok 4.7 har en renare historia och en stökigare sådan bakom sig. SpaceXAI släppte den 21 september 2026 efter en lansering som sköts upp gång på gång – Musk hade pekat på fönster i slutet av augusti, början av september och mitten av september innan modellen faktiskt släpptes. Själva släppet var snävt: en större basmodell än Grok 4.6, en längre körning med förstärkningsinlärning inriktad på uppgifter som tar flera timmar, och ingen ändring av $2/$6-prislistan som Grok 4.6 hade haft sedan 12 augusti.

Vad varje leverantör optimerade för

Läs de två lanseringsmeddelandena som ett par och designsatsningarna är nästan perfekt motsatta.

SpaceXAI är optimerad för agentisk exekvering. Grok 4.7:s leverantörsrapporterade siffror är koncentrerade till terminal- och repository-arbete: Terminal-Bench 4.0 på 38,0 % mot Grok 4.6:s 20,3 %, CursorBench 4.0 på 46,3 %, DeepSWE v1.1 på 71,0 % vid hög resonemangsansträngning, EEBench på 64,0 %. Företagets egen beskrivning av lanseringen anger självverifiering och hantering av lång kontext i Grok Bot-miljön som målen. Grok 4.7 har ett fönster på 500 000 token, tar in text och bilder, returnerar text och exponerar resonemangsansträngning från low till xhigh. Det är en modell byggd för att slutföra jobb.

Alibaba optimerade för räckvidd. Qwen 3.8 Max har ett kontextfönster på cirka 984 000 token – i praktiken en miljon – och dess publicerade styrkor är bredd snarare än djup inom ett enskilt område: en Terminal Bench 2.1-poäng på 86,6, SWE-bench Pro på 67,7, PaperBench på 93,0, GPQA Diamond på 92,6, MMMU-Pro på 82,3, OSWorld-Verified på 86,1. Den tar emot text-, bild- och videoindata och returnerar text, stöder nivåer för resonemangsansträngning med xhigh som standard, och dess svagare publicerade punkt är Humanity's Last Exam på 43,6. Det är en modell byggd för att hantera vad som helst du ger den.

Varje siffra i det stycket är rapporterad av leverantören. Ingen av uppsättningarna har oberoende reproducerats, och de två uppsättningarna är ändå inte direkt jämförbara – Terminal-Bench 2.1 och Terminal-Bench 4.0 är olika benchmarks, så Qwens 86,6 och Groks 38,0 får aldrig ställas sida vid sida.

• Oberoende komposit — Grok 4.7 46 på AA Intelligence Index v4.3.2 mot Qwen 3.8 Max 45 på samma version. Ett statistiskt oavgjort resultat.

• Pris per miljon tokens – 2,00 USD in / 6,00 USD ut för båda. Qwens cacherabatt anges till 88 %, vilket ger en blandad avgift på 1,18 USD per miljon; Grok 4.7:s cachevillkor publiceras inte på samma grund.

• Kontextfönster — Grok 4.7 500 000 tokens vs Qwen 3.8 Max cirka 984 000. Qwen vinner med nästan det dubbla, och detta är den enskilt största specifikationsskillnaden mellan dem.

• Inmatningsmodaliteter — Grok 4.7 text och bild vs Qwen 3.8 Max text, bild och video.

• Vikter — båda proprietära. Ingen av modellerna kan laddas ner, vilket helt eliminerar det vanliga argumentet om öppna vikter från denna jämförelse.

• Parametrar — Grok 4.7 redovisas inte i något specifikationsblad från SpaceXAI (siffran ~2,1T är ett påstående från Musk) mot Qwen 3.8 Max, som rapporteras ligga på 2,4T totalt med 95B aktiva, vilket Alibaba inte heller har bekräftat i ett specifikationsblad.

• Serveringshastighet — Qwen 3.8 Max vid 38,8 utdatatokens per sekund med 3,08 sekunder till första token, enligt Artificial Analysis; Grok 4.7 positionerad av SpaceXAI som ungefär dubbelt så snabb som jämförbara modeller, leverantörsrapporterad, utan någon oberoende genomströmningssiffra publicerad ännu.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

Kontextskillnaden är det verkliga beslutet.

När pris och kapacitet är identiska faller beslutet på allt annat som skiljer sig åt, och här är det kontexten. Att dubbla fönstret från 500 000 till ungefär 984 000 tokens är inte en finess i specifikationsbladet – det är skillnaden mellan att dela upp ett kodförråd i bitar och att hålla det.

Qwen 3.8 Max:s längre fönster kommer med ett dokumenterat förbehåll som är viktigt för köpare: versionen med öppna vikter som Alibaba annonserade för veckan den 10 augusti 2026 var endast text och inkluderade inte den fullständiga kontexten på en miljon token. Det påverkar inte den hostade slutpunkten som den här jämförelsen handlar om, men det är värt att känna till om du planerade utifrån den öppna lanseringen.

Det finns en andra aspekt på Grok-sidan. Grok-linjen har historiskt tillämpat en prisklippa vid 200 000 indatatokens, där en begäran som passerar tröskeln prisar om hela begäran till dubbel taxa – 4 USD in och 12 USD ut. Med ett fönster på 500 000 tokens ligger den tröskeln väl inom modellens arbetsområde. Innan du dirigerar långkontextarbete till Grok 4.7, bekräfta aktuell prislista för den driftsatta modellen, eftersom samspelet mellan ett stort fönster och en prisklippa är där fakturor för lång kontext går fel.

Vad en månads arbete kostar på var och en

Eftersom de annonserade priserna är identiska måste kostnadsjämförelsen byggas utifrån tokenbeteende snarare än utifrån prislistan, och där skiljer sig de två modellerna åt på ett sätt som är mätbart.

Artificial Analysis uppmätte att Grok 4.7 genererade 240 miljoner utdatatokens när dess Intelligence Index kördes, jämfört med en median på 92 miljoner bland modellerna på listan – den är en mångordig resonerare. Qwen 3.8 Max genererade 190 miljoner utdatatokens i samma index, med en total utvärderingskostnad på 4 934,79 USD och en uppmätt hastighet på 38,8 tokens per sekund. Båda ligger långt över medianen för mångordighet, och Grok 4.7 är den mer mångordiga av de två.

Så vid en identisk kostnad på $6 per miljon output-tokens kostar den modell som genererar fler tokens per uppgift mer per uppgift. De publicerade siffrorna för utförlighet antyder att Grok 4.7 kommer att förbruka fler output-tokens för motsvarande indexarbete, vilket innebär att prislikheten i själva verket är en liten vinst för Qwen 3.8 Max när det gäller kostnad per uppgift – uppvägd av Grok 4.7:s påstådda hastighetsfördel, som förkortar väggklockstiden och därmed den mänskliga kostnaden för att vänta på en agentkörning. Ingen av dessa uppvägningar syns på ett prisblad, och båda är värda att mäta på din egen trafik i stället för att anta.

Den enda asymmetrin som inte är omtvistad är cachning. Qwen 3.8 Max publicerar en cacherabatt på 88 % och en blandad taxa på 1,18 USD vid en mix på 7:2:1 av cacheträffar/input/output. För arbetsbelastningar med ett stort stabilt prefix – en systemprompt, ett kodbas-header, en dokumentuppsättning – är det i den rabatten de verkliga besparingarna ligger, och det är värt att kontrollera hur Grok 4.7:s cachevillkor står sig innan du förbinder dig till volym.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Att välja, när siffrorna vägrar välja åt dig

En 46:a och en 45:a på samma index, till samma pris, är så nära ett äkta oavgjort resultat som den här bloggen sannolikt kommer att publicera. Det innebär att beslutet bör fattas utifrån de axlar där de två modellerna faktiskt skiljer sig åt, och det finns fyra av dem.

Välj Grok 4.7 om ditt arbete är agentisk kodning och terminalexekvering, om wall-clock-hastighet vid långa körningar betyder mer än kontextutrymme, och om du vill ha ett reglage för resonemang per begäran för att hålla enkel trafik billig. Välj Qwen 3.8 Max om du rutinmässigt hanterar indata som är större än en halv miljon tokens, om videoindata finns på din färdplan, om du vill ha 88 % cacherabatt för prefix-tunga arbetsbelastningar, eller om du vill ha en modell vars leverantör publicerar en bred utvärderingsmatris i stället för en som är koncentrerad till ett enda spår.

Om det ärliga svaret är "lite av båda," är det det normala svaret, och det är fallet som detta par är byggt för. Qwen 3.8 Max finns på OrcaRouter till Alibabas listpris, och OrcaRouter för vidare leverantörers listpriser med 0 % påslag, så $2/$6 ovan är vad du faktiskt betalar och en leverantörs prisändring slår igenom här samma dag i stället för vid förnyelse. En API-nyckel täcker Qwen 3.8 Max plus över 200 andra modeller, vilket innebär att kontextbeslutet blir en routingregel per begäran i stället för ett plattformsåtagande: skicka de överdimensionerade indata till 984k-fönstret och behåll allt annat på den endpoint som är snabbast och billigast för uppgiften, med automatisk failover om en leverantör försämras. När en uppgift verkligen behöver båda formerna – en långkontextläsning följd av en agentisk exekveringsomgång – komponerar routing-DSL modeller till ett enda anrop i stället för att tvinga dig välja sida.

Ett förtydligande är värt att nämna, eftersom ingen av modellerna är öppen: inget i den här jämförelsen handlar om nedladdningsbara vikter. Båda är hostade slutpunkter, och självhostning är inte ett alternativ för någon av dem.

Det enda numret att hålla koll på

Fyrtiosex mot fyrtiofem är inte ett skäl att välja en modell, och det borde det inte vara. Vad som avgör den här jämförelsen är kontextfönstret — 500 000 tokens mot ungefär 984 000 — och den form varje leverantör valde: Grok 4.7 optimerad för att slutföra svåra agentiska uppgifter snabbt, Qwen 3.8 Max optimerad för att hantera vad du än ger den. Samma pris, samma uppmätta kapacitet, olika jobb. Det är ett routingbeslut, och det är den typen av beslut som borde ta en eftermiddag att testa snarare än ett kvartal att upphandla.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen