Een gegenereerde hero-titelkaart voor een artikel met de titel 'Grok 4.7 vs Qwen 3.8 Max — een muntworp op papier', met de ondertitel 'Identieke prijs, één indexpunt uit elkaar, tegengestelde vormen' en stat-chips met AA Index 46 vs 45, prijs $2/$6 bij beide, en context 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: identieke prijs, één punt uit elkaar, tegenovergestelde vormen

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee gesloten vlaggenschipmodellen, beide voor $2 per miljoen inputtokens en $6 per miljoen output, beide met een score binnen één punt van elkaar op dezelfde onafhankelijke benchmark, negentien dagen na elkaar uitgebracht. Grok 4.7 verscheen op 21 september 2026 van SpaceXAI; Qwen 3.8 Max werd op 3 augustus 2026 door de leverancier uitgebracht en op 2 september 2026 vernieuwd. Op de huidige Artificial Analysis Intelligence Index, versie v4.3.2, scoort Grok 4.7 46 en Qwen 3.8 Max 45. Qua prijs en gemeten capaciteit zijn deze twee modellen dezelfde aankoop. Op al het andere — context, modaliteit, serveersnelheid, openheid en wat elke leverancier koos te optimaliseren — kunnen ze niet meer van elkaar verschillen, en dat is wat deze vergelijking de moeite waard maakt om uit te voeren in plaats van over te slaan.

Eerst de tijdlijn, want Qwen 3.8 Max heeft twee datums.

Dit zorgt bij veel berichtgeving voor verwarring, dus het is de moeite waard om het meteen bovenaan recht te zetten. Qwen 3.8 Max werd gelanceerd op 3 augustus 2026 als Alibaba's grootste en meest capabele model, gebouwd op de Qwen 3.5 vision-language-architectuur met een sparse mixture-of-experts-ontwerp dat naar verluidt 2,4 biljoen totale parameters telt, met 95 miljard actieve per token. Op 2 september 2026 bracht Alibaba een vernieuwde build uit — de 0902-revisie, de versie met de huidige model-ID's en de versie waarnaar Artificial Analysis zijn pagina dateert. Als je zowel een augustus- als een septemberdatum voor Qwen 3.8 Max hebt gezien, komt het daardoor: de ene is de lancering, de andere is de revisie die de meeste mensen vandaag daadwerkelijk aanroepen.

Grok 4.7 heeft een schonere geschiedenis, en achter zich een rommeligere. SpaceXAI bracht het uit op 21 september 2026 na een lancering die herhaaldelijk uitliep — Musk had gewezen op vensters eind augustus, begin september en medio september voordat het model daadwerkelijk werd uitgebracht. De release zelf was beperkt: een groter basismodel dan Grok 4.6, een langere reinforcement-learning-run gericht op taken van meerdere uren, en geen wijziging in de tariefkaart van $2/$6 die Grok 4.6 sinds 12 augustus hanteerde.

Waar elke leverancier op heeft geoptimaliseerd

Lees de twee lanceringsaankondigingen als een paar en de ontwerpgokken staan bijna perfect tegenover elkaar.

SpaceXAI is geoptimaliseerd voor agentische uitvoering. De door de leverancier gerapporteerde cijfers van Grok 4.7 zijn geconcentreerd in terminal- en repositorywerk: Terminal-Bench 4.0 op 38,0% tegenover 20,3% van Grok 4.6, CursorBench 4.0 op 46,3%, DeepSWE v1.1 op 71,0% bij hoge reasoning effort, EEBench op 64,0%. In de eigen beschrijving van de release door het bedrijf worden zelfverificatie en het omgaan met lange contexten binnen de Grok Bot-omgeving genoemd als de doelen. Grok 4.7 biedt een contextvenster van 500.000 tokens, accepteert tekst en afbeeldingen, retourneert tekst en biedt redeneerinspanning van laag tot xhigh. Het is een model dat is gebouwd om taken af te ronden.

Alibaba heeft geoptimaliseerd voor bereik. Qwen 3.8 Max biedt een contextvenster van ongeveer 984.000 tokens — effectief een miljoen — en de gepubliceerde sterke punten liggen op breedte in plaats van diepte op één terrein: een score van 86,6 op Terminal Bench 2.1, 67,7 op SWE-bench Pro, 93,0 op PaperBench, 92,6 op GPQA Diamond, 82,3 op MMMU-Pro en 86,1 op OSWorld-Verified. Het accepteert tekst-, beeld- en video-invoer en retourneert tekst, ondersteunt niveaus van reasoning-inspanning met xhigh als standaard, en het zwakkere gepubliceerde punt is Humanity's Last Exam met 43,6. Het is een model dat is gebouwd om alles aan te kunnen wat je het voorlegt.

Elk cijfer in die paragraaf is door de leverancier gerapporteerd. Geen van beide sets is onafhankelijk gereproduceerd, en de twee sets zijn sowieso niet direct vergelijkbaar — Terminal-Bench 2.1 en Terminal-Bench 4.0 zijn verschillende benchmarks, dus de 86,6 van Qwen en de 38,0 van Grok mogen nooit naast elkaar worden geplaatst.

• Onafhankelijke samengestelde score — Grok 4.7 46 op AA Intelligence Index v4.3.2 vs. Qwen 3.8 Max 45 op dezelfde versie. Een statistische gelijkstand.

• Prijs per miljoen tokens — $2,00 in / $6,00 uit bij beide. De cachekorting van Qwen wordt vermeld als 88%, wat een gemengd tarief van $1,18 per miljoen oplevert; de cachevoorwaarden van Grok 4.7 zijn niet op dezelfde basis gepubliceerd.

• Contextvenster — Grok 4.7 500.000 tokens vs Qwen 3.8 Max ongeveer 984.000. Qwen wint met bijna het dubbele, en dit is het grootste individuele specificatieverschil tussen hen.

• Invoermodaliteiten — Grok 4.7 tekst en afbeelding vs Qwen 3.8 Max tekst, afbeelding en video.

• Gewichten — beide propriëtair. Geen van beide modellen kan worden gedownload, waardoor het gebruikelijke open-gewichtenargument volledig uit deze vergelijking verdwijnt.

• Parameters — Grok 4.7 niet vermeld op enig specificatieblad van SpaceXAI (het cijfer van ~2,1T is een claim van Musk) versus Qwen 3.8 Max, naar verluidt 2,4T totaal met 95B actief, wat Alibaba evenmin op een specificatieblad heeft bevestigd.

• Serveersnelheid — Qwen 3.8 Max met 38,8 uitvoer-tokens per seconde en 3,08 seconden tot het eerste token, volgens Artificial Analysis; Grok 4.7 door SpaceXAI gepositioneerd als ongeveer twee keer zo snel als vergelijkbare modellen, volgens opgave van de leverancier, waarbij nog geen onafhankelijk doorvoercijfer is gepubliceerd.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

Het contextverschil is de echte beslissing

Wanneer prijs en capaciteit identiek zijn, valt de beslissing op al het andere dat verschilt, en hier is dat context. Het venster verdubbelen van 500.000 naar ongeveer 984.000 tokens is geen aardigheidje op een specificatieblad — het is het verschil tussen een repository in stukken hakken en hem in zijn geheel vasthouden.

Het langere contextvenster van Qwen 3.8 Max gaat gepaard met een gedocumenteerd voorbehoud dat belangrijk is voor kopers: de opengewichtenversie die Alibaba aankondigde voor de week van 10 augustus 2026 was alleen tekst en bevatte niet de volledige context van een miljoen tokens. Dat is niet van invloed op de gehoste endpoint waar deze vergelijking over gaat, maar het is goed om te weten als je je plannen op de open release baseerde.

Er is nog een tweede overweging aan de Grok-kant. De Grok-lijn heeft historisch gezien een tariefklif bij 200.000 inputtokens, waarbij een aanvraag die de drempel overschrijdt, voor de hele aanvraag opnieuw tegen het dubbele tarief wordt geprijsd — $4 in en $12 uit. Met een venster van 500.000 tokens ligt die drempel ruim binnen het werkbereik van het model. Voordat u werk met een lange context naar Grok 4.7 routeert, moet u de actuele tariefkaart voor het ingezette model controleren, want juist in de wisselwerking tussen een groot venster en een tariefklif gaan facturen voor lange context mis.

Wat een maand werk per stuk kost

Omdat de hoofdtarieven identiek zijn, moet de kostenvergelijking worden opgebouwd op basis van het gedrag van tokens in plaats van op basis van de tariefkaart, en daar lopen de twee modellen uiteen op een manier die meetbaar is.

Artificial Analysis mat dat Grok 4.7 240 miljoen outputtokens genereerde tijdens het uitvoeren van zijn Intelligence Index, tegenover een mediaan van 92 miljoen over de modellen op de ranglijst — het is een breedsprakige redeneerder. Qwen 3.8 Max genereerde 190 miljoen outputtokens op dezelfde index, met totale evaluatiekosten van $4.934,79 en een gemeten snelheid van 38,8 tokens per seconde. Beide liggen ruim boven de mediane breedsprakigheid, en Grok 4.7 is de meer breedsprakige van de twee.

Bij een identieke outputprijs van $6 per miljoen kost het model dat meer tokens per taak produceert meer per taak. De gepubliceerde uitgebreidheidscijfers suggereren dat Grok 4.7 meer outputtokens zal verbruiken voor gelijkwaardig indexwerk, wat betekent dat de gelijke prijs in feite een kleine overwinning is voor Qwen 3.8 Max op kosten per taak — tenietgedaan door het geclaimde snelheidsvoordeel van Grok 4.7, dat de kloktijd verkort en daarmee de menselijke kosten van wachten op een agent-run vermindert. Geen van beide compensaties is zichtbaar op een prijskaart, en beide zijn het waard om op je eigen verkeer te meten in plaats van aan te nemen.

De enige asymmetrie die niet ter discussie staat, is caching. Qwen 3.8 Max publiceert een cachekorting van 88% en een blended tarief van $1,18 bij een 7:2:1-mix van cache-hit/input/output. Voor workloads met een grote stabiele prefix — een systeemprompt, een codebase-header, een documentenset — zit de echte besparing in die korting, en het is de moeite waard om te controleren hoe de cachevoorwaarden van Grok 4.7 zich verhouden voordat je je op volume vastlegt.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Kiezen, wanneer de cijfers weigeren voor je te kiezen

Een 46 en een 45 op dezelfde index, tegen dezelfde prijs, is zo dicht bij een echt gelijkspel als deze blog waarschijnlijk zal publiceren. Dat betekent dat de beslissing moet worden genomen op de assen waarop de twee modellen daadwerkelijk van elkaar verschillen, en dat zijn er vier.

Kies Grok 4.7 als je werk agentisch programmeren en terminaluitvoering is, als kloktijd bij lange runs belangrijker is dan contextruimte, en als je een redeneerinstelling per verzoek wilt om eenvoudig verkeer goedkoop te houden. Kies Qwen 3.8 Max als je regelmatig inputs van meer dan een half miljoen tokens verwerkt, als video-invoer op je roadmap staat, als je de cachekorting van 88% wilt voor prefix-intensieve workloads, of als je een model wilt waarvan de leverancier een brede evaluatiematrix publiceert in plaats van een die op één enkel terrein is toegespitst.

Als het eerlijke antwoord 'een beetje van beide' is, dan is dat het normale antwoord, en dat is precies het geval waarvoor dit tweetal is gebouwd. Qwen 3.8 Max staat op OrcaRouter tegen Alibaba's lijstprijs, en OrcaRouter geeft de lijstprijzen van providers door met 0% opslag, dus de $2/$6 hierboven is wat je daadwerkelijk betaalt en een tariefwijziging van een leverancier is hier dezelfde dag live in plaats van bij verlenging. Eén API-sleutel dekt Qwen 3.8 Max plus meer dan 200 andere modellen, wat betekent dat de contextbeslissing een routeringsregel per verzoek wordt in plaats van een platformtoezegging: stuur de te grote inputs naar het venster van 984k en houd al het overige op het eindpunt dat het snelst en goedkoopst is voor die taak, met automatische failover als een provider verslechtert. Waar een taak echt beide vormen nodig heeft — een lezing met lange context gevolgd door een agentische uitvoeringsronde — stelt de routerings-DSL modellen samen in één enkele aanroep in plaats van je te dwingen een kant te kiezen.

Eén verduidelijking die het vermelden waard is, aangezien geen van beide modellen open is: niets in deze vergelijking betreft downloadbare gewichten. Beide zijn gehoste endpoints, en zelfhosting is voor geen van beide een optie.

Het enige nummer om te onthouden

Zesenveertig tegen vijfenveertig is geen reden om een model te kiezen, en dat zou het ook niet moeten zijn. Wat deze vergelijking beslist, is het contextvenster — 500.000 tokens tegen ongeveer 984.000 — en de vorm die elke leverancier koos: Grok 4.7 geoptimaliseerd om moeilijke agentische taken snel af te ronden, Qwen 3.8 Max geoptimaliseerd om te gaan met wat je er ook maar aan geeft. Dezelfde prijs, dezelfde gemeten capaciteit, verschillende taken. Dat is een routeringsbeslissing, en het is het soort beslissing dat een middag testen zou moeten vergen in plaats van een kwartaal aanschaffen.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt