
Gemini 3.7 Flash vs Grok 4.6: Google's prijzenoorlog vs SpaceXAI's zelfcontrolerende agent
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0259Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0258Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0166Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
Drie weken nadat Gemini 3.6 Flash grotendeels flopte, halveerde Google de prijs en lanceerde Gemini 3.7 Flash — een zet die de meeste berichtgeving opvatte als een directe aanval op Grok 4.6, het op agenten afgestemde vlaggenschip dat SpaceXAI de dag ervoor had uitgebracht voor $2 en $6. De timing is het verhaal: twee bijna-frontiermodellen, één dag na elkaar, beide gericht op dezelfde koper — een team dat agentische codering wil zonder frontierprijzen te betalen — en geprijsd volgens tegenovergestelde filosofieën. Google koopt de respons met een promotie van vijf maanden. SpaceXAI verkoopt vertrouwen per taak tegen een vaste lijstprijs.
Grok 4.6, uitgebracht op 12 augustus 2026, is SpaceXAI's verfijning van zijn 1,5 biljoen parameter tellende Grok 4.5-fundament, gebouwd voor langlopende agents die hun eigen deeltaakvoltooiing verifiëren, met een contextvenster van 500K, tekst- en beeldinvoer, en een tarief van $2/$6 dat verdubbelt bij meer dan 200K invoertokens. Gemini 3.7 Flash, uitgebracht op 13 augustus 2026, is Googles algoritmische verfijning van Gemini 3.6 Flash — 1M context, multimodale invoer met video en audio, en een promotioneel tarief van $0,75/$3,75 dat op 1 januari 2027 verdubbelt naar $1,50/$7,50. Op de onafhankelijke Artificial Analysis Intelligence Index scoort Grok 4.6 61, duidelijk een stap boven vroege metingen van ongeveer 56 voor Gemini 3.7 Flash.
De prijsoorlog, één regel per dimensie
• Prijs per 1M input — Gemini 3.7 Flash $0,75 (intro) vs Grok 4.6 $2,00. Google onderbiedt met meer dan 60%.
• Prijs per 1M output — Gemini 3.7 Flash $3,75 (intro) vs Grok 4.6 $6,00.
• Na 1 januari 2027 — Gemini verdubbelt naar $1,50/$7,50 versus Grok, ongewijzigd op $2/$6.
• Contextvenster — Gemini 3.7 Flash 1M vs Grok 4.6 500K.
• Facturering voor lange invoer — Gemini rekent een vast tarief over het volledige venster; Grok verdubbelt naar $4/$12 bij 200K of meer invoer.
• Denktokens — Gemini factureert ze als output; de kosten van Grok zijn opgenomen in een onafhankelijk gemeten ~$0.84 per taak.
De kern in één zin: Gemini 3.7 Flash is vandaag op elke regel van de prijslijst goedkoper, en het grootste deel van dat voordeel verdampt op 1 januari. Grok 4.6 kost in augustus net zo veel als in maart.

Waar het geld van Gemini 3.7 Flash naartoe ging
Google's eigen cijfers rapporteren grote sprongen voor Gemini 3.7 Flash ten opzichte van 3.6 Flash: 65,3% op DeepSWE v1.1 (voorheen 49,0%), 43,6% op FrontierCode 1.1 Main (voorheen 34,4%), 85,8% op Terminal-bench 2.1 (voorheen 78,0%), en een WebDev Arena Elo van 1588 (voorheen 1538). Dit zijn door leveranciers gerapporteerde, niet gereproduceerde cijfers — het soort cijfers dat een ontwikkeling meet, geen oordeel tussen leveranciers. Maar de trend is waar het om draait: de verbeteringen kwamen drie weken na een lancering die recensenten grotendeels hadden afgeschreven, wat aangeeft dat Google de Flash-klasse behandelt als het strijdtoneel, niet als het vlaggenschip.
Het andere effect van Googles promotie is dat het aankoopvenster wordt gecomprimeerd. Bij $0,75/$3,75 is het model goedkoop genoeg om op grote schaal te testen; bij $1,50/$7,50 is het nog steeds concurrerend, maar geen wapen meer in de prijzenoorlog. Elk productieteam dat het tijdens het introductievenster adopteert, zou in december de economische levensvatbaarheid opnieuw moeten evalueren, en niet aannemen dat het getal met hen meebeweegt.
Waar het geld van Grok 4.6 naartoe ging
De pitch van Grok 4.6 is anders: niet goedkopere tokens, maar minder verspilde tokens. Het is getraind om zichzelf te verifiëren — om te controleren of een deeltaak daadwerkelijk is voltooid voordat hij verdergaat — en onafhankelijke meting bevestigt dat effect: Artificial Analysis schat de kosten op ongeveer $0,84 per taak, met een GDPVal-AA v2 van 1.753 en een Intelligence Index van 61. Dat zijn cijfers van derden, en het zijn de sterkste cijfers in deze vergelijking, omdat ze vastleggen wat de prijs per token mist: een model dat minder stappen nodig heeft om een klus af te ronden, is goedkoper per afgeronde klus, zelfs bij een hogere tokenprijs.
De afweging is waar het goedkopere model ruimte laat. De 500K-context van Grok 4.6 is de helft van de 1M van Gemini 3.7 Flash, en het tarief van $2/$6 verdubbelt bij meer dan 200K invoer — dus workloads met een lange context en veel invoer zijn precies waar de lijstprijs van Grok 4.6 niet meer concurrerend is met het promotietarief van Gemini.
De taakspecifieke economie
Bij introductieprijzen is het gemengde tarief van Gemini 3.7 Flash bij een 80/20 invoer/uitvoer-verdeling ruwweg $1,35 per miljoen tokens; de stickerprijs van Grok 4.6 is bij dezelfde verdeling $2,80 per miljoen vóór de toeslag voor lange invoer. Op papier lijkt het Google-model met afstand de volumewinnaar. De complicatie is dat de denktokens van Gemini als uitvoer worden gefactureerd, de claims over benchmarks een week oud zijn, en de efficiëntie per taak nog niet onafhankelijk is gemeten — terwijl die van Grok 4.6 dat wel is. Goedkope tokens plus verspilde beurten kunnen duurder uitvallen dan dure tokens die de klus afmaken, en dit is een vergelijking waarbij de ene kant gegevens heeft over die vraag en de andere kant niet.
Inzetten op het nieuwe model zonder in te zetten op de pipeline.
Grok 4.6 staat op OrcaRouter tegen SpaceXAI's lijstprijs van $2/$6 met 0% opslag, inclusief de 2x stap boven 200K, die de modelpagina live haalt uit de routeringslaag. Gemini 3.7 Flash is één dag oud en draait op Google's eigen API; zijn voorganger Gemini 3.6 Flash staat op OrcaRouter tegen Google's lijstprijs.


Als de vraag die deze vergelijking eigenlijk stelt is: 'moet ik mijn agent-pijplijn inzetten op het nieuwe goedkope model', dan is de routeringslaag de afdekking: een failover-regel die de agent vandaag op Grok 4.6 draait en overschakelt naar Gemini 3.7 Flash op de dag dat die uitkomt, of een fusiepaneel waar beide een antwoord geven en een rechter ze verzoent — het soort opzet waarvoor de routerings-DSL bestaat, en een die niet vereist dat je een kant kiest voordat het bewijs binnen is.
De eerlijke lezing
Als je vandaag de goedkoopste token wilt en je vertrouwt op de oplevertijd van drie weken, dan is Gemini 3.7 Flash de agressieve gok — de prijzenoorlog is echt, de benchmarkwinsten zijn gerapporteerd, en de introductieperiode is een echte korting. Als je een model wilt waarvan de agent-efficiëntie onafhankelijk is gemeten, waarvan de prijs in januari niet wijzigt, en waarvan de zelfverificerende lus is ontworpen voor langdurig werk, dan is Grok 4.6 de conservatieve keuze, en de AA-data geeft het een voordeel op kosten per voltooide taak. De ene kant is een uitverkoop met een aftelling; de andere kant is een prijs met een staat van dienst. Beide zijn verdedigbaar — dat is wat dit een echte vergelijking maakt in plaats van een formaliteit.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
