Hero-titelkaart met de tekst "Gemini 4 Argon vs GPT-6 Sol — een vijfde van de prijs, vier keer de rekening", met chips met de tekst "Argon $2 / $10", "Sol $2 / $10" en "Kosten per indextaak $1.99 vs $1.05", en een voettekstregel met de tekst "Argon-cijfers door de leverancier gerapporteerd; indexcijfers volgens Artificial Analysis, gelezen op 2026-10-01." Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Gemini 4 Argon vs GPT-6 Sol: Een vijfde van de prijs, vier keer de rekening

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Voer de Artificial Analysis-indexsuite uit op Gemini 4 Argon en het kost $2.407. Voer dezelfde suite uit op GPT-6 Sol en het kost $1.546. Dezelfde index, dezelfde taken, dezelfde week. De twee modellen hebben identieke lijstprijzen — $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens, Argon als een aangegeven introductietarief van Go​ogle en Sol als het vaste tarief van Open​AI — en toch verschillen de uiteindelijke kosten van identiek werk met 56%, in het voordeel van het model dat vijf punten lager scoort. Dat verschil is de hele reden waarom deze vergelijking het waard is om op te schrijven, en het heeft niets te maken met de tariefkaart.

Google kondigde op 2026-09-30 Gemini 4 Argon aan, noemde het het volgende tijdperk van frontier-intelligentie, met een prijs van $2 voor input en $10 voor output en gecachte input tegen 95% korting, en rolt het uit naar vertrouwde cyberverdedigers via het Fairwind Program. GPT-6 Sol is algemeen beschikbaar sinds 2026-09-22, toen OpenAI de middenklasse van de GPT-6-lijn uitbracht voor $2 voor input en $10 voor output met een cachekorting van 90%. De een is vandaag te koop via een OpenAI-compatibel endpoint en de ander is voor niemand buiten een met naam genoemd cohort te koop, wat de praktische tweesprong in dit artikel vormt. Maar de kosteninversie hierboven blijft overeind, zelfs als je beschikbaarheid volledig buiten beschouwing laat, en het begrijpen waarom is het nuttige deel.

De inversie, eenvoudig gesteld

Artificial Analysis publiceert zowel een Intelligence Index als een verantwoording van wat het kostte om die index te draaien. Samen gelezen zeggen ze dit:

• Intelligence Index — Gemini 4 Argon 52,6 tegenover GPT-6 Sol 47,5. Een verschil van vijf punten, gemeten met Argon ingesteld op zijn hoge inspanningsinstelling en Sol op max, waardoor de vergelijking gunstiger uitvalt voor Sol dan voor Argon.

• Lijstprijs per miljoen tokens — identiek. $2,00 in / $10,00 uit bij beide. Cache-reads zijn het enige verschil: $0,10 bij Argon, $0,20 bij Sol.

• Kosten per indextaak — Gemini 4 Argon $1,99 tegenover GPT-6 Sol $1,05. Argon kost ongeveer twee keer zoveel per taak, ondanks dat het per token evenveel kost.

• Kosten voor het draaien van de volledige suite — Gemini 4 Argon $2.407 tegen GPT-6 Sol $1.546.

• Gemeten uitvoersnelheid — GPT-6 Sol 77,0 tokens per seconde tegenover Gemini 4 Argon 48,9, een verschil van 1,6× dat zich zowel in latentie als in kosten uit.

Er is één regel in die lijst die alle andere verklaart, en het is niet de prijs. Het is het aantal tokens. Op de eigen taken van de index genereerde Gemini 4 Argon ongeveer 561.000 outputtokens per taak; GPT-6 Sol genereerde ongeveer 282.000. Argon denkt twee keer zo lang na om dezelfde vraag te beantwoorden, en bij een identiek tarief per token is dat precies twee keer de rekening.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Sol. The Gemini 4 Argon column reads: AA Intelligence Index 52.6, price $2 in / $10 out per million tokens, cost per index task $1.99, output tokens per task 561K, output speed 48.9 tok/s, max output 1M tokens. The GPT-6 Sol column reads: AA Intelligence Index 47.5, price $2 in / $10 out, cost per index task $1.05, output tokens per task 282K, output speed 77.0 tok/s, max output 128K tokens. A footer line reads that the prices are vendor list prices and the index figures are per Artificial Analysis, read 2026-10-01.

Waarom de tokens de prijs zijn

Dit is de correctie die het waard is om te internaliseren voordat iemand een migratie begroot, want de intuïtie wijst de verkeerde kant op. Wanneer een model hetzelfde geprijsd is als zijn concurrent en twee keer zoveel outputtokens verbruikt om te voltooien, is de prijs per token niet de prijs. De prijs is per token vermenigvuldigd met het aantal tokens dat het model besluit te besteden, en die tweede factor is een eigenschap van het model, niet van de tariefkaart.

De marge per taak varieert enorm, wat het nog erger maakt — je kunt niet één vaste vermenigvuldigingsfactor toepassen en verdergaan:

• Terminal-Bench 4.0 — Argon 165.330 outputtokens per taak tegenover de 97.372 van Sol. Argon kost hier $6,78 per taak tegenover $4,00 van Sol, ook al scoort Argon 57,1% tegenover 43,9% van Sol.

• CritPt — Argon 109.533 tokens tegenover Sol's 31.848. Een tokenratio van 3,4× bij een taak waarop Sol juist hogerscoort, 30,9% tegen 27,1%.

• GDPval — Argon 74.571 tokens tegenover de 41.567 van Sol, voor $1,82 per taak tegenover $1,32.

• Alwetendheid — een tokenverhouding van 938 tegenover 2.662 in het voordeel van Argon, voor $0,010 per taak tegenover $0,027 van Sol. De enige taakfamilie waarin de richting omslaat.

• Redeneren met lange context — Argon 2.197 tokens tegen de 954 van Sol, en de enige taak in de suite waarin Sol qua score duidelijk wint, 83,7% tegen 79,7%.

CritPt is de leerzame. Een model dat drieënhalf keer zoveel tokens verbruikt om op dezelfde vraag een iets slechter antwoord te produceren, is geen verhaal over capaciteiten; het is een verhaal over uitgavenpatronen. Argons redeneerproces is lang, en bij sommige taakvormen vertaalt die lengte zich in score en bij andere simpelweg in dollars. De 52,6 van de index en de 47,5 van Sol zijn het geheel, en aggregaten verbergen precies dit.

Waar de vijf punten eigenlijk vandaan komen

Aangezien de indexkloof en de kostenkloof in tegengestelde richtingen wijzen, is het de moeite waard om te weten welke taken elk van beide aandrijven.

• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% versus GPT-6 Sol 43,9%. Argons grootste enkele overwinning, en de taakfamilie die het dichtst in de buurt komt van langdurige agentische codering.

• Alwetendheid — Gemini 4 Argon 42.4 versus GPT-6 Sol 27.1. Een verschil van vijftien punten op het gebied van feitelijke dekking, de grootste proportionele kloof in de suite.

• AutomationBench-AA — Gemini 4 Argon 77,5% versus GPT-6 Sol 61,6%.

• SciCode — Gemini 4 Argon 61,8% versus GPT-6 Sol 57,6%.

• Humanity's Last Exam — Gemini 4 Argon 57,1% tegenover GPT-6 Sol 47,9%.

• GDPval — Gemini 4 Argon 1.611 versus GPT-6 Sol 1.487.

• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo tegen de 1.493,84 van Argon, een verschil van 11 punten dat binnen de gepubliceerde betrouwbaarheidsintervallen valt en als gelijkspel moet worden beschouwd.

• Redeneren met lange context — GPT-6 Sol 83,7% versus Gemini 4 Argon 79,7%. De enige duidelijke overwinning van Sol.

• CritPt — GPT-6 Sol 30,9% tegenover Gemini 4 Argon 27,1%. Sol wint opnieuw, nipt.

Het beeld is dus niet: "Argon is beter". Het is dat Argon beter is in de twee dingen die in het lanceringsmateriaal vooropstonden — end-to-end uitvoering van bedrijfstaken en software-engineering over een lange horizon — en dat Sol gelijk staat of voorloopt op de academisch getinte redeneerladder en op het vasthouden van coherentie over een lange context. Voor een lezer wiens werklast een retrieval-pijplijn met een prompt van 400K tokens is, is Sol tegelijkertijd het betere en het goedkopere model, wat een ongewone en comfortabele positie is om in te verkeren.

De specificatieverschillen die de benchmarkdiscussie overleven

• Maximale uitvoer — Gemini 4 Argon 1.000.000 tokens in één traject, dat Google beschrijft als het grootste in de industrie en een toename van de 64K-limiet van de vorige generatie. GPT-6 Sol 128.000 tokens.

• Contextvenster — de leverancierskaart van GPT-6 Sol vermeldt ongeveer 1.050.000 tokens; die van Argon is 1.000.000. Artificial Analysis heeft Sol gemeten op 872.000 tokens via zijn harness, wat een meting met de harness is en niet een getal van de kaart — beschouw de kaart als de specificatie en het getal uit de harness als wat de evaluator daadwerkelijk heeft getest.

• Inputmodaliteiten — beide nemen tekst, afbeeldingen en bestanden aan. Het lanceringsmateriaal van Argon leunt ook op begrip van lange video's, waar Google 91,7% op LVBench claimt en het als state of the art beschrijft; dat is een door de leverancier gerapporteerd cijfer en nog geen enkele onafhankelijke instantie reproduceert het.

• Video-invoer — Zwak. Artificial Analysis neemt Argon op in de grafieken met video-invoer uitgeschakeld en vermeldt video expliciet bij de lancering, terwijl op de kaart van Sol video helemaal niet wordt vermeld. Als video cruciaal is in je pipeline, geeft geen van beide kaarten uitsluitsel, en moet je testen voordat je je architectuur bepaalt.

• Redeneerinspanning — Sol biedt via de API een configureerbare inspanning (none tot max, standaard medium) en werd in kaart gebracht op max. Argon werd in kaart gebracht op high; niemand heeft dezelfde suite gepubliceerd op de hoogste instelling.

Het uitvoerplafond van 1M tokens is hetgeen dat echt een architectuur kan veranderen in plaats van een budget. Alles wat je momenteel opsplitst in een dozijn geketende aanroepen om onder een limiet van 128K te blijven — een patchset voor meerdere bestanden, een volledig auditrapport, een lang document in één keer — wordt één aanroep met minder plekken waar een agent-loop de toestand kan verliezen. Of dat twee keer de kosten per taak waard is, hangt volledig af van of je die werklast hebt. Als dat zo is, is het waarschijnlijk de moeite waard. Als je aanroepen van het type classificeren-en-terugsturen zijn, is het geld dat wordt besteed aan ruimte die niemand zal benutten.

De inspanningsinstelling die niemand evenaarde, en waarom dat ertoe doet

Eén voorbehoud verdient een eigen alinea, want het pleit tegen de interpretatie van de kloof van vijf punten in de index als een puur capaciteitsverschil. Artificial Analysis zet in zijn grafieken Gemini 4 Argon op zijn hoge instelling voor redeneerinspanning en GPT-6 Sol op max. Dat zijn niet dezelfde treden op de twee ladders, en de richting van de discrepantie is interessant: Sol werd op zijn duurste instelling gedraaid en Argon op een middelmatige.

Er volgen twee interpretaties en de data kunnen ze niet van elkaar scheiden. Ofwel zou Argon bij max hoger scoren dan 52,6 — maar ook meer dan 561.000 tokens per taak verbruiken en meer dan $1,99 kosten — ofwel zou het ongeveer hetzelfde scoren, wat zou betekenen dat de inspanningsregelaar niet veel doet op deze suite. Er is geen gepubliceerde run die dit beslecht. Wie 52,6 citeert als het plafond van Argon, citeert een configuratie, niet een model, en de configuratie is degene die de leverancier als eerste koos te publiceren.

Dezelfde logica geldt voor Sol's 47,5, alleen dan in de tegenovergestelde richting: max staat bovenaan zijn ladder, dus het cijfer ligt dichter bij een plafond dan bij een vloer. Een eerlijke strijd bij gelijke inzet zou de kloof kunnen verkleinen en zou ook de kostenvergelijking kunnen omdraaien, aangezien de tokens die max verbruikt de tokens zijn die $10 per miljoen kosten.

De beschikbaarheidsfork, die het daadwerkelijke antwoord bepaalt.

Gemini 4 Argon is niet algemeen beschikbaar. De aankondiging van Google zegt dat het wordt uitgerold naar een groep vertrouwde cyberverdedigers via het Fairwind Program, dat het bedrijf deelneemt aan het vrijwillige proces van de Amerikaanse overheid voor pre-releasetoegang tot modellen, en dat algemene toegang voor ontwikkelaars, ondernemingen en consumenten "zo snel mogelijk" komt, te beginnen met betalende API-klanten en abonnees van Google AI Ultra. Er is geen model-ID, geen endpoint, geen quota en geen datum. Het staat op geen enkele publieke API, de onze inbegrepen — controleer de catalogus en je krijgt een 404, omdat het daar nog niet bestaat.

GPT-6 Sol is een aanroepbaar product. Op OrcaRouter is het openai/gpt-6-sol, op hetzelfde OpenAI-compatibele endpoint als de andere meer dan 200 modellen in de catalogus, tegen de lijstprijs van OpenAI doorgegeven met nul markup, dus de $2/$10 hierboven en de lange-contextstap van 272.000 tokens naar $4/$15 zijn wat je daadwerkelijk betaalt in plaats van wat een tariefkaart beweert. Automatische failover tussen providers dekt het geval waarin de route midden in een run verslechtert, en de routing-DSL laat één applicatie zijn goedkope classificatieverkeer naar een kleiner model sturen en zijn zware redeneerverkeer naar Sol, zonder een tweede SDK.

A capture of the OrcaRouter model page for openai/gpt-6-sol, listed by OpenAI with a 2026-09-22 date, a 1M-token context window, a 128K-token maximum output, text, image and file input, and pricing of $2.00 per million input tokens and $10.00 per million output tokens.

Die laatste opzet is het eerlijke antwoord op deze vergelijking voor de meeste teams. Het kostenargument voor Argon is reëel, maar voorwaardelijk: het geldt alleen bij een werklast waarin agentwerk met een lange horizon domineert; het kostenargument ertegen is reëel bij elke andere werklast; en je kunt het deze maand toch niet kopen. De goedkope zet is om nu het evaluatieharnas te bouwen — je eigen prompts, je eigen scoring, uitgevoerd tegen Sol met een paar effort-instellingen — zodat je, wanneer Argon betalende API-klanten bereikt, een gemeten antwoord hebt op een vraag die alle anderen op basis van een leaderboard zullen beantwoorden.

Wat zou het beslechten?

Drie dingen, in volgorde van hoeveel ze het oordeel zouden beïnvloeden. Algemene beschikbaarheid van Argon tegen een echte, niet-introductieprijs — het woord "introductory" betekent dat de $2/$10 kunnen veranderen, en Googles eigen volgorde zet betalende API-klanten voorop, dus het eerste gepubliceerde tarief na de lancering is het tarief om in de gaten te houden. Een gepubliceerde Artificial Analysis-run van Argon op de hoogste effort-instelling, die zou uitwijzen of 52,6 een plafond is of er net onder zit. En één onafhankelijke reproductie van het DeepSWE v1.1-cijfer — Google claimt 77,9% en noemt het een nieuwe state of the art; het is door de leverancier gerapporteerd en op dit moment niet buiten Google gereproduceerd.

Tot dan is de tweedeling helder en licht ironisch. GPT-6 Sol is het beter geverifieerde model, het snellere, het goedkopere per afgeronde taak, en het model dat je vanmiddag kunt aanroepen. Gemini 4 Argon is het hoger scorende model op het scorebord dat zijn leverancier ervoor koos te publiceren, ongeveer twee keer zo duur om daadwerkelijk te gebruiken, en nog niet te koop. Een keuze tussen hen is geen oordeel over capaciteit. Het is een oordeel over welke van die twee zinnen jouw maand beschrijft.

A capture of the Artificial Analysis model page for Gemini 4 Argon (High), dated September 2026 and credited to Google, marked a proprietary model. It reports an Artificial Analysis Intelligence Index score of 53, pricing of $2.00 per million input tokens and $10.00 per million output tokens with a 95% cache discount, an average cost of $1.99 per task on the Intelligence Index, a 1M-token context window, and text and image input.