
GPT-6.1 Sol vs Gemini 4 Argon: Een half punt uit elkaar, en slechts één ervan is te koop
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Alles wat je kunt vergelijken tussen GPT-6.1 Sol en Gemini 4 Argon is meetbaar, en niets ervan is concreet toepasbaar, omdat slechts één van de twee modellen te koop is. Gemini 4 Argon werd op 30 september 2026 aangekondigd in een DeepMind-bericht dat aan Koray Kavukcuoglu wordt toegeschreven, met een opgegeven introductieprijs van $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens, en wordt eerst uitgerold naar een bij naam genoemd cohort cyberverdedigers via het Fairwind Program. Het heeft geen model-id, geen API-endpoint, geen gepubliceerd tarief per token waartegen je kunt worden gefactureerd, en geen pagina die je als klant kunt bereiken. GPT-6.1 Sol werd op 29 september 2026 uitgebracht voor $2,00 en $10,00 en is nu beschikbaar. Op de Artificial Analysis Intelligence Index schelen de twee 0,8 punt — Argon 52,6, Sol 51,8 — wat dit het dichtst bij elkaar liggende paar in deze batch maakt en, op de index alleen, een volledige gelijkstand. Op de maatstaf die echte implementaties bepaalt, is een van deze modellen helemaal geen kandidaat.
Die asymmetrie is geen technisch detail, en ook geen primeur. Het is het feit dat moet bepalen hoe de vergelijking wordt gelezen: Argons cijfers beschrijven een model in een gecontroleerde uitrol naar één cohort, en die van GPT-6.1 Sol beschrijven een product op een prijslijst. Ze vergelijken is nog steeds de moeite waard — Argon is waar de leverancier momenteel mee vooroploopt, en de metingen ervan zeggen iets wezenlijks over waar de top van de Gemini-lijn zich bevindt — maar elke conclusie moet de frase "als het te koop zou zijn" bevatten, en geen enkele bevat de frase "zou je moeten overstappen".
De index staat precies één vergelijking toe, en het is bijna een gelijkspel.

Beide modellen staan op Artificial Analysis, en beide hebben een score en een verantwoording van wat het produceren van die score heeft gekost.
• Intelligence Index, v4.3.2 — Gemini 4 Argon 52,6 vs GPT-6.1 Sol 51,8, een verschil van 0,8 punt
• Kosten per indextaak — Gemini 4 Argon $1,99 vs GPT-6.1 Sol $0,72, een verschil van 2,8× voor die 0,8 punten
• Kosten om de volledige suite te draaien — Gemini 4 Argon $2.407 vs GPT-6.1 Sol $1.082
• Uitvoertokens gegenereerd op die suite — Gemini 4 Argon 110M vs GPT-6.1 Sol 67M, een 1,6× verschil in breedsprakigheid
• Vermelde introductieprijs — $2,00 in en $10,00 uit per miljoen tokens voor beide, met 95% korting voor gecachte input op Argon
• Contextvenster — GPT-6.1 Sol 1.050.000 tokens; Argon is niet gepubliceerd
De vierde regel verklaart de tweede. Een kostenverschil van 2,8× per taak bij vrijwel identieke tarieven in de kop komt doordat er 1,6× zoveel tokens worden geschreven tegen een vergelijkbare outputprijs, plus wat het redeneervolume daarachter ook kost. Afgaande op zijn modelkaart is Argon geen duur model. Het is een praatgraag model in de evaluatie, en de rekening wordt in de output vereffend.
De configuraties verschillen, en de richting van het verschil bevoordeelt het goedkopere model. Artificial Analysis toont Gemini 4 Argon op zijn instelling voor hoge inspanning en GPT-6.1 Sol op max — dus Sol wordt gemeten op zijn duurste instelling en Argon op iets onder zijn plafond. Het gat van 0,8 punt is daarom de gunstige versie van de vergelijking voor Sol: geef Argon zijn hoogste instelling en het gat wordt waarschijnlijk groter, geef Sol een lagere instelling en zijn kosten dalen verder. Geen van beide ingrepen wijzigt de beschikbaarheidslijn, de enige lijn die een inzetbeslissing beëindigt.
Een verschil van 0,8 punt überhaupt lezen
Een verschil van minder dan een punt op een samengestelde score van tien evaluaties is geen rangschikking. Het zijn twee modellen in dezelfde band.
Wat de index niet voor Argon publiceert, is het componentdetail dat de band leesbaar zou maken — op welke evaluaties het wint, waar het zwak is, hoe het zich gedraagt in de subscores waaruit het composiet bestaat. De pagina van GPT-6.1 Sol bevat die rijen; die van Argon bevat een kop en een kostenpost. Een vergelijking die alleen op de kop is gebaseerd, kan zeggen dat de twee gelijk staan en verder niets, en ze zou precies dat moeten zeggen in plaats van een winnaar te fabriceren uit een marge van 0,8 punt.
Er is één extern datapunt dat het toevoegen waard is, en het wijst de andere kant op. In een codingevaluatie door een derde partij die na de aankondiging circuleerde, eindigde Argon als derde achter GPT-6 Astra en Claude Opus 5.5 — een sterk resultaat voor een model in een gecontroleerde uitrol, en een resultaat dat consistent is met een score van 52,6 op de samengestelde index. Het is ook een enkele observatie uit een enkele evaluatie, gepubliceerd in de eerste dagen van een aankondiging, waardoor het veeleer bewijs dan een trackrecord is. Label het en ga verder.
Waar de twee prijskaarten eigenlijk voor dienen
Het aangegeven tarief voor Argon verdient meer aandacht dan de indexrij, omdat er twee getallen in staan.
Het introductietarief is $2,00 in en $10,00 uit, met gecachte invoer tegen 95% korting, wat op een kaart Argon een gelijkwaardige prijsmatch met GPT-6.1 Sol zou opleveren. In de eigen voetnoot van de leverancier staat dat het tarief na een introductieperiode die niet nader wordt gedefinieerd, $4,00 per miljoen invoer- en $20,00 per miljoen uitvoertokens wordt. Dat tweede paar is geen hypothetisch getal — het is het gepubliceerde bedrag waarop het model naar verwachting zal uitkomen — en het komt precies uit op de huidige frontier-listprijs in plaats van eronder. Een vergelijking die alleen het introductiepaar noemt, citeert een promotiegetal voor een model dat nog niet algemeen beschikbaar is, wat neerkomt op twee gradaties van voorlopigheid op één regel.
De kaart van GPT-6.1 Sol is het tegenovergestelde soort object. $2,00 en $10,00 is het vaste tarief, geen promotie; de long-contextstap naar $4,00 / $15,00 boven 272.000 prompttokens is gepubliceerd en geldt voor een gedefinieerde grens; gecachete input tegen $0,10 is vandaag live en factureerbaar. Er zit niets in dat een voetnoot vereist over een periode die de leverancier weigert te definiëren.
Dat is de kern achter de beschikbaarheidslijn. Niet dat Argon een slechter model is — de index zegt dat de twee gelijk staan — maar dat een van deze twee kaarten een toezegging is en de andere een intentie.
De uitrol zelf is de vergelijking

Het Fairwind-programma is het deel van Argon's aankondiging dat een technische vergelijking doorgaans overslaat, en het is juist het deel dat hier het meest van belang is.
De leverancier geeft het model eerst in handen van een met naam genoemde groep cyberverdedigers, vóór alle anderen, zonder aangekondigde datum voor een algemene openstelling, zonder wachtlijst voor ontwikkelaars en zonder gepubliceerde identifier die een klant kan vastpinnen. Dat is een legitieme manier om een frontiermodel uit te brengen, en het is niet ongebruikelijk voor capaciteiten van deze klasse. Het betekent ook dat elke claim over de kosten, latentie, doorvoer en betrouwbaarheid van Argon bij echt verkeer momenteel niet gemeten is: er is geen productieverkeer om te meten. De eigen benchmarkrun van de leverancier bestaat, en het composiet van Artificial Analysis bestaat, en samen vormen ze de evaluatie van één lab en de suite van één evaluator. Dat is het volledige dossier.
Het trackrecord van GPT-6.1 Sol is acht dagen oud en op een andere manier mager: één onafhankelijke configuratie, geen corpus van praktijkmensen, en een product dat al wordt geleverd en waarvan de faalmodi nog nergens zijn opgeschreven. Geen van beide modellen is goed onderbouwd. Een ervan heeft echter een factuur.
Dus waar is deze vergelijking voor
Drie toepassingen, en geen ervan is een aankoopbeslissing.
Eerst: kalibratie. Als je bijhoudt waar Argon staat tegenover GPT-6.1 Sol, dan is 52,6 tegen 51,8 bij een kostenverschil per taak van 2,8× het huidige antwoord, en het zegt dat de Gemini 4-lijn concurrerend is qua capaciteiten terwijl de commerciële voorwaarden nog worden uitgewerkt. Let op dat het introductietarief wordt vervangen door het $4.00 / $20.00-paar, waardoor een prijsmatch een prijspremie wordt bij ongewijzigde capaciteiten.
Ten tweede, een afwachtende houding. Een model dat wordt aangekondigd, gemeten en niet routeerbaar is, is het duidelijkste geval dat er bestaat voor het behouden van een abstractie tussen je applicatie en je modelkeuze. Beide modellen in dit stuk zijn op dezelfde manier bereikbaar vanaf onze kant van het hek: GPT-6.1 Sol staat op OrcaRouter tegen zijn eigen $2,00 / $10,00 met gecachte input tegen $0,10 en niets extra's, zodat er vandaag tegen de listprijs van de provider een workload tegen kan worden gebouwd. Als en wanneer Argon een identifier en een tariefkaart krijgt, zou het evalueren ervan een configuratiewijziging moeten zijn in plaats van een herschrijving — en tot die tijd is de juiste hoeveelheid engineering om aan Argon te besteden, de hoeveelheid die dat waar houdt.
Ten derde, een falsifieerbare watchlist. Elk van de volgende zou dit veranderen van een stuk over wat we tot nu toe weten in een vergelijking waarin je kunt shoppen: een model-ID in de ontwikkelaarsdocumentatie, een vermelding op de modelkaartindex, een post over algemene beschikbaarheid met gepubliceerde tarieven per token, of Artificial Analysis die een tweede configuratie publiceert op een ander inspanningsniveau. Totdat een daarvan beschikbaar komt, beschrijft een stuk dat beweert dat Argon in productie goedkoper, sneller of beter is dan GPT-6.1 Sol, een model dat niemand buiten één cohort heeft gedraaid.

De eerlijke afsluiting is één zin, en die gaat over de vorm van de vraag, niet over de score. Gemini 4 Argon en GPT-6.1 Sol liggen dicht genoeg bij elkaar op het enige onafhankelijke leaderboard waarop beide voorkomen dat de index niet tussen hen kan kiezen; wat tussen hen kiest, is dat de een beschikbaar is en de ander een belofte, en een belofte is niet iets waar je productieverkeer naartoe routeert. Volg Argon, adopteer Sol als de prijs en de modaliteiten bij je werk passen, en houd de abstractie dun genoeg dat het op de dag dat Argon echt wordt, een regel configuratie is in plaats van een project.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
