Een hero-titelkaart voor een artikel dat GPT-6 Sol vergelijkt met Kimi K3, met de tekst 'GPT-6 Sol vs Kimi K3' en de ondertitel 'Drie aannames over open weights, getest tegen één rekening', waarin GPT-6 Sol als closed wordt weergegeven tegen $2,00/$10,00 met een Index van 48 en Kimi K3 als open weights tegen $3,00/$15,00 met een Index van 44.
Guides & Insights

GPT-6 Sol vs Kimi K3: Drie aannames over open gewichten, getest tegen één factuur

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het kopen van open gewichten is meestal een gok op drie dingen: dat ze goedkoper zijn, dat ze je controle geven, en dat ze een verzekering zijn tegen een leverancier die van gedachten verandert. Kimi K3, het model met 2,8 biljoen parameters dat Moonshot AI op 27 juli 2026 onder open gewichten uitbracht, en GPT-6 Sol, het gesloten model dat op 22 september 2026 werd uitgebracht, vormen een zuivere testcase voor alle drie, omdat de twee modellen op de neutrale ranglijst dicht genoeg bij elkaar liggen dat de aannames het argument zelf moeten dragen.

Dit is hoe ze het ervan afbrengen. K3 is niet goedkoper per taak — het is ongeveer twee keer zo duur, met $3,00 en $15,00 per miljoen tokens tegenover de $2,00 en $10,00 van Sol. De controle is reëel, maar heeft een hardwareondergrens die de meeste teams niet zullen overschrijden. En de verzekering is de enige aanname die volledig standhoudt, wat het de enige maakt die het waard is om voor te betalen. Wat volgt is de berekening achter elk.

De twee modellen, in het kort.

Kimi K3 is een sparse mixture-of-experts-model met 2,8 biljoen totale parameters en ongeveer 104 miljard — ongeveer 3,7% — actief per token, gepubliceerd onder een Modified MIT-licentie met een contextvenster van 1.048.576 tokens. Moonshots architectuurclaims zijn specifiek: Kimi Delta Attention, een hybride linear-attention-schema dat volgens het bedrijf tot 6,3× sneller is bij long-context-decoding, plus Attention Residuals en een Stable LatentMoE-framework. Het neemt tekst en afbeeldingen als invoer en geeft tekst terug. Het ongedistilleerde model is groter dan 1 TB en een productie-implementatie wordt beschreven in termen van een ondergrens van 64 accelerators.

GPT-6 Sol is gesloten, met één enkele identifier, en geprijsd tegen een vast tarief van $2,00 en $10,00, met een cacheread van $0,20 en cachewrites van $2,50, waarbij het hele verzoek boven 272.000 inputtokens opnieuw wordt geprijsd naar $4,00 en $15,00. Het is tekst en afbeelding in, tekst uit, met een venster van 1.050.000 tokens, een maximale invoer van 922.000 tokens, een uitvoerplafond van 128.000 tokens en een kennisafsluitdatum van 20 april 2026.

Contextvensters zijn in de praktijk vrijwel hetzelfde getal — een verschil van 0,1%. Dat neemt de meest voorkomende reden weg om een van beide te verkiezen, en het betekent dat de beslissing volledig berust op de drie aannames.

Aanname één: open weights zijn goedkoper. Dat zijn ze niet.

• Invoer — GPT-6 Sol $2,00 per miljoen tokens vs Kimi K3 $3,00 per miljoen tokens

• Uitvoer — GPT-6 Sol $10,00 per miljoen tokens vs. Kimi K3 $15,00 per miljoen tokens

• Gecachte invoer — GPT-6 Sol $0,20 per miljoen tokens vs Kimi K3 $0,30 per miljoen tokens; beide zijn een tiende van het tarief voor niet-gecachte invoer

• Intelligence Index, onafhankelijk — GPT-6 Sol 48 bij maximale inspanning vs Kimi K3 44 bij maximale inspanning

• Kosten per Index-taak, onafhankelijk — GPT-6 Sol $1,06 vs Kimi K3 $2,00

• Outputtokens voor de index-run — GPT-6 Sol 77M vs Kimi K3 160M

• Contextvenster — GPT-6 Sol 1.050.000 tokens vs. Kimi K3 1.048.576 tokens

• Gewichten — GPT-6 Sol gesloten vs Kimi K3 open, downloadbaar en zelf te hosten

• Licentie — GPT-6 Sol niet van toepassing vs Kimi K3 Modified MIT

• Totaal aantal parameters — GPT-6 Sol niet bekendgemaakt vs. Kimi K3 2.800 miljard, waarvan er per token 104 miljard actief zijn

Sol is goedkoper op elke regel van de tariefkaart, en het verschil is het grootst precies daar waar agentische workloads hun geld uitgeven. De onafhankelijke raad is het eens over de richting en grofweg over de omvang: Sol kost ongeveer half zoveel per voltooide taak, met vier indexpunten hoger. K3 genereerde iets meer dan twee keer zoveel outputtokens om dezelfde index te draaien.

Eén nuance zorgt ervoor dat dit geen afstraffing wordt. Moonshot beweert dat K3 21% minder outputtokens uitstuurt dan zijn voorganger, en het architectuurwerk — het attention-schema, het residualontwerp — is rechtstreeks gericht op de decodeerkosten bij lange contexten. Bij een workload die wordt gedomineerd door zeer lange inputs, kunnen de efficiëntiefuncties van K3 een deel van de kloof dichten die de indexrun laat zien. Niemand heeft die meting op een vergelijkbare testomgeving gepubliceerd, dus beschouw het als een leveranciersclaim met een plausibel mechanisme, niet als een resultaat.

A six-row scoreboard card titled 'GPT-6 Sol vs Kimi K3 - the scoreboard', comparing the two models on input price, output price, Intelligence Index, cost per task, weight availability and context window. The left column lists GPT-6 Sol at $2.00 input and $10.00 output, an Index of 48, $1.06 per task, closed weights and a 1,050,000-token context; the right column lists Kimi K3 at $3.00 and $15.00, an Index of 44, $2.00 per task, open weights under Modified MIT and a 1,048,576-token context. A footer reads 'Vendor list prices; Index per Artificial Analysis.'Screenshot of the Artificial Analysis model page for Kimi K3 (max), captured 23 September 2026, showing an Intelligence Index score of 44 in the open-weights class, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a cost of $2.00 per Intelligence Index task, 160 million output tokens generated during the index run, a 1M-token context window, 2.8 trillion total parameters with 104 billion active, and open model weights under the Kimi K3 license.

Aanname twee: open gewichten geven je controle. Tot aan een hardwareondergrens.

De controle is reëel en verdient een precieze formulering, want "open weights" wordt vaak losjes gebruikt. Een Modified MIT-licentie op een downloadbaar checkpoint betekent dat u het model op uw eigen hardware kunt draaien, kunt fine-tunen, een specifieke revisie kunt vastzetten en inferentie binnen een door u beheerde grens kunt houden. Niets daarvan is beschikbaar met GPT-6 Sol, tegen welke prijs dan ook.

Wat het niet betekent, is dat zelfhosting qua kosten een vervanging is voor de API. De gepubliceerde cijfers plaatsen het full-precision checkpoint op ongeveer 4,9 TB, of ongeveer 397 GB bij 1-bit-kwantisatie, met een implementatieondergrens in het bereik van 410 GB aan gecombineerd geheugen en productie-implementaties die in termen van 64 accelerators worden beschreven. Een team dat al zo'n type cluster draait, heeft hier een echte optie. Een team dat dat niet doet, vergelijkt een API-rekening met een kapitaalinvestering, en de API-rekening wint met een ruime marge.

De eerlijke versie van het controleargument is beperkter dan gewoonlijk wordt gesteld: open gewichten geven je de mogelijkheid om weg te gaan, niet de mogelijkheid om goedkoop te draaien. Dat zijn verschillende dingen, en slechts één ervan is beschikbaar voor de meeste teams.

Veronderstelling drie: open gewichten zijn een verzekering. Deze houdt stand.

De derde veronderstelling overleeft elk getal hierboven, en het is de reden dat K3 überhaupt een markt heeft. Moonshot kan worden overgenomen, kan zijn licentie voor toekomstige versies wijzigen, kan K3 uitfaseren, kan zijn prijs verhogen, kan abonnementen opschorten — en het heeft nieuwe abonnementen binnen 48 uur na release opgeschort om de servicekwaliteit voor bestaande betalende klanten te beschermen, wat een levende demonstratie is dat API-toegang een beleidsbeslissing is en geen eigenschap.

Als K3 wordt afgeschaft, draaien de gewichten die je hebt gedownload nog steeds. Als Moonshot de API-prijs verdrievoudigt, blijft je zelfgehoste implementatie onaangetast. Als je tegenover een auditor moet aantonen dat je inferentiestack vastligt op een bekende revisie, geeft een checkpoint je dat en een API niet. Niets hiervan verschijnt in een kosten-per-taaktabel, en het is allemaal reëel.

De vraag is wat het waard is. Op basis van de bovenstaande cijfers betaalt u ongeveer het dubbele per voltooide taak voor die verzekering, plus vier indexpunten aan capaciteit. Voor een workload waarin een API-deprecatie een bedrijfsonderbreking is, is dat goedkoop. Voor een workload waarin u gewoon van model zou wisselen, is het een premie voor een hedge die u nooit zult inzetten.

Beide zitten op één toets als je dat wilt.

Screenshot of OrcaRouter's model page for Kimi K3, captured 23 September 2026, showing the model id kimi/kimi-k3 from provider MoonshotAI, a 1,048,576-token context window, text and image input with text output, vision, tool, JSON and reasoning support, list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a p50 time to first token of 8.11 seconds and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses.

Kimi K3 staat in de catalogus van OrcaRouter tegen de lijstprijs van Moonshot, volgens het pass-through-model dat een tariefwijziging van Moonshot dezelfde dag aan onze kant live zet in plaats van nadat een reseller opnieuw onderhandelt. GPT-6 Sol staat op het moment van schrijven niet in onze catalogus en is bereikbaar via OpenAI's eigen API.

Die combinatie is meer waard dan het klinkt voor deze specifieke beslissing, omdat de twee modellen tot verschillende faalmodi behoren. De reden om K3 te draaien is niet dat het goedkoper is — dat is het niet — maar dat het een hedge is, en een hedge waar je niet snel naar kunt overschakelen is niet echt een hedge. K3 achter dezelfde endpoint houden als al het andere, met automatische failover en een routeringsregel die in de configuratie kan worden gewijzigd, is wat "we hebben een open-weight fallback" verandert van een slide in een presentatie in iets dat om 3 uur 's nachts werkt.

Waar elk eigenlijk voor dient

• Als je de laagste kosten per voltooide taak bij algemeen werk wilt — GPT-6 Sol, en de marge is ongeveer 2×.

• Als je van de twee de hoogste capaciteit wilt op het neutrale leaderboard — GPT-6 Sol met vier punten.

• Als je al een cluster in de geheugenklasse van 400 GB of meer draait en inferentie binnen je eigen grens nodig hebt — K3, dan verandert de afweging volledig, omdat de marginale kosten van de gewichten niet hetzelfde zijn als de kosten van de hardware.

• Als je werkelijke vereiste is dat je model niet van je kan worden afgenomen — K3, en dit is het enige argument in de vergelijking waarop Sol geen antwoord heeft.

• Als je op prijs per token kiest omdat K3 het goedkopere Chinese model lijkt — controleer dan eerst het aantal tokens. Met 160 miljoen outputtokens voor de index-run tegenover 77 miljoen van Sol, koop je met dat goedkopere tarief meer tokens, niet een lagere factuur.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt