
GPT-6.1 Sol vs Kimi K3: De download bestaat, en het is nog steeds niet de goedkope optie
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Kimi K3 is het tegenvoorbeeld dat dit soort argumenten gewoonlijk beslecht. Moonshot AI bracht in juli 2026 het model met 2,8 biljoen parameters uit en publiceerde de gewichten — moonshotai/Kimi-K3 staat op Hugging Face, zonder toegangsbeperking, met meer dan een miljoen downloads en een laatste revisie in september. Er is hier dus geen asterisk van "in principe open, achtergehouden voor veiligheidsverharding", geen vertraging van twee weken om uit te zitten. GPT-6.1 Sol, dat OpenAI op 29 september 2026 uitbracht, is gesloten en alleen via API beschikbaar en zal dat altijd blijven. En op de onafhankelijke ranglijst scoort het downloadbare model 43,6 tegen 51,8 voor het gesloten model, terwijl het $2,00 per voltooide indextaak kost tegenover $0,72. Open gewichten zouden de goedkope uitweg moeten zijn; in deze combinatie vormen ze de dure kant van de transactie, en de reden is niet de licentie.
Wat elk model is
Kimi K3 is een sparse mixture-of-experts-model met 2.800 miljard totale parameters en ruwweg 104 miljard — ongeveer 3,7% — actief per token. Het heeft een contextvenster van 1.048.576 tokens, accepteert tekst en afbeeldingen als invoer en retourneert tekst. De gepubliceerde checkpoint is een FP8-artefact en het is een werkelijk grote download; een productie-implementatie op je eigen hardware is een clusterbeslissing, niet een werkstationbeslissing. De architectuurclaim van Moonshoot is een hybride linear-attention-schema waarvan het zegt dat het aanzienlijk sneller is bij long-context-decodering, plus het rest- en routeringswerk dat een model met 2,8 biljoen parameters überhaupt serveerbaar maakte.
GPT-6.1 Sol is OpenAI's vernieuwing in het middensegment — onder GPT-6 Astra, boven GPT-6 Luna — met een contextvenster van 1.050.000 tokens, een uitvoerplafond van 128.000 tokens, tekst-, afbeeldings- en bestandsinvoer, en een kennisafsluitdatum van 30 april 2026. Redeneren loopt van laag tot max met gemiddeld als standaard; de 'geen'-optie die de vorige GPT-6 Sol accepteerde, wordt direct afgewezen, en OpenAI's eigen migratienotitie verwijst ontwikkelaars naar laag, in plaats daarvan. De prijs bedraagt $2,00 en $10,00 per miljoen tokens, met gecachte invoer tegen $0,10.
Eén regel per dimensie, beide zijden op elk:
• Invoer — GPT-6.1 Sol $2,00 per 1 mln vs. Kimi K3 $3,00 per 1 mln
• Uitvoer — GPT-6.1 Sol $10,00 per 1 mln vs. Kimi K3 $15,00 per 1 mln
• Gecachte invoer — GPT-6.1 Sol $0,10 per 1 mln vs. Kimi K3 $0,30 per 1 mln
• Contextvenster — 1.050.000 tokens vs. 1.048.576 tokens; een verschil van 0,1%, niet van belang
• Maximale uitvoer — 128.000 tokens bij beide
• Totale en actieve parameters — niet bekendgemaakt vs. 2.800 miljard totaal, 104 miljard actief per token
• Modaliteit — tekst, afbeelding en bestand in, tekst uit vs. tekst en afbeelding in, tekst uit
• Gewichten — gesloten, alleen API vs. open, zonder toegangsbeperkingen, meer dan 1 mln downloads
• Clausule voor lange context — brengt voor het hele verzoek boven 272.000 invoertokens 2× de invoer- en cacheprijs en 1,5× de uitvoerprijs in rekening vs. geen gelijkwaardige clausule op de gepubliceerde kaart
• Intelligence Index, onafhankelijk, maximale inspanning — 51,8 vs. 43,6
• Kosten per indextaak, onafhankelijk — $0,72 vs. $2,00
• Uitvoertokens bij de indexrun — 67 miljoen vs. 160 miljoen, tegen een mediaan van 140 miljoen op de ranglijst voor zijn vergelijkingsklasse
De enige evaluatie die K3 wint, en waarom dat ertoe doet
Vóór de berekening, de uitzondering, want die is reëel. Evaluatie voor evaluatie gescoord bij maximale inspanning op Artificial Analysis v4.3.2: GPT-6.1 Sol leidt zeven van de tien en eindigt nergens gelijk, maar het model dat de evaluatie voor redeneren met lange context wint, is K3:
• AA-LCR v1.1 — Kimi K3 0,887 vs GPT-6.1 Sol 0,830. Een voorsprong van zes punten op de evaluatie die specifiek is gebouwd voor het redeneren over lange inputs.
• SciCode — Kimi K3 0,595 vs GPT-6.1 Sol 0,542. K3 leidt ook op het gebied van wetenschappelijk programmeren.
• Terminal-Bench 4.0 — Kimi K3 0,126 vs GPT-6.1 Sol 0,561. Een gat van 43 punten in de andere richting, en veruit het grootste verschil in de vergelijking.
• Humanity's Last Exam — Kimi K3 0,469 vs GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 vs GPT-6.1 Sol 41,5; op het gebied van feitelijke betrouwbaarheid behoren de twee niet tot dezelfde modelklasse.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 vs GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 vs GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 en 0,234; Sol 0,649, 0,310 en 0,317.
Het AA-LCR-resultaat is het resultaat dat je serieus moet nemen, want het is het enige getal dat het kosten-per-taakverhaal tegenspreekt, en het wijst op een workload waarbij het goedkoop lijkende antwoord in beide richtingen onjuist is. Als je verkeer bestaat uit zeer lange inputs, een bescheiden gegenereerd antwoord en intensief hergebruik van een stabiele prefix — de vorm waarin breedsprakigheid nooit de kans krijgt om toe te bijten — dan is de combinatie bij K3 van een eersteklas lange-contextscore, een beeldinvoer en een downloadbaar checkpoint een betere fit dan die van Sol, en het kosten-per-taakcijfer voor de indexrun geldt niet voor jou. Dat is de eerlijke versie van "open gewichten zijn een meerprijs waard": soms is het open model simpelweg het betere model voor de klus, en hier is dat op één as het geval.
Het is ook de moeite waard te benoemen wat die twee overwinningen gemeen hebben. K3 is sterk waar een taak kan worden beantwoord in één lange lees- of redeneeract, en zwak waar die in veel kleine stappen moet worden uitgevoerd en gecontroleerd. De kloof van 43 punten op Terminal-Bench en de kloof van 22 punten op omniscience zijn dezelfde bevinding vanuit twee gezichtshoeken: langdurige agentische uitvoering is niet waarop deze checkpoint is geoptimaliseerd.
De rekensom, die uiteindelijk de doorslag geeft.
De tariefkaart van K3 is op elke tariefregel 1,5× die van Sol en de gemeten kosten per voltooide indextaak bedragen 2,8×, en het verschil tussen 1,5 en 2,8 wordt volledig verklaard door tokenvolume. De eigen meting van het bestuur is 160 miljoen outputtokens voor K3 tegenover 67 miljoen voor Sol op dezelfde suite van tien evaluaties. K3 produceert 2,4 keer de output tegen 1,5 keer de prijs, en 2,4 × 1,5 is 3,6 — het cijfer van het bestuur van $2,00 tegen $0,72 is iets vriendelijker dan de zuivere verhouding omdat input- en cachebijdragen het enigszins compenseren, maar de richting staat niet ter discussie.
De marketing van Moonshoot zelf druist hier op een manier tegenin die het waard is zorgvuldig te lezen. Het bedrijf beweert dat K3 minder outputtokens genereert dan zijn voorganger, en het architectuurwerk — het attention-schema, het residuele ontwerp — is rechtstreeks gericht op de kosten van het decoderen van lange contexten. Beide kunnen waar zijn terwijl het model nog steeds twee keer zo verbose is als een benchmarkmediaan op een algemene suite. De twee beweringen gaan over verschillende dingen: efficiëntie ten opzichte van een eerdere Kimi, en efficiëntie ten opzichte van het veld. Alleen op de tweede wordt u afgerekend, en dat is wat de onafhankelijke raad meet.
Caching verzacht dat. Beide tarieven voor gecachte input zijn een tiende van het niet-gecachte inputtarief van hun model — $0,30 voor K3, $0,10 voor Sol — dus de cachelijn verandert de rangorde niet, maar betekent wel dat een workload met veel requests en weinig antwoorden de kloof verkleint tot ongeveer de tariefkaartverhouding in plaats van de gemeten taakverhouding. En de long-contextclausule van Sol werkt juist de andere kant op: boven 272.000 inputtokens wordt de hele aanvraag opnieuw geprijsd tegen $4,00 en $15,00, met cache tegen $0,20, wat de enige band is waar de vaste tariefkaart van K3 onbetwist wint. Dat is om twee redenen het weten waard, want het is ook de band waarin de long-contextscore van K3 het beste cijfer in deze vergelijking is.

Wat zijn open weights hier eigenlijk waard?
Drie dingen, en het is de moeite waard ze te scheiden, want "open weights" wordt meestal als één argument gebruikt, terwijl het er drie zijn.
Het eerste is dat je kunt weggaan. Als Moonshoot wordt overgenomen, de licentie voor toekomstige versies wijzigt, K3 uitfaseert of zijn API-prijs verhoogt, blijft een checkpoint dat je al hebt gedownload gewoon draaien. Dat is geen hypothetisch scenario voor dit lab: Moonshoot schorste nieuwe abonnementen binnen ongeveer 48 uur na een eerdere release om de servicekwaliteit voor bestaande betalende klanten te beschermen, wat een levend voorbeeld is van het feit dat API-toegang een beleidsbeslissing is en geen eigenschap. Niets hiervan staat in een kosten-per-taaktabel, en het is allemaal echt.
Het tweede is dat je kunt vastzetten. Een vaste revisie, fijn afgestemd, draaiend binnen een grens die je zelf beheert, is iets wat je een auditor kunt laten zien en wat een API niet kan bieden. Voor gereguleerd verkeer is dat meer waard dan een tariefkaart.
De derde — degene die gewoonlijk wordt verondersteld — is dat het goedkoper zal zijn. Dat is niet zo. De checkpoint is een FP8-artefact met 2,8 biljoen parameters, en de gepubliceerde implementatierichtlijnen zijn toegespitst op configuraties met meerdere accelerators in plaats van één enkele node. Een team dat al dat type cluster draait, heeft hier een reële optie en de afweging verandert volledig, omdat de marginale kosten van een token dan elektriciteit zijn. Een team dat dat niet doet, vergelijkt een API-rekening met een kapitaalaankoop, en de API-rekening wint met een ruime marge. De eerlijke samenvatting is dat open gewichten je hier de mogelijkheid geven om weg te gaan, niet de mogelijkheid om goedkoop te draaien.
Beide op één toets, wat het onderdeel is dat de trade nuttig maakt.
Kimi K3 staat op OrcaRouter tegen de eigen lijstprijs van Moonshoot — $3,00 en $15,00 per miljoen tokens met een cache-read van $0,30, ongewijzigd ten opzichte van de tariefkaart van de leverancier — en GPT-6.1 Sol is op de dag van release tegen de prijs van OpenAI op onze routes verschenen, $2,00 en $10,00 met gecachte input tegen $0,10 en de 272.000-tokenstap wordt exact zoals vermeld doorgegeven. Aan geen van beide wordt iets toegevoegd. Het platform geeft de lijstprijs van de provider door in plaats van er een opslag op te zetten, dus een tariefwijziging van Moonshoot en een tariefwijziging van OpenAI verschijnen beide aan onze kant op dezelfde dag dat ze bij de leverancier verschijnen, zonder een tweede contract of een wederverkoper ertussen.

De reden dat dit voor dit paar zwaarder weegt dan voor de meeste, is dat de twee modellen verschillende faalmodi vertegenwoordigen. GPT-6.1 Sol is het model dat je draait voor langdurige uitvoering, toollussen en feitelijke betrouwbaarheid; Kimi K3 is het model dat je draait voor zeer lange inputs, waarbij je de beste long-contextscore wilt en een checkpoint wilt als hedge tegen de zakelijke beslissing van iemand anders. Dat zijn geen concurrerende keuzes, het zijn twee routes in hetzelfde verkeer. Het achter één endpoint houden van beide, met automatische failover ertussen en een regel die werk met lange inputs naar K3 verplaatst en uitvoeringswerk naar Sol, is wat "we hebben een open-weight fallback" verandert van een regel in een ontwerpdocument in iets dat om drie uur 's nachts werkt tijdens een call die aan het mislukken is.

Waar elk thuishoort
• Terminalagenten, coderen op repo-schaal, uitvoering in meerdere stappen — GPT-6.1 Sol, met een voorsprong van 43 punten op Terminal-Bench 4.0. Dit is niet nipt.
• Antwoorden waarbij een hallucinatie duur is — GPT-6.1 Sol, op een AA-Omniscience-verschil van 22 punten.
• Zeer lange inputs met een kort gegenereerd antwoord — Kimi K3. Beste score voor redeneren met lange context in deze vergelijking, beeldinvoer, en een breedsprakigheid die nooit de kans krijgt om van toepassing te zijn.
• Zelfhosting of een inferentiestack die je moet kunnen bevriezen — Kimi K3, en alleen als je de hardware al beheert. Het checkpoint is het eindproduct; de economische kant van het draaien ervan staat daar los van.
• Een hedge tegen een leverancier die zijn voorwaarden wijzigt — Kimi K3, en dit is het enige argument dat GPT-6.1 Sol tegen geen enkele prijs kan weerleggen.
• Kiezen op basis van de tariefkaart — noch K3 noch Sol is de goedkope optie in deze vergelijking, en geen van beide is de goedkope optie in de GPT-6-lijn. Als de factuur de doorslaggevende input is, staat het model dat je wilt verderop in de prijslijst, niet in deze tabel.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
