
Solar Mini 4 scoorde 24 op de Artificial Analysis Index — en kost vijf keer meer per taak dan GPT-6 Luna
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1 mln tokens
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1 mln tokens · 159 tok/s
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 220 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Solar Mini 4 rekent hetzelfde per invoertoken als GPT-6 Luna, en ongeveer vijf keer zoveel om een taak daadwerkelijk af te ronden. Dat is het hele verhaal van de eerste onafhankelijke evaluatie van Upstage's nieuwe model, en het is niet het verhaal dat de lanceringsmaterialen vertelden. Solar Mini 4 ging live op 22 september 2026 als een sparse mixture-of-experts met 35 miljard parameters die ongeveer 3 miljard parameters per token activeert, geprijsd op $0,10 per miljoen invoertokens en $0,40 per miljoen uitvoertokens. GPT-6 Luna, OpenAI's efficiëntielaag, staat op de prijslijst voor $0,10 en $0,50, met een long-contextlaag boven 272.000 tokens die beide ongeveer verdubbelt. Op een tariefkaart lijken ze dezelfde aankoop. Op de Intelligence Index van Artificial Analysis, waar beide modellen door dezelfde suite van tien evaluaties werden gehaald, kost Solar Mini 4 $0,36 per voltooide taak tegenover $0,07 voor GPT-6 Luna (max) — een factor 5,4 die volledig voortkomt uit hoe de twee modellen zich tijdens een taak gedragen en niet uit wat ze per token in rekening brengen.
Op 30 september 2026 publiceerde Artificial Analysis zijn verslag over het model, dat 24 scoort op de Intelligence Index v4.3.2. Alles in dit artikel dat aan Artificial Analysis wordt toegeschreven, is de eigen meting van die organisatie; alles dat aan Upstage wordt toegeschreven, is de claim van de leverancier. Het onderscheid is hier belangrijker dan gewoonlijk, omdat de twee cijferreeksen niet altijd overeenkomen.
Wat de onafhankelijke run eigenlijk zegt

Solar Mini 4 komt uit op 24,05 op de Intelligence Index, tegenover een mediaan van 12 onder de reasoningmodellen in zijn prijsklasse. Dat plaatst het ruim boven het gemiddelde voor zijn gewichtsklasse, en de eigen framing van Upstage — "hoogste totaalscore onder de modellen met 3B actieve parameters in de Artificial Analysis Intelligence Index-vergelijking" — doorstaat onafhankelijke tests op dat specifieke punt. Qwen3.6 35B A3B, dat ook 3B parameters activeert, scoort 18,2 op dezelfde index. K2 Horizon MoVA 36B A4B, met 4B actief, scoort 25,3 — en doet dat met een kortere context, 524K tokens tegen 1,05 mln voor Solar Mini 4. Tegenover Inkling, een open-weights MoE met 975 miljard parameters die in juli is uitgebracht, komt Solar Mini 4 uit op 24,1 tegen 25,0 — binnen één punt van een model dat bijna dertig keer zo groot is en $1,00/$4,05 per miljoen tokens kost.
Het profiel in die score is ongelijkmatig, en die ongelijkmatigheid is het nuttige deel:
• Redeneren met lange context is het relatieve sterke punt. Solar Mini 4 scoort 83% op AA-LCR v1.1, gelijk aan MiniMax-M3 en GPT-6 Luna (max), en voor op Gemini 3.8 Flash (high) en GPT-6 Astra (max) met 81%.
• Wetenschappelijk programmeren houdt stand. 48% op SciCode, één punt voor op MiniMax-M3 en Inkling (xhigh).
• Agentisch coderen stort in. 1% op Terminal-Bench 4.0. Niet "zwak" — 1%. Op AutomationBench-AA, dat meerstapsworkflows uitvoert binnen echte SaaS-applicaties, 22,3%.
• Kennisnauwkeurigheid is laag, maar het model weet dat het gokt. AA-Omniscience retourneert −11 met 18% nauwkeurigheid; het model onthoudt zich van een antwoord bij ongeveer de helft van de vragen die het krijgt. Het niet-hallucinatiepercentage is 64%, ruim boven Inkling (xhigh) met 32% en GPT-6 Luna (max) met 23%. Een model dat de helft van de tijd "Ik weet het niet" zegt en in twee derde van de gevallen gelijk heeft wanneer het wel antwoordt, is een ander instrument dan een model dat vol vertrouwen confabuleert.
Bij agentisch kenniswerk zijn de cijfers 1072 Elo op GDPval-AA en 872 Elo op AA-Briefcase, beide dicht bij Inkling (xhigh).
Het vijfvoudige getal, uitgepakt
Het kosten-per-taakcijfer van Artificial Analysis is het cijfer dat de meeste inkoopgesprekken zal bepalen, en het verdient het om als uitsplitsing te worden gelezen in plaats van als kop te worden geciteerd. Twee dingen drijven het.
Eerst: volume. Solar Mini 4 produceert ongeveer 88.300 outputtokens per Intelligence Index-taak; daarvan zijn er 71.600 redeneertokens. Bij $0,40 per miljoen outputtokens is dat ongeveer $0,035 van de rekening — goedkoop, want output is goedkoop. Wat het in plaats daarvan kost, is tijd: bij een gemeten 204 tokens per seconde registreert Artificial Analysis 430 seconden werk voor een gemiddelde indextaak, oftewel ongeveer 7,2 minuten. GPT-6 Luna (max) produceert 50.000 outputtokens per taak bij 127 tokens per seconde en doet er 396 seconden over. Inkling (xhigh), een open-weights-model met 975 miljard parameters, produceert 34.700 tokens en is in 169 seconden klaar. Solar Mini 4 is langzamer dan beide, maar met een marge die niets te maken heeft met het vijfvoudige kostenverschil.
Ten tweede — en dit is het hele verhaal — cache-schrijfinput. De kostenopsplitsing van Artificial Analysis schrijft ongeveer $0,30 van de $0,36 per taak van Solar Mini 4 toe aan tokens die in de promptcache worden geschreven, tegenover $0,03 voor cachereads, $0,035 voor output en een afrondingsfout voor echt niet-gecachete input. Voor GPT-6 Luna (max) bedraagt het cacheschrijven $0,012 van $0,068 — ongeveer 17% van de rekening, tegenover 82% voor Solar Mini 4. Gecachte input is de goedkoopste post op de tariefkaart van Upstage, met $0,01 per miljoen, en het model van Artificial Analysis maakt er wel gebruik van; het probleem is hoeveel er moet worden geschreven voordat het kan worden gelezen. Een agent die bij elke beurt een groeiend gesprek opnieuw verzendt, betaalt de schrijfkosten veel vaker dan een model dat in een korte, afgesloten beurt antwoordt.
Dat is de bevinding die het waard is om mee te nemen naar productie: voor een model als dit voorspelt de prijs per token vrijwel niets over de rekening per taak. Het cachegedrag doet dat wel.
Waar de eigen cijfers van Upstage afwijken

Het lanceringsbericht van Upstage, gepubliceerd op 1 oktober 2026 onder de titel "Solar Mini 4: Gebouwd voor agent-workloads met een hoog volume", meldt 24,1 op de Artificial Analysis Intelligence Index — praktisch hetzelfde cijfer — en maakt verschillende beweringen die naast de onafhankelijke data staan, in plaats van erbovenop.
De leverancier noemt 22,3% op AutomationBench-AA, exact overeenkomend met Artificial Analysis, en 47,2 op τ³-Banking, een benchmark voor beleid en toolgebruik die de indexsuite sindsdien heeft laten vallen. De leverancier rapporteert 83,3% op AA-LCR en 47,6% op SciCode, beide binnen een afrondingsfout van de onafhankelijke cijfers. Op Humanity's Last Exam rapporteert hij 19,6%, terwijl de pagina van Artificial Analysis 25,8% vermeldt voor hetzelfde model; beide zijn plausibele uitkomsten van een berucht volatiele evaluatie, maar het zijn niet hetzelfde getal en geen van beide mag als het andere worden gepresenteerd.
Twee specificatieregels spreken elkaar ook tegen. Upstage documenteert een contextvenster van 512K tokens met maximaal 128K uitvoertokens. Artificial Analysis vermeldt een contextvenster van 1,0M tokens en een maximale uitvoer van 262K. De blog van Upstage maakt expliciet dat het cijfer van 512K het contract is dat daadwerkelijk wordt geleverd; het verschil is iets dat het waard is om te verifiëren aan de hand van een API-respons voordat iemand er een retrievalpijplijn op bouwt.
De leverancier maakt ook de enige vergelijking die hij op zijn eigen voorwaarden kan maken: een interne test met drie agenttaken in het Koreaans, drie keer per model uitgevoerd, waarbij het voltooien van 1.000 sets van drie taken naar schatting $1,25 kostte met Solar Mini 4 en $2,20 met MiMo-V2.5. Dat is een door de leverancier uitgevoerde test met door de leverancier gekozen taken, waarbij latentie buiten beschouwing is gelaten, en wijst in de tegenovergestelde richting van het resultaat van Artificial Analysis. Het is niet verkeerd — verschillende taken gebruiken verschillende tokenbudgetten — maar het is een marketingcijfer, en de gepubliceerde introductiekorting van het model is een aparte reden om je eigen cijfers opnieuw te berekenen in plaats van die van iemand anders over te nemen.
Prijzen, volgens de actuele documentatie van de Upstage-console: $0,10 per miljoen invoertokens, $0,01 per miljoen gecachte invoertokens, $0,40 per miljoen uitvoertokens, met een lanceringskorting die momenteel wordt geadverteerd als 50% korting tot en met 22 oktober 2026 UTC, waardoor de effectieve tarieven tot dan $0,05 voor invoer, $0,005 voor gecachte invoer en $0,20 voor uitvoer bedragen.
Wat dit betekent als jij degene bent die betaalt
Het interessante aan Solar Mini 4 is niet dat het een slecht model is. Het is dat het een oprecht goed klein model is waarvan de economie wordt gedomineerd door gedrag dat een tariefkaart je niet kan laten zien. Een 24 op de index bij drie actieve parameters is een echt engineeringresultaat, en Koreaanstalige workloads — het opgegeven sterke punt van het model, naast Engels en Japans — zijn precies waar dat resultaat het meest waarschijnlijk zijn prijs waard is.
Het lastige deel is alles na de eerste aanroep. Lange assistentbeurten, weinig cachehergebruik en een taak die zeven minuten decodeertijd per index-run kost, komen samen uit op een getal dat totaal niet lijkt op $0,10/$0,40. Als je het evalueert, is het eerlijke experiment een test van de kosten per voltooide taak op je eigen workload, met promptcaching ingeschakeld op de manier waarop je productiestack het daadwerkelijk zou gebruiken — niet een vergelijking van tokenprijzen.
Dit is ook de klasse van problemen die een router bestaat om op te lossen, en de reden dat OrcaRouter de lijstprijzen van providers doorgeeft met 0% opslag, zodat een prijswijziging van een leverancier dezelfde dag nog op je factuur terechtkomt. Wij routeren geen Upstage-modellen, dus noch Solar Mini 4 noch Solar Pro 4 is via ons beschikbaar — die komen van Upstage's eigen API en platforms van derden. Wat we wél routeren is de andere helft van deze vergelijking: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash en meer dan 200 andere modellen achter één enkele sleutel, wat het praktisch maakt om een goedkoop model en een duur model op dezelfde taak te houden en automatische failover en per-request routing te laten beslissen welke antwoordt. Wanneer het verschil tussen twee modellen een vijfvoudige kloof in kosten per taak is die geen enkele prijslijst onthult, is de mogelijkheid om één enkele aanvraag tussen hen te verplaatsen belangrijker dan welke benchmarktabel dan ook.

De korte versie: Solar Mini 4 is het nieuwe Pareto-punt dat Artificial Analysis voor modellen met minder dan drie miljard actieve parameters trekt, en het is per afgeronde taak ongeveer vijf keer duurder dan een model dat tegen dezelfde invoerprijs wordt aangeboden. Beide uitspraken zijn waar, en de tweede is degene die op een factuur komt te staan.
