
Solar Mini 4 fick 24 på Artificial Analysis Index — och kostar fem gånger mer per uppgift än GPT-6 Luna
- openaiNYOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1M tokens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1M tokens · 159 tok/s
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 220 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Solar Mini 4 tar samma pris per indatatoken som GPT-6 Luna, och ungefär fem gånger så mycket för att faktiskt slutföra en uppgift. Det är hela historien om den första oberoende utvärderingen av Upstages nya modell, och det är inte den historia som lanseringsmaterialet berättade. Solar Mini 4 lanserades den 22 september 2026 som en sparse mixture-of-experts med 35 miljarder parametrar som aktiverar omkring 3 miljarder parametrar per token, prissatt till 0,10 dollar per miljon indatatokens och 0,40 dollar per miljon utdatatokens. GPT-6 Luna, OpenAI:s effektivitetsklass, har ett listpris på 0,10 och 0,50 dollar, med en långkontextnivå över 272 000 tokens som ungefär fördubblar båda. På en prislista ser de ut som samma köp. På Artificial Analysis Intelligence Index, där båda modellerna kördes genom samma svit med tio utvärderingar, kostar Solar Mini 4 0,36 dollar per slutförd uppgift, jämfört med 0,07 dollar för GPT-6 Luna (max) — en faktor på 5,4 som helt och hållet kommer från hur de två modellerna beter sig under en uppgift snarare än från vad de tar betalt per token.
Den 30 september 2026 publicerade Artificial Analysis sin analys av modellen, som får 24 på Intelligence Index v4.3.2. Allt i den här artikeln som tillskrivs Artificial Analysis är organisationens egen mätning; allt som tillskrivs Upstage är leverantörens påstående. Distinktionen är viktigare här än vanligt, eftersom de två uppsättningarna siffror inte alltid stämmer överens.
Vad den oberoende körningen faktiskt säger

Solar Mini 4 hamnar på 24,05 i Intelligence Index, mot en median på 12 bland resonemangsmodellerna i sin prisklass. Det placerar den väl över genomsnittet för sin viktklass, och Upstages egen formulering – ”högsta totalpoäng bland de 3B-aktiva modellerna i Artificial Analysis Intelligence Index-jämförelsen” – håller vid oberoende testning på just den punkten. Qwen3.6 35B A3B, som också aktiverar 3B parametrar, får 18,2 på samma index. K2 Horizon MoVA 36B A4B, med 4B aktiva, får 25,3 – och det gör den på en kortare kontext, 524K tokens mot Solar Mini 4:s 1,05M. Jämfört med Inkling, en MoE med öppna vikter och 975 miljarder parametrar som släpptes i juli, hamnar Solar Mini 4 på 24,1 mot 25,0 – inom en poäng från en modell som är nästan trettio gånger så stor och som kostar $1,00/$4,05 per miljon tokens.
Profilen i den där poängen är ojämn, och ojämnheten är den användbara delen:
Lång kontext är den relativa styrkan. Solar Mini 4 får 83 % på AA-L1.1, i nivå med Mini-M3 och GPT-6 Luna (max), och före Gemini 3.8 Flash (high) och GPT-6 Astra (max) på 81 %.
• Vetenskaplig kodning håller måttet. 48 % på SciCode, en poäng före MiniMax-M3 och Inkling (xhigh).
• Agentisk kodning kollapsar. 1 % på Terminal-Bench 4.0. Inte "svag" — 1 %. På AutomationBench-AA, som kör arbetsflöden i flera steg över verkliga SaaS-applikationer, 22,3 %.
• Kunskapsnoggrannheten är låg, men modellen vet att den gissar. AA-Omniscience returnerar −11 med 18 % noggrannhet; modellen avstår från att svara på ungefär hälften av frågorna den får. Dess icke-hallucinationsgrad är 64 %, långt före Inkling (xhigh) på 32 % och GPT-6 Luna (max) på 23 %. En modell som säger "jag vet inte" hälften av gångerna och har rätt två tredjedelar av gångerna den väl svarar är ett annat instrument än en modell som konfabulerar självsäkert.
Inom agentiskt kunskapsarbete är siffrorna 1072 Elo på GDPval-AA och 872 Elo på AA-Briefcase, båda nära Inkling (xhigh).
Det femfaldiga talet, uppackat
Artificial Analysiss siffra för kostnad per uppgift är den som kommer att avgöra de flesta upphandlingssamtal, och den förtjänar att läsas som en uppdelning snarare än att citeras som en rubrik. Två saker driver den.
Först: volym. Solar Mini 4 avger cirka 88 300 utdatatoken per uppgift i Intelligence Index; 71 600 av dessa är resonemangstoken. Vid $0,40 per miljon utdatatoken är det ungefär $0,035 av notan – billigt, eftersom utdata är billigt. Det som i stället kostar är tid: vid uppmätta 204 token per sekund loggar Artificial Analysis 430 sekunders arbete för en genomsnittlig indexuppgift, eller ungefär 7,2 minuter. GPT-6 Luna (max) avger 50 000 utdatatoken per uppgift vid 127 token per sekund och tar 396 sekunder. Inkling (xhigh), en modell med öppna vikter och 975 miljarder parametrar, avger 34 700 token och blir klar på 169 sekunder. Solar Mini 4 är långsammare än båda, men med en marginal som inte har något att göra med den femfaldiga kostnadsskillnaden.
För det andra – och det här är hela historien – cacheskrivindata. Kostnadsfördelningen från Artificial Analysis tillskriver cirka 0,30 USD av Solar Mini 4:s 0,36 USD per uppgift till tokens som skrivs in i promptcachen, mot 0,03 USD för cacheläsningar, 0,035 USD för utdata och ett avrundningsfel för verkligt ocachad indata. För GPT-6 Luna (max) är cacheskrivning 0,012 USD av 0,068 USD – cirka 17 % av räkningen, mot 82 % för Solar Mini 4. Cachad indata är den billigaste posten i prislistan från Upstage på 0,01 USD per miljon, och modellen från Artificial Analysis använder den faktiskt; problemet är hur mycket som måste skrivas innan det kan läsas. En agent som skickar om en växande konversation vid varje tur betalar skrivkostnaden långt oftare än en modell som svarar i en kort, avslutad tur.
Det är den insikten som är värd att ta med in i produktionen: för en modell som den här förutsäger priset per token nästan ingenting om kostnaden per uppgift. Cachebeteendet gör det.
Där Upstages egna siffror skiljer sig åt

Upstages lanseringsinlägg, publicerat den 1 oktober 2026 med titeln "Solar Mini 4: Byggd för agentarbetsbelastningar med hög volym", rapporterar 24,1 på Artificial Analysis Intelligence Index – i praktiken samma siffra – och framför flera påståenden som ligger vid sidan av, snarare än ovanpå, den oberoende datan.
Leverantören uppger 22,3 % på AutomationBench-AA, vilket exakt matchar Artificial Analysis, och 47,2 på τ³-Banking, ett benchmark för policy- och verktygsanvändning som indexsviten sedan dess har tagit bort. Den rapporterar 83,3 % på AA-LCR och 47,6 % på SciCode, båda inom ett avrundningsfel från de oberoende siffrorna. På Humanity's Last Exam rapporterar den 19,6 %, medan Artificial Analysis-sidan anger 25,8 % för samma modell; båda är rimliga tolkningar av en notoriskt volatil utvärdering, men de är inte samma siffra och ingen av dem bör presenteras som den andra.
Två specifikationsrader säger också emot varandra. Upstage dokumenterar ett kontextfönster på 512K token med upp till 128K utdatatoken. Artificial Analysis anger ett kontextfönster på 1,0M token och en maximal utdata på 262K. Upstages blogg är tydlig med att siffran 512K är den som gäller i leveransen; avvikelsen är en sådan sak som är värd att stämma av mot ett API-svar innan någon bygger en hämtningspipeline på den.
Leverantören gör också den enda jämförelse den kan göra på sina egna villkor: ett internt test över tre koreanskspråkiga agentuppgifter som kördes tre gånger per modell, där att slutföra 1 000 set med tre uppgifter beräknades kosta 1,25 USD med Solar Mini 4 och 2,20 USD med MiMo-V2.5. Det är ett test som leverantören själv har kört på uppgifter som leverantören har valt, utan att räkna med latens, och det pekar i motsatt riktning mot resultatet från Artificial Analysis. Det är inte fel – olika uppgifter använder olika tokenbudgetar – men det är en marknadsföringssiffra, och modellens publicerade lanseringsrabatt är ett separat skäl att räkna om dina egna siffror i stället för att använda någon annans.
Prissättning, enligt den aktuella dokumentationen för Upstage-konsolen: $0.10 per miljon indatatokens, $0.01 per miljon cachade indatatokens, $0.40 per miljon utdatatokens, med en lanseringsrabatt som för närvarande annonseras som 50 % rabatt till och med 22 oktober 2026 UTC, vilket ger effektiva priser på $0.05 för indata, $0.005 för cachad indata och $0.20 för utdata fram till dess.
Vad detta innebär om du är den som betalar
Det intressanta med Solar Mini 4 är inte att det är en dålig modell. Det är att det är en genuint bra liten modell vars ekonomi domineras av beteende som en prislista inte kan visa dig. En 24:a på indexet med tre aktiva parametrar är ett riktigt ingenjörsresultat, och koreanskspråkiga arbetsbelastningar – modellens angivna styrka, vid sidan av engelska och japanska – är precis där det resultatet med störst sannolikhet är värt sitt pris.
Det besvärliga är allt som ligger nedströms om det första anropet. Långa assistentturer, låg cacheåteranvändning och en uppgift som tar sju minuters avkodning per indexkörning summerar till en siffra som inte alls liknar $0.10/$0.40. Om du utvärderar det är det ärliga experimentet ett test av kostnad per slutförd uppgift på din egen arbetsbelastning, med promptcachning aktiverad på det sätt som din produktionsstack faktiskt skulle använda den – inte en jämförelse av tokenpriser.
Detta är också den typ av problem som en router finns till för att lösa, och anledningen till att OrcaRouter förmedlar leverantörernas listpriser vidare med 0 % påslag så att en leverantörs prisändring når din faktura samma dag. Vi routar inte Upstage-modeller, så varken Solar Mini 4 eller Solar Pro 4 är tillgängliga via oss – de kommer från Upstages eget API och tredjepartsplattformar. Det vi däremot routar är den andra halvan av den här jämförelsen: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash och över 200 andra modeller bakom en enda nyckel, vilket är det som gör det praktiskt att behålla en billig modell och en dyr för samma uppgift och låta automatisk failover och routning per begäran avgöra vilken som svarar. När skillnaden mellan två modeller är en femfaldig kostnad-per-uppgift-klyfta som ingen prislista avslöjar, spelar möjligheten att flytta en enskild begäran mellan dem större roll än någon benchmark-tabell.

Den korta versionen: Solar Mini 4 är den nya Pareto-punkten som Artificial Analysis ritar upp för modeller under tre miljarder aktiva parametrar, och den är ungefär fem gånger dyrare per slutförd uppgift än en modell som listas till samma pris för indata. Båda påståendena är sanna, och det är det andra som syns på en faktura.
