
Solar Mini 4 ha ottenuto 24 sull'Artificial Analysis Index — e costa cinque volte di più per attività rispetto a GPT-6 Luna
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1M di token
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1M di token · 159 tok/s
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 220 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Solar Mini 4 fa pagare quanto GPT-6 Luna per token di input, e circa cinque volte tanto per portare effettivamente a termine un compito. Questa è tutta la storia della prima valutazione indipendente del nuovo modello di Upstage, e non è la storia raccontata dai materiali di lancio. Solar Mini 4 è stato reso disponibile il 22 settembre 2026 come mixture-of-experts sparso da 35 miliardi di parametri che attiva circa 3 miliardi di parametri per token, al prezzo di 0,10 $ per milione di token di input e 0,40 $ per milione di output. GPT-6 Luna, il livello di efficienza di OpenAI, ha un listino di 0,10 $ e 0,50 $, con un livello long-context oltre i 272.000 token che raddoppia all’incirca entrambi. Su un listino prezzi sembrano lo stesso acquisto. Sull’Intelligence Index di Artificial Analysis, dove entrambi i modelli sono stati sottoposti alla stessa suite di dieci valutazioni, Solar Mini 4 costa 0,36 $ per compito completato contro 0,07 $ per GPT-6 Luna (max) — un fattore di 5,4 che deriva interamente da come i due modelli si comportano durante un compito, non da quanto fanno pagare per un token.
Il 30 settembre 2026, Artificial Analysis ha pubblicato la propria analisi del modello, che ottiene 24 sull'Intelligence Index v4.3.2. Tutto ciò che in questo articolo è attribuito ad Artificial Analysis è una misurazione della stessa organizzazione; tutto ciò che è attribuito a Upstage è un'affermazione del fornitore. Qui la distinzione conta più del solito, perché i due insiemi di numeri non sempre concordano.
Cosa dice davvero l'esecuzione indipendente

Solar Mini 4 si colloca a 24,05 sull'Intelligence Index, contro una mediana di 12 tra i modelli di ragionamento nella sua fascia di prezzo. Ciò lo pone ben al di sopra della media della sua categoria di peso, e la stessa formulazione di Upstage — "punteggio complessivo più alto tra i modelli con 3B attivi nel confronto dell'Artificial Analysis Intelligence Index" — regge ai test indipendenti su quel punto specifico. Qwen3.6 35B A3B, che attiva a sua volta 3B parametri, ottiene 18,2 sullo stesso indice. K2 Horizon MoVA 36B A4B, con 4B attivi, ottiene 25,3 — e lo fa su un contesto più breve, 524K token contro 1,05M di Solar Mini 4. Rispetto a Inkling, un MoE open-weights da 975 miliardi di parametri rilasciato a luglio, Solar Mini 4 si attesta a 24,1 contro 25,0 — a un punto di distanza da un modello quasi trenta volte più grande che costa $1,00/$4,05 per milione di token.
Il profilo all'interno di quella partitura è irregolare, e l'irregolarità è la parte utile:
• Il ragionamento su contesti lunghi è il punto di forza relativo. Solar Mini 4 ottiene l'83% su AA-LCR v1.1, allo stesso livello di MiniMax-M3 e GPT-6 Luna (max), e davanti a Gemini 3.8 Flash (high) e GPT-6 Astra (max) all'81%.
• Il coding scientifico regge. 48% su SciCode, un punto avanti a MiniMax-M3 e Inkling (xhigh).
• La programmazione agentica crolla. 1% su Terminal-Bench 4.0. Non "debole" — 1%. Su AutomationBench-AA, che esegue flussi di lavoro multi-step attraverso applicazioni SaaS reali, 22,3%.
• L'accuratezza delle conoscenze è bassa, ma il modello sa di stare tirando a indovinare. AA-Omniscience restituisce −11 con un'accuratezza del 18%; il modello si astiene su circa la metà delle domande che gli vengono poste. Il suo tasso di non-allucinazione è del 64%, ben al di sopra di Inkling (xhigh) al 32% e di GPT-6 Luna (max) al 23%. Un modello che dice "non lo so" metà delle volte e ha ragione due volte su tre quando risponde è uno strumento diverso da un modello che confabula con sicurezza.
Nel lavoro di conoscenza agentico, i valori sono 1072 Elo su GDPval-AA e 872 Elo su AA-Briefcase, entrambi vicini a Inkling (xhigh).
Il numero delle cinque volte, scomposto
Il dato di Artificial Analysis sul costo per attività è quello che deciderà la maggior parte delle conversazioni di procurement, e merita di essere letto come una ripartizione anziché citato come titolo. Due fattori lo determinano.
Primo, il volume. Solar Mini 4 genera circa 88.300 token di output per attività dell'Intelligence Index; 71.600 di questi sono token di ragionamento. A 0,40 $ per milione di token di output, equivale a circa 0,035 $ della fattura — economico, perché l'output è economico. Ciò che costa invece è il tempo: a una velocità misurata di 204 token al secondo, Artificial Analysis registra 430 secondi di lavoro per un'attività media dell'indice, ovvero circa 7,2 minuti. GPT-6 Luna (max) genera 50.000 token di output per attività a 127 token al secondo e impiega 396 secondi. Inkling (xhigh), un modello open-weights da 975 miliardi di parametri, genera 34.700 token e termina in 169 secondi. Solar Mini 4 è più lento di entrambi, ma di un margine che non ha nulla a che vedere con il divario di costo di cinque volte.
Secondo — e questa è tutta la storia — l'input di scrittura in cache. Il dettaglio dei costi di Artificial Analysis attribuisce circa 0,30 $ dei 0,36 $ per task di Solar Mini 4 a token scritti nella cache del prompt, contro 0,03 $ per le letture dalla cache, 0,035 $ per l'output e un errore di arrotondamento per l'input realmente non in cache. Per GPT-6 Luna (max), la scrittura in cache è 0,012 $ su 0,068 $ — circa il 17% della fattura, contro l'82% di Solar Mini 4. L'input in cache è la voce più economica del listino di Upstage, a 0,01 $ per milione, e il modello di Artificial Analysis la usa effettivamente; il problema è quanto bisogna scrivere prima di poterlo leggere. Un agente che invia di nuovo una conversazione in crescita a ogni turno paga il costo di scrittura molto più spesso di un modello che risponde in un turno breve e chiuso.
Questo è il risultato che vale la pena portare in produzione: per un modello come questo, il prezzo per token non predice quasi nulla del costo per attività. Il comportamento della cache, invece, sì.
Dove i numeri di Upstage stesso differiscono

Il post di lancio di Upstage, pubblicato il 1° ottobre 2026 con il titolo "Solar Mini 4: Built for High-Volume Agent Workloads", riporta 24,1 sull'Artificial Analysis Intelligence Index — di fatto lo stesso valore — e avanza diverse affermazioni che si collocano accanto ai dati indipendenti, anziché al di sopra di essi.
Il fornitore cita il 22,3% su AutomationBench-AA, in perfetta corrispondenza con Artificial Analysis, e 47,2 su τ³-Banking, un benchmark di policy e uso degli strumenti che la suite dell'indice ha nel frattempo rimosso. Riporta l'83,3% su AA-LCR e il 47,6% su SciCode, entrambi entro un errore di arrotondamento rispetto ai valori indipendenti. Su Humanity's Last Exam riporta il 19,6%, mentre la pagina di Artificial Analysis indica il 25,8% per lo stesso modello; entrambi sono valori plausibili di una valutazione notoriamente volatile, ma non sono lo stesso numero e nessuno dei due dovrebbe essere presentato al posto dell'altro.
Due righe di specifiche sono inoltre in disaccordo. Upstage documenta una finestra di contesto di 512K token con un output fino a 128K token. Artificial Analysis indica una finestra di contesto di 1,0M token e un output massimo di 262K. Il blog di Upstage è esplicito sul fatto che la cifra di 512K è il contratto effettivo; la discrepanza è il tipo di cosa che vale la pena risolvere verificandola rispetto a una risposta API prima che qualcuno costruisca sopra una pipeline di retrieval.
Il fornitore propone anche l'unico confronto che può fare alle proprie condizioni: un test interno su tre attività di agent in lingua coreana, eseguito tre volte per modello, in cui completare 1.000 set di tre attività è costato una stima di 1,25 $ con Solar Mini 4 e 2,20 $ con MiMo-V2.5. Si tratta di un test eseguito dal fornitore su attività scelte dal fornitore, con la latenza esclusa, e punta nella direzione opposta rispetto al risultato di Artificial Analysis. Non è sbagliato — attività diverse mettono alla prova budget di token diversi — ma è una cifra di marketing, e lo sconto di lancio pubblicato per il modello è un motivo separato per rifare i propri calcoli invece di adottare quelli di chiunque altro.
Prezzi, secondo la documentazione live della console Upstage: 0,10 $ per milione di token di input, 0,01 $ per milione di token di input in cache, 0,40 $ per milione di token di output, con uno sconto di lancio attualmente pubblicizzato del 50% fino al 22 ottobre 2026 UTC, il che porta le tariffe effettive a 0,05 $ per l'input, 0,005 $ per l'input in cache e 0,20 $ per l'output fino a quella data.
Cosa significa se sei tu a pagare
La cosa interessante di Solar Mini 4 non è che sia un modello scarso. È che è un piccolo modello davvero valido, la cui economia è dominata da comportamenti che un listino prezzi non può mostrare. Un 24 sull'indice con tre parametri attivi è un vero risultato ingegneristico, e i carichi di lavoro in lingua coreana — il punto di forza dichiarato del modello, insieme all'inglese e al giapponese — sono esattamente il campo in cui è più probabile che quel risultato valga il suo prezzo.
La parte scomoda è tutto ciò che viene dopo la prima chiamata. Turni lunghi dell'assistente, scarso riutilizzo della cache e un'attività che richiede sette minuti di decodifica per ogni esecuzione dell'indice si sommano fino a un numero che non assomiglia per niente a $0.10/$0.40. Se lo stai valutando, l'esperimento onesto è un test del costo per attività completata sul tuo carico di lavoro, con la cache dei prompt abilitata nel modo in cui il tuo stack di produzione la userebbe realmente — non un confronto tra prezzi dei token.
Anche questa è la classe di problemi che un router esiste per risolvere, ed è il motivo per cui OrcaRouter riporta i prezzi di listino dei provider con 0% di markup, così una variazione di prezzo di un fornitore arriva sulla tua fattura lo stesso giorno. Non instradiamo i modelli Upstage, quindi né Solar Mini 4 né Solar Pro 4 sono disponibili tramite noi — provengono dall'API di Upstage stessa e da piattaforme di terze parti. Ciò che invece instradiamo è l'altra metà di questo confronto: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash e oltre 200 altri modelli dietro un'unica chiave, ed è questo che rende pratico tenere un modello economico e uno costoso sullo stesso compito e lasciare che il failover automatico e il routing per singola richiesta decidano quale risponde. Quando la differenza tra due modelli è un divario di costo per compito di cinque volte che nessun listino prezzi rivela, la possibilità di spostare una singola richiesta tra i due conta più di qualsiasi tabella di benchmark.

In breve: Solar Mini 4 è il nuovo punto di Pareto che Artificial Analysis traccia per i modelli sotto i tre miliardi di parametri attivi, ed è circa cinque volte più costoso per attività completata rispetto a un modello che ha lo stesso prezzo di listino per l'input. Entrambe queste affermazioni sono vere, e la seconda è quella che compare in fattura.
