
Solar Mini 4 vs Granite 4.2 3B: un modello che chiami e un checkpoint che scarichi
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1M di token
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1M di token · 159 tok/s
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 220 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti Solar Mini 4 accanto a Granite 4.2 3B e il numero interessante non è il divario nei benchmark. È che Granite 4.2 3B, il modello di ragionamento Apache-2.0 di IBM rilasciato il 25 agosto 2026, stasera girerà gratis su un laptop, mentre Solar Mini 4, il modello proprietario di Upstage rilasciato il 22 settembre 2026, non girerà su nessun dispositivo che possiedi e addebita $0,10 per milione di token di input e $0,40 per milione di token di output per rispondere a una domanda. Entrambi attivano all'incirca tre miliardi di parametri di calcolo per token. Uno è un file. L'altro è un tassametro.
Questa differenza decide quasi tutto il resto di questo confronto, inclusi quali benchmark valga persino la pena mettere a confronto diretto. Granite 4.2 3B ha ricevuto una valutazione indipendente molto prima che lo facesse Solar Mini 4 — Artificial Analysis gli assegna 9 sull'Intelligence Index v4.3.2, dalla stessa suite di valutazione e dalla stessa organizzazione che assegna a Solar Mini 4 un 24. Il che significa che il divario di quindici punti qui è insolitamente ben fondato: un solo laboratorio, una sola metodologia e due modelli che nessuno ha dovuto accettare sulla fiducia.
La specifica, sulle dimensioni che effettivamente li separano
• Architettura — Solar Mini 4 è un mixture-of-experts sparso: 35B parametri totali, 3B attivi per token, secondo Upstage. Granite 4.2 3B è denso, circa 3B parametri con all'incirca 4B totali incluse le embedding secondo i metadati safetensors. Stesso budget di attivazione, due modi diversi di spenderlo.
• Pesi — Solar Mini 4 è proprietario e chiuso. Granite 4.2 3B è distribuito con licenza Apache 2.0, con una ricetta di addestramento documentata fin nei dettagli delle proporzioni dei dati.
• Contesto — Upstage documenta 512K token con output fino a 128K; Artificial Analysis indica 1,0M per lo stesso modello, quindi considera il limite massimo come non definito. Granite 4.2 3B funziona nativamente con 131.072 token, estesi a 512K mediante una quinta fase di pre-addestramento.
• Prezzo — Solar Mini 4 a $0,10 / $0,01 in cache / $0,40 per milione di token, attualmente scontato del 50% fino al 22 ottobre 2026. Granite 4.2 3B non ha un listino prezzi del fornitore perché non c'è nulla da noleggiare; gli endpoint ospitati monitorati da Artificial Analysis lo prezzano intorno a $0,03 / $0,12, e l'hosting in autonomia costa l'elettricità.
• Indice di Intelligenza — 24 per Solar Mini 4, 9 per Granite 4.2 3B, entrambi da Artificial Analysis v4.3.2.
• Velocità — 204 token di output al secondo per Solar Mini 4 e 223 per Granite 4.2 3B, entrambi misurati dallo stesso laboratorio, con tempo al primo chunk di 1,5 s e 0,5 s rispettivamente. Il modello dense è il più veloce su entrambi i fronti.
Di cosa è fatto davvero il divario di quindici punti

Le valutazioni individuali raccontano una storia meno lusinghiera rispetto al titolo per Granite 4.2 3B, e una più complicata per Solar Mini 4. Su AA-LCR v1.1, il benchmark di ragionamento su contesto lungo, Solar Mini 4 ottiene 83% e Granite 4.2 3B ottiene 24%. Quella singola valutazione incide per una quota enorme della differenza nell'indice, e non è un accidente di scala — è ciò che si ottiene con 512K a 1M token di contesto e con l'addestramento per usarlo. La finestra di Granite 4.2 3B arriva nativamente fino a 131K; la fase estesa a 512K esiste, ma il modello non è stato messo a punto per ragionare su tutta la sua estensione come lo è stato Solar Mini 4.
Sulla conoscenza generale il divario si restringe e poi si inverte nel carattere. Granite 4.2 3B ottiene il 55,9% su GPQA, mentre Solar Mini 4 non ha alcun dato GPQA; su Humanity's Last Exam i due sono rispettivamente al 6,6% e al 25,8%, che è il confronto più diretto e quello che la differenza di dimensioni lascia prevedere. Ciò che Granite 4.2 3B non fa, secondo Artificial Analysis, è inventare: il suo tasso di non-allucinazione AA-Omniscience è del 73,7%, superiore al 64,2% di Solar Mini 4. Il modello più piccolo ha meno probabilità di inventare una risposta che non possiede.
Il coding agentico è il punto in cui entrambi i modelli cadono, ed è qui che leggere i numeri conta. Solar Mini 4 ottiene l'1% su Terminal-Bench 4.0 e il 22,3% su AutomationBench-AA. Granite 4.2 3B ottiene lo 0% su Terminal-Bench 4.0, il 13,9% sul più vecchio Terminal-Bench 2.1 e il 5,6% su τ³-Banking. Nessuno dei due modelli è lo strumento giusto per il lavoro autonomo da terminale. I membri da 8B e 30B della famiglia Granite 4.2 hanno ricevuto il reinforcement learning agentico di IBM e portano con sé risultati su SWE-Bench e Terminal-Bench; il 3B ha esplicitamente saltato quel blocco di addestramento, e il modello di Upstage è pensato per il retrieval, la strutturazione e l'applicazione di policy, non per guidare una shell.
Dove Granite 4.2 3B è ancora la risposta corretta
Sette gigabyte e un terzo di pesi in bfloat16, meno di quattro gigabyte con una quantizzazione pratica, e una licenza Apache 2.0 che ti permette di eseguire il fine-tuning del modello sui tuoi dati e distribuire il risultato senza chiedere a nessuno. Uno studente con una sola GPU consumer, un ospedale che non può inviare testi dei pazienti a terzi, un prodotto che deve funzionare su un aeromobile o nel seminterrato di una fabbrica, un team che vuole possedere un modello invece di affittare un endpoint — ognuno di questi casi sceglie Granite 4.2 3B e non si volta più indietro. Il motore viene eseguito tramite vLLM, SGLang, Transformers e GGUF, e Ollama elenca una build granite4.2:3b.
I suoi numeri riportati dal fornitore meritano la solita cautela. La scheda di IBM dichiara 78,33 su AIME 2025, 66,67 su HMMT February 2025 e 69,71 su LiveCodeBench v6 — tutti non riprodotti da terze parti, e per un modello denso da 3B il valore di AIME si colloca ben al di sopra dell'intervallo storico. L'indice 9 di Artificial Analysis registra il modello come realmente utile e ben lontano dalla frontiera, che è il segnale più affidabile proprio perché IBM non l'ha pubblicato.
Dove Solar Mini 4 è la risposta corretta
Qualsiasi cosa in cui il lavoro consista in un lungo documento, un'estrazione strutturata ripetuta o una policy che debba essere applicata in modo coerente su larga scala — e in cui novanta secondi di latenza siano accettabili. Il profilo di Solar Mini 4 è quello di uno specialista: 83% sul ragionamento a contesto lungo, 48% sul coding scientifico, 64% di non-allucinazione, e una tendenza documentata ad astenersi piuttosto che tirare a indovinare. Parla inoltre coreano come lingua di prima classe accanto a inglese e giapponese, il che, per un deployment sul mercato coreano, non è una nota a piè di pagina.
Ciò che gli acquirenti non dovrebbero fare è confrontare i due prezzi per token e concludere che Solar Mini 4 sia tre volte più costoso. Artificial Analysis ha misurato Solar Mini 4 a 0,36 $ per attività completata dell'Intelligence Index — e, sulla stessa suite, Granite 4.2 3B a 0,006 $. Si tratta di un fattore sessanta, determinato dalle stesse cose che fanno lievitare Solar Mini 4 rispetto a GPT-6 Luna (max): 88.300 token di output per attività contro i 18.600 di Granite, e una struttura di costi in cui le scritture nella prompt cache rappresentano 0,30 $ dei 0,36 $ di Solar Mini 4 contro 0,0006 $ dei 0,006 $ di Granite. Un prezzo di output basso su un modello verboso non è un'attività economica.

Nessuno dei due modelli è su OrcaRouter — non instradiamo né Granite né Upstage — quindi se vuoi Granite 4.2 3B arriva da Hugging Face, e se vuoi Solar Mini 4 arriva dall'API di Upstage e da piattaforme di terze parti. Ma lo schema a due modelli che questo confronto suggerisce è quello per cui i router sono progettati, ed è il motivo per cui OrcaRouter mette più di 200 modelli dietro un'unica chiave con 0% di markup rispetto al prezzo di listino del provider: esegui il lavoro su documenti lunghi e in lingua coreana con qualunque modello che valga davvero il suo costo, mantieni i passaggi deterministici di estrazione su qualcosa che ospiti tu, e lascia che routing e failover spostino una richiesta tra i due per chiamata anziché per contratto.

Una nota finale sui numeri sopra. Ogni dato di Solar Mini 4 che proviene da Artificial Analysis è una misurazione indipendente; ogni dato di Granite 4.2 3B proveniente dalla model card di IBM è un'affermazione del fornitore che nessuna terza parte ha riprodotto. I punteggi dell'indice Artificial Analysis di 24 e 9 sono gli unici due numeri qui che sono stati prodotti dallo stesso laboratorio nelle stesse condizioni — e sono i due su cui basare una decisione.
