
Solar Pro 4 ottiene 42: il flagship Agent-First di Upstage, ora misurato in modo indipendente
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Upstage Solar Pro 4 è stata lanciata il 10 agosto 2026, e il primo numero degno di attenzione era il prezzo: $0.30 per milione di token in input e $1.20 per milione di token in output sull'API proprietaria di Upstage, con una promo di lancio che lo riduce a $0.03 e $0.12 — uno sconto del 90% — sui listini attuali. Quattro giorni dopo è arrivato il secondo numero degno di attenzione. Il 12 agosto 2026, Artificial Analysis ha pubblicato la prima valutazione indipendente di Solar Pro 4, assegnandole un punteggio di 42 sul suo Intelligence Index, contro 14 per Solar Pro 3 — un guadagno triplo rispetto al punteggio misurato del predecessore e un balzo di 27 punti secondo l'aritmetica del laboratorio — confermando il posizionamento di Solar Pro 4 da parte di Upstage come flagship proprietario, il modello che sostituisce Solar Pro 3 al vertice della gamma. In ogni caso, economico; ora, anche misurato in modo indipendente.
Cosa è stato effettivamente spedito
Solar Pro 4 è il flagship commerciale della svolta di Upstage verso l'era degli agenti. L'azienda ha trascorso il 2026 a ricostruire la linea Solar attorno a carichi di lavoro agentici — il suo fratello open-weight Solar Open 2 è uscito a fine luglio — e Solar Pro 4 è il prodotto ospitato a cui quella svolta puntava. Upstage lo inquadra in una frase: un modello per attività che richiedono contesto prolungato, esecuzione multi-step e completamento end-to-end piuttosto che risposte singole.
In concreto, la pagina del modello lo descrive come il modello di punta di Upstage specializzato per l'uso agentico, adatto a flussi di lavoro agentici, produttività d'ufficio, lavoro intensivo sui documenti e programmazione. Sulla carta è il contesto più ampio mai lanciato dalla linea — Solar Pro 3 offriva 128K — e l'unico Solar finora con una storia di ragionamento pubblicata e una superficie di chiamata degli strumenti pensata per agenti autonomi.
Specifiche come elencate al lancio:
• Finestra di contesto — 524.288 token (524K) nella scheda del vendor, circa quattro volte i 128K della generazione precedente; la misurazione indipendente di Artificial Analysis registra 384K, quindi considera la cifra più grande come un'affermazione di Upstage.
• Prezzo — tariffa ufficiale dell'API Upstage: $0,30 per 1M token di input / $1,20 per 1M token di output, con input in cache a $0,06; una promo di lancio la sconta del 90% a $0,03 / $0,12 sui listini attuali
• Capacità — ragionamento, chiamata di funzioni, modalità JSON, streaming e ricerca web, con supporto per input visivi
• Pesi — proprietari, non aperti; nessuna release su Hugging Face (a differenza del modello open Solar Open 2)
• Accesso — API della console Upstage e diverse piattaforme di terze parti; un'app di chat su solar-chat.upstage.ai per test pratici
Quei dati sono la dichiarazione del fornitore, non una scheda tecnica certificata da un audit — e la prima misurazione indipendente ora contraddice uno di essi. Artificial Analysis registra una finestra di contesto di 384K token e un output massimo di 256K per Solar Pro 4, contro i 524K e i 128K–131K dichiarati dal fornitore. L'elenco delle funzionalità e la cifra di contesto di Upstage stessa provengono dalla pagina del modello; i numeri di AA sono la lettura indipendente.


Cosa è cambiato rispetto a Solar Pro 3 — i primi numeri indipendenti
Le affermazioni di Upstage su Solar Pro 4 si concentrano su tre aree di miglioramento rispetto a Solar Pro 3, tutte rilevanti per gli agenti: ragionamento su documenti lunghi, uso di strumenti multi-turno e prestazioni nelle attività da terminale. Sono esattamente le dimensioni in cui un modello agente dimostra il proprio valore: mantenere un filo logico attraverso un documento lungo, sostenere una sequenza di chiamate a strumenti senza perdere il filo e portare a termine i compiti che vengono eseguiti all'interno di una shell.
Il primo run indipendente conferma la direzione di tutte queste affermazioni. Artificial Analysis ha valutato Solar Pro 4 con 42 punti nel suo Intelligence Index contro i 14 di Solar Pro 3, e i miglioramenti più netti si trovano esattamente dove Upstage aveva indicato:
• Terminal-Bench v2.1 (attività terminali): 12% → 57%
• AA-LCR (ragionamento a lungo contesto): 31% → 71%
• τ³-Banking (uso di strumenti multi-turno): 9% → 23%
• GDPval-AA v2 (lavoro agentico nel mondo reale): Elo 498 → 1.277, sopra la linea di base umana di 1.000 e leggermente avanti a Qwen3.7 Max (1.272) e MiMo-V2.5-Pro (1.266)
Il posizionamento nell'indice è la notizia principale: 42 si colloca accanto a Inkling (xhigh, 42) e subito dietro a MiMo-V2.5-Pro (43). Un modello con prezzo da fascia economica ora ottiene risultati da agente serio.
Il punteggio era accompagnato da due avvertenze. Il miglioramento AA-Omniscience (-53 → -1) è in gran parte dovuto all'astensione: Solar Pro 4 tenta solo il 41% delle domande contro il 92% di Solar Pro 3, il suo tasso di allucinazioni è sceso dall'88% al 24%, ma l'accuratezza è rimasta invariata al 19%. E il guadagno in intelligenza è costato in latenza: circa 8,6 minuti per attività Intelligence Index contro i 6,0 di Solar Pro 3, mentre l'uso di token è migliorato da circa 52k a 43k token di output per attività. È un modello più intelligente, più cauto e più lento.
Perché il prezzo conta più delle specifiche
Il punto a favore di Solar Pro 4 è il suo rapporto prezzo-intelligenza misurata. Anche al prezzo di listino ufficiale, un modello con contesto da 384K a 524K a $0.30 per milione di token di input sottocosta essenzialmente l'intero campo — circa un sedicesimo del prezzo di input di un'ammiraglia di frontiera — e la promozione con sconto del 90% porta quel prezzo a un sedicesimo di un sedicesimo. Questo si colloca in una fascia in cui il mercato oggi vende modelli piccoli e veloci, non modelli capaci di agire come agenti con un punteggio di fascia media verificato.

Il caso scettico non è più che Solar Pro 4 sia non provato — il run AA lo stabilisce — ma che sia reale. Il guadagno in onniscienza è in parte un pattern di rifiuto, non solo conoscenza. La latenza misurata è un passo indietro rispetto a Solar Pro 3. Il contesto di 384K di Artificial Analysis è al di sotto del dato di punta di 524K dichiarato dal fornitore. E il badge "90% di sconto" significa che il prezzo futuro potrebbe cambiare una volta terminato il periodo promozionale — la tariffa durevole è la lista di $0,30 / $1,20, non l'etichetta da $0,03 / $0,12.
Chi dovrebbe provarlo, chi dovrebbe aspettare
Provalo ora se: stai prototipando un agente e il costo dominante è rappresentato dai token, ti serve una finestra di contesto lunga e il tuo carico di lavoro tollera un ragionamento più lento, oppure stai valutando carichi di lavoro di documenti in lingua coreana e dell'Asia orientale, dove Upstage ha sempre ottenuto buoni risultati.
Aspetta, se: il tuo carico di lavoro è critico per la produzione e non può assorbire una regressione mentre il settore calibra le aspettative, hai bisogno di open weights per self-hosting o fine-tuning — Solar Pro 4 non è quel modello; Solar Open 2 lo è — oppure stai comprando in base al numero di contesto 524K, che la prima misurazione indipendente non riproduce.
Esiste una via di mezzo che vale la pena di nominare: mettere Solar Pro 4 dietro un livello di failover piuttosto che scommettere su di esso un intero pipeline. Un gateway di routing che possa ripiegare su un secondo modello in caso di timeout o errore consente di cogliere il vantaggio di un nuovo modello economico senza il rischio del singolo punto di guasto — il pattern per cui esiste il failover automatico di OrcaRouter, e poiché OrcaRouter trasmette i prezzi di listino dei provider senza alcun ricarico, qualunque cosa Upstage faccia pagare è ciò che paghi, senza margine di rivenditore aggiunto.
Cosa guardare dopo
Il capitolo "nessun numero indipendente ancora" di questo modello è chiuso: ci sono voluti quattro giorni. Ciò che conta ora è ciò che implica la prima misurazione. Il prezzo post-promo: il badge del 90% è un'offerta di apertura, non un impegno, e la tariffa di listino dietro di esso è $0,30/$1,20. Se Upstage risponderà alla latenza misurata e alla discrepanza di contesto tra 384K e 524K, entrambe le scoperte più utilizzabili della run AA. E i veri carichi di lavoro degli agenti: il miglior test per un modello con chiamate di strumenti sono i lavori a lunga esecuzione nel mondo reale, non una classifica. Al 13 agosto 2026, il riepilogo accurato di Solar Pro 4 è più circoscritto e più solido di una settimana fa: un'ammiraglia a forma di agente molto economica da un laboratorio serio, confermata come il successore di Solar Pro 3 da parte di Upstage, con un punteggio indipendente di 42 su cui discutere.
