
Solar Mini 4 vs MathForm 8B: un modello risponde alla domanda, l'altro la rende verificabile
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1M di token
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1M di token · 159 tok/s
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 220 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Metti Solar Mini 4 accanto a MathForm 8B e stai confrontando due modelli che non competono per lo stesso token. Solar Mini 4 è lo sparse mixture-of-experts da 35 miliardi di parametri di Upstage, rilasciato il 22 settembre 2026 con circa 3 miliardi di parametri attivi per token, e risponde alle domande: legge un documento lungo, vi ragiona sopra, restituisce un risultato scritto. MathForm 8B è l'autoformalizzatore da 8 miliardi di parametri di OpenBMB, pubblicato il 14 agosto 2026 con licenza Apache 2.0, e fa qualcosa che nessun modello di ragionamento fa affatto: prende un'affermazione matematica in linguaggio naturale e la riscrive come un teorema Lean 4 che il compilatore di un assistente di dimostrazione verificherà a livello di tipi. Uno produce risposte. L'altro produce domande verificabili dalla macchina, e il secondo è la merce più rara.
Vale comunque la pena fare il confronto, perché entrambi finiscono nello stesso tipo di pipeline, e perché i due hanno punti di forza opposti in un modo che rende la scelta insolitamente netta. Il modello di Upstage è forte sui documenti lunghi, debole sul ragionamento complesso e costoso per ogni attività completata. Il modello di OpenBMB è ristretto al punto da essere inutile al di fuori della sua nicchia, non è mai stato valutato da un valutatore indipendente e non costa nulla da eseguire una volta che si ha una GPU.
Fianco a fianco, sulle cose che differiscono
• Di cosa si tratta — Solar Mini 4 è un modello di ragionamento generale con un contesto di 1M token (512K secondo la documentazione di Upstage stessa) e un punteggio misurato di 24,1 sull'Artificial Analysis Intelligence Index. MathForm 8B è un autoformalizzatore a singolo compito, senza punteggio pubblicato sull'indice, senza valutazioni indipendenti e senza dichiarazioni di capacità generali.
• Parametri — 35B totali / 3B attivi, sparsi, per Solar Mini 4; 8,19B densi per MathForm 8B, fine-tuned da Qwen3-8B sul corpus FormalVerse di OpenBMB con circa 367.000 esempi Lean 4 verificati.
• Licenza e distribuzione — Solar Mini 4 è proprietario, accessibile tramite l'API di Upstage e piattaforme di terze parti. MathForm 8B è costituito da pesi Apache-2.0 con un template di chat, quattro shard safetensors e un percorso di deployment Transformers, vLLM o SGLang dietro un endpoint compatibile con OpenAI.
• Prezzo — Solar Mini 4 a $0.10 / $0.01 in cache / $0.40 per milione di token, attualmente scontato del 50% fino al 22 ottobre 2026. MathForm 8B non ha un listino prezzi; il suo costo è la GPU che ci metti sotto.
• Velocità — 204 token di output al secondo per Solar Mini 4 sull'harness di Artificial Analysis, con 88.300 token di output per attività di indicizzazione e circa 430 secondi di lavoro per attività. L'output di MathForm 8B è una singola intestazione di teorema Lean 4, qualche centinaio di token al massimo.
• Indipendenza dei suoi numeri — Solar Mini 4 è stato testato da una terza parte. MathForm 8B no: ogni cifra riportata nel suo articolo è degli autori stessi, e il modello è troppo nuovo e troppo specializzato per aver attirato una verifica indipendente.
Dove i due modelli si incontrano, e dove non lo fanno

Le modalità di fallimento sono ciò che rende interessante questo abbinamento, perché sono esattamente opposte. Il risultato pubblicato più debole di Solar Mini 4 è Terminal-Bench 4.0 all'1%, con AutomationBench-AA al 22,3% — è scarso nel verificare il proprio lavoro in un ambiente che gli fornisce feedback. L'intera premessa progettuale di MathForm 8B è la verifica: OpenBMB distingue un Syntax Check, che chiede se l'enunciato Lean 4 compila, da un Consistency Check, che chiede se l'enunciato compilato significhi effettivamente la stessa cosa del problema informale. Il classico fallimento che esiste per prevenire è un enunciato che supera il controllo di tipo indebolendo silenziosamente l'asserzione.
Questa è una distinzione reale e vale la pena essere precisi. Un modello di ragionamento che produce una dimostrazione ha un noto problema di autoverifica: nulla nella generazione ti dice se la risposta è corretta. Un compilatore sì. Se il tuo flusso di lavoro è "convertire una banca di problemi in qualcosa che una macchina possa verificare", MathForm 8B sta facendo la metà del lavoro che Solar Mini 4 non è in grado di fare affatto, e quel che resta non è una questione di grado.
I numeri del fornitore, etichettati come tali: il paper di OpenBMB riporta un Pass@8 medio dell'88,06% con Syntax Check e del 72,37% con Consistency Check su sei benchmark, e sostiene che questi superino diversi autoformalizzatori specializzati da 32B. Niente di tutto ciò è stato riprodotto da terzi. Il calo di 16 punti tra i due controlli è il dato più informativo — misura quanto spesso un enunciato compilato non corrisponda esattamente al problema richiesto, ed è il motivo per cui Consistency Check esiste come colonna separata.
Perché un team eseguirebbe entrambi
Perché la pipeline naturale ha una fase economica ad alto volume e una fase costosa a basso volume. MathForm 8B gira sul tuo hardware e converte problemi informali in header Lean 4, con un compilatore disponibile a rifiutare output scadente prima che lo veda un umano. Solar Mini 4 gestisce ciò che accade attorno a questo: leggere il paper di supporto, estrarre le ipotesi, riassumere il risultato in coreano o inglese e instradare il lavoro. I due non competono mai per la stessa richiesta, e quello più piccolo è quello che possiede la parte del lavoro con un segnale oggettivo di superamento/fallimento.
Non possiamo instradarti nessuno dei due modelli — i modelli di Upstage non sono su OrcaRouter e nemmeno quelli di OpenBMB — quindi se vuoi Solar Mini 4 arriva dall'API di Upstage stessa, e se vuoi MathForm 8B arriva da Hugging Face e dalla tua GPU. Quello che possiamo fare è mettere il resto di quella pipeline dietro un'unica chiave: oltre 200 modelli con markup dello 0% rispetto al prezzo di listino del provider, failover automatico tra provider e un DSL di routing che ti consente di concatenare modelli in un'unica chiamata. In un flusso di lavoro in cui un piccolo specialista esegue la fase di formalizzazione e un grande generalista fa tutto il resto, poter cambiare il generalista modificando una stringa di modello — invece di rilasciare una nuova integrazione — è la differenza tra una modifica da due settimane e un pomeriggio.

Cosa portare via
Se la tua domanda è "quale di questi dovrei usare", la risposta onesta è che dipende dal fatto che tu abbia bisogno di una risposta o di una formalizzazione, e nessun benchmark lo risolverà. Se la tua domanda è "MathForm 8B vale il download", la risposta è sì per un unico compito ristretto e no per qualunque altra cosa — è un formalizzatore, non un dimostratore, e l'obbligo di dimostrazione resta aperto nell'output che produce. Se la tua domanda è "Solar Mini 4 vale $0.36 per compito", la risposta è sì per documenti lunghi in grandi quantità e no per qualsiasi cosa che richieda che verifichi il proprio lavoro.

Fonti, per concludere. Ogni dato di Solar Mini 4 riportato sopra è una misurazione indipendente di Artificial Analysis, tranne la finestra di contesto, che è un dato di Upstage e non concorda con il loro. Ogni dato di MathForm 8B è riportato dal fornitore da arXiv 2608.14221 e non riprodotto, e il suo rilascio non è stato annunciato — i pesi, il dataset FormalVerse e il paper sono tutti comparsi il 14 agosto 2026, senza alcun post sul blog del fornitore e senza alcuna esecuzione di benchmark indipendente fino ad oggi.
