Una card del titolo principale generata che recita "Solar Mini 4 vs MathForm 8B" con il sottotitolo "Uno risponde alla domanda, l'altro la rende verificabile" e due badge che recitano "Un generalista contro un autoformalizzatore" e "Compilazione Lean 4 nel ciclo".
Guides & Insights

Solar Mini 4 vs MathForm 8B: un modello risponde alla domanda, l'altro la rende verificabile

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti Solar Mini 4 accanto a MathForm 8B e stai confrontando due modelli che non competono per lo stesso token. Solar Mini 4 è lo sparse mixture-of-experts da 35 miliardi di parametri di Upstage, rilasciato il 22 settembre 2026 con circa 3 miliardi di parametri attivi per token, e risponde alle domande: legge un documento lungo, vi ragiona sopra, restituisce un risultato scritto. MathForm 8B è l'autoformalizzatore da 8 miliardi di parametri di OpenBMB, pubblicato il 14 agosto 2026 con licenza Apache 2.0, e fa qualcosa che nessun modello di ragionamento fa affatto: prende un'affermazione matematica in linguaggio naturale e la riscrive come un teorema Lean 4 che il compilatore di un assistente di dimostrazione verificherà a livello di tipi. Uno produce risposte. L'altro produce domande verificabili dalla macchina, e il secondo è la merce più rara.

Vale comunque la pena fare il confronto, perché entrambi finiscono nello stesso tipo di pipeline, e perché i due hanno punti di forza opposti in un modo che rende la scelta insolitamente netta. Il modello di Upstage è forte sui documenti lunghi, debole sul ragionamento complesso e costoso per ogni attività completata. Il modello di OpenBMB è ristretto al punto da essere inutile al di fuori della sua nicchia, non è mai stato valutato da un valutatore indipendente e non costa nulla da eseguire una volta che si ha una GPU.

Fianco a fianco, sulle cose che differiscono

• Di cosa si tratta — Solar Mini 4 è un modello di ragionamento generale con un contesto di 1M token (512K secondo la documentazione di Upstage stessa) e un punteggio misurato di 24,1 sull'Artificial Analysis Intelligence Index. MathForm 8B è un autoformalizzatore a singolo compito, senza punteggio pubblicato sull'indice, senza valutazioni indipendenti e senza dichiarazioni di capacità generali.

• Parametri — 35B totali / 3B attivi, sparsi, per Solar Mini 4; 8,19B densi per MathForm 8B, fine-tuned da Qwen3-8B sul corpus FormalVerse di OpenBMB con circa 367.000 esempi Lean 4 verificati.

• Licenza e distribuzione — Solar Mini 4 è proprietario, accessibile tramite l'API di Upstage e piattaforme di terze parti. MathForm 8B è costituito da pesi Apache-2.0 con un template di chat, quattro shard safetensors e un percorso di deployment Transformers, vLLM o SGLang dietro un endpoint compatibile con OpenAI.

• Prezzo — Solar Mini 4 a $0.10 / $0.01 in cache / $0.40 per milione di token, attualmente scontato del 50% fino al 22 ottobre 2026. MathForm 8B non ha un listino prezzi; il suo costo è la GPU che ci metti sotto.

• Velocità — 204 token di output al secondo per Solar Mini 4 sull'harness di Artificial Analysis, con 88.300 token di output per attività di indicizzazione e circa 430 secondi di lavoro per attività. L'output di MathForm 8B è una singola intestazione di teorema Lean 4, qualche centinaio di token al massimo.

• Indipendenza dei suoi numeri — Solar Mini 4 è stato testato da una terza parte. MathForm 8B no: ogni cifra riportata nel suo articolo è degli autori stessi, e il modello è troppo nuovo e troppo specializzato per aver attirato una verifica indipendente.

Dove i due modelli si incontrano, e dove non lo fanno

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

Le modalità di fallimento sono ciò che rende interessante questo abbinamento, perché sono esattamente opposte. Il risultato pubblicato più debole di Solar Mini 4 è Terminal-Bench 4.0 all'1%, con AutomationBench-AA al 22,3% — è scarso nel verificare il proprio lavoro in un ambiente che gli fornisce feedback. L'intera premessa progettuale di MathForm 8B è la verifica: OpenBMB distingue un Syntax Check, che chiede se l'enunciato Lean 4 compila, da un Consistency Check, che chiede se l'enunciato compilato significhi effettivamente la stessa cosa del problema informale. Il classico fallimento che esiste per prevenire è un enunciato che supera il controllo di tipo indebolendo silenziosamente l'asserzione.

Questa è una distinzione reale e vale la pena essere precisi. Un modello di ragionamento che produce una dimostrazione ha un noto problema di autoverifica: nulla nella generazione ti dice se la risposta è corretta. Un compilatore sì. Se il tuo flusso di lavoro è "convertire una banca di problemi in qualcosa che una macchina possa verificare", MathForm 8B sta facendo la metà del lavoro che Solar Mini 4 non è in grado di fare affatto, e quel che resta non è una questione di grado.

I numeri del fornitore, etichettati come tali: il paper di OpenBMB riporta un Pass@8 medio dell'88,06% con Syntax Check e del 72,37% con Consistency Check su sei benchmark, e sostiene che questi superino diversi autoformalizzatori specializzati da 32B. Niente di tutto ciò è stato riprodotto da terzi. Il calo di 16 punti tra i due controlli è il dato più informativo — misura quanto spesso un enunciato compilato non corrisponda esattamente al problema richiesto, ed è il motivo per cui Consistency Check esiste come colonna separata.

Perché un team eseguirebbe entrambi

Perché la pipeline naturale ha una fase economica ad alto volume e una fase costosa a basso volume. MathForm 8B gira sul tuo hardware e converte problemi informali in header Lean 4, con un compilatore disponibile a rifiutare output scadente prima che lo veda un umano. Solar Mini 4 gestisce ciò che accade attorno a questo: leggere il paper di supporto, estrarre le ipotesi, riassumere il risultato in coreano o inglese e instradare il lavoro. I due non competono mai per la stessa richiesta, e quello più piccolo è quello che possiede la parte del lavoro con un segnale oggettivo di superamento/fallimento.

Non possiamo instradarti nessuno dei due modelli — i modelli di Upstage non sono su OrcaRouter e nemmeno quelli di OpenBMB — quindi se vuoi Solar Mini 4 arriva dall'API di Upstage stessa, e se vuoi MathForm 8B arriva da Hugging Face e dalla tua GPU. Quello che possiamo fare è mettere il resto di quella pipeline dietro un'unica chiave: oltre 200 modelli con markup dello 0% rispetto al prezzo di listino del provider, failover automatico tra provider e un DSL di routing che ti consente di concatenare modelli in un'unica chiamata. In un flusso di lavoro in cui un piccolo specialista esegue la fase di formalizzazione e un grande generalista fa tutto il resto, poter cambiare il generalista modificando una stringa di modello — invece di rilasciare una nuova integrazione — è la differenza tra una modifica da due settimane e un pomeriggio.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Cosa portare via

Se la tua domanda è "quale di questi dovrei usare", la risposta onesta è che dipende dal fatto che tu abbia bisogno di una risposta o di una formalizzazione, e nessun benchmark lo risolverà. Se la tua domanda è "MathForm 8B vale il download", la risposta è sì per un unico compito ristretto e no per qualunque altra cosa — è un formalizzatore, non un dimostratore, e l'obbligo di dimostrazione resta aperto nell'output che produce. Se la tua domanda è "Solar Mini 4 vale $0.36 per compito", la risposta è sì per documenti lunghi in grandi quantità e no per qualsiasi cosa che richieda che verifichi il proprio lavoro.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Fonti, per concludere. Ogni dato di Solar Mini 4 riportato sopra è una misurazione indipendente di Artificial Analysis, tranne la finestra di contesto, che è un dato di Upstage e non concorda con il loro. Ogni dato di MathForm 8B è riportato dal fornitore da arXiv 2608.14221 e non riprodotto, e il suo rilascio non è stato annunciato — i pesi, il dataset FormalVerse e il paper sono tutti comparsi il 14 agosto 2026, senza alcun post sul blog del fornitore e senza alcuna esecuzione di benchmark indipendente fino ad oggi.