Una card con titolo principale 'Intern-Decision-0.8B vs MathForm 8B' e sottotitolo 'Uno di questi può verificare il proprio lavoro', con i badge 'output Lean 4 verificato dal compilatore' e 'solo confidenza autodichiarata', con il logo OrcaRouter sovrapposto nell'angolo.
Guides & Insights

Intern-Decision-0.8B vs MathForm 8B: uno di questi può verificare il proprio lavoro

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La domanda più utile che si possa porre su qualsiasi piccolo modello specialistico è chi lo verifica. Intern-Decision-0.8B e MathForm 8B esistono entrambi perché un modello generale è stato sottoposto a fine-tuning per diventare uno ristretto, entrambi sono derivati Apache-2.0 dei pesi Qwe​n, ed entrambi sono stati pubblicati su Hugging Face senza una campagna di marketing — ma si trovano su lati opposti di una linea che determina come li distribuiresti. MathForm 8B è il modello di autoformalizzazione da 8B di OpenBMB, rilasciato il 14 agosto 2026, che traduce la matematica in linguaggio naturale in Lean 4 e consegna il risultato a un compilatore, che lo accetta o no. Intern-Decision-0.8B è la testa decisionale da 852.985.920 parametri di InternLM, caricata il 26 settembre 2026, che restituisce una distribuzione di probabilità calibrata sulle opzioni che hai fornito in anticipo — e nulla al mondo verifica in modo indipendente se l'etichetta che restituisce sia corretta. Uno di questi modelli produce un output con una prova. L'altro produce un output con un punteggio di confidenza, e la differenza in ciò che puoi fare con queste due cose è l'intero articolo.

Quell'inquadramento spiega anche perché il divario dimensionale — 8B contro 0.8B, un fattore dieci — sia il numero meno interessante del confronto. Nessuno dei due modelli cerca di essere bravo in ciò che fa l'altro, e la valutazione di nessuno dei due ti dice nulla sull'altro. Ciò che hanno in comune è una modalità di rilascio e una discendenza Qwen, ed entrambe le cose contano meno della questione della verifica.

Cosa sia in realtà ognuno

MathForm 8B è l'artefatto distribuito di una ricetta in due fasi descritta nel paper MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement (arXiv 2608.14221). Un pianificatore di retrieval estrae definizioni pertinenti e formalizzazioni esistenti da Mathlib prima dell'esecuzione del generatore; gli enunciati generati vengono poi revisionati utilizzando la diagnostica del compilatore e il feedback di coerenza semantica; il corpus risultante, FormalVerse, contiene circa 367.000 esempi Lean 4 verificati; e MathForm 8B viene addestrato su di esso tramite fine-tuning supervisionato seguito da apprendimento per rinforzo che utilizza la compilazione Lean e i segnali di coerenza semantica come ricompensa. È un modello solo testo basato su Qwen3-8B, servito tramite Transformers, vLLM o SGLang con un'API compatibile con OpenAI, con una lunghezza di contesto consigliata di 16.384 token e un budget massimo di generazione di 16.384 token. La sua pipeline di valutazione, i file di benchmark e gli script Pass@k sono tutti nel repository GitHub di OpenBMB, e il dataset di addestramento è pubblico.

Intern-Decision-0.8B è l'artefatto distribuito di una ricetta che nessuno ha descritto. La scheda del modello dice che è "un modello multimodale strutturato per le decisioni, fine-tuned da Qwen3.5-0.8B" e si ferma lì — nessuna descrizione dei dati, nessuna procedura di addestramento, nessun paper, nessun repository. Ciò che documenta in modo approfondito è il contratto di inferenza. Il motore incluso mappa le opzioni di ogni domanda su simboli a token singolo, genera uno scheletro con un <decision> segnaposto per campo, esegue un singolo forward pass causale, legge i logit nella posizione prima di ciascun segnaposto, applica la softmax solo sui simboli consentiti per quel campo, applica una calibrazione adattata e rimappa i simboli ai valori delle tue opzioni. Non c'è generate() da invocare e nessun campionamento in nessun punto del percorso. Accetta testo più fino a otto immagini, gestisce da una a sedici domande con fino a 62 opzioni ciascuna e rifiuta gli input oltre 8.192 token invece di troncarli. La temperatura di calibrazione predefinita è 2,747760550703, adattata per checkpoint mediante minimizzazione della NLL su 1.728 casi.

Leggi quei due paragrafi affiancati e l'asimmetria è netta. MathForm 8B include un articolo, un dataset, una pipeline di valutazione e un repository. Intern-Decision-0.8B include una descrizione dell'API e una tabella di benchmark.

L'asimmetria di verifica, che è la vera storia

L'output di MathForm 8B è verificabile da qualcosa di diverso da un essere umano. Emette Lean 4, e Lean 4 o compila o non compila. I numeri di OpenBMB sono riportati sotto due regimi proprio per questo motivo: Pass@8 dell'88,06% sotto Syntax Check, il che significa che l'output compila, e 72,37% sotto Consistency Check, il che significa che compilae un controllo di coerenza semantica concorda che l'affermazione formale significhi ciò che diceva quella informale. Entrambe le cifre sono medie su sei benchmark, e il paper riporta anche tassi di superamento CC del 63% su FATE-H e del 37% sui sottoinsiemi FATE-X più difficili, con l'affermazione che questo supera gli autoformalizzatori specializzati da 32B. Questi sono riportati dal fornitore — li ha eseguiti OpenBMB — ma la proprietà che conta è strutturale, non statistica: un sistema a valle che consuma l'output di MathForm 8B può rifiutare una cattiva formalizzazione senza chiedere a un modello di giudicarla. Il compilatore è l'oracolo.

Intern-Decision-0.8B ha un contratto di tipo e nessun oracolo. La forma dell'output è garantita — un campo dichiarato choice restituisce una distribuzione sui valori di opzione che hai elencato, un score restituisce un valore atteso ponderato per probabilità sulla tua rubrica, un noul restituisce una probabilità di sì. Niente al di fuori del modello può dirti se l'argmax era corretto. Il valore di confidenza è la stima che il modello dà della propria correttezza, e il lavoro di calibrazione della card è un tentativo onesto di rendere significativa quella stima — una temperatura adattata che preserva l'argmax affinando o ammorbidendo le probabilità, validata su casi tenuti fuori — ma una risposta sbagliata ben calibrata resta una risposta sbagliata. Se la tua pipeline ha bisogno di sapere se un'etichetta è giusta, ti servono dati etichettati e devi misurarlo tu stesso.

Non è un difetto esclusivo di Intern-Decision-0.8B. È la condizione di ogni classificatore, ed è il problema irrisolto dell'intera categoria di modelli decisionali che comprende Jev di TypeSafe e Laya di Convai. Vale la pena affermarlo chiaramente, perché una tabella di benchmark con una colonna del punteggio di Brier può dare l'impressione che la calibrazione sia verifica. Non lo è. La calibrazione ti dice che quando questo modello dice 80%, ha ragione l'80% delle volte sull'intera distribuzione valutata — il che è realmente utile per impostare soglie e calcolare il valore atteso, e non è una garanzia di correttezza per singolo elemento.

Il tabellone, sulle righe che entrambi i modelli hanno

• Parametri — Intern-Decision-0.8B: 852.985.920 su uno shard linguistico da 1,50 GB, uno shard di visione da 176 MB e un proiettore da 25 MB. MathForm 8B: 8B denso, basato su Qwen3-8B.

• Modello base — Intern-Decision-0.8B: Qwen3.5-0.8B, rilasciato a febbraio 2026. MathForm 8B: Qwen3-8B.

• Compito — Intern-Decision-0.8B: decisioni tipizzate su uno schema che scrivi tu — scelta, punteggio, binaria. MathForm 8B: matematica in linguaggio naturale verso la formalizzazione in Lean 4.

• Output — Intern-Decision-0.8B: distribuzione calibrata più argmax per campo, nessun testo generato. MathForm 8B: sorgente Lean 4 generato, tipicamente lungo.

• Verifica — Intern-Decision-0.8B: nessuna esterna; la confidenza è autodichiarata. MathForm 8B: il compilatore Lean 4, più un controllo di coerenza semantica.

• Prove pubblicate — Intern-Decision-0.8B: una tabella di benchmark di un fornitore su sette benchmark, non riprodotta, senza paper. MathForm 8B: un paper, un dataset pubblico di circa 367.000 esempi, una pipeline di valutazione e un repository, eseguiti dal fornitore.

• Licenza — Entrambe Apache 2.0, e Intern-Decision-0.8B include inoltre il file di licenza Qwen preservato per i suoi pesi upstream.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Costo e latenza non sono comparabili, e non è una scusa

InternLM ha misurato Intern-Decision-0.8B a 33,98 ms di media e 37,50 ms p95 per query su una singola RTX 4090 attraverso il percorso locale di Hugging Face, con la sua versione 2B che registra 33,28 ms di media. La scheda di MathForm 8B raccomanda fino a 16.384 nuovi token per formalizzazione a temperatura 0,6 e top_p 0,95. Queste due misurazioni non sono la stessa quantità. Una è un singolo passaggio in avanti su un prompt; l'altra è una generazione autoregressiva che può durare migliaia di token. Moltiplicare un budget di formalizzazione rispetto a una decisione da 34 ms non ti dice nulla sull'efficienza relativa, perché i modelli non stanno facendo la stessa quantità di lavoro — uno legge e assegna un punteggio, l'altro legge e scrive uno script di dimostrazione. Se il throughput è il tuo vincolo, i fatti rilevanti sono più semplici di un rapporto. MathForm 8B formalizza un'affermazione per generazione, e a 16K token per output su un modello denso da 8B, questo è un carico di lavoro che satura la GPU e un candidato per il batching tramite vLLM o SGLang, entrambi documentati da OpenBMB. Intern-Decision-0.8B risponde a sedici domande che coprono un intero record in un solo passaggio, quindi l'unità di lavoro è un record anziché un campo, e il budget del record è il limite massimo di input di 8.192 token — che arriva più velocemente di quanto un lettore possa aspettarsi quando stai inserendo uno stato lungo, uno schema ricco e fino a otto immagini.

Dove ognuno è lo strumento giusto

MathForm 8B appartiene a una pipeline il cui collo di bottiglia è la revisione umana della matematica. L'autoformalizzazione esiste perché scrivere in Lean è più lento che leggerlo, e perché un enunciato verificabile dalla macchina è qualcosa che un assistente di dimostrazione può poi attaccare. La proprietà che lo rende affidabile — output verificato dal compilatore — è anche la proprietà che lo rende ristretto: formalizza, non dimostra, e la scheda è esplicita che i controlli di compilazione richiedono un Kimina Lean Server in esecuzione e che gli esperimenti hanno usato Lean 4.21.0. Chiunque lo adotti adotta quello stack. Come con qualsiasi modello open-weights di pochi giorni o di poche settimane, puntare un percorso di test verso di esso e ripiegare su un modello collaudato quando si blocca è il modo a basso rischio di valutarlo, ed è esattamente ciò a cui serve un gateway con failover automatico lungo una catena di fallback — tentativi che arrivano prima che la risposta inizi, così una formalizzazione bloccata non raggiunge mai il chiamante.

Intern-Decision-0.8B appartiene a qualsiasi contesto in cui esiste già un insieme chiuso di risposte e il costo di generare testo per recuperarlo è puro spreco. Triage, routing, valutazione con rubriche, giudicare un record rispetto a una policy scritta — i casi in cui un modello generativo viene usato come un modo costoso per scegliere da un elenco. I suoi vantaggi sono che è deterministico, che restituisce una probabilità utilizzabile anziché una stringa da analizzare, e che a 1,73 GB su disco funziona comodamente al di sotto del costo di memoria di un browser per laptop. I suoi svantaggi sono che la documentazione si ferma alla superficie API, che nessuno al di fuori di InternLM ha pubblicato un risultato per esso, e che l'unica colonna di benchmark che suggerisce un problema di sicurezza — un punteggio WildJailBreak di 64,48 contro il 96,29 di Jev — è inspiegata. Non metterlo di fronte a input avversariali senza aver eseguito tu stesso quel test.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Entrambi i modelli condividono una discendenza degna di nota, perché cambia ciò che "open" ti garantisce. Ciascuno è un fine-tuning di un checkpoint Qwen e ciascuno preserva correttamente la licenza upstream: MathForm 8B con licenza Apache 2.0, con la provenienza Qwen3-8B dichiarata nella card, Intern-Decision-0.8B con licenza Apache 2.0, con un fileLICENSE-QWEN separato nel repository. Nessuno dei due prevede una soglia di ricavi né una restrizione sul campo di utilizzo — a differenza della LFM Open License v1.0 di Liquid AI, che subordina i diritti commerciali al fatto che la tua entità resti sotto la soglia di 10 milioni di dollari di ricavi annuali. Se stai costruendo in ambito commerciale, questa è una distinzione che separa questi due rilasci da parti dell'ecosistema dei piccoli modelli, e si applica a entrambi allo stesso modo.

Se vuoi il livello decisionale senza il checkpoint non documentato

Il divario tra "una testa decisionale è la forma giusta per questo problema" e "questa particolare testa decisionale è una che puoi difendere davanti a un revisore" è ciò che colma un'alternativa ospitata. Jev 1.13 di TypeSafe è il modello rispetto al quale InternLM ha messo alla prova la sua famiglia su Jevbench, su Typed Decision e su ToolACE, ed è oggi richiamabile tramite un singolo endpoint compatibile con OpenAI a $0,042 per milione di token di input, con l'output fatturato a zero — la tariffa pubblicata dal fornitore, trasferita senza alcun ricarico anziché maggiorata lungo il percorso. Per un lettore che vuole misurare se una testa decisionale aiuti affatto prima di impegnarsi su un checkpoint da 0,8B con un repository mancante, questo è il primo esperimento economico, e le valutazioni di terze parti di Jev stesso gli conferiscono un track record documentato che Intern-Decision-0.8B non ha ancora.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

La risposta breve

Questi due non sono alternative. MathForm 8B è uno specialista il cui output può essere verificato da un programma, pensato per un compito in cui la verifica è la parte difficile, e viene fornito con paper, dataset e sistema di valutazione per dimostrare l'affermazione. Intern-Decision-0.8B è uno specialista il cui output solo tu puoi verificare, pensato per compiti in cui le risposte erano già scritte e la parte difficile era arrivarci rapidamente e a basso costo, e viene fornito con un modulo di inferenza e una tabella. Se hai bisogno di una formalizzazione, c'è solo uno di questi da considerare. Se hai bisogno di un'etichetta e sei pronto a costruire la ground truth con cui verificarla, il 0.8B è il download più interessante — veloce, deterministico, Apache 2.0, e abbastanza piccolo che il costo per scoprire se vale qualcosa è un pomeriggio anziché una voce di budget.