Een hero-titelkaart met de tekst 'Intern-Decision-0.8B vs MathForm 8B', met het onderschrift 'Een van deze kan zijn eigen werk controleren', met de badges 'compiler-geverifieerde Lean 4-uitvoer' en 'alleen zelfgerapporteerd vertrouwen', met het OrcaRouter-logo samengesteld in de hoek.
Guides & Insights

Intern-Decision-0.8B vs MathForm 8B: Een van deze kan zijn eigen werk controleren

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De nuttigste vraag die je over elk klein gespecialiseerd model kunt stellen, is: wie controleert het. Intern-Decision-0.8B en MathForm 8B bestaan beide omdat een algemeen model tot een smal model is gefinetuned, beide zijn Apache-2.0-afgeleiden van Qwe​n-gewichten, en beide zijn zonder marketingcampagne op Hugging Face gezet — maar ze bevinden zich aan weerszijden van een grens die bepaalt hoe je ze zou inzetten. MathForm 8B is het 8B-autoformaliseringsmodel van OpenBMB, uitgebracht op 14 augustus 2026, dat wiskunde in natuurlijke taal naar Lean 4 vertaalt en het resultaat aan een compiler overhandigt, die het al dan niet accepteert. Intern-Decision-0.8B is het beslissingshoofd van InternLM met 852.985.920 parameters, geüpload op 26 september 2026, dat een gekalibreerde kansverdeling retourneert over opties die je vooraf hebt opgegeven — en niets in de wereld verifieert onafhankelijk of het label dat het teruggeeft juist is. Een van deze modellen produceert output met een bewijs. Het andere produceert output met een betrouwbaarheidsscore, en het verschil in wat je met die twee dingen kunt doen, is het hele artikel.

Die framing verklaart ook waarom het verschil in grootte — 8B tegenover 0,8B, een factor tien — het minst interessante getal in de vergelijking is. Geen van beide modellen probeert goed te zijn in wat het andere doet, en de evaluatie van geen van beide zegt je iets over het andere. Wat ze gemeen hebben, is een releasepatroon en een Qwen-afkomst, en beide wegen minder zwaar dan de verificatievraag.

Wat elk ervan eigenlijk is

MathForm 8B is het uitgeleverde artefact van een tweetrapsrecept dat wordt beschreven in het artikel MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement (arXiv 2608.14221). Een retrieval-planner haalt relevante definities en bestaande formalisaties uit Mathlib voordat de generator draait; de gegenereerde uitspraken worden vervolgens herzien aan de hand van compilerdiagnostiek en feedback over semantische consistentie; het resulterende corpus, FormalVerse, bevat ongeveer 367.000 geverifieerde Lean 4-voorbeelden; en MathForm 8B wordt erop getraind via supervised fine-tuning gevolgd door reinforcement learning met Lean-compilatie en signalen van semantische consistentie als beloning. Het is een model dat alleen tekst verwerkt, gebaseerd op Qwen3-8B, geserveerd via Transformers, vLLM of SGLang met een OpenAI-compatibele API, met een aanbevolen contextlengte van 16.384 tokens en een maximaal generatiebudget van 16.384 tokens. De evaluatiepijplijn, benchmarkbestanden en Pass@k-scripts staan allemaal in de OpenBMB GitHub-repository, en de trainingsdataset is openbaar.

Intern-Decision-0.8B is het geleverde artefact van een recept dat niemand heeft beschreven. De modelkaart zegt dat het "een multimodaal gestructureerd beslissingsmodel is dat is fine-getuned vanaf Qwen3.5-0.8B" en stopt daar — geen databeschrijving, geen trainingsprocedure, geen paper, geen repository. Wat het wel grondig documenteert, is het inferentiecontract. De meegeleverde engine mapt de opties van elke vraag naar single-token symbolen, rendert een skelet met één <decision> placeholder per veld, voert één causale forward pass uit, leest logits op de positie vóór elke placeholder, softmaxt over alleen de toegestane symbolen van dat veld, past een gefitte kalibratie toe, en mapt symbolen terug naar je optiewaarden. Er is geen generate() aanroep en geen sampling ergens in het pad. Het accepteert tekst plus tot acht afbeeldingen, verwerkt één tot zestien vragen met elk tot 62 opties, en weigert invoer van meer dan 8.192 tokens in plaats van deze af te kappen. De standaard kalibratietemperatuur is 2,747760550703, per checkpoint gefit door NLL-minimalisatie over 1.728 gevallen.

Lees die twee paragrafen naast elkaar en de asymmetrie is schrijnend. MathForm 8B komt met een paper, een dataset, een evaluatiepijplijn en een repository. Intern-Decision-0.8B komt met een API-beschrijving en een benchmarktabel.

De verificatieasymmetrie, die het echte verhaal is

De output van MathForm 8B is controleerbaar door iets anders dan een mens. Het genereert Lean 4, en Lean 4 compileert of het compileert niet. De cijfers van OpenBMB worden om precies deze reden onder twee regimes gerapporteerd: Pass@8 van 88,06% onder Syntax Check, wat betekent dat de output compileert, en 72,37% onder Consistency Check, wat betekent dat het compileert en een semantische consistentiecontrole bevestigt dat de formele bewering betekent wat de informele zei. Beide cijfers zijn gemiddelden over zes benchmarks, en het artikel rapporteert ook CC-slaagpercentages van 63% op FATE-H en 37% op de moeilijkere FATE-X-subsets, met de bewering dat dit gespecialiseerde 32B-autoformaliseerders overtreft. Die zijn door de leverancier gerapporteerd — OpenBMB heeft ze uitgevoerd — maar de eigenschap die ertoe doet is structureel, niet statistisch: een downstreamsysteem dat de output van MathForm 8B gebruikt, kan een slechte formalisering afwijzen zonder een model te vragen het te beoordelen. De compiler is het orakel.

Intern-Decision-0.8B heeft een typecontract en geen orakel. De uitvoervorm is gegarandeerd — een veld dat choice heet, retourneert een verdeling over de optiewaarden die je hebt opgegeven, een score retourneert een waarschijnlijkheidsgewogen verwachte waarde over je rubric, een noul retourneert een ja-kans. Niets buiten het model kan je vertellen of de argmax correct was. De betrouwbaarheidswaarde is de eigen schatting van het model van zijn eigen correctheid, en het kalibratiewerk van de kaart is een oprechte poging om die schatting betekenisvol te maken — een gefitte temperatuur die de argmax behoudt terwijl de kansen worden verscherpt of verzacht, gevalideerd op achtergehouden gevallen — maar een goed gekalibreerd fout antwoord is nog steeds een fout antwoord. Als je pijplijn moet weten of een label juist is, heb je gelabelde data nodig, en moet je het zelf meten.

Dat is geen defect dat uniek is voor Intern-Decision-0.8B. Het is de conditie van elke classificator, en het is het onopgeloste probleem in de hele categorie beslissingsmodellen waartoe TypeSafe's Jev en Convai's Laya behoren. Het is de moeite waard om dit duidelijk te stellen, omdat een benchmarktabel met een Brier-scorekolom de indruk kan wekken dat kalibratie verificatie is. Dat is niet zo. Kalibratie vertelt je dat wanneer dit model 80% zegt, het ongeveer 80% van de tijd gelijk heeft over de geëvalueerde verdeling — wat daadwerkelijk nuttig is voor het instellen van drempels en het berekenen van verwachte waarde, en geen garantie is voor de correctheid per item.

Het scorebord, op de rijen die beide modellen hebben

• Parameters — Intern-Decision-0.8B: 852.985.920 verdeeld over een taal-shard van 1,50 GB, een vision-shard van 176 MB en een projector van 25 MB. MathForm 8B: 8B dense, gebaseerd op Qwen3-8B.

• Basismodel — Intern-Decision-0.8B: Qwen3.5-0.8B, uitgebracht in februari 2026. MathForm 8B: Qwen3-8B.

• Taak — Intern-Decision-0.8B: getypeerde beslissingen over een schema dat je zelf schrijft — keuze, score, binair. MathForm 8B: wiskunde in natuurlijke taal naar Lean 4-formalisering.

• Uitvoer — Intern-Decision-0.8B: gekalibreerde verdeling plus argmax per veld, geen tekst gegenereerd. MathForm 8B: gegenereerde Lean 4-broncode, doorgaans lang.

• Verificatie — Intern-Decision-0.8B: geen externe verificatie; vertrouwen is zelfgerapporteerd. MathForm 8B: de Lean 4-compiler, plus een semantische consistentiecontrole.

• Gepubliceerd bewijs — Intern-Decision-0.8B: een benchmarktabel van de leverancier over zeven benchmarks, niet gereproduceerd, geen paper. MathForm 8B: een paper, een publieke dataset van ongeveer 367.000 voorbeelden, een evaluatiepijplijn en repository, door de leverancier uitgevoerd.

• Licentie — Beide Apache 2.0, en Intern-Decision-0.8B bevat daarnaast het bewaard gebleven Qwen-licentiebestand voor de upstream-gewichten.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Kosten en latentie zijn niet vergelijkbaar, en dat is geen uitvlucht.

InternLM mat Intern-Decision-0.8B op 33,98 ms gemiddeld en 37,50 ms p95 per query op één RTX 4090 via het lokale Hugging Face-pad, terwijl de 2B-variant een gemiddelde van 33,28 ms liet optekenen. De eigen kaart van MathForm 8B adviseert tot 16.384 nieuwe tokens per formalisatie bij temperatuur 0,6 en top_p 0,95. Die twee metingen zijn niet dezelfde grootheid. De ene is één enkele forward pass over een prompt; de andere is een autoregressieve generatie die duizenden tokens kan beslaan. Een formalisatiebudget afzetten tegen een beslissing van 34 ms zegt je niets over relatieve efficiëntie, want de modellen verrichten niet dezelfde hoeveelheid werk — de ene leest en scoort, de andere leest en schrijft een bewijsscript. Als doorvoer je beperkende factor is, zijn de relevante feiten eenvoudiger dan een verhouding. MathForm 8B formaliseert één bewering per generatie, en bij 16K tokens per output op een 8B-dense model is dat een GPU-verzadigende workload en een kandidaat voor batchen via vLLM of SGLang, die beide door OpenBMB worden gedocumenteerd. Intern-Decision-0.8B beantwoordt zestien vragen die een heel record in één doorgang omvatten, dus de werkeenheid is een record in plaats van een veld, en het recordbudget is het invoerplafond van 8.192 tokens — dat sneller wordt bereikt dan een lezer zou verwachten wanneer je een lange toestand, een rijk schema en maximaal acht afbeeldingen erin stopt.

Waar elk van hen het juiste hulpmiddel is

MathForm 8B hoort thuis in een pijplijn waarvan de flessenhals menselijke beoordeling van wiskunde is. Autoformalizatie bestaat omdat het schrijven van Lean langzamer gaat dan het lezen ervan, en omdat een machinecontroleerbare uitspraak er een is die een bewijsassistent vervolgens kan aanpakken. De eigenschap die het betrouwbaar maakt — door de compiler geverifieerde output — is ook de eigenschap die het beperkt maakt: het formaliseert, het bewijst niet, en de modelkaart zegt expliciet dat compilatiecontroles een draaiende Kimina Lean Server vereisen en dat de experimenten Lean 4.21.0 gebruikten. Wie het adoptert, adoptert die stack. Zoals bij elk model met open gewichten van een paar dagen of weken oud, is een testpad erop richten en terugvallen op een bewezen model wanneer het vastloopt de minst risicovolle manier om het te evalueren, en dat is precies waarvoor een gateway met automatische failover over een fallback-keten dient — herhaalpogingen die plaatsvinden voordat het antwoord begint, zodat een vastgelopen formalisatie je aanroeper nooit bereikt.

Intern-Decision-0.8B hoort overal waar al een gesloten antwoordenset bestaat en de kosten van het genereren van tekst om die terug te vinden pure verspilling zijn. Triage, routering, scoren volgens een rubric, het toetsen van een record aan een geschreven beleid — de gevallen waarin een generatief model wordt gebruikt als een dure manier om uit een lijst te kiezen. De voordelen zijn dat het deterministisch is, dat het een bruikbare waarschijnlijkheid retourneert in plaats van een tekenreeks die je moet parsen, en dat het met 1,73 GB op schijf comfortabel onder de geheugenkosten van een laptopbrowser draait. De nadelen zijn dat de documentatie bij het API-oppervlak stopt, dat niemand buiten InternLM er een resultaat voor heeft gepubliceerd, en dat de enige benchmarkkolom die op een veiligheidsprobleem wijst — een WildJailBreak-score van 64,48 tegenover Jev's 96,29 — onverklaard is. Stel het niet bloot aan adversariële input zonder die test zelf uit te voeren.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Beide modellen delen een afstamming die het vermelden waard is, want die verandert wat "open" je oplevert. Elk is een fine-tune van een Qwen-checkpoint, en elk behoudt de upstream-licentie correct: MathForm 8B onder Apache 2.0 met de Qwen3-8B-herkomst vermeld op de kaart, Intern-Decision-0.8B onder Apache 2.0 met een apart LICENSE-QWEN-bestand in de repository. Geen van beide heeft een omzetdrempel of een beperking op het gebruiksgebied — anders dan Liquid AI's LFM Open License v1.0, die commerciële rechten afhankelijk maakt van of je entiteit onder een jaarlijkse omzetgrens van $10 miljoen blijft. Als je commercieel bouwt, is dat een onderscheid dat deze twee releases onderscheidt van delen van het ecosysteem van kleine modellen, en het geldt voor beide in gelijke mate.

Als je de beslissingslaag zonder de ongedocumenteerde checkpoint wilt

Het gat tussen "een decision head is de juiste vorm voor dit probleem" en "deze specifieke decision head is er een die je kunt verdedigen tegenover een reviewer" is wat een gehost alternatief overbrugt. TypeSafe's Jev 1.13 is het model waartegen InternLM zijn familie benchmarkte op Jevbench, op Typed Decision en op ToolACE, en het is vandaag aanroepbaar via één OpenAI-compatibel endpoint voor $0,042 per miljoen inputtokens, met output gefactureerd tegen nul — het door de leverancier gepubliceerde tarief, doorgegeven zonder opslag in plaats van onderweg met een opslag verhoogd. Voor een lezer die wil meten of een decision head überhaupt helpt voordat hij zich vastlegt op een 0,8B-checkpoint met een ontbrekende repository, is dat het goedkope eerste experiment, en Jev's eigen evaluaties door derden geven het een gedocumenteerd trackrecord dat Intern-Decision-0.8B nog niet heeft.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Het korte antwoord

Deze twee zijn geen alternatieven. MathForm 8B is een specialist wiens output door een programma kan worden geverifieerd, gericht op een taak waarbij verificatie het moeilijke deel is, en hij wordt geleverd met de paper, de dataset en het evaluatieharnas om de claim te onderbouwen. Intern-Decision-0.8B is een specialist wiens output alleen jij kunt verifiëren, gericht op taken waarbij de antwoorden al waren opgeschreven en het moeilijke deel was om ze snel en goedkoop te bereiken, en hij wordt geleverd met een inferentiemodule en een tabel. Als je een formalisering nodig hebt, is er maar één van deze om te overwegen. Als je een label nodig hebt en bereid bent de ground truth te bouwen om het daaraan te toetsen, is de 0.8B de interessantere download — snel, deterministisch, Apache 2.0, en klein genoeg dat de kosten om erachter te komen of hij ergens goed voor is een middag zijn in plaats van een begrotingspost.