Eine Hero-Titelkarte mit der Aufschrift „Inter-Decision-0.8B vs MathForm 8B“ und dem Untertitel „Eines davon kann seine eigene Arbeit überprüfen“, die die Badges „compiler-verifizierte Lean-4-Ausgabe“ und „ausschließlich selbstberichtete Konfidenz“ trägt, mit dem in der Ecke eingefügten OrcaRouter-Logo.
Guides & Insights

Intern-Decision-0.8B vs. MathForm 8B: Eines davon kann seine eigene Arbeit überprüfen

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die nützlichste Frage, die man zu jedem kleinen Spezialmodell stellen kann, ist, wer es überprüft. Intern-Decision-0.8B und MathForm 8B existieren beide, weil ein allgemeines Modell zu einem eng zugeschnittenen Modell feinabgestimmt wurde, beide sind Apache-2.0-Derivate von Qwe​n-Gewichten, und beide wurden ohne Marketingkampagne auf Hugging Face gestellt – aber sie liegen auf entgegengesetzten Seiten einer Linie, die bestimmt, wie man sie einsetzen würde. MathForm 8B ist OpenBMBs 8B-Autoformalisierungsmodell, veröffentlicht am 14. August 2026, das Mathematik in natürlicher Sprache in Lean 4 übersetzt und das Ergebnis einem Compiler übergibt, der es entweder akzeptiert oder nicht. Intern-Decision-0.8B ist InternLMs Entscheidungs-Head mit 852.985.920 Parametern, hochgeladen am 26. September 2026, der eine kalibrierte Wahrscheinlichkeitsverteilung über Optionen zurückgibt, die man im Voraus angegeben hat – und nichts auf der Welt verifiziert unabhängig, ob das zurückgegebene Label richtig ist. Eines dieser Modelle erzeugt Ausgaben mit einem Beweis. Das andere erzeugt Ausgaben mit einem Konfidenzwert, und der Unterschied darin, was man mit diesen beiden Dingen anfangen kann, macht den gesamten Artikel aus.

Diese Einordnung erklärt auch, warum die Größenlücke – 8B gegenüber 0,8B, ein Faktor von zehn – die am wenigsten interessante Zahl im Vergleich ist. Keines der beiden Modelle versucht, gut in dem zu sein, was das andere tut, und die Evaluierung des einen sagt nichts über das andere aus. Was sie gemeinsam haben, ist ein Veröffentlichungsmuster und eine Qwen-Abstammung, und beides ist weniger wichtig als die Verifizierungsfrage.

Was jedes einzelne tatsächlich ist

MathForm 8B ist das ausgelieferte Artefakt eines zweistufigen Rezepts, das im Paper MathForm: Skalierung der mathematischen Autoformalisierung mit Wissensabruf und verifikationsgesteuerter Verfeinerung (arXiv 2608.14221) beschrieben wird. Ein Retrieval-Planer ruft relevante Definitionen und bestehende Formalisierungen aus Mathlib ab, bevor der Generator ausgeführt wird; die generierten Aussagen werden dann mithilfe von Compiler-Diagnosen und Feedback zur semantischen Konsistenz überarbeitet; der resultierende Korpus FormalVerse enthält ungefähr 367.000 verifizierte Lean-4-Beispiele; und MathForm 8B wird darauf mittels überwachtem Feintuning trainiert, gefolgt von Reinforcement Learning, das Lean-Kompilierung und Signale semantischer Konsistenz als Reward verwendet. Es ist ein reines Textmodell auf Basis von Qwen3-8B, das über Transformers, vLLM oder SGLang mit einer OpenAI-kompatiblen API bereitgestellt wird, mit einer empfohlenen Kontextlänge von 16.384 Token und einem maximalen Generierungsbudget von 16.384 Token. Seine Evaluierungs-Pipeline, Benchmark-Dateien und Pass@k-Skripte befinden sich alle im OpenBMB-GitHub-Repository, und der Trainingsdatensatz ist öffentlich.

Intern-Decision-0.8B ist das ausgelieferte Artefakt eines Rezepts, das niemand beschrieben hat. Die Modellkarte sagt, es sei „ein multimodales strukturiertes Entscheidungsmodell, das aus Qwen3.5-0.8B feinabgestimmt wurde“, und endet dort – keine Datenbeschreibung, kein Trainingsverfahren, kein Paper, kein Repository. Was sie jedoch ausführlich dokumentiert, ist der Inferenzvertrag. Die mitgelieferte Engine ordnet die Optionen jeder Frage Einzeltoken-Symbolen zu, rendert ein Skelett mit einem <decision>-Platzhalter pro Feld, führt einen kausalen Vorwärtsdurchlauf aus, liest Logits an der Position vor jedem Platzhalter, führt Softmax nur über die für dieses Feld zulässigen Symbole durch, wendet eine angepasste Kalibrierung an und ordnet die Symbole wieder Ihren Optionswerten zu. Es gibt keinen generate()-Aufruf, und an keiner Stelle im Pfad wird gesampelt. Es akzeptiert Text plus bis zu acht Bilder, verarbeitet eine bis sechzehn Fragen mit jeweils bis zu 62 Optionen und weist Eingaben mit mehr als 8.192 Tokens zurück, anstatt sie zu kürzen. Die Standard-Kalibrierungstemperatur beträgt 2,747760550703 und wird pro Checkpoint durch NLL-Minimierung über 1.728 Fälle angepasst.

Liest man diese beiden Absätze nebeneinander, ist die Asymmetrie eklatant. MathForm 8B kommt mit einem Paper, einem Datensatz, einer Evaluierungspipeline und einem Repository. Intern-Decision-0.8B kommt mit einer API-Beschreibung und einer Benchmark-Tabelle.

Die Verifikationsasymmetrie, das ist die eigentliche Geschichte.

Die Ausgabe von MathForm 8B ist von etwas anderem als einem Menschen überprüfbar. Es gibt Lean 4 aus, und Lean 4 kompiliert entweder oder nicht. Die Zahlen von OpenBMB werden aus genau diesem Grund unter zwei Regimen berichtet: Pass@8 von 88,06 % unter Syntax Check, was bedeutet, dass die Ausgabe kompiliert, und 72,37 % unter Consistency Check, was bedeutet, dass sie kompiliert und eine semantische Konsistenzprüfung bestätigt, dass die formale Aussage bedeutet, was die informelle sagte. Beide Werte sind Durchschnittswerte über sechs Benchmarks, und das Paper berichtet außerdem CC-Bestehensraten von 63 % auf FATE-H und 37 % auf den schwierigeren FATE-X-Teilmengen, mit der Behauptung, dass dies spezialisierte 32B-Autoformalisierer übertrifft. Dabei handelt es sich um Anbieterangaben – OpenBMB hat sie durchgeführt –, doch die entscheidende Eigenschaft ist strukturell, nicht statistisch: Ein nachgelagertes System, das die Ausgabe von MathForm 8B nutzt, kann eine schlechte Formalisierung zurückweisen, ohne ein Modell zu bitten, sie zu beurteilen. Der Compiler ist das Orakel.

Intern-Decision-0.8B hat einen Typvertrag und kein Orakel. Die Ausgabeform ist garantiert — ein Feld, das als choice deklariert wird, gibt eine Verteilung über die von Ihnen aufgeführten Optionswerte zurück, ein score gibt einen wahrscheinlichkeitsgewichteten Erwartungswert über Ihre Bewertungsrubrik zurück, ein noul gibt eine Ja-Wahrscheinlichkeit zurück. Nichts außerhalb des Modells kann Ihnen sagen, ob der Argmax korrekt war. Der Konfidenzwert ist die eigene Schätzung des Modells für seine eigene Korrektheit, und die Kalibrierungsarbeit der Karte ist ein ehrlicher Versuch, diese Schätzung aussagekräftig zu machen — eine angepasste Temperatur, die den Argmax bewahrt, während sie die Wahrscheinlichkeiten schärft oder abschwächt, validiert an zurückgehaltenen Fällen —, aber eine gut kalibrierte falsche Antwort ist immer noch eine falsche Antwort. Wenn Ihre Pipeline wissen muss, ob ein Label richtig ist, brauchen Sie gelabelte Daten, und Sie müssen es selbst messen.

Das ist kein Defekt, der nur Intern-Decision-0.8B eigen ist. Es ist die Grundbedingung jedes Klassifikators, und es ist das ungelöste Problem in der gesamten Kategorie der Entscheidungsmodelle, zu der TypeSafe's Jev und Convai's Laya gehören. Es lohnt sich, das klar auszusprechen, denn eine Benchmark-Tabelle mit einer Brier-Score-Spalte kann den Eindruck erwecken, Kalibrierung sei Verifikation. Das ist sie nicht. Kalibrierung sagt Ihnen, dass dieses Modell, wenn es 80 % sagt, über die evaluierte Verteilung hinweg in etwa 80 % der Fälle richtig liegt — was für das Festlegen von Schwellenwerten und die Berechnung des Erwartungswerts wirklich nützlich ist und keine Korrektheitsgarantie für einzelne Elemente darstellt.

Die Ergebnistafel, auf den Zeilen, die beide Modelle haben

• Parameter — Intern-Decision-0.8B: 852.985.920 über einen 1,50 GB großen Sprach-Shard, einen 176 MB großen Vision-Shard und einen 25 MB großen Projektor. MathForm 8B: 8B dense, basierend auf Qwen3-8B.

• Basismodell — Intern-Decision-0.8B: Qwen3.5-0.8B, veröffentlicht im Februar 2026. MathForm 8B: Qwen3-8B.

• Aufgabe — Intern-Decision-0.8B: typisierte Entscheidungen über ein Schema, das Sie schreiben — Auswahl, Bewertung, binär. MathForm 8B: Mathematik in natürlicher Sprache zur Lean-4-Formalisierung.

• Ausgabe — Intern-Decision-0.8B: kalibrierte Verteilung plus Argmax pro Feld, kein Text generiert. MathForm 8B: generierter Lean-4-Quellcode, typischerweise lang.

• Verifikation — Intern-Decision-0.8B: keine externe; Konfidenz wird selbst berichtet. MathForm 8B: der Lean-4-Compiler, plus eine semantische Konsistenzprüfung.

• Veröffentlichte Belege – Intern-Decision-0.8B: eine Anbieter-Benchmark-Tabelle über sieben Benchmarks, nicht reproduziert, kein Paper. MathForm 8B: ein Paper, ein öffentlicher Datensatz mit rund 367.000 Beispielen, eine Evaluierungs-Pipeline und ein Repository, vom Anbieter betrieben.

• Lizenz — Beide Apache 2.0, und Intern-Decision-0.8B führt zusätzlich die beibehaltene Qwen-Lizenzdatei für seine Upstream-Gewichte mit.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Kosten und Latenz sind nicht vergleichbar, und das ist kein Ausweichen

InternLM hat Intern-Decision-0.8B mit 33,98 ms im Mittel und 37,50 ms p95 pro Abfrage auf einer einzelnen RTX 4090 über den lokalen Hugging-Face-Pfad gemessen, während das 2B-Geschwistermodell 33,28 ms im Mittel erreichte. Die eigene Model Card von MathForm 8B empfiehlt bis zu 16.384 neue Token pro Formalisierung bei Temperatur 0,6 und top_p 0,95. Diese beiden Messwerte sind nicht dieselbe Größe. Der eine ist ein einzelner Forward-Pass über einen Prompt; der andere ist eine autoregressive Generierung, die über Tausende von Token laufen kann. Ein Formalisierungsbudget gegen eine 34-ms-Entscheidung aufzurechnen, sagt nichts über die relative Effizienz aus, weil die Modelle nicht dieselbe Arbeit verrichten — das eine liest und bewertet, das andere liest und schreibt ein Beweisskript. Wenn der Durchsatz Ihre Einschränkung ist, sind die relevanten Fakten einfacher als ein Verhältnis. MathForm 8B formalisiert eine Aussage pro Generierung, und bei 16K Token pro Ausgabe auf einem dichten 8B-Modell ist das eine GPU-sättigende Arbeitslast und ein Kandidat für Batching über vLLM oder SGLang, die beide von OpenBMB dokumentiert werden. Intern-Decision-0.8B beantwortet sechzehn Fragen, die einen gesamten Datensatz abdecken, in einem Durchgang, sodass die Arbeitseinheit ein Datensatz statt eines Feldes ist, und das Datensatzbudget ist die Eingabeobergrenze von 8.192 Token — die schneller erreicht ist, als ein Leser erwarten mag, wenn man einen langen Zustand, ein umfangreiches Schema und bis zu acht Bilder hineinpackt.

Wo jedes einzelne das richtige Werkzeug ist

MathForm 8B gehört in eine Pipeline, deren Engpass die menschliche Überprüfung von Mathematik ist. Autoformalisierung existiert, weil das Schreiben von Lean langsamer ist als das Lesen, und weil eine maschinell überprüfbare Aussage eine ist, die ein Beweisassistent dann angreifen kann. Die Eigenschaft, die es vertrauenswürdig macht – vom Compiler verifizierte Ausgabe –, ist zugleich die Eigenschaft, die seinen Anwendungsbereich einschränkt: Es formalisiert, es beweist nicht, und die Karte sagt ausdrücklich, dass Kompilierungsprüfungen einen laufenden Kimina Lean Server erfordern und dass die Experimente Lean 4.21.0 verwendeten. Wer es übernimmt, übernimmt diesen Stack. Wie bei jedem erst wenige Tage oder Wochen alten Open-Weights-Modell gilt: Einen Testpfad darauf zu richten und auf ein bewährtes Modell zurückzugreifen, wenn es stockt, ist die risikoarme Methode, es zu evaluieren – und genau dafür ist ein Gateway mit automatischem Failover über eine Fallback-Kette gedacht – Wiederholungen, die eintreffen, bevor die Antwort beginnt, sodass eine ins Stocken geratene Formalisierung niemals Ihren Aufrufer erreicht.

Intern-Decision-0.8B gehört überall dorthin, wo bereits eine geschlossene Antwortmenge existiert und die Kosten für das Generieren von Text, um sie wiederzugewinnen, reine Verschwendung sind. Triage, Routing, Rubrikbewertung, das Beurteilen eines Datensatzes anhand einer schriftlichen Richtlinie – die Fälle, in denen ein generatives Modell als teure Methode eingesetzt wird, um aus einer Liste auszuwählen. Seine Vorteile sind, dass es deterministisch ist, dass es eine nutzbare Wahrscheinlichkeit statt einer Zeichenkette zurückgibt, die man erst parsen muss, und dass es mit 1,73 GB auf der Festplatte bequem unter den Speicherkosten eines Laptop-Browsers läuft. Seine Nachteile sind, dass die Dokumentation an der API-Oberfläche endet, dass niemand außerhalb von InternLM ein Ergebnis dafür veröffentlicht hat und dass die eine Benchmark-Spalte, die auf ein Sicherheitsproblem hindeutet – ein WildJailBreak-Wert von 64,48 gegenüber 96,29 bei Jev – unerklärt ist. Setzen Sie es nicht adversariellen Eingaben aus, ohne diesen Test selbst durchzuführen.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Beide Modelle haben eine gemeinsame Abstammung, die erwähnenswert ist, denn sie verändert, was „offen“ Ihnen bringt. Beide sind jeweils ein Fine-Tuning eines Qwen-Checkpoints, und beide behalten die Upstream-Lizenz korrekt bei: MathForm 8B unter Apache 2.0, wobei die Qwen3-8B-Herkunft auf der Modellkarte angegeben ist, Intern-Decision-0.8B unter Apache 2.0 mit einer separaten LICENSE-QWEN-Datei im Repository. Keines von beiden enthält eine Umsatzschwelle oder eine Einschränkung des Nutzungsbereichs – anders als die LFM Open License v1.0 von Liquid AI, die kommerzielle Rechte davon abhängig macht, dass Ihr Unternehmen unter einer jährlichen Umsatzgrenze von 10 Millionen US-Dollar bleibt. Wenn Sie kommerziell entwickeln, ist das ein Unterschied, der diese beiden Veröffentlichungen von Teilen des Ökosystems kleiner Modelle trennt, und er gilt für beide gleichermaßen.

Wenn Sie die Entscheidungsebene ohne den undokumentierten Checkpoint möchten

Die Lücke zwischen „ein Decision Head ist die richtige Form für dieses Problem" und „dieser konkrete Decision Head ist einer, den man gegenüber einem Reviewer verteidigen kann", ist das, was eine gehostete Alternative schließt. TypeSafe's Jev 1.13 ist das Modell, gegen das InternLM seine Familie auf Jevbench, auf Typed Decision und auf ToolACE verglichen hat, und es ist heute über einen einzigen OpenAI-kompatiblen Endpunkt aufrufbar, für $0,042 pro Million Eingabe-Tokens, wobei Output mit null abgerechnet wird — der veröffentlichte Tarif des Anbieters, ohne Aufschlag durchgereicht statt unterwegs aufgeschlagen. Für einen Leser, der messen möchte, ob ein Decision Head überhaupt hilft, bevor er sich auf einen 0,8B-Checkpoint mit fehlendem Repository festlegt, ist das das günstige erste Experiment, und Jevs eigene Drittanbieter-Evaluierungen verleihen ihm eine dokumentierte Erfolgsbilanz, die Intern-Decision-0.8B noch nicht hat.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Die kurze Antwort

Diese beiden sind keine Alternativen. MathForm 8B ist ein Spezialist, dessen Ausgabe ein Programm verifizieren kann, ausgerichtet auf eine Aufgabe, bei der die Verifikation der schwierige Teil ist, und es wird mit Paper, Datensatz und Evaluations-Harness geliefert, um die Behauptung zu belegen. Intern-Decision-0.8B ist ein Spezialist, dessen Ausgabe nur Sie verifizieren können, ausgerichtet auf Aufgaben, bei denen die Antworten bereits aufgeschrieben waren und der schwierige Teil darin bestand, schnell und kostengünstig an sie zu gelangen, und es wird mit einem Inferenzmodul und einer Tabelle geliefert. Wenn Sie eine Formalisierung brauchen, ist nur eine dieser beiden in Betracht zu ziehen. Wenn Sie ein Label brauchen und bereit sind, die Ground Truth aufzubauen, gegen die Sie es prüfen können, ist das 0.8B der interessantere Download – schnell, deterministisch, Apache 2.0 und klein genug, dass der Aufwand, herauszufinden, ob es etwas taugt, eher ein Nachmittag als ein Budgetposten ist.