Eine generierte Hero-Titelkarte mit der Aufschrift 'Solar Mini 4 vs MathForm 8B', dem Untertitel 'Der eine beantwortet die Frage, der andere macht sie überprüfbar' und zwei Badges mit der Aufschrift 'Ein Generalist gegen einen Autoformalizer' und 'Lean-4-Kompilierung im Loop'.
Guides & Insights

Solar Mini 4 vs. MathForm 8B: Das eine Modell beantwortet die Frage, das andere macht sie überprüfbar.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stell Solar Mini 4 neben MathForm 8B, und du vergleichst zwei Modelle, die nicht um dasselbe Token konkurrieren. Solar Mini 4 ist Upstages 35-Milliarden-Parameter-Sparse-Mixture-of-Experts, veröffentlicht am 22. September 2026, mit ungefähr 3 Milliarden aktiven Parametern pro Token, und es beantwortet Fragen: ein langes Dokument lesen, darüber Schlussfolgerungen ziehen, ein schriftliches Ergebnis liefern. MathForm 8B ist OpenBMBs 8-Milliarden-Parameter-Autoformalisierer, veröffentlicht am 14. August 2026 unter Apache 2.0, und es tut etwas, das kein Reasoning-Modell überhaupt tut – es nimmt eine natürlichsprachliche mathematische Aussage und schreibt sie als Lean-4-Theorem um, das der Compiler eines Beweisassistenten typprüfen wird. Das eine erzeugt Antworten. Das andere erzeugt maschinell überprüfbare Fragen, und Letzteres ist die seltenere Ware.

Der Vergleich lohnt sich trotzdem, weil beide in derselben Art von Pipeline landen und weil die beiden in einer Weise gegensätzliche Stärken haben, die die Wahl ungewöhnlich eindeutig macht. Upstages Modell ist stark bei langen Dokumenten, schwach bei schwierigem Schlussfolgern und teuer pro abgeschlossener Aufgabe. OpenBMBs Modell ist so eng begrenzt, dass es außerhalb seiner Nische nutzlos ist, wurde überhaupt noch nie von einem unabhängigen Evaluator bewertet und kostet nichts im Betrieb, sobald man eine GPU hat.

Seite an Seite, bei den Dingen, die sich unterscheiden

• Worum es sich handelt — Solar Mini 4 ist ein allgemeines Reasoning-Modell mit einem Kontext von 1 Mio. Token (512K laut der eigenen Dokumentation von Upstage) und einem gemessenen Wert von 24,1 im Artificial Analysis Intelligence Index. MathForm 8B ist ein Single-Task-Autoformalizer ohne veröffentlichten Indexwert, ohne unabhängige Evaluierung und ohne Angaben zu allgemeinen Fähigkeiten.

• Parameter — 35 Mrd. gesamt / 3 Mrd. aktiv, sparse, für Solar Mini 4; 8,19 Mrd. dense für MathForm 8B, feinabgestimmt aus Qwen3-8B auf OpenBMBs FormalVerse-Korpus mit rund 367.000 verifizierten Lean-4-Beispielen.

• Lizenzbereitstellung — Solar Mini 4 ist proprietär und über Upstage-API und Drittanbieter-Plattformen zugänglich. FormForm 8B sind Apache-2.0-Gewichte mit einem Chat-Template, vier Safetensors-Shards und einem Deployment mit Transformers, vLLM oder SGLang hinter einem OpenAI-kompatiblen Endpoint.

• Preis — Solar Mini 4 für 0,10 $ / 0,01 $ gecacht / 0,40 $ pro Million Tokens, derzeit 50 % Rabatt bis zum 22. Oktober 2026. MathForm 8B hat keine Preisliste; seine Kosten sind die GPU, die Sie darunter betreiben.

• Geschwindigkeit — 204 Ausgabe-Token pro Sekunde für Solar Mini 4 auf dem Testrahmen von Artificial Analysis, mit 88.300 Ausgabe-Token pro Index-Aufgabe und etwa 430 Sekunden Arbeit pro Aufgabe. Die Ausgabe von MathForm 8B ist ein einzelner Lean-4-Theorem-Header, höchstens ein paar hundert Token.

• Unabhängigkeit seiner Zahlen — Solar Mini 4 wurde von einem Dritten getestet. Bei MathForm 8B ist das nicht der Fall: jede Zahl in seinem Paper stammt von den Autoren selbst, und das Modell ist zu neu und zu spezialisiert, als dass es bereits einen unabhängigen Testlauf erhalten hätte.

Wo die beiden Modelle übereinstimmen und wo nicht

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

Die Fehlermodi sind es, die diese Paarung interessant machen, denn sie sind exakte Gegensätze. Das schwächste veröffentlichte Ergebnis von Solar Mini 4 ist Terminal-Bench 4.0 mit 1 %, dazu AutomationBench-AA mit 22,3 % — es ist schlecht darin, seine eigene Arbeit in einer Umgebung zu verifizieren, die ihm Feedback gibt. Die gesamte Designprämisse von MathForm 8B ist Verifikation: OpenBMB unterscheidet einen Syntax Check, der fragt, ob die Lean-4-Aussage kompiliert, von einem Consistency Check, der fragt, ob die Aussage, die kompiliert wurde, tatsächlich dasselbe bedeutet wie das informelle Problem. Der klassische Fehler, den er verhindern soll, ist eine Aussage, die type-checkt, dabei aber stillschweigend die Behauptung abschwächt.

Das ist ein echter Unterschied, und es lohnt sich, präzise zu sein. Ein Reasoning-Modell, das einen Beweis erzeugt, hat ein wohlbekanntes Selbstverifizierungsproblem: Nichts an der Generierung sagt einem, ob die Antwort richtig ist. Ein Compiler schon. Wenn dein Workflow darin besteht, „eine Aufgabenbank in etwas umzuwandeln, das eine Maschine überprüfen kann“, dann erledigt MathForm 8B die Hälfte der Arbeit, die Solar Mini 4 überhaupt nicht leisten kann, und der Rest ist keine Frage des Grades.

Die Anbieterzahlen, als solche gekennzeichnet: Das Paper von OpenBMB berichtet über einen durchschnittlichen Pass@8 von 88,06 % unter Syntax Check und 72,37 % unter Consistency Check über sechs Benchmarks hinweg und behauptet, dass diese mehrere spezialisierte 32B-Autoformalisierer übertreffen. Nichts davon wurde von einer dritten Partei reproduziert. Der Rückgang um 16 Punkte zwischen den beiden Prüfungen ist die aussagekräftigere Zahl – er misst, wie oft eine kompilierte Aussage nicht ganz dem Problem entspricht, nach dem gefragt wurde, und er ist der Grund, warum Consistency Check als separate Spalte existiert.

Warum ein Team beides ausführen würde

Denn die natürliche Pipeline hat eine kostengünstige Phase mit hohem Volumen und eine teure Phase mit niedrigem Volumen. MathForm 8B läuft auf Ihrer eigenen Hardware und wandelt informelle Probleme in Lean 4-Header um, wobei ein Compiler verfügbar ist, um fehlerhafte Ausgabe abzulehnen, bevor ein Mensch sie sieht. Solar Mini 4 übernimmt, was darum herum geschieht: das Lesen des unterstützenden Papers, das Extrahieren der Annahmen, das Zusammenfassen des Ergebnisses auf Koreanisch oder Englisch und das Routing der Arbeit. Die beiden konkurrieren nie um dieselbe Anfrage, und die kleinere ist diejenige, die den Teil der Aufgabe verantwortet, der ein objektives Bestanden-/Nicht-bestanden-Signal hat.

Keines der beiden Modelle ist etwas, das wir an dich weiterleiten können – Upstages Modelle sind nicht auf OrcaRouter, und die von OpenBMB auch nicht – wenn du also Solar Mini 4 willst, kommt es von Upstages eigener API, und wenn du MathForm 8B willst, kommt es von Hugging Face und deiner eigenen GPU. Was wir tun können, ist, den Rest dieser Pipeline hinter einen einzigen Schlüssel zu legen: mehr als 200 Modelle mit 0 % Aufschlag auf den Listenpreis des Anbieters, automatisches Failover über Anbieter hinweg und eine Routing-DSL, mit der du Modelle zu einem einzigen Aufruf verketten kannst. In einem Workflow, in dem ein kleiner Spezialist den Formalisierungsschritt übernimmt und ein großer Generalist alles drumherum erledigt, ist die Möglichkeit, den Generalisten durch Ändern eines Modell-Strings auszutauschen – statt eine neue Integration auszuliefern –, der Unterschied zwischen einer zwei Wochen dauernden Änderung und einem Nachmittag.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Was Sie mitnehmen sollten

Wenn Ihre Frage lautet: „Welche davon sollte ich verwenden?“, dann ist die ehrliche Antwort, dass es davon abhängt, ob Sie eine Antwort oder eine Formalisierung brauchen, und kein Benchmark wird das entscheiden. Wenn Ihre Frage lautet: „Ist MathForm 8B den Download wert?“, dann lautet die Antwort ja für eine einzige eng umrissene Aufgabe und nein für alles andere — es ist ein Formalisierer, kein Beweiser, und die Beweisverpflichtung bleibt in der von ihm erzeugten Ausgabe offen. Wenn Ihre Frage lautet: „Ist Solar Mini 4 0,36 US-Dollar pro Aufgabe wert?“, dann lautet die Antwort ja für lange Dokumente in großen Mengen und nein für alles, was von ihm verlangt, seine eigene Arbeit zu überprüfen.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Bezugsquellen, zum Abschluss. Jede oben genannte Zahl zu Solar Mini 4 ist eine unabhängige Messung von Artificial Analysis, mit Ausnahme des Kontextfensters, das Upstages eigene Angabe ist und von deren abweicht. Jede Zahl zu MathForm 8B ist vom Anbieter gemeldet aus arXiv 2608.14221 und nicht reproduziert, und seine Veröffentlichung war unangekündigt — die Gewichte, der FormalVerse-Datensatz und das Paper erschienen alle am 14. August 2026, ohne Blogbeitrag des Anbieters und ohne bisherigen unabhängigen Benchmark-Lauf.