Een gegenereerde hero-titelkaart met de tekst 'Solar Mini 4 vs MathForm 8B', de ondertitel 'De een beantwoordt de vraag, de ander maakt die controleerbaar' en twee badges met de tekst 'Een generalist tegenover een autoformaliseerder' en 'Lean 4-compilatie in de lus'.
Guides & Insights

Solar Mini 4 vs MathForm 8B: Het ene model beantwoordt de vraag, het andere maakt die controleerbaar

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Solar Mini 4 naast MathForm 8B en je vergelijkt twee modellen die niet om dezelfde token concurreren. Solar Mini 4 is het sparse mixture-of-experts-model van Upstage met 35 miljard parameters, uitgebracht op 22 september 2026 met ongeveer 3 miljard actieve parameters per token, en het beantwoordt vragen: een lang document lezen, erover redeneren, een geschreven resultaat teruggeven. MathForm 8B is de autoformalizer van OpenBMB met 8 miljard parameters, gepubliceerd op 14 augustus 2026 onder Apache 2.0, en het doet iets wat geen enkel redeneermodel doet — het neemt een wiskundige uitspraak in natuurlijke taal en herschrijft die als een Lean 4-stelling die de compiler van een bewijsassistent kan type-checken. De ene produceert antwoorden. De andere produceert machinecontroleerbare vragen, en de tweede is de zeldzamere waar.

De vergelijking is toch de moeite waard, omdat beide in hetzelfde soort pipeline terechtkomen, en omdat de twee tegengestelde sterke punten hebben op een manier die de keuze ongewoon helder maakt. Het model van Upstage is sterk in lange documenten, zwak in moeilijk redeneren, en duur per afgeronde taak. Het model van OpenBMB is zo smal dat het buiten zijn niche nutteloos is, is nooit door een onafhankelijke evaluator beoordeeld, en kost niets om te draaien zodra je een GPU hebt.

Naast elkaar, op de dingen die verschillen

• Wat het is — Solar Mini 4 is een algemeen redeneermodel met een context van 1 miljoen tokens (512K volgens Upstage's eigen documentatie) en een gemeten 24,1 op de Artificial Analysis Intelligence Index. MathForm 8B is een autoformalizer voor één taak, zonder gepubliceerde indexscore, zonder onafhankelijke evaluatie en zonder claims over algemene capaciteiten.

• Parameters — 35B totaal / 3B actief, sparse, voor Solar Mini 4; 8,19B dense voor MathForm 8B, fine-tuned vanaf Qwen3-8B op de FormalVerse-corpus van OpenBMB met ongeveer 367.000 geverifieerde Lean 4-voorbeelden.

• Licentie en levering — Solar Mini 4 is propriëtair en bereikbaar via de API van Upstage en platforms van derden. MathForm 8B bestaat uit Apache-2.0-gewichten met een chatsjabloon, vier safetensors-shards en een implementatiepad via Transformers, vLLM of SGLang achter een OpenAI-compatibel eindpunt.

• Prijs — Solar Mini 4 kost $0,10 / $0,01 voor gecachte tokens / $0,40 per miljoen tokens, momenteel 50% korting tot 22 oktober 2026. MathForm 8B heeft geen tariefkaart; de kosten zijn de GPU die je eronder zet.

• Snelheid — 204 outputtokens per seconde voor Solar Mini 4 op de testomgeving van Artificial Analysis, met 88.300 outputtokens per indextaak en ongeveer 430 seconden werk per taak. De output van MathForm 8B is één Lean 4-theorema-header, hooguit een paar honderd tokens.

• Onafhankelijkheid van de cijfers — Solar Mini 4 is door een derde partij uitgevoerd. MathForm 8B niet: elk cijfer in de paper is van de auteurs zelf, en het model is te nieuw en te gespecialiseerd om een onafhankelijke run te hebben aangetrokken.

Waar de twee modellen samenkomen, en waar ze dat niet doen

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

De faalmodi zijn wat deze combinatie interessant maakt, want ze zijn elkaars exacte tegenpolen. Het zwakste gepubliceerde resultaat van Solar Mini 4 is Terminal-Bench 4.0 op 1%, met AutomationBench-AA op 22,3% — het is slecht in het verifiëren van zijn eigen werk in een omgeving die het feedback geeft. Het hele ontwerpprincipe van MathForm 8B is verificatie: OpenBMB maakt onderscheid tussen een syntaxiscontrole, die nagaat of het Lean 4-statement compileert, en een consistentiecontrole, die nagaat of het statement dat is gecompileerd daadwerkelijk hetzelfde betekent als het informele probleem. De klassieke fout die het beoogt te voorkomen, is een statement dat de typecontrole doorstaat terwijl het de bewering stilletjes verzwakt.

Dat is een echt onderscheid en het is de moeite waard om daar precies over te zijn. Een redeneermodel dat een bewijs produceert, heeft een bekend zelfverificatieprobleem: niets in de generatie vertelt je of het antwoord juist is. Een compiler doet dat wel. Als je workflow is "een probleembank omzetten in iets dat een machine kan controleren", dan doet MathForm 8B het halve werk dat Solar Mini 4 helemaal niet kan doen, en wat overblijft is geen kwestie van gradatie.

De leverancierscijfers, als zodanig aangeduid: de paper van OpenBMB rapporteert een gemiddelde Pass@8 van 88,06% onder Syntax Check en 72,37% onder Consistency Check over zes benchmarks, en beweert dat die verscheidene gespecialiseerde 32B-autoformaliseerders verslaan. Niets daarvan is door een derde partij gereproduceerd. De daling van 16 punten tussen de twee checks is het informatievere getal — het meet hoe vaak een gecompileerde statement niet precies het probleem is waar je naar vroeg, en het is de reden dat Consistency Check als aparte kolom bestaat.

Waarom een team beide zou draaien

Omdat de natuurlijke pipeline een goedkope fase met een hoog volume en een dure fase met een laag volume heeft. MathForm 8B draait op je eigen hardware en zet informele problemen om in Lean 4-headers, met een compiler beschikbaar om slechte output af te wijzen voordat een mens die ziet. Solar Mini 4 behandelt wat daaromheen gebeurt: het lezen van het ondersteunende artikel, het extraheren van de aannames, het samenvatten van het resultaat in het Koreaans of Engels, en het routeren van het werk. De twee concurreren nooit om hetzelfde verzoek, en de kleinere is degene die het deel van de taak bezit met een objectief slaag-/faalsignaal.

Geen van beide modellen is iets dat we naar je kunnen routeren — de modellen van Upstage staan niet op OrcaRouter en die van OpenBMB ook niet — dus als je Solar Mini 4 wilt, komt het van de eigen API van Upstage, en als je MathForm 8B wilt, komt het van Hugging Face en je eigen GPU. Wat we wel kunnen doen, is de rest van die pipeline achter één sleutel zetten: meer dan 200 modellen met 0% markup bovenop de lijstprijs van de provider, automatische failover tussen providers, en een routing-DSL waarmee je modellen aan elkaar kunt koppelen in één aanroep. In een workflow waarin een kleine specialist de formalisatiestap doet en een grote generalist al het overige doet, is de generalist kunnen veranderen door een modelstring aan te passen — in plaats van een nieuwe integratie uit te rollen — het verschil tussen een wijziging van twee weken en een middag.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Wat mee te nemen

Als je vraag is "welke van deze moet ik gebruiken", dan is het eerlijke antwoord dat het ervan afhangt of je een antwoord of een formalisering nodig hebt, en geen enkele benchmark zal daar uitsluitsel over geven. Als je vraag is "is MathForm 8B het downloaden waard", dan is het antwoord ja voor één nauw afgebakende taak en nee voor al het andere — het is een formaliseerder, geen bewijzer, en de bewijsverplichting blijft open in de uitvoer die het produceert. Als je vraag is "is Solar Mini 4 $0,36 per taak waard", dan is het antwoord ja voor lange documenten in grote hoeveelheden en nee voor alles wat vereist dat het zijn eigen werk controleert.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Bronvermelding, tot slot. Elk cijfer voor Solar Mini 4 hierboven is een onafhankelijke meting door Artificial Analysis, behalve het contextvenster, dat een eigen cijfer van Upstage is en afwijkt van dat van hen. Elk cijfer voor MathForm 8B is door de leverancier gerapporteerd uit arXiv 2608.14221 en niet gereproduceerd, en de release ervan was onaangekondigd — de gewichten, de FormalVerse-dataset en het paper verschenen allemaal op 14 augustus 2026, zonder blogpost van de leverancier en tot op heden zonder onafhankelijke benchmarkrun.