Ett genererat hjältetitelkort med texten "Solar Mini 4 vs MathForm 8B", underrubriken "Den ena svarar på frågan, den andra gör den kontrollerbar" och två märken med texten "En generalist mot en autoformaliserare" och "Lean 4-kompilering i loopen".
Guides & Insights

Solar Mini 4 vs MathForm 8B: En modell besvarar frågan, den andra gör den kontrollerbar

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ Solar Mini 4 bredvid MathForm 8B och du jämför två modeller som inte konkurrerar om samma token. Solar Mini 4 är Upstages sparse mixture-of-experts med 35 miljarder parametrar, släppt den 22 september 2026 med ungefär 3 miljarder aktiva parametrar per token, och den besvarar frågor: läser ett långt dokument, resonerar över det och returnerar ett skriftligt resultat. MathForm 8B är OpenBMB:s autoformaliserare med 8 miljarder parametrar, publicerad den 14 augusti 2026 under Apache 2.0, och den gör något som ingen resonemangsmodell gör alls – den tar ett matematiskt påstående i naturligt språk och skriver om det som ett Lean 4-teorem som en bevisassistents kompilator kommer att typkontrollera. Den ena producerar svar. Den andra producerar maskinkontrollerbara frågor, och den senare är den sällsyntare varan.

Jämförelsen är ändå värd att göra, eftersom båda hamnar i samma typ av pipeline och eftersom de två har motsatta styrkor på ett sätt som gör valet ovanligt enkelt. Upstages modell är stark på långa dokument, svag på svåra resonemang och dyr per slutförd uppgift. OpenBMB:s modell är smal till den grad att den är oanvändbar utanför sin nisch, har aldrig någonsin poängsatts av en oberoende utvärderare och kostar inget att köra när du väl har en GPU.

Sida vid sida, om det som skiljer sig

• Vad det är — Solar Mini 4 är en generell resonemangsmodell med 1M-tokens kontextfönster (512K enligt Upstages egen dokumentation) och uppmätta 24,1 på Artificial Analysis Intelligence Index. MathForm 8B är en autoformaliserare för en enda uppgift utan publicerad indexpoäng, utan oberoende utvärdering och utan anspråk på generell förmåga.

• Parametrar — 35B totalt / 3B aktiva, gles, för Solar Mini 4; 8,19B tät för MathForm 8B, finjusterad från Qwen3-8B på OpenBMB:s FormalVerse-korpus med ungefär 367 000 verifierade Lean 4-exempel.

• Licens och leverans — Solar Mini 4 är proprietärt och nås via Upstages API och tredjepartsplattformar. MathForm 8B är Apache-2.0-vikter med en chattmall, fyra safetensors-shards och en distributionsväg via Transformers, vLLM eller SGLang bakom en OpenAI-kompatibel slutpunkt.

• Pris — Solar Mini 4 för $0.10 / $0.01 cachat / $0.40 per miljon tokens, för närvarande 50 % rabatt till och med den 22 oktober 2026. MathForm 8B har ingen prislista; dess kostnad är den GPU du sätter under den.

• Hastighet — 204 utdatatoken per sekund för Solar Mini 4 i Artificial Analysiss testramverk, med 88 300 utdatatoken per indextask och omkring 430 sekunders arbete per task. MathForm 8B:s utdata är ett enda Lean 4-teoremhuvud, högst några hundra token.

• Siffrornas oberoende — Solar Mini 4 har körts av en tredje part. MathForm 8B har inte det: varje siffra i dess artikel är författarnas egna, och modellen är för ny och för specialiserad för att ha lockat till sig en oberoende körning.

Där de två modellerna möts, och där de inte gör det

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

Det är fellägena som gör den här kombinationen intressant, för de är varandras exakta motsatser. Solar Mini 4:s svagaste publicerade resultat är Terminal-Bench 4.0 på 1 %, med AutomationBench-AA på 22,3 % – den är dålig på att verifiera sitt eget arbete i en miljö som ger den återkoppling. Hela designpremissen för MathForm 8B är verifiering: OpenBMB skiljer mellan en Syntax Check, som undersöker om Lean 4-påståendet kompilerar, och en Consistency Check, som undersöker om påståendet som den kompilerade faktiskt betyder samma sak som det informella problemet. Det klassiska fel som den är till för att förhindra är ett påstående som klarar typkontroll men samtidigt i tysthet försvagar själva hävdandet.

Det är en verklig distinktion, och det är värt att vara precis om den. En resonemangsmodell som producerar ett bevis har ett välkänt självverifieringsproblem: ingenting i genereringen säger dig huruvida svaret är rätt. Det gör en kompilator. Om ditt arbetsflöde är att ”omvandla en problembank till något som en maskin kan kontrollera”, gör MathForm 8B halvan av jobbet som Solar Mini 4 inte alls kan göra, och resterna är inte en fråga om grad.

Leverantörens siffror, märkta som sådana: OpenBMB:s artikel rapporterar ett genomsnittligt Pass@8 på 88,06 % under Syntax Check och 72,37 % under Consistency Check över sex benchmarks, och hävdar att dessa slår flera specialiserade 32B-autoformaliserare. Inget av detta har reproducerats av en tredje part. Tappet på 16 punkter mellan de två kontrollerna är den mer informativa siffran – den mäter hur ofta ett kompilerat påstående inte riktigt är det problem du frågade om, och det är anledningen till att Consistency Check finns som en separat kolumn.

Varför ett team skulle köra båda

Därför att den naturliga pipelinen har ett billigt steg med hög volym och ett dyrt steg med låg volym. MathForm 8B körs på din egen hårdvara och omvandlar informella problem till Lean 4-headers, med en kompilator tillgänglig för att avvisa dålig output innan en människa ser den. Solar Mini 4 hanterar det som sker runtomkring: att läsa stödartikeln, extrahera antagandena, sammanfatta resultatet på koreanska eller engelska och dirigera arbetet. De två konkurrerar aldrig om samma förfrågan, och den mindre är den som äger den del av jobbet som har en objektiv signal för godkänt/underkänt.

Ingen av modellerna är något som vi kan routa till dig – Upstages modeller finns inte på OrcaRouter och inte heller OpenBMB:s – så om du vill ha Solar Mini 4 kommer den från Upstages eget API, och om du vill ha MathForm 8B kommer den från Hugging Face och din egen GPU. Vad vi kan göra är att lägga resten av den där pipelinen bakom en enda nyckel: fler än 200 modeller med 0 % påslag utöver leverantörens listpris, automatisk failover mellan leverantörer och ett routing-DSL som låter dig kedja modeller till ett enda anrop. I ett arbetsflöde där en liten specialist gör formaliseringssteget och en stor generalist gör allt runtomkring, är möjligheten att byta generalist genom att redigera en modellsträng – i stället för att leverera en ny integration – skillnaden mellan en tvåveckorsförändring och en eftermiddag.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Vad du bör ta med dig

Om din fråga är "vilken av dessa ska jag använda", är det ärliga svaret att det beror på om du behöver ett svar eller en formalisering, och ingen benchmark kommer att avgöra det. Om din fråga är "är MathForm 8B värd nedladdningen", är svaret ja för ett smalt jobb och nej för allt annat – den är en formaliserare, inte en bevisare, och bevisskyldigheten förblir öppen i resultatet den producerar. Om din fråga är "är Solar Mini 4 värd $0,36 per uppgift", är svaret ja för långa dokument i hög volym och nej för allt som kräver att den kontrollerar sitt eget arbete.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Källor, avslutningsvis. Varje siffra för Solar Mini 4 ovan är en oberoende mätning av Artificial Analysis, förutom kontextfönstret, som är Upstages egen siffra och inte stämmer med deras. Varje siffra för MathForm 8B är leverantörsrapporterad från arXiv 2608.14221 och inte reproducerad, och dess lansering var oannonserad – vikterna, datasetet FormalVerse och artikeln dök alla upp den 14 augusti 2026, utan något blogginlägg från leverantören och utan någon oberoende benchmarkkörning hittills.