
Intern-Decision-0.8B vs MathForm 8B: En av dessa kan kontrollera sitt eget arbete
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 592 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Den mest användbara frågan du kan ställa om vilken liten specialiserad modell som helst är vem som kontrollerar den. Intern-Decision-0.8B och MathForm 8B finns båda därför att en allmän modell finjusterades till en smal, båda är Apache-2.0-derivat av Qwen-vikter, och båda lades upp på Hugging Face utan en marknadsföringskampanj — men de befinner sig på varsin sida om en gräns som avgör hur du skulle driftsätta dem. MathForm 8B är OpenBMB:s 8B-autoformaliseringsmodell, släppt den 14 augusti 2026, som översätter matematik på naturligt språk till Lean 4 och lämnar resultatet till en kompilator, som antingen accepterar det eller inte. Intern-Decision-0.8B är InternLM:s beslutshuvud med 852 985 920 parametrar, uppladdat den 26 september 2026, som returnerar en kalibrerad sannolikhetsfördelning över alternativ som du angav i förväg — och inget i världen verifierar oberoende om etiketten den returnerar är rätt. En av dessa modeller producerar utdata med ett bevis. Den andra producerar utdata med en konfidenspoäng, och skillnaden i vad du kan göra med dessa två saker är hela artikeln.
Den ramen förklarar också varför storleksgapet – 8B mot 0,8B, en faktor tio – är det minst intressanta talet i jämförelsen. Ingen av modellerna försöker vara bra på det den andra gör, och ingen av deras utvärderingar säger något om den andra. Det de har gemensamt är ett utgivningsmönster och ett Qwen-släktskap, och båda dessa spelar mindre roll än verifieringsfrågan.
Vad var och en faktiskt är
MathForm 8B är den släppta artefakten av ett tvåstegsrecept som beskrivs i artikeln MathForm: Skalning av matematisk autoformalisering med kunskapshämtning och verifieringsstyrd förfining (arXiv 2608.14221). En hämtningsplanerare hämtar relevanta definitioner och befintliga formaliseringar från Mathlib innan generatorn körs; genererade påståenden revideras sedan med hjälp av kompilatordiagnostik och återkoppling om semantisk konsistens; det resulterande korpuset, FormalVerse, innehåller ungefär 367 000 verifierade Lean 4-exempel; och MathForm 8B tränas på det genom övervakad finjustering följt av förstärkningsinlärning med Lean-kompilering och signaler om semantisk konsistens som belöning. Det är en modell som endast hanterar text, baserad på Qwen3-8B, som serveras via Transformers, vLLM eller SGLang med ett OpenAI-kompatibelt API, med en rekommenderad kontextlängd på 16 384 token och en maximal genereringsbudget på 16 384 token. Dess utvärderingspipeline, benchmarkfiler och Pass@k-skript finns alla i OpenBMB:s GitHub-repositorium, och träningsdatasetet är offentligt.
Intern-Decision-0.8B är den levererade artefakten av ett recept som ingen har beskrivit. Modellkortet säger att den är "en multimodal strukturerad beslutsmodell finjusterad från Qwen3.5-0.8B" och stannar där — ingen databeskrivning, ingen träningsprocedur, ingen artikel, inget kodförråd. Vad den däremot dokumenterar noggrant är inferenskontraktet. Den medföljande motorn mappar varje frågas alternativ till enkelttoken-symboler, renderar ett skelett med en <decision>-platshållare per fält, kör en kausal framåtpassning, läser logits vid positionen före varje platshållare, kör softmax över endast det fältets tillåtna symboler, tillämpar en anpassad kalibrering och mappar symboler tillbaka till dina alternativvärden. Det finns inget generate()-anrop och ingen sampling någonstans i vägen. Den accepterar text plus upp till åtta bilder, hanterar en till sexton frågor med upp till 62 alternativ vardera, och avvisar indata över 8 192 tokens i stället för att trunkera dem. Standardkalibreringstemperaturen är 2,747760550703, anpassad per checkpoint genom NLL-minimering över 1 728 fall.
Läs de två styckena sida vid sida, och asymmetrin är slående. MathForm 8B kommer med en artikel, en datauppsättning, en utvärderingspipeline och ett kodförråd. Intern-Decision-0.8B kommer med en API-beskrivning och en benchmarktabell.
Verifieringsasymmetrin, som är den egentliga historien
MathForm 8B:s utdata kan kontrolleras av något annat än en människa. Den producerar Lean 4, och Lean 4 kompilerar eller kompilerar inte. OpenBMB:s siffror rapporteras under två regimer av just denna anledning: Pass@8 på 88,06 % under Syntax Check, vilket innebär att utdata kompilerar, och 72,37 % under Consistency Check, vilket innebär att det kompilerar och att en semantisk konsistenskontroll instämmer i att det formella påståendet betyder vad det informella sa. Båda siffrorna är medelvärden över sex benchmarks, och artikeln rapporterar också CC-godkännandefrekvenser på 63 % för FATE-H och 37 % för de svårare FATE-X-delmängderna, med påståendet att detta överträffar specialiserade 32B-autoformaliserare. Dessa är rapporterade av leverantören – OpenBMB körde dem – men egenskapen som spelar roll är strukturell, inte statistisk: ett nedströms system som konsumerar MathForm 8B:s utdata kan avvisa en dålig formalisering utan att be en modell bedöma den. Kompilatorn är oraklet.
Intern-Decision-0.8B har ett typkontrakt och inget orakel. Utdatans form är garanterad – ett fält som deklarerats som choice returnerar en fördelning över de alternativvärden du listade, ett score returnerar ett sannolikhetsviktat förväntat värde över din bedömningsmall, ett noul returnerar en ja-sannolikhet. Inget utanför modellen kan tala om för dig huruvida argmax var korrekt. Konfidensvärdet är modellens egen uppskattning av sin egen korrekthet, och kortets kalibreringsarbete är ett ärligt försök att göra den uppskattningen meningsfull – en anpassad temperatur som bevarar argmax samtidigt som den skärper eller mjukar upp sannolikheterna, validerad på undanhållna fall – men ett välkalibrerat felaktigt svar är fortfarande ett felaktigt svar. Om din pipeline behöver veta huruvida en etikett är rätt, behöver du märkt data, och du behöver mäta det själv.
Det är inte en defekt som är unik för Intern-Decision-0.8B. Det är villkoret för varje klassificerare, och det är det olösta problemet inom hela kategorin beslutsmodeller som omfattar TypeSafe's Jev och Convai's Laya. Det är värt att säga tydligt, eftersom en benchmarktabell med en kolumn för Brier score kan ge intrycket att kalibrering är verifiering. Det är det inte. Kalibrering säger att när den här modellen säger 80 %, har den rätt ungefär 80 % av tiden över den utvärderade fördelningen – vilket är genuint användbart för att sätta trösklar och beräkna förväntat värde, och är inte en garanti för korrekthet per enskilt objekt.
Resultattavlan, på de rader som båda modellerna har
• Parametrar — Intern-Decision-0.8B: 852 985 920 fördelat över en språkdel på 1,50 GB, en visionsdel på 176 MB och en projektor på 25 MB. MathForm 8B: 8B dense, baserat på Qwen3-8B.
• Basmodell — Intern-Decision-0.8B: Qwen3.5-0.8B, släpptes i februari 2026. MathForm 8B: Qwen3-8B.
• Uppgift — Intern-Decision-0.8B: typade beslut över ett schema du skriver — val, poäng, binärt. MathForm 8B: matematik på naturligt språk till Lean 4-formalisering.
• Utdata — Intern-Decision-0.8B: kalibrerad fördelning plus argmax per fält, ingen text genererad. MathForm 8B: genererad Lean 4-källkod, vanligtvis lång.
• Verifiering — Intern-Decision-0.8B: ingen extern; konfidensen är självrapporterad. MathForm 8B: Lean 4-kompilatorn, plus en semantisk konsistenskontroll.
• Publicerad evidens — Intern-Decision-0.8B: en leverantörsbenchmarktabell över sju benchmarks, ej reproducerad, ingen artikel. MathForm 8B: en artikel, en offentlig datamängd med ungefär 367 000 exempel, en utvärderingspipeline och ett kodförråd, körda av leverantören.
• Licens — Båda är Apache 2.0, och Intern-Decision-0.8B innehåller dessutom den bevarade Qwen-licensfilen för sina uppströmsvikter.

Kostnad och latens är inte jämförbara, och det är inte en undanflykt.
InternLM uppmätte Intern-Decision-0.8B till 33,98 ms i genomsnitt och 37,50 ms p95 per fråga på ett enda RTX 4090 via den lokala Hugging Face-vägen, medan dess 2B-syskon noterade 33,28 ms i genomsnitt. MathForm 8B:s eget kort rekommenderar upp till 16 384 nya token per formalisering vid temperatur 0,6 och top_p 0,95. Dessa två mätningar är inte samma kvantitet. Den ena är en enda framåtpassning över en prompt; den andra är en autoregressiv generering som kan pågå i tusentals token. Att multiplicera en formaliseringsbudget mot ett beslut på 34 ms säger ingenting om relativ effektivitet, eftersom modellerna inte utför samma mängd arbete – den ena läser och poängsätter, den andra läser och skriver ett bevisskript. Om genomströmning är din begränsning är de relevanta fakta enklare än en kvot. MathForm 8B formaliserar ett påstående per generering, och vid 16K token per utdata på en 8B tät modell är det en GPU-saturerande arbetsbelastning och en kandidat för batchkörning via vLLM eller SGLang, vilka båda dokumenteras av OpenBMB. Intern-Decision-0.8B besvarar sexton frågor som täcker en hel post i en enda omgång, så arbetsenheten är en post snarare än ett fält, och postbudgeten är indatataket på 8 192 token – vilket nås snabbare än en läsare kanske förväntar sig när du packar in ett långt tillstånd, ett rikt schema och upp till åtta bilder.
Där var och en är rätt verktyg
MathForm 8B hör hemma i en pipeline vars flaskhals är mänsklig granskning av matematik. Autoformalisering finns eftersom det är långsammare att skriva Lean än att läsa det, och eftersom ett maskinkontrollerbart påstående är ett som en bevisassistent sedan kan angripa. Egenskapen som gör den tillförlitlig — kompilatorverifierad utdata — är också egenskapen som gör den snäv: den formaliserar, den bevisar inte, och modellkortet anger uttryckligen att kompileringskontroller kräver en körande Kimina Lean Server och att experimenten använde Lean 4.21.0. Den som väljer den väljer den stacken. Precis som med alla modeller med öppna vikter som är några dagar eller några veckor gamla är att rikta en testväg mot den och falla tillbaka på en beprövad modell när den stannar ett sätt att utvärdera den med låg risk, vilket är vad en gateway med automatisk failover över en reservkedja är till för — återförsök som inträffar innan svaret börjar, så att en stannad formalisering aldrig når din anropare.
Intern-Decision-0.8B hör hemma varhelst en sluten svarsuppsättning redan finns och kostnaden för att generera text för att återfå den är rent slöseri. Triage, routning, poängsättning enligt bedömningsmatris, bedömning av en post mot en skriven policy – de fall där en generativ modell används som ett dyrt sätt att välja från en lista. Dess fördelar är att den är deterministisk, att den returnerar en användbar sannolikhet i stället för en sträng du måste tolka, och att den vid 1,73 GB på disk körs bekvämt under minneskostnaden för en webbläsare på en bärbar dator. Dess nackdelar är att dokumentationen stannar vid API-ytan, att ingen utanför InternLM har publicerat ett resultat för den, och att den enda benchmarkkolumn som antyder ett säkerhetsproblem – en WildJailBreak-poäng på 64,48 mot Jevs 96,29 – är oförklarad. Sätt inte den framför adversariella indata utan att själv köra det testet.

Båda modellerna delar en härstamning värd att notera, eftersom det förändrar vad "öppen" ger dig. Vardera är en finjustering av en Qwen-checkpoint, och vardera bevarar uppströmslicensen korrekt: MathForm 8B under Apache 2.0 med Qwen3-8B-härkomsten angiven på kortet, Intern-Decision-0.8B under Apache 2.0 med en separat LICENSE-QWEN-fil i repositoriet. Ingen av dem har en intäktströskel eller en användningsområdesbegränsning – till skillnad från Liquid AI:s LFM Open License v1.0, som villkorar kommersiella rättigheter med att din enhet håller sig under en årlig intäktsgräns på 10 miljoner dollar. Om du bygger kommersiellt är det en skillnad som skiljer dessa två utgåvor från delar av ekosystemet för små modeller, och den gäller båda i lika hög grad.
Om du vill ha beslutsfattandelagret utan den odokumenterade kontrollpunkten
Klyftan mellan "ett beslutshuvud är rätt form för det här problemet" och "just detta beslutshuvud är ett du kan försvara inför en granskare" är vad ett hostat alternativ överbryggar. TypeSafe's Jev 1.13 är modellen som InternLM benchmarkade sin familj mot på Jevbench, på Typed Decision och på ToolACE, och den är anropbar idag via en enda OpenAI-kompatibel endpoint till $0,042 per miljon input-tokens med utdata debiterad till noll — leverantörens publicerade pris, förmedlat utan påslag i stället för uppskruvat på vägen. För en läsare som vill mäta om ett beslutshuvud hjälper alls innan man binder sig till en 0,8B-checkpoint med ett saknat repository, är det det billiga första experimentet, och Jevs egna tredjepartsutvärderingar ger den en dokumenterad meritlista som Intern-Decision-0.8B ännu inte har.

Det korta svaret
Dessa två är inte alternativ. MathForm 8B är en specialist vars utdata ett program kan verifiera, inriktad på en uppgift där verifieringen är den svåra delen, och den kommer med artikeln, datasetet och utvärderingsramverket för att styrka påståendet. Intern-Decision-0.8B är en specialist vars utdata bara du kan verifiera, inriktad på uppgifter där svaren redan var nedskrivna och den svåra delen var att nå dem snabbt och billigt, och den kommer med en inferensmodul och en tabell. Om du behöver en formalisering finns det bara en av dessa att överväga. Om du behöver en etikett och är beredd att bygga facit för att kontrollera den mot, är 0.8B den mer intressanta nedladdningen – snabb, deterministisk, Apache 2.0 och tillräckligt liten för att kostnaden för att ta reda på om den är något att ha är en eftermiddag snarare än en budgetpost.
