
AesCode-8B vs MathForm-8B: Båda är 8B-fintuningar vars utdata en maskin kan kontrollera
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 87 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
AesCode-8B och MathForm-8B släpptes inom åtta veckor från varandra, båda från kodförråd snarare än pressmeddelanden, och sammanträffandet är mer intressant än det först verkar. Båda utgår från en checkpoint ur Qwen3-familjen. Båda lägger hela sin träningsbudget på en smal utdataform. Och båda byggdes kring en kontrollmekanism: MathForm-8B tränas mot en Lean 4-kompilators utlåtande, och AesCode-8B poängsätts genom att varje kandidatsida renderas i en sandlådad webbläsare och att DOM:en, de beräknade stilarna och en skärmbild läses av. Ingen av dem är en chattbot och ingen av dem försöker bli en. Det som skiljer dem åt är vad en maskin kan verifiera och vad den inte kan – och, när det gäller den nyare av de två, vad som händer när halva poängen kommer från en domare som ingen har namngivit.
Publiceringsuppgifterna är inte symmetriska. MathForm-8B kom från OpenBMB och dess modellkort daterar utgivningen till 2026-08-14; den bygger på Qwen3-8B och tränades på FormalVerse, ett korpus med ungefär 367 000 verifierade Lean 4-exempel, med övervakad finjustering följd av förstärkningsinlärning som använder Lean-kompilering och kontroller av semantisk konsekvens som belöningssignal. AesCode-8B har inget utgivningsdatum någonstans i sina filer. Microsoft skapade Hugging Face-repositoriet den 2026-09-29, committade vikterna kl. 03:35 UTC den 2026-10-07 med meddelandet "Release AesCode-8B" och publicerade träningskoden på GitHub den 2026-10-08. Ingen annonsering åtföljde någon av händelserna, modellkortets citering lyder "Under review, 2027", och repositoriet visade två nedladdningar vid tidpunkten för detta skrivande. Den är finjusterad från Qwen3-VL-8B-Instruct, vilket är värt att notera just eftersom den inte har samma förfader som MathForm-8B:s.
Härkomsten förklarar större delen av uppdelningen
Qwen3-8B och Qwen3-VL-8B-Instruct delar en generation och ett familjenamn men inte en uppgift. Qwen3-8B är en textbaserad generalist: ungefär 8,2 miljarder totala parametrar, varav cirka 7 miljarder icke-embedding, grouped-query-attention, en inbyggd kontext på 32K tokens som kan utökas till 131K via YaRN, och träning över 119 språk och dialekter. Qwen3-VL-8B-Instruct är det vision-språkliga syskonet, och det är den checkpoint som AesCode-8B utgår från — den publicerade AesCode-konfigurationen är ett direkt Qwen3-VL-recept med 36 dolda lager, hidden size 4 096, 32 attention heads med 8 key-value heads och en vokabulär på 151 936 tokens.
Den förgreningen avgör indatasidan för båda specialisterna innan någon av dem tränades. MathForm-8B tar emot text och avger text i en formell syntax. AesCode-8B tar emot text plus en valfri referensbild och avger ett dokument.
• Base — MathForm-8B: Qwen3-8B, endast text. AesCode-8B: Qwen3-VL-8B-Instruct, bild och text som indata.
• Parametrar — MathForm-8B: cirka 8,2B. AesCode-8B: cirka 8,8B i bf16 över fyra shards, vilket Hugging Face avrundar till 9B.
• Träningsdata — MathForm-8B: FormalVerse, ungefär 367 000 verifierade Lean 4-exempel. AesCode-8B: 3 000 cold-start-demonstrationer, sedan GDPO-förstärkningsinlärning över 7 408 promptar under 400 steg.
• Vad kontrollerar utdata — MathForm-8B: en Lean 4-kompilator, samt en semantisk konsistenskontroll mot det ursprungliga problemet. AesCode-8B: en sandlådad Playwright-rendering med sex deterministiska verifierare och en modellpoängsatt bedömningsmall.
• Licens – båda Apache 2.0, båda utan åtkomstkrav, båda ärver från Qwen3-familjens stomme.
• Hostas var som helst — ingendera, så vitt vi kan se.
Två olika betydelser av "verifierbar"
Det här är en distinktion som det är värt att ta sig tid med, för "machine-checkable" används om båda och betyder inte samma sak.
MathForm-8B:s granskare är en bevisassistent. Lean 4 antingen accepterar ett påstående eller inte, och utslaget är inte en åsiktsfråga, en bedömningsmall eller en domares smak. Träningsloopen är inriktad mot den signalen: SFT-stadiet på FormalVerse lär ut mappningen från ett informellt problem till en formell teoremformulering med en imports-header och ett namngivet teorem, och RL-stadiet skärper den med hjälp av kompilering plus en konsistenskontroll som undersöker om formaliseringen fortfarande säger vad det ursprungliga problemet sa. Kompilering är binär och reproducerbar av vem som helst med samma Lean-version. Konsistenskontroll är den mjukare halvan, och det är den halva där de rapporterade siffrorna blir svaga — vilket är precis vad de publicerade resultaten visar.
AesCode-8B:s kontrollfunktion är en renderare. Kandidater renderas i en sandlådad Playwright-webbläsare med externa förfrågningar blockerade, och testramverket läser av DOM:en, beräknade stilar, avgränsningsrutor, konsolstatus och en skärmbild. Sex deterministiska kanaler poängsätter det som går att tolka — exekvering, exakt text, gränsbeteende, tabell- och diagramdata, semantisk layout, vitrymd — och en sjunde, Visual Graph Rubric, poängsätter geometri och placering genom grafbundna ja/nej-frågor. Tabeller måste vara riktiga HTML-tabeller och diagram måste vara ECharts-specifikationer, vilket är en begränsning som gör verklig nytta: den tvingar utdata till en form som en verifierare kan tolka. Den deterministiska halvan är genuint reproducerbar. Den visuella halvan bedöms av en vision-språkmodell vars identitet dokumentationen inte namnger, vilket innebär att ingen utanför labbet kan reproducera den.
Så den ärliga jämförelsen är inte "den ena är verifierad och den andra inte." Det är att MathForm-8B:s primära signal är en kompilator och dess sekundära signal är en konsistenskontroll, medan AesCode-8B:s primära signal är en uppsättning deterministiska DOM-assertioner och dess sekundära signal är en modells åsikt, paketerat i samma övergripande poäng.

Vad var och en rapporterar, och vad det är värt
MathForm-8B rapporterar ett genomsnittligt Pass@8 på 88,06 % under syntaxkontrollen och 72,37 % under konsistenskontrollen över sex benchmarks. Spridningen mellan benchmarks är den intressanta delen: 95,06 % konsistens på FormalIMATH och 94,83 % på ProverBench, sedan 63 % på FATE-H och 37 % på FATE-X. De två sista är de svåra, realistiska påståendena, och fallet från mitten av 90-procentsnivån till mitten av 30-procentsnivån är förmågans ärliga form. Alla dessa siffror är rapporterade av leverantören och inte reproducerade, och benchmarkblandningen är viktad mot de enklare uppsättningarna.
AesCode-8B rapporterar 82,94 totalt på Microsofts bedömningsmatris för infografik med 300 prover – Text 94,06, Gräns 88,36, Diagram 87,79, Regel 90,07, Innehåll 86,41, Layout 87,80, Stil 53,21, Visuell 75,80 – med tre genereringar per prompt och utan selektion. Microsoft rapporterar också att den slår referenskonditionerad GPT-5.5, som får 81,28, och Claude Opus 4.8, som får 80,39, enligt samma bedömningsmatris, att ett allvarligt canvas-överflödesfel återkommer i 4,3 % av de 300 proverna, och att 22,4 visuella poäng skiljer 32B-kompanjonen från dess egen backbone. Varje siffra är leverantörens, på leverantörens uppgift, poängsatt mot kanaler som leverantören har utformat.
De två uppsättningarna siffror kan inte alls jämföras med varandra. Det finns ingen gemensam uppgift, inget gemensamt mått och ingen gemensam bedömare. Att ställa 88,06 % bredvid 82,94 skulle innebära att jämföra en godkännandegrad för Lean-formalisering med en övergripande poäng för en infografik, och ingen av modellerna har någonsin utvärderats på det den andra gör.
En asymmetri är värd att nämna eftersom den talar emot den nyare modellen. MathForm-8B:s huvudmetrik har en inbyggd extern granskare: vem som helst kan installera Lean, ladda samma benchmarkar och kontrollera om påståendena kompilerar. AesCode-8B:s huvudmetrik har inte det — de deterministiska verifierarna skulle kunna köras igen av en beslutsam utomstående, men den visuella halvan av poängen beror på en domare som artikeln inte har identifierat. En icke-reproducerad kompilatorgodkännandefrekvens är ett svagare påstående än en benchmarktabell, och fortfarande ett starkare än en icke-reproducerad rubrikpoäng med en anonym bedömare i sig.
Att köra dem är en annan fråga än endera poängen
Båda är beslut om egen hosting i dag. MathForm-8B är den billigare av de två med stor marginal: en ungefär 8,2B text-only-checkpoint med en genereringsbudget på omkring 16K tokens Lean-utdata, som kvantiseras ned till ett enda mellanklasskort. AesCode-8B är en 8,8B visionsspråkmodell vars serveringsväg hanterar både bilder och text; kortets eget kommando är vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, och 17,5 GB bf16-vikter plus en KV-cache för 24 576 tokens och två bilder innebär att ett 24 GB-kort är tight och att 40-48 GB är den realistiska lägstanivån. Räkna även med en renderingsstack om du vill poängsätta dina egna utdata, för det är så varje kvalitetspåstående om modellen gjordes.
Den större dolda kostnaden är att båda modellerna är specialister som du skulle införa permanent. Ett team som behöver formalisering och dokumentgenerering kör nu två 8B-serveringsvägar, två uppsättningar promptformat, två felprofiler, och ingen av modellerna kan absorbera den andras arbete. Det är fallet som ett routinglager finns till för: behåll specialisterna där ekonomin och datahanteringen motiverar att äga en GPU, och skicka den allmänna trafiken till något som hostas bakom samma endpoint. Konkret är generalistsyskonen till dessa två baser anropbara — Qwen3-VL-8B-Instruct för 0,18 USD per miljon indata och 0,70 USD per miljon utdata över en kontext på 131 072 token, tillsammans med Qwen 3.8-familjen och andra öppna checkpoints — allt via OrcaRouters enda API som täcker över 200 modeller, med leverantörernas listpris vidarebefordrat med 0 % påslag och automatiskt failover mellan leverantörer. Ingen av specialisterna är routbar här eller någon annanstans vi kan hitta; det som är routbart är generalisten du faller tillbaka på när det smala jobbet är klart, vilket är skillnaden mellan att testa en forskningscheckpoint och att göra den till ett bärande beroende.

Att välja mellan dem, om du verkligen måste
Välj MathForm-8B när artefakten måste kompilera. Omvandling av problembank, formella korpusar för en bevisare, förformatering av påståenden för Lean-baserade verktyg – det är hela arbetsbeskrivningen, och det är den enda av de två som tränades för det. Ta FATE-siffrorna på allvar när du planerar omfattningen: på de svåraste realistiska påståendena blir ungefär en tredjedel konsekventa, och du kommer ändå att behöva bygga ett steg för mänsklig granskning.
Välj AesCode-8B när artefakten måste renderas. En brief går in, ett redigerbart HTML-dokument kommer ut, tabeller är tabeller och diagram är diagramspecifikationer, och hela saken går att diffa i Git. Acceptera Stiltaket — 53,21, en dimension som definieras som att den inte kräver ytterligare visuell revidering före leverans — som det ärliga måttet på hur mycket redigering som återstår, och acceptera att kontexten på 24 576 token bara har validerats på enskilda infografiska sidor och inte på de presentationsdeck med flera slides som folk faktiskt vill ha.
Det val som de flesta team faktiskt kommer att ställas inför är dock inget av dessa. Det är huruvida en av dessa smala specialister överhuvudtaget är värd att driftsätta, eller huruvida generalisten bakom den, anropad via ett API, är tillräckligt nära för den volym du har. Det är en eftermiddag av prompttestning snarare än ett GPU-köp, och båda modellkortens egna siffror ger dig anledningen att köra det: MathForm-8B:s hard-set-konsistens ligger på 37 %, och AesCode-8B:s Style-poäng ligger på 53 %, så ingen av dem är en modell som du skulle sätta i en pipeline utan övervakning.

Vad båda utgåvorna berättar för dig om hur modeller levereras nu
Två 8B-fintunade modeller, med åtta veckors mellanrum, från två olika labb, släppta utan tillkännagivande, utan produktsida och utan oberoende utvärdering, båda uppbyggda kring en verifieringsloop, båda under Apache 2.0, och ingen av dem serveras av någon. Det mönstret är historien mer än vad någon av modellerna är. Forskningsmetoden har flyttat in i belöningsfunktionen — OpenBMB:s kompilatorsignal, Microsofts frikopplade tvärmodala kanaler — och de publicerade artefakterna har blivit träningsreceptet plus vikterna, med artikeln som kommer senare, om den alls kommer.
Vad det innebär för den som läser en jämförelse som den här är att leverantörens egna siffror är allt man får ett tag, och den användbara frågan är inte hur höga de är utan hur kontrollerbara de är. AesCode-8B:s overflow-frekvens och dess Style-tak är kontrollerbara påståenden förklädda till misslyckanden. MathForm-8B:s FATE-X-konsistensvärde är samma sak. Det är de siffrorna man ska läsa, och dem man ska gå tillbaka och köra om själv så snart kontrollverktygen är reproducerbara från början till slut.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
