Ett genererat titelkort med rubriken "AesCode-8B vs Gemma 4 12B" och två rundade kort sida vid sida. Det vänstra kortet AesCode-8B har en ikon föreställande ett webbläsarfönster och raderna "Microsoft-forskningscheckpoint" och "Avger en renderad HTML-sida"; det högra kortet Gemma 4 12B har en ikon med ett förstoringsglas över ett dokument och raderna "Google DeepMind, lanserades 2026-06-03" och "Svarar på frågor om bilder". En avdelare mellan dem lyder "en renderar, en svarar" och en bildtextremsa längst upp lyder "icke annonserat släpp – endast vikter, ingen hostad slutpunkt". OrcaRouter-logotypen är komponerad nere till höger.
Guides & Insights

AesCode-8B vs Gemma 4 12B: Två små visionsmodeller, två helt olika utdata

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

AesCode-8B och Gemma 4 12Bbåda tar en bild och en mening och båda är Apache-2.0-checkpoints som du laddar ner i stället för att hyra, vilket är anledningen till att sökmotorer gladeligen ställer dem sida vid sida. Likheten är verklig och den är också ytlig. Gemma 4 12B returnerar ett svar – en beskrivning, en transkription, ett kodavsnitt, ett resonemangsspår. AesCode-8B returnerar en renderad sida: en slajd, en affisch eller en instrumentpanel som ett komplett HTML- och CSS-dokument som du kan öppna i en webbläsare och redigera för hand. Samma indataform, samma ungefärliga viktklass, och en utdata som nästan inte har något gemensamt med den andra. Den enda skillnaden avgör nästan varje praktisk fråga nedan, inklusive vilken du kan sätta framför en användare i morgon.

Värt att säga redan från början, eftersom det påverkar hur mycket tyngd siffrorna kan bära: Gemma 4 12B lanserades av DeepMind den 3 juni 2026 med ett modellkort, dokumentation och ett ekosystem, och det har sedan dess testats oberoende. AesCode-8B lanserades inte alls. Microsofts repository för den skapades den 29 september 2026 och vikterna landade i en commit med titeln "Release AesCode-8B" kl. 03:35 UTC den 7 oktober 2026, med tränings- och utvärderingskoden som dök upp på GitHub dagen därpå. Det finns inget inlägg från Microsoft Research, ingen produktsida, ingen versionsinformation och ingen preprint — modellkortets citering lyder "Under review" med platshållaråret 2027. I skrivande stund visar 8B-repositoriet två nedladdningar och en gillamarkering. Allt kvantitativt om AesCode-8B är därför Microsofts eget, och ingenting har reproducerats av någon annan.

De två modellerna, på sina egna villkor

Gemma 4 12B är en medelstor öppen modell, en dense checkpoint med 11,95 miljarder parametrar vars definierande designval är att den inte har någon separat bild- eller ljudkodare: bildpatchar och ljudvågformer går rakt in i transformatorn. Den har en kontext på 256K tokens och behöver cirka 16 GB VRAM, med BF16-vikter på omkring 27 GB och kvantiserade versioner under 7 GB. Tillverkarens eget kort – rapporterat av tillverkaren och märkt som sådant här – listar DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 och LiveCodeBench v6 72,0 i tänkandeläge. Oberoende utvärdering är den del som betyder mer: Artificial Analysis ger resonemangskonfigurationen ett Intelligence Index på 14, uppmäter ungefär 114 tokens per sekund och prissätter ett typiskt serverat anrop till nära 0,10 USD per miljon inputtokens och 0,30 USD per miljon outputtokens. Den har tre och en halv månads driftsättning bakom sig.

AesCode-8B är en finjustering av Qwen3-VL-8B-Instruct, publicerad med fyra safetensors-shards som totalt uppgår till 17 543 339 408 byte – omkring 8,8 miljarder bf16-parametrar, vilket är anledningen till att Hugging Faces avrundade storleksfält anger 9B medan leverantören säger 8B. Den publicerade konfigurationen är ett renodlat Qwen3-VL-recept: 36 dolda lager, dold storlek 4 096, 32 uppmärksamhetshuvuden med 8 nyckel-värde-huvuden, en vokabulär på 151 936 token och ett krav på transformers 4.57 eller nyare. Microsofts rapporterade körningar använde en kontext på 24 576 token med upp till 12 000 utdatatoken, temperatur 0,8, top-p 0,95 och tre genereringar per prompt utan urval. Licensen är Apache 2.0, utan gating, inget tillägg för godtagbar användning. Det som inte finns i paketet är tränings- och utvärderingsdata, samt någon hostad endpoint – vi kunde inte hitta AesCode-8B serverad någonstans, och den finns inte i vår egen katalog.

Vad modellerna faktiskt tränades att göra

Designbriefen citeras i modellkortet och är värd att läsas som hela tesen: kodmodeller ”kan inte se hur layout, hierarki och färg samspelar på duken”, medan bildgeneratorer ”skapar visuellt övertygande sidor men återger ofta text, siffror och logiska relationer fel”. AesCode är försöket att behålla både kompositionssinnet och verifierbarheten samtidigt.

Mekanismen är ovanlig på ett specifikt sätt. Varje träningsprompt paras ihop med en referensbild som genererats från samma prompt, vilken tillhandahåller layout och stil medan textprompten förblir auktoriteten för innehållet. Sedan, vid inferens, behöver modellen knappt bilden: undanhåll referensen för AesCode-8B och dess Visual-poäng sjunker 1,00 poäng av hundra. Undanhåll den för Qwen3-VL-8B-Instruct och tappet är 19,55. Undanhåll den för GPT-5.5, utvärderad i samma testramverk, och det är 10,04. Den visuella priorn hamnade i vikterna snarare än i indata, och det är det egentliga forskningsresultatet bakom rubriken.

Träningsmålet för Gemma 4 12B är det vanliga multimodala målet, och det är ingen kritik att säga det: läsa bilden, svara på frågan, följa instruktionen, anropa verktyget. Inget i dess modellkort tyder på att den någonsin har varit inriktad på att producera en renderad artefakt, och ingen publicerad utvärdering av Gemma 4 12B mäter dokumentlayoutkvalitet, canvas-överskridning eller designkonsekvens, eftersom de inte är modellens metriker.

Resultattavlan, och vems bedömningsmatris det är

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• Parametrar — AesCode-8B: 8,8B bf16, dense. Gemma 4 12B: 11,95B dense.

• Indata — AesCode-8B: text plus en valfri referensbild. Gemma 4 12B: text, bild, ljud och video.

• Utdata — AesCode-8B: ett komplett HTML- och CSS-dokument. Gemma 4 12B: text, inklusive verktygsanrop.

• Kontext — AesCode-8B: 24 576 tokens i den rapporterade konfigurationen. Gemma 4 12B: 256K tokens.

• Licens — båda Apache 2.0, utan åtkomstbegränsning, vikter ingår.

• Bevis — AesCode-8B: Microsofts egen bedömningsmall för infografik med 300 stickprov, tre genereringar per prompt, ingen oberoende reproduktion. Gemma 4 12B: ett leverantörskort plus ett oberoende Intelligence Index på 14 och uppmätt genomströmning på Artificial Analysis.

Nu till den del som resultattavlan inte kan förmedla. Microsoft rapporterar AesCode-8B på 82,94 Overall i den där 300-exempeluppsättningen, före referenskonditionerade GPT-5.5 på 81,28 och Claude Opus 4.8 på 80,39, och 31,1 Visual-poäng före sin egen Qwen3-VL-8B-stomme. Läs allt som leverantörsrapporterat och icke-reproducerat, enligt en bedömningsmall som leverantören byggt, på urval som leverantören valt, poängsatt av en testrigg som leverantören tränat modellen mot. Kortet är ärligt nog att publicera en dimension som ingen modell i jämförelsen klarar 60 på — Style, där AesCode-8B ligger på 53,21 och GPT-5.5 leder på 57,91 — och Microsofts egen definition av den dimensionen är design som inte kräver ytterligare visuell revidering före leverans. På den enda axeln som frågar om en människa skulle leverera sidan oredigerad, är 8B-modellen inte ledaren. Det är siffran att hålla fast vid när någon citerar 82,94.

Där de genuint överlappar

Det finns exakt en gemensam hylla, och den är smalare än den ser ut. Om du utvärderar små öppna visionsmodeller för en dokumenttung pipeline är båda kandidater – den ena för att läsa ett dokument, den andra för att producera ett. Ett team som genererar interna instrumentpaneler som HTML och även behöver extrahera figurer ur uppladdade PDF-filer kommer i kontakt med båda produkterna under samma vecka.

Uppdelningen i den överlappningen är ren. Gemma 4 12B är modellen du riktar mot ett inkommande dokument. AesCode-8B är modellen du riktar mot en brief när leveransen är en sida. Ingen av dem ersätter den andra, och en pipeline som vill ha båda är en pipeline med två modeller snarare än ett val.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

Driftsättning, vilket är där asymmetrin faktiskt biter

Gemma 4 12B:s serving-historia är färdig. Du laddar ner den, kvantiserar den om du vill, kör den på 16 GB VRAM, och det finns en stor bas av verktyg som redan gör detta. Om du hellre inte vill köra den alls, är ett serverat anrop billigt och oberoende prissatt.

AesCode-8B:s servinghistoria är en kommandorad och lite aritmetik. Modellkortet ger vägen direkt — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, med transformers 4.57 eller nyare för den icke-vLLM-baserade vägen. 17,5 GB bf16-vikter måste ligga sida vid sida med en KV-cache för 24 576 token och upp till två bilder, så ett enda 24 GB-kort är tekniskt sett tillräckligt och obehagligt snävt; 40–48 GB, eller två 24 GB-kort, är den realistiska lägstanivån. Budgetera även för en renderingsmotor, eftersom varje kvalitetsanspråk om den här modellen görs genom att rendera dess HTML-utdata i en sandlådad webbläsare, så att poängsätta dina egna resultat innebär att sätta upp något Playwright-liknande med externa förfrågningar blockerade.

Sedan har vi det ärliga läget när det gäller tillgänglighet. Vi routar inte AesCode-8B, och det gör inte heller någon annan, så vitt vi kan hitta; en utvärdering i dag innebär vikter på din egen hårdvara. Det närmaste som går att anropa är den arkitektur som modellen finjusterades från. Qwen3-VL-8B-Instruct är routbar via OrcaRouter nu för 0,18 USD per miljon indatatoken och 0,70 USD per miljon utdatatoken med en kontext på 131 072 token, och de två checkpoints vi faktiskt har prissätts på samma sätt – Gemma 4 26B-A4B för 0,06 och 0,33 USD, Gemma 4 31B för 0,13 och 0,38 USD. Leverantörens listpris förs vidare utan påslag, och redundansväxling mellan leverantörer sker automatiskt, så det billiga sättet att ta reda på om dina prompter ens renderas väl är att först testa den icke-finjusterade basmodellen och lägga GPU-veckan bara på de prompter som klarar sig.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

Vilken av dem du faktiskt vill ha

Välj AesCode-8B om leverabeln är en sida. Modellen genererar strukturerad, redigerbar HTML – tabeller som HTML-tabeller, diagram som ECharts-specifikationer – vilket innebär att utdata diffar i Git och kan stilas om av en designer utan att genereras om. Acceptera avvägningen: en oannonserad forskningscheckpoint med ett tvåsiffrigt antal nedladdningar, ingen oberoende utvärdering, ingen hostad slutpunkt, en 24K-kontext som endast har validerats på enskilda infografiska sidor, och en språktagg för enbart engelska på kortet.

Välj Gemma 4 12B för allt annat. Den läser dokument bättre än de flesta modeller av sin dubbla storlek, den hanterar ljud, den följer verktygsinstruktioner, den har en kvarts miljon tokens i kontext, och den har tre och en halv månads erfarenhet från andra människor bakom sig. Om du väljer en av dessa två som din lilla visionsmodell, och du inte specifikt har blivit ombedd att skapa bildspel som kod, är detta svaret.

Och om det ärliga kravet är båda, behandla det inte som ett tiebreak. Dirigera läsningsarbetet till en hostad modell och behåll renderingsarbetet på vilken maskin som helst som kan hålla vikterna.

Vad skulle ändra den här sidan

Tre signaler. En oberoende reproduktion av 82,94 och referensnedgången på 1,00 punkt skulle flytta AesCode-8B från ett leverantörspåstående till ett resultat, och skulle göra storleksfrågan 8B kontra 12B genuint intressant i stället för bara nominellt intressant. Om en inferensleverantör plockade upp checkpointen skulle det få driftsättningskolumnen att kollapsa, som för närvarande utgör hela den praktiska skillnaden. Och artikeln som Microsoft citerar som under granskning – ”AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards” – skulle besvara de frågor som modellkortet inte kan, med början i hur den visuella rubricen beter sig när själva designgrafen är fel. Tills en av dessa blir verklighet är den försvarbara tolkningen snäv och reell: AesCode-8B är mycket bra på de delar av visuell design som en maskin kan kontrollera, medelmåttig på den del den inte kan, och Gemma 4 12B är en färdig produkt som gör ett annat jobb.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen