
AesCode-8B vs. Gemma 4 12B: Zwei kleine Vision-Modelle, zwei völlig unterschiedliche Ergebnisse
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 87 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
AesCode-8B und Gemma 4 12B nehmen beide ein Bild und einen Satz entgegen, und beide sind Apache-2.0-Checkpoints, die man herunterlädt, statt sie zu mieten – weshalb Suchmaschinen sie bereitwillig nebeneinanderstellen. Die Ähnlichkeit ist real, und sie ist zugleich oberflächlich. Gemma 4 12B liefert eine Antwort zurück – eine Beschreibung, eine Transkription, ein Code-Schnipsel, eine Gedankenkette. AesCode-8B liefert eine gerenderte Seite zurück: eine Folie, ein Poster oder ein Dashboard als vollständiges HTML- und CSS-Dokument, das man im Browser öffnen und von Hand bearbeiten kann. Gleiche Eingabeform, ungefähr dieselbe Gewichtsklasse, und eine Ausgabe, die so gut wie nichts mit der anderen gemeinsam hat. Dieser eine Unterschied entscheidet nahezu jede praktische Frage weiter unten, einschließlich der, welche man morgen einem Nutzer vorlegen kann.
Das sollte man vorab sagen, denn es bestimmt, wie viel Gewicht die Zahlen tragen können: Gemma 4 12B wurde von DeepMind am 03.06.2026 mit einer Modellkarte, Dokumentation und einem Ökosystem veröffentlicht und ist seitdem unabhängig getestet worden. AesCode-8B wurde überhaupt nicht veröffentlicht. Microsofts Repository dafür wurde am 29.09.2026 angelegt, und die Gewichte landeten in einem Commit mit dem Titel „Release AesCode-8B“ um 03:35 UTC am 07.10.2026, wobei der Trainings- und Evaluierungscode am folgenden Tag auf GitHub erschien. Es gibt keinen Beitrag von Microsoft Research, keine Produktseite, keine Versionshinweise und kein Preprint – die Zitation der Modellkarte lautet „Under review“ mit dem Platzhalterjahr 2027. Zum Zeitpunkt dieses Textes zeigt das 8B-Repository zwei Downloads und ein Like. Alles Quantitative zu AesCode-8B stammt daher von Microsoft selbst, und nichts wurde von jemand anderem reproduziert.
Die beiden Modelle, zu ihren eigenen Bedingungen
Gemma 4 12B ist ein mittelgroßes offenes Modell, ein dichter Checkpoint mit 11,95 Milliarden Parametern, dessen prägende Designentscheidung darin besteht, dass es keinen separaten Vision- oder Audio-Encoder besitzt: Bild-Patches und Audio-Wellenformen gehen direkt in den Transformer. Es verfügt über einen 256K-Token-Kontext und benötigt etwa 16 GB VRAM, wobei die BF16-Gewichte bei rund 27 GB und quantisierte Builds unter 7 GB liegen. Die eigene Karte des Anbieters – vom Anbieter gemeldet und hier als solche gekennzeichnet – listet im Thinking-Modus DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 und LiveCodeBench v6 72,0 auf. Die unabhängige Bewertung ist der Teil, der stärker zählt: Artificial Analysis bewertet die Reasoning-Konfiguration mit einem Intelligence Index von 14, misst rund 114 Token pro Sekunde und veranschlagt einen typischen bereitgestellten Aufruf mit nahezu 0,10 $ pro Million Input-Token und 0,30 $ pro Million Output-Token. Hinter ihm liegen dreieinhalb Monate Deployment.
AesCode-8B ist ein Fine-Tuning von Qwen3-VL-8B-Instruct, veröffentlicht mit vier Safetensors-Shards mit insgesamt 17.543.339.408 Bytes — etwa 8,8 Milliarden bf16-Parameter, weshalb das gerundete Größenfeld von Hugging Face 9B anzeigt, während der Anbieter 8B angibt. Die veröffentlichte Konfiguration ist ein direktes Qwen3-VL-Rezept: 36 versteckte Schichten, Hidden-Größe 4.096, 32 Attention-Heads mit 8 Key-Value-Heads, ein Vokabular von 151.936 Tokens und eine Anforderung an transformers 4.57 oder neuer. Die von Microsoft berichteten Läufe verwendeten einen Kontext von 24.576 Tokens mit bis zu 12.000 Ausgabe-Tokens, Temperatur 0,8, Top-p 0,95 und drei Generierungen pro Prompt ohne Auswahl. Die Lizenz ist Apache 2.0, ohne Zugangsbeschränkung, kein Zusatz zur akzeptablen Nutzung. Was nicht im Paket enthalten ist, sind die Trainings- und Evaluationsdaten und jeglicher gehostete Endpunkt — wir konnten AesCode-8B nirgendwo gehostet finden, und es ist nicht in unserem eigenen Katalog.
Wozu die Modelle tatsächlich trainiert wurden
Das Design-Briefing wird in der Modellkarte zitiert und es lohnt sich, es als die gesamte These zu lesen: Codemodelle „können nicht sehen, wie Layout, Hierarchie und Farbe auf der Leinwand zusammenkommen“, während Bildgeneratoren „visuell überzeugende Seiten komponieren, aber Text, Zahlen und logische Beziehungen oft falsch darstellen“. AesCode ist der Versuch, den Sinn für Komposition und die Überprüfbarkeit zugleich zu bewahren.
Der Mechanismus ist in einer bestimmten Hinsicht ungewöhnlich. Jeder Trainings-Prompt ist mit einem Referenzbild gepaart, das aus genau demselben Prompt generiert wurde; es liefert Layout und Stil, während der Text-Prompt maßgeblich für den Inhalt bleibt. Bei der Inferenz braucht das Modell das Bild dann kaum: Wenn man AesCode-8B die Referenz vorenthält, sinkt sein Visual-Score um 1,00 Punkte von hundert. Wenn man sie Qwen3-VL-8B-Instruct vorenthält, beträgt der Rückgang 19,55. Wenn man sie GPT-5.5 vorenthält, bewertet unter derselben Testumgebung, sind es 10,04. Das visuelle Prior landete in den Gewichten statt in der Eingabe, und das ist das eigentliche Forschungsergebnis unter der Schlagzeile.
Das Trainingsziel von Gemma 4 12B ist das gewöhnliche multimodale, und es ist keine Kritik, das zu sagen: das Bild lesen, die Frage beantworten, die Anweisung befolgen, das Tool aufrufen. Nichts in seiner Modellkarte deutet darauf hin, dass es jemals darauf ausgerichtet war, ein gerendertes Artefakt zu erzeugen, und keine veröffentlichte Evaluierung von Gemma 4 12B misst die Qualität des Dokumentlayouts, Canvas-Überlauf oder Design-Konsistenz, weil das nicht die Metriken des Modells sind.
Die Anzeigetafel und wessen Bewertungsraster sie ist

• Parameter — AesCode-8B: 8,8B bf16, dicht. Gemma 4 12B: 11,95B dicht.
• Eingaben — AesCode-8B: Text plus ein optionales Referenzbild. Gemma 4 12B: Text, Bild, Audio und Video.
• Ausgabe — AesCode-8B: ein vollständiges HTML- und CSS-Dokument. Gemma 4 12B: Text, einschließlich Tool-Aufrufe.
• Kontext — AesCode-8B: 24.576 Token in der gemeldeten Konfiguration. Gemma 4 12B: 256K Token.
• Lizenz — beide Apache 2.0, ohne Zugangsbeschränkung, Gewichte enthalten.
• Belege — AesCode-8B: Microsofts eigenes Infografik-Bewertungsraster mit 300 Stichproben, drei Generierungen pro Prompt, keine unabhängige Reproduktion. Gemma 4 12B: eine Herstellerkarte plus ein unabhängiger Intelligence Index von 14 und gemessener Durchsatz bei Artificial Analysis.
Jetzt der Teil, den das Scoreboard nicht vermitteln kann. Microsoft meldet für AesCode-8B 82,94 im Gesamtwert auf diesem 300-Stichproben-Set, vor dem referenzkonditionierten GPT-5.5 mit 81,28 und Claude Opus 4.8 mit 80,39, und mit 31,1 Visual-Punkten Vorsprung vor seinem eigenen Qwen3-VL-8B-Backbone. All das ist als vom Anbieter berichtet und nicht reproduziert zu lesen, nach einer Rubrik, die der Anbieter erstellt hat, auf Stichproben, die der Anbieter ausgewählt hat, bewertet von einer Testumgebung, gegen die der Anbieter das Modell trainiert hat. Die Modellkarte ist ehrlich genug, eine Dimension zu veröffentlichen, bei der kein Modell im Vergleich die 60-Marke überschreitet – Style, wo AesCode-8B bei 53,21 liegt und GPT-5.5 mit 57,91 führt –, und Microsofts eigene Definition dieser Dimension ist Design, das vor der Auslieferung keine weitere visuelle Überarbeitung benötigt. Auf der einen Achse, die danach fragt, ob ein Mensch die Seite unbearbeitet ausliefern würde, ist das 8B-Modell nicht der Spitzenreiter. Das ist die Zahl, die man im Kopf behalten sollte, wenn jemand die 82,94 zitiert.
Wo sie sich tatsächlich überschneiden
Es gibt genau ein gemeinsames Regal, und es ist schmaler, als es aussieht. Wenn Sie kleine offene Vision-Modelle für eine dokumentenlastige Pipeline bewerten, sind beide Kandidaten – eines zum Lesen eines Dokuments, das andere zum Erzeugen eines solchen. Ein Team, das interne Dashboards als HTML generiert und außerdem Zahlen aus hochgeladenen PDFs extrahieren muss, kommt in derselben Woche mit beiden Produkten in Berührung.
Die Aufteilung innerhalb dieser Überschneidung ist sauber. Gemma 4 12B ist das Modell, das man auf ein eingehendes Dokument ansetzt. AesCode-8B ist das Modell, das man auf ein Briefing ansetzt, wenn das Ergebnis eine Seite ist. Keines ersetzt das andere, und eine Pipeline, die beides will, ist eine Zwei-Modell-Pipeline und keine Wahl.

Deployment, wo die Asymmetrie tatsächlich zuschlägt
Die Serving-Story von Gemma 4 12B ist abgeschlossen. Du lädst es herunter, quantisierst es, wenn du willst, führst es mit 16 GB VRAM aus, und es gibt eine große Basis an Tooling, die das bereits tut. Wenn du es lieber gar nicht selbst ausführen möchtest, ist ein servierter Aufruf günstig und unabhängig bepreist.
Die Serving-Story von AesCode-8B ist eine Kommandozeile und etwas Arithmetik. Die Modellkarte gibt die Route direkt vor — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, transformers 4.57 oder neuer für den Nicht-vLLM-Pfad. 17,5 GB an bf16-Gewichten müssen gemeinsam mit einem KV-Cache für 24.576 Token und bis zu zwei Bilder Platz finden, also ist eine einzelne 24-GB-Karte technisch ausreichend und unangenehm knapp; 40-48 GB oder zwei 24-GB-Karten sind die realistische Untergrenze. Planen Sie außerdem einen Renderer ein, denn jede Qualitätsaussage über dieses Modell wird gemacht, indem man seine HTML-Ausgabe in einem Sandbox-Browser rendert; das Bewerten Ihrer eigenen Ergebnisse bedeutet also, etwas Playwright-artiges aufzusetzen, bei dem externe Anfragen blockiert sind.
Dann ist da der ehrliche Stand der Verfügbarkeit. Wir routen AesCode-8B nicht, und soweit wir das feststellen können, tut das auch sonst niemand; eine Evaluation heute bedeutet Gewichte auf der eigenen Hardware. Das Nächste, was aufrufbar ist, ist die Architektur, von der das Modell feinabgestimmt wurde. Qwen3-VL-8B-Instruct ist jetzt über OrcaRouter routingfähig, zu $0,18 pro Million Input-Tokens und $0,70 pro Million Output-Tokens bei einem Kontext von 131.072 Tokens, und die beiden Checkpoints, die wir führen, werden genauso bepreist — Gemma 4 26B-A4B zu $0,06 und $0,33, Gemma 4 31B zu $0,13 und $0,38. Der Listenpreis des Anbieters wird ohne Aufschlag durchgereicht, und ein Failover zwischen Anbietern erfolgt automatisch, sodass der günstige Weg herauszufinden, ob deine Prompts überhaupt gut funktionieren, darin besteht, zuerst das untrainierte Backbone zu testen und die GPU-Woche nur für die Prompts auszugeben, die überleben.

Welche willst du eigentlich?
Wählen Sie AesCode-8B, wenn das Ergebnis eine Seite ist. Das Modell gibt strukturiertes, editierbares HTML aus – Tabellen als HTML-Tabellen, Diagramme als ECharts-Spezifikationen –, was bedeutet, dass die Ausgabe in Git diffbar ist und von einem Designer neu gestaltet werden kann, ohne sie neu zu generieren. Akzeptieren Sie den Kompromiss: ein nicht angekündigter Research-Checkpoint mit einer zweistelligen Download-Zahl, keine unabhängige Evaluierung, kein gehosteter Endpunkt, ein 24K-Kontext, der nur auf einzelnen Infografik-Seiten validiert wurde, und ein ausschließlich englischer Sprach-Tag auf der Karte.
Nimm Gemma 4 12B für alles andere. Es liest Dokumente besser als die meisten Modelle, die doppelt so groß sind, es verarbeitet Audio, es befolgt Tool-Anweisungen, es hat eine Viertelmillion Tokens Kontext und es hat dreieinhalb Monate Erfahrung anderer Leute hinter sich. Wenn du eines dieser beiden als dein kleines Vision-Modell auswählst und nicht ausdrücklich darum gebeten wurdest, Folien als Code zu erstellen, dann ist dies die Antwort.
Und wenn die ehrliche Anforderung beides verlangt, dann behandle es nicht als Tie-Break. Leite die Lesearbeit an ein gehostetes Modell weiter und belasse die Renderarbeit auf welcher Maschine auch immer die Gewichte halten kann.
Was würde diese Seite verändern?
Drei Signale. Eine unabhängige Reproduktion der 82,94 und des 1,00-Punkte-Referenzrückgangs würde AesCode-8B von einer Herstellerbehauptung zu einem Ergebnis machen und die Größenfrage 8B gegen 12B wirklich interessant machen statt nur nominell. Ein Inferenzanbieter, der den Checkpoint aufgreift, würde die Deployment-Spalte kollabieren lassen, die derzeit den gesamten praktischen Unterschied ausmacht. Und das Papier, das Microsoft als unter Begutachtung befindlich zitiert – „AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards“ –, würde die Fragen beantworten, die die Modellkarte nicht beantworten kann, angefangen damit, wie sich die visuelle Bewertungsrubrik verhält, wenn der Design-Graph selbst falsch ist. Bis eines davon eintritt, ist die vertretbare Lesart eng und real: AesCode-8B ist sehr gut in den Teilen des visuellen Designs, die eine Maschine prüfen kann, mittelmäßig bei dem Teil, den sie nicht prüfen kann, und Gemma 4 12B ist ein fertiges Produkt, das eine andere Aufgabe erfüllt.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
