
AesCode-32B: Microsofts stilles 33B-Modell, das Präsentationen als bearbeitbares HTML schreibt
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 87 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Die Zeitstempel auf AesCode-32B widersprechen sich, und dieser Widerspruch macht schon fast alles aus, worüber es zu berichten gibt. Das Hugging-Face-Repository microsoft/AesCode-32B wurde am 29. September 2026 angelegt, doch alles darin traf in einem einzigen Commit vom 7. Oktober 2026 ein, dessen Nachricht schlicht „Release AesCode-32B" lautet — und der Trainings-Stack, der das Ergebnis reproduzierbar macht, wurde am 8. Oktober auf github.com/microsoft/AesCode veröffentlicht. Microsoft hat nichts angekündigt: keinen Blogbeitrag, kein arXiv-Preprint, keine Leaderboard-Einreichung, keine Modellseite auf der eigenen Website. Was existiert, ist ein Vision-Language-Modell mit 33 Milliarden Parametern, das einen Prompt entgegennimmt und ein vollständiges, in sich geschlossenes HTML-Dokument ausgibt — eine Folie, ein Poster, ein Dashboard — plus einen kleineren Begleiter, microsoft/AesCode-8B. Beide sind aus Qwen3-VL-Vision-Modellen feinabgestimmt — Qwen3-VL-32B-Instruct bzw. Qwen3-VL-8B-Instruct — beide stehen unter Apache 2.0, und beide sind heute herunterladbar.
Die Repo-ID lautet microsoft/AesCode-32B und die Karte beginnt mit dem Trick: AesCode kombiniert deinen Prompt mit einem Bild, das aus genau diesem Prompt erzeugt wurde, verwendet das Bild als ästhetische Referenz und folgt dem Text für den eigentlichen Inhalt. Bildgeneratoren gestalten eine ansehnliche Seite und geben die Zahlen darauf falsch wieder; Codemodelle bekommen die Zahlen richtig hin und können nicht sehen, wie die Seite aussieht. AesCode ist ein Versuch, beides zu vereinen, und die ehrliche Zusammenfassung davon mit Stand 11. Oktober 2026 ist, dass die Gewichte echt und überprüfbar sind, die Benchmark-Zahlen die des Labs selbst sind, ermittelt mit einer Harness, die das Lab geschrieben hat, und niemand außerhalb von Microsoft bisher eine Zahl dafür veröffentlicht hat. Dieser Beitrag hält diese drei Kategorien durchgängig auseinander.
Was tatsächlich im Repository steht, Byte für Byte

Beginne mit dem, was du verifizieren kannst, ohne auch nur einem Wort der Modellkarte zu vertrauen. Das 32B-Repository enthält vierzehn Safetensors-Shards mit insgesamt 66.714.912.704 Bytes, was bei BF16 ungefähr 33,4 Milliarden Parametern entspricht – konsistent mit den „33B params“ der Karte und deren Warnung, dass allein die Gewichte etwa 65 GB Accelerator-Speicher benötigen. Die Konfiguration deklariert Qwen3VLForConditionalGeneration als Architektur und qwen3_vl als Modelltyp, daher ist dies keine neue Architektur und benötigt auch keine: Es lädt mit transformers>=4.57, und die Karte liefert einen vLLM-Befehl mit, der es über vier Tensor-Parallel-Ranks bedient, wobei pro Prompt zwei Bilder erlaubt sind und eine Obergrenze von 24.576 Tokens gilt.
Die Interaktionszähler sind der unauffälligste Teil des Releases. Zwei Downloads und ein Like beim 32B-Repository zum Zeitpunkt des Verfassens. Es gibt keinen Eintrag im Inference-Provider-Mapping von Hugging Face, was bedeutet, dass hinter der Repo-Seite kein gehosteter Endpoint angebunden ist und nirgends ein GGUF-, MLX- oder llama.cpp-Build beworben wird. Für ein Modell, das Microsofts Namen trägt und Ergebnisse liefert, die GPT-5.5 in der eigenen Tabelle des Anbieters schlagen, ist das ein auffallend kleiner Fußabdruck – und es ist der stärkste verfügbare Beleg dafür, dass dies ohne einen dahinterstehenden Launch online ging.
Das begleitende Code-Repository füllt die andere Hälfte der Zeitlinie aus, und hier wird die Frage nach dem Veröffentlichungsdatum wirklich mehrdeutig. microsoft/AesCodewurde am 23. Juli 2026 erstellt – zehn Wochen vor den Gewichten – und enthält vierzehn Commits, jeder einzelne von demselben Beitragenden verfasst und jeder einzelne mit einem Zeitstempel innerhalb von zwanzig Sekunden Abstand zu den anderen am 8. Oktober 2026, zwischen 23:14:04 und 23:14:24 UTC. Sie umfassen die Spezifikation zur Erzeugung von Prompts und verifizierbaren Anforderungen, die Datenpipeline, die Designgraphen und Rubrikfragen aufbaut, eine Cold-Start-SFT-Phase, die GDPO-Reinforcement-Learning-Schleife, einen Playwright-basierten Rendering-Verifier, Tests und die README, die all das dokumentiert. Es gibt keine Releases und keine Tags, die Repository-Beschreibung ist leer, und es hat einen Stern.

Also, welches Datum ist die Veröffentlichung? Der Repository-Eintrag sagt 29. September. Der Commit, der das Modell enthält, sagt 7. Oktober. Der Code, der erklärt, wie das Modell erstellt wurde, sagt 8. Oktober. Drei Zeitstempel innerhalb eines einzigen Zwei-Wochen-Fensters, und keinem davon ist ein Satz von Microsoft beigefügt, der lautet: „Wir liefern das jetzt aus.“ Betrachten Sie den 7.–8. Oktober als das maßgebliche Datum für die Artefakte, die die meisten Leute tatsächlich herunterladen werden, und den 29. September als das Datum, an dem das Repository reserviert wurde. Wer Ihnen sagt, AesCode-32B sei an einem bestimmten Tag „gestartet“, wählt stellvertretend für Sie einen dieser Zeitstempel aus.
Der Mechanismus: ein Bild als ästhetische Orientierung, ein Graph als Belohnung.
Die technische Aussage der Karte ist eng und spezifisch, was ein Punkt zu ihren Gunsten ist. Das Modell wird mit Cold-Start-Supervised-Fine-Tuning auf 3.000 Demonstrationen bei einer Lernrate von 1e-5 trainiert, dann mit GDPO – einer gruppenrelativen Variante der Policy-Optimierung – über 7.408 Prompts für 520 Schritte. Das 8B-Modell verwendete dasselbe Rezept und stoppte bei 400 Schritten. Der RL-Lauf verwendete die FSDP-vLLM-Hybrid-Engine von verl ohne Critic und ohne separat trainiertes Reward-Modell, AdamW mit konstant 5e-6 ohne Warmup, 128 Prompts pro Schritt mit jeweils acht Rollouts und Prompt und Antwort jeweils auf 8.192 Token begrenzt.
Was die Belohnung ungewöhnlich macht, ist, dass sie kein einzelner Skalar ist. Jedes Trainingsziel wird als Design-Graph beschrieben, der die gesamte Leinwand abdeckt, sodass einzelne Eigenschaften getrennt zugerechnet werden können. Aus diesem Graphen stammen sieben Kanäle – Ausführung, Text, Grenze, Tabellendiagramm, Layout, Leerraum und Design –, die jeweils vor der Aggregation innerhalb ihrer Rollout-Gruppe normalisiert werden, damit ein dominantes Signal die anderen nicht übertönen kann. Deterministische Verifizierer bewerten, was aus dem Code und seinem Rendering geparst werden kann; ein Vision-Language-Richter bewertet, was nicht geparst werden kann, anhand einer Rubrik, die an die eigenen Elemente und Relationen des Graphen gebunden ist. Kandidaten-HTML wird bewertet, indem es in einem Playwright-Browser in einer Sandbox mit blockierten externen Anfragen gerendert wird, der das DOM, berechnete Stile, Bounding Boxes, den Konsolenstatus und einen Screenshot exportiert.
Die technische Konsequenz ist es wert, genannt zu werden, weil sie in der Ausgabe auftaucht, die du erhältst: Das Modell ist darauf trainiert, Tabellen als echte HTML-Tabellenstrukturen und Diagramme als ECharts-Spezifikationen auszugeben, sodass beide direkt inspizierbar sind, statt in Pixel eingebrannt zu sein. Das ist der Unterschied zwischen einem Deck, das du einem Designer geben kannst, und einem Deck, das du einem Linter geben kannst. Die Reproduktionsanforderungen sind entsprechend hoch — das README verlangt Python 3.10, CUDA 12.6 und einen Node mit acht B200 GPUs, pinnt einen bestimmten verl-Commit und stellt unverblümt fest, dass ein Patch gegen diesen Commit erforderlich ist, weil das Standard-verl keine Qwen3-VL-Unterstützung bietet, und warnt, dass der Browser ohne die Playwright-Systembibliotheken beim Start fehlschlägt und Seiten null Punkte erzielen, und dass der entsprechende Reward-Kanal ohne den gepinnten OCR-Stack null zurückgibt, statt sich zu enthalten, und das Signal stillschweigend verfälscht.
Die Benchmark-Tabelle und die vier Gründe, sie nicht zu streng zu handhaben
Die Kernzahlen von AesCode-32B stammen aus 300 Infografik-Beispielen, drei Generierungen pro Prompt bei Temperatur 0,8 und Top-p 0,95, jeweils bis zu 12.000 Ausgabe-Tokens, ohne Auswahl unter den Generierungen. Die Werte sind Prozentangaben. Mit Referenz meldet das 32B-Modell Text 95,34, Boundary 97,27, Table/Chart 90,37 und einen Rule-Durchschnitt von 94,33; auf der visuellen Seite Content 85,76, Layout 90,58, Style 55,99, für einen Visual-Durchschnitt von 77,44 und einen Overall-Wert von 85,89. In derselben Tabelle erreicht GPT-5.5 mit einer Referenz einen Overall-Wert von 81,28 und Claude Opus 4.8 mit einer Referenz einen Overall-Wert von 80,39, während das Qwen3-VL-32B-Instruct-Backbone, auf dem das Modell trainiert wurde, 61,10 erreicht.

Vier Einschränkungen sind im selben Atemzug mit diesen Zahlen zu nennen, und keine davon ist eine Herabwürdigung der Arbeit. Erstens wurde jede Zeile, einschließlich der Zeilen zu GPT-5.5 und Claude Opus 4.8, von Microsoft auf Microsofts Harness mit Microsofts Bewertungsraster ausgeführt — das sind nicht die Zahlen der anderen Labore, sondern Microsofts Messungen der Modelle von Wettbewerbern, und die Modellkarte selbst bezeichnet das Bewertungsraster als „stichprobenspezifisch“ für jeden Design-Graphen. Zweitens wird das Bewertungsraster von derselben Pipeline erzeugt, die die Trainingsdaten generiert hat, und das ist genau das Setup, in dem ein Benchmark in Richtung der Stärken eines Modells abdriften kann; die Modellkarte ist offen hinsichtlich der Grenzen dieses Bewertungsrasters — Style, was verlangt, dass ein Design vor der Auslieferung keine weitere visuelle Überarbeitung benötigt, wird als „die gemeinsame Obergrenze für jedes System“ bezeichnet, und kein Modell in der Tabelle überschreitet 60. Drittens gibt es nirgendwo eine unabhängige Messung dieses Modells: keinen Eintrag in einem Leaderboard eines Dritten, keine Reproduktion, und angesichts von zwei Downloads mit ziemlicher Sicherheit noch niemanden außerhalb des Labors, der es bisher ausführt. Viertens ist der Vergleich auf subtile Weise asymmetrisch, und zwar auf eine Art, die es zu bemerken lohnt — die Zeilen von AesCode-32B sind alle referenzkonditioniert, das Modell wird also in der Konfiguration gemessen, für die es trainiert wurde, was die Modellkarte anerkennt, indem sie zeigt, dass die Qualität weiterhin am höchsten ist, wenn eine Referenz bereitgestellt wird.
Das eine Ergebnis in der Tabelle, das besser standhält als die Schlagzeile, ist eher eine Robustheits- als eine Qualitätsbehauptung. Das Zurückhalten des Referenzbilds bei der Inferenz kostet AesCode-8B nur 1,00 Visual-Punkt, gegenüber 19,55 für sein Qwen3-VL-8B-Instruct-Backbone und 10,04 für GPT-5.5. Das Argument der Karte ist, dass referenzkonditioniertes Training visuelle Planung in die Policy internalisiert, statt das Modell zu lehren, zu kopieren, was es sieht. Das ist vom Anbieter berichtet und nicht reproduziert, und es ist außerdem die Art von Behauptung, die ein einzelner unabhängiger Durchlauf klären würde – und die Art, die in der Produktion am wichtigsten ist, wo man nicht immer ein Referenzbild zur Hand hat.
Was der Betrieb kostet und was das für den Vergleich bedeutet
Nichts an diesem Modell ist günstig selbst zu hosten. Zehn- bis zwölftausend Ausgabe-Token sind die Arbeitsgröße eines einzelnen Artefakts, und ein vollständiges HTML-Dokument mit einer ECharts-Spezifikation liegt näher am oberen Ende dieser Spanne als am unteren, sodass jede Generierung ein langer Decode ist. Das Serving-Rezept der Karte selbst verlangt vier GPUs bei Tensor-Parallelität, um ungefähr 65 GB BF16-Parameter zu halten, und das Trainingsrezept verlangt acht B200s. Das ist eine echte Maschine, kein Hobby-Deployment, und es setzt die Bedingungen des Vergleichs: Die Modelle, an denen AesCode-32B gemessen wird, werden pro Token gemietet, und das Modell selbst wird pro GPU-Stunde gemietet, egal ob man die Hardware besitzt oder nicht.
Die praktische Form dieses Vergleichs ist genau der Punkt, für den es eine Routing-Schicht gibt, und es lohnt sich, genau zu sein, wenn es darum geht, was wir hosten und was nicht. AesCode-32B steht nicht im Katalog von OrcaRouter, und wir bieten es nicht an – es gibt nirgendwo einen gehosteten Endpunkt dafür, den ich verifizieren kann, Microsoft eingeschlossen. Was im Katalog steht, ist die andere Seite des Tisches: die gehosteten Modelle, gegen die Sie einen selbst gehosteten Artefakt-Generator benchmarken würden, einschließlich GPT-5.5 und die kleineren Qwen3-VL-Vision-Modelle, erreichbar über einen einzigen API-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag, was bedeutet, dass eine Preisänderung eines Anbieters am selben Tag bei uns live ist. Der Vergleich eines gemieteten Endpunkts mit einem Modell, das Sie selbst betreiben, braucht keinen zweiten Vertrag und kein zweites SDK, und eine Routing-DSL erlaubt es, einen selbst gehosteten Aufruf neben gehosteten Aufrufen hinter einem einzigen Endpunkt zu platzieren. Wenn sich AesCode-32B bei der einen Sache, die seine Modellkarte behauptet, als gut erweist, sind die Kosten, das herauszufinden, eine GPU-Rechnung, und die Kosten der Alternativen, mit denen Sie es vergleichen, sind ein Schlüssel, den Sie wahrscheinlich bereits haben.
Was Sie heute damit tun können und was nicht existiert
• Lade es herunter und führe es aus — die Gewichte stehen unter Apache 2.0, folgen dem Qwen3-VL-Backbone, mit vierzehn BF16-Shards und einem funktionierenden transformers-Pfad oberhalb von Version 4.57 und einem vLLM-Rezept in der Model Card.
• Reproduziere das Training – der Code steht unter MIT-Lizenz und ist vollständig genug, um aussagekräftig zu sein: der Reward-Verifier, der Rubrik-Builder, die SFT- und GDPO-Phasen, ein gepinnter verl-Commit plus der Patch, der Qwen3-VL-Unterstützung hinzufügt, und eine README, die die Fehlermodi auflistet, statt sie zu verbergen.
• Bewerte es referenzfrei — das Modell akzeptiert Prompts mit oder ohne Referenzbild, und die am besten überprüfbare Behauptung der Karte steckt in genau dieser Konfiguration.
• Eine API dafür bekommen – unmöglich. Es gibt keinen gehosteten Endpoint, keine Inference-Provider-Zuordnung im Repository und keinen GGUF- oder MLX-Build; das auszuführen bedeutet, die Hardware auszuführen.
• Das Paper – Sie können es noch nicht. Die Model Card verlinkt ein Paper mit dem Titel AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards, und sein eigener BibTeX-Eintrag gibt als Publikationsort „Under review“ und als Jahr 2027 an. Eine Suche ergibt kein Paper mit diesem Titel. Es gibt ein anderes, früheres Microsoft-Paper mit einem fast identischen Namen – Code Aesthetics with Agentic Reward Feedback vom Oktober 2025, das ein AesCoder-4B-Modell und einen AesCode-358K-Datensatz veröffentlicht hat – und nichts in der AesCode-32B-Model-Card zitiert es oder stellt eine Beziehung dazu her. Wenn Sie auf der Suche nach Hintergrundlektüre stattdessen auf dieses stoßen, lesen Sie über ein anderes Modell, das von teilweise denselben Autoren stammt.
• Vergleich auf einem öffentlichen Leaderboard – noch nicht. Kein Drittanbieter-Index scheint es bewertet zu haben, was für ein Repository mit zwei Downloads nicht überraschend ist.
Wer sich kümmern sollte und wer warten sollte
Die Zielgruppe hierfür ist enger, als die Schlagzeilen-Tabelle nahelegt, und spezifischer als „alle, die mit Modellen bauen“. Wenn Ihr Produkt Prompts in Präsentationen, Poster, Berichte oder Dashboards verwandelt, die anschließend noch jemand bearbeiten muss, dann haben Sie die Wahl, auf die dieses Modell abzielt, bereits entdeckt: Bildgenerierung liefert Ihnen ein schönes Rechteck, das Sie nicht ändern können, und Codegenerierung liefert Ihnen etwas Bearbeitbares, das aussieht, als wäre es von einem Compiler zusammengesetzt worden. Ein 33B-Modell mit offenen Gewichten, das ein vollständiges HTML-Dokument mit echten Tabellen und ECharts-Spezifikationen ausgibt, das innerhalb von etwa einem Punkt seiner referenzkonditionierten Qualität bleibt, wenn Sie ihm keine Referenz geben können, und das Sie unter Apache 2.0 auf Ihren eigenen House-Style feinabstimmen können, ist ein wirklich nützliches Ding, das es geben sollte. Kein anderes Modell erledigt genau diese Aufgabe in dieser Größe unter diesen Bedingungen.
Dagegen: Alles, was Sie über die Qualität wissen, stammt aus einer Tabelle, die der Anbieter erstellt hat, das dahinterstehende Bewertungsschema wurde von derselben Pipeline erzeugt, die die Trainingsdaten hervorgebracht hat, und die einzige Obergrenze, die die Karte einräumt – Style unter 60 für jedes getestete System – ist genau die Dimension, die für ein designsensitives Produkt am wichtigsten wäre. Ein Team, das aus Compliance-Gründen die Generierung im Haus behalten muss und einen freien Acht-GPU-Knoten hat, hat genug, um heute zu starten. Ein Team, das nächste Woche ein Modell für den Produktivbetrieb auswählt, hat keine unabhängige Kennzahl, auf die es seine Wahl stützen kann, und sollte die 85,89 gegenüber 81,28 nicht als gesichertes Ergebnis interpretieren.
Was würde daraus eine Geschichte machen?
Vier Dinge, von denen noch keines existiert. Eine Ankündigung – Microsoft hat nichts gesagt, und das Paper, auf das die Model Card verweist, steht ausdrücklich unter Begutachtung, sodass ein technischer Bericht mit Trainingsdetails über die Zusammenfassung der Model Card hinaus jederzeit erscheinen könnte. Ein unabhängiger Run – die referenzfreie Robustheitsbehauptung und der Boundary-Score, der laut Model Card bei 4,3 % der Stichproben zu einem schwerwiegenden Fehler führt, gegenüber 34,7 % bei GPT-5.5, sind beide günstig zu testen und beide wert, getestet zu werden. Serving-Unterstützung außerhalb der Rezeptur des Anbieters – ein GGUF-Build oder ein Eintrag in einer gängigen Runtime würde die Hardware-Story stärker verändern als jeder Benchmark. Und ein zweiter Datenpunkt zur Größenfrage: Ein 8B-Modell, das in derselben Tabelle 82,94 Overall gegenüber 85,89 des 32B-Modells erzielt, ist eine Zwei-Punkte-Lücke für ein Viertel der Parameter – und das ist die Art von Sache, die entweder reproduziert wird oder stillschweigend nicht mehr erwähnt wird.
Bis eines davon eintrifft, lautet die zutreffende Beschreibung von AesCode-32B so: echte Gewichte unter einer permissiven Lizenz, ein Trainings-Stack, der detailliert genug ist, um von einem gut ausgestatteten Labor reproduziert zu werden, eine Benchmark-Tabelle, die die Messung eines Unternehmens an seinem eigenen Modell und an denen zweier Wettbewerber darstellt, und eine Repository-Historie, die es einem nicht erlaubt, irgendeinen einzelnen Tag als Launch-Datum zu bezeichnen. Es ist ein interessanteres Artefakt, als sein Zähler mit zwei Downloads vermuten lässt, und ein weniger belegtes, als seine 85.89 nahelegt. Beide Hälften dieses Satzes sind die ehrliche Lesart am 11. Oktober 2026.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
