Eine generierte Titelkarte mit der Überschrift „AesCode-8B vs Qwen3-8B“ mit zwei abgerundeten Karten nebeneinander. Die linke Karte AesCode-8B trägt ein Browserfenster-Symbol, das eine Plakatseite rendert, sowie die Zeilen „Basis: Qwen3-VL-8B-Instruct“ und „Gibt eine gerenderte Seite aus“; die rechte Karte Qwen3-8B trägt ein Dokument-Symbol mit einer Sprechblase und die Zeilen „Qwens eigener Generalist“ und „Text, 119 Sprachen“. Ein Trenner dazwischen lautet „Cousins, nicht Eltern und Kind“, und ein Beschriftungsstreifen oben lautet „AesCode-8B ist kein Fine-Tuning von Qwen3-8B“. Das OrcaRouter-Logo ist unten rechts einkomponiert.
Guides & Insights

AesCode-8B vs. Qwen3-8B: Sie sehen aus wie Eltern und Kind, und sind es nicht

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Namen verleiten zu einem Fehler. AesCode-8B ist ein 8B-Modell mit einem Qwen3-VL-8B-Instruct-Backbone, Qwen3-8B ist das eigene 8B-Modell des Anbieters, und die naheliegende Lesart ist, dass das erste ein Fine-Tune des zweiten ist. Ist es nicht. Die veröffentlichte Konfiguration von AesCode-8B gibt Qwen3-VL-8B-Instruct als Basis an – das Vision-Language-Geschwistermodell, ein anderer Checkpoint mit einer anderen Aufgabe – und die Hugging-Face-Metadaten führen es als Finetune jenes Modells, nicht des reinen Textmodells Qwen3-8B. Die beiden AesCode-Modelle in dieser Gewichtsklasse sind eher Cousins als Eltern und Kind, und genau diese Unterscheidung ist der ganze Grund, warum diese Seite nützlich ist: Sie verrät Ihnen, was Microsoft gekauft hat, als es von einem Vision-Language-Checkpoint ausging, was das auf der Textseite gekostet hat, und warum ein Vergleich mit dem einfachen 8B-Generalisten der Familie letztlich eher einen Fork als ein Upgrade misst.

Beide sind Apache 2.0 und beide sind herunterladbar, doch ihre Veröffentlichungsgeschichten könnten unterschiedlicher nicht sein. Qwen3-8B erschien im April 2025 als Teil der Qwen3-Generation des Anbieters, mit Dokumentation, Ökosystem-Integration und achtzehn Monaten fremder Deployments im Rücken. AesCode-8B weist in seinen Dateien nirgends ein Veröffentlichungsdatum auf. Microsoft erstellte das Hugging-Face-Repository am 29. September 2026, committete die Gewichte unter der Nachricht „Release AesCode-8B“ am 7. Oktober 2026 um 03:35 UTC und veröffentlichte den Trainingscode am darauffolgenden Tag auf GitHub. Es gibt keinen Beitrag von Microsoft Research, keinen Release-Hinweis, keine Produktseite und kein Paper — die Zitation der Modellkarte lautet „Unter Begutachtung“ mit dem Platzhalterjahr 2027, und das Repository verzeichnete zum Zeitpunkt dieses Schreibens zwei Downloads. Alle quantitativen Angaben zu AesCode-8B weiter unten sind Microsofts eigene und wurden von niemandem reproduziert.

Der Stammbaum, den die Namen verbergen

Die Modellreihe der Qwen3-Generation enthält mehrere Checkpoints der 8B-Klasse, die eine Abstammungslinie und nicht viel mehr gemeinsam haben. Qwen3-8B ist der reine Text-Generalist: rund 8,2 Milliarden Gesamtparameter, davon etwa 7 Milliarden Nicht-Embedding-Parameter, Grouped-Query-Attention, ein nativer 32K-Token-Kontext, der sich über YaRN auf 131K erweitern lässt, und Training über 119 Sprachen und Dialekte hinweg. Es kann schlussfolgern, chatten, programmieren und Tools aufrufen, und genau deshalb gehört es zu den 8B-Modellen, die im offenen Ökosystem am häufigsten selbst gehostet werden. Qwen3-VL-8B-Instruct ist das multimodale Mitglied: dieselbe Generation derselben Familie, mit einem dedizierten Vision-Tower obendrauf, Bild und Text als Eingabe, Text als Ausgabe.

Microsoft begann mit dem zweiten. Die AesCode-8B-Konfiguration lautet Qwen3VLForConditionalGeneration, mit 36 Hidden-Layern, Hidden-Size 4.096, 32 Attention-Heads und 8 Key-Value-Heads, einem Vokabular mit 151.936 Tokens und verschachtelten mrope-Positionen, und es benötigt transformers 4.57 oder neuer. Die Shards summieren sich auf 17.543.339.408 Bytes, etwa 8,8 Milliarden bf16-Parameter, weshalb das gerundete Größenfeld von Hugging Face 9B angibt, während der Anbieter 8B sagt. Das ist eine Rundung und keine Abweichung, und die Parameteranzahl ist nicht der entscheidende Unterschied — die Eingabemodalität und der Serving-Kontext mit 24.576 Tokens sind es.

Die ehrliche Formulierung ist also nicht „Generalist gegen sein Fine-Tuning“. Sie lautet: ein Text-Generalist mit langem Kontext und achtzehn Monaten Produktionsgeschichte gegen einen multimodalen Forschungs-Checkpoint, der ein Dokument ausgibt und nie unabhängig evaluiert wurde.

A generated two-column scoreboard titled "AesCode-8B vs Qwen3-8B - the scoreboard". Left column AesCode-8B reads Base Qwen3-VL-8B-Instruct, Parameters 8.8B, Output HTML and CSS page, Context 24,576 tokens, Languages English only, Evidence vendor rubric and unreproduced. Right column Qwen3-8B reads Base Qwen3-8B itself, Parameters 8.2B, Output text and tool calls, Context 32K native and 131K extended, Languages 119, Evidence 18 months independent. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Qwen3-8B specifications are Alibaba's." The OrcaRouter logo is composited bottom-right.

Wofür Microsoft das Trainingsbudget ausgegeben hat

Das Design-Briefing wird auf der Modellkarte zitiert und erklärt die Aufspaltung: Code-Modelle „können nicht sehen, wie Layout, Hierarchie und Farbe auf der Leinwand zusammenkommen“, während Bildgeneratoren „visuell überzeugende Seiten komponieren, aber Text, Zahlen und logische Beziehungen oft falsch wiedergeben“. AesCode ist der Versuch, den Sinn für Komposition von dem einen und Verifizierbarkeit von dem anderen zu übernehmen, und das Rezept ist auf eine bestimmte Weise ungewöhnlich.

Jeder Trainings-Prompt ist mit einem Referenzbild gepaart, das aus genau diesem Prompt generiert wurde – Microsofts eigene Durchläufe nutzten GPT-Image-2 für das Bild und GPT-5.5, um aus einer kurzen Vorgabe einen detaillierten Inhalts-Prompt zu erweitern. Die Referenz trägt nur Layout und Stil; für den Inhalt bleibt der Text-Prompt maßgeblich. Bei der Inferenz braucht das Modell sie dann kaum: Wenn man AesCode-8B die Referenz vorenthält, fällt sein Visual-Wert um 1,00 Punkt auf einer Skala von 100 – gegenüber 19,55 beim Backbone und 10,04 bei GPT-5.5. Ein verwandtes Ergebnis ist, dass referenzbasierte Belohnungen den Prompt-only-Visual-Wert von 25,17 auf 69,71 hoben, sodass das visuelle Vorwissen in die Gewichte wanderte, anstatt in der Eingabe zu bleiben.

Der Rest ist eine Geschichte über Reward-Design. Supervision ist ein „Design-Graph“ aus Knoten und Kanten – Text, Diagramme, Tabellen, Karten, Regionen, Bildslots, wobei Containment, Ausrichtung, Reihenfolge und Verbindung die Kanten sind – so gewählt, dass jede Eigenschaft auf der Leinwand zu einem benannten Element gehört und daher einzeln bewertet werden kann. Sieben Kanäle bewerten das Ergebnis: sechs deterministische Verifier für Ausführung, Text, Grenzen, Tabellen- und Diagrammdaten, semantisches Layout und Leerraum, plus eine probenspezifische visuelle Graph-Rubrik, die von einem Vision-Language-Modell bewertet wird. Kandidaten werden in einem sandboxed Playwright-Browser mit blockierten externen Anfragen gerendert, und das Harness liest DOM, berechnete Styles, Bounding Boxes und einen Screenshot zurück, weshalb Tabellen HTML-Tabellen und Diagramme ECharts-Spezifikationen sein müssen. Das Training war Cold-Start-überwachtes Fine-Tuning auf 3.000 Demonstrationen, dann GDPO über 7.408 Prompts für 400 Schritte auf einem einzelnen Knoten mit acht NVIDIA B200s, wobei jeder Reward-Kanal innerhalb seiner Rollout-Gruppe normalisiert wurde, damit ein dichtes regelbasiertes Signal das spärliche visuelle nicht übertönen kann. Microsoft misst diese Normalisierung mit 5,12 Visual-Punkten über einfachem skalarem GRPO.

Nichts an dieser Maschinerie existiert, um AesCode-8B zu einem besseren allgemeinen Assistenten zu machen. Sie existiert, um die Ausgabe überprüfbar zu machen, und sie ist der Grund dafür, dass der Kontext des Modells so ist, wie er ist.

Seite an Seite, mit beschrifteten Zahlen.

• Base — AesCode-8B: Qwen3-VL-8B-Instruct, ein Vision-Language-Checkpoint. Qwen3-8B: der rein textbasierte Generalist derselben Generation.

• Parameter — AesCode-8B: etwa 8,8 Mrd. bf16 über vier Shards. Qwen3-8B: insgesamt etwa 8,2 Mrd., davon rund 7 Mrd. ohne Embedding.

• Eingaben — AesCode-8B: Text plus ein optionales Referenzbild. Qwen3-8B: Text.

• Ausgabe — AesCode-8B: ein vollständiges HTML- und CSS-Dokument. Qwen3-8B: Text, Tool-Aufrufe, Code.

• Kontext — AesCode-8B: 24.576 Tokens in der angegebenen Konfiguration. Qwen3-8B: 32K nativ, 131K erweitert via YaRN.

• Sprachen — AesCode-8B: Das Tag der Karte ist allein „en“. Qwen3-8B: 119 Sprachen und Dialekte.

• Belege — AesCode-8B: Microsofts eigenes Infografik-Bewertungsraster mit 300 Stichproben, drei Generierungen pro Prompt, keine externe Reproduktion. Qwen3-8B: achtzehn Monate unabhängiger Benchmarks, Quantisierungsarbeit und Produktionseinsatz.

• Lizenz — Beide Apache 2.0, ohne Zugangsbeschränkung. Ein Gleichstand – und nicht das Unterscheidungsmerkmal, für das man ihn hält.

Die Evidenzlücke ist der eigentliche Vergleich.

Microsoft meldet AesCode-8B mit 82,94 Overall in seinem Bewertungsraster, vor referenzkonditioniertem GPT-5.5 mit 81,28 und Claude Opus 4.8 mit 80,39, und mit 31,1 Visual-Punkten Vorsprung vor seinem eigenen referenzkonditionierten Backbone. Drei Zahlen in dieser Tabelle sind mehr wert als die Schlagzeile. Die erste ist Style, wo AesCode-8B bei 53,21 liegt und kein Modell im Vergleich 60 überschreitet – und Microsofts Definition von Style ist Design, das vor der Auslieferung keine weitere visuelle Überarbeitung benötigt, sodass das Modell in der einen Dimension, die fragt, ob ein Mensch die Seite unverändert ausliefern würde, nicht der Spitzenreiter ist. Die zweite ist der Grenzfehler: Ein schwerwiegender Canvas-Überlauf tritt bei 4,3 % der 300 Stichproben wiederholt auf, gegenüber 34,7 % bei GPT-5.5. Die dritte ist, dass die visuelle Hälfte der Bewertung von einem ungenannten Vision-Language-Judge stammt, was bedeutet, dass die deterministische Hälfte von einem Außenstehenden reproduzierbar ist und die andere Hälfte nicht.

Die Zahlen von Qwen3-8B stammen aus einer völlig anderen Quelle, und das ist wichtiger als die Frage, welche Zahlen höher sind. Achtzehn Monate unabhängiger Evaluierung, Community-Quantisierungen, Serving-Benchmarks und Produktiv-Deployments sind eine andere Art von Beleg: Es ist keine Behauptung, sondern eine Erfolgsbilanz. Man kann herausfinden, wie sich Qwen3-8B unter 4-Bit-Quantisierung auf einer bestimmten Karte verhält, weil jemand es veröffentlicht hat. Für AesCode-8B geht das nicht, denn Stand dieser Woche hat es niemand außerhalb von Microsoft auf irgendetwas laufen lassen.

Und es gibt keine gemeinsame Metrik zwischen den beiden Tabellen. Qwen3-8B hat keinen Infografik-Layout-Score; AesCode-8B hat überhaupt keinen veröffentlichten General-Reasoning-Benchmark. Der Vergleich ist nicht knapp oder nicht knapp — er ist nicht verfügbar.

Was das Ausführen jedes einzelnen tatsächlich erfordert

A screenshot of the OrcaRouter model page for qwen/qwen3-vl-8b-instruct showing the Vision, Tools and JSON capability badges, the byline "by Qwen - 2025-10-14", the description "Qwen3-VL 8B Instruct - open-weight small vision-language model, 8B params, 128k context, no thinking mode", the pricing row reading $0.18 input and $0.70 output per million tokens, and the OpenAI-compatible code sample against the https://api.orcarouter.ai/v1 base URL.

Qwen3-8B ist der einfache Fall. Ein 8,2B-Textmodell lässt sich auf eine einzelne Consumer-Karte quantisieren, hat achtzehn Monate Tooling in jedem Serving-Framework und jeder lokalen Runtime hinter sich und verhält sich vorhersehbar. Die Kontexterweiterung auf 131K ist dokumentiert und nicht bloß Folklore, und die Abdeckung von 119 Sprachen ist der Grund, warum es in so vielen mehrsprachigen Pipelines auftaucht.

AesCode-8B ist ein Serving-Projekt. Der Befehl der Karte selbst lautet vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, mit transformers 4.57 oder neuer für den Nicht-vLLM-Pfad. Die 17,5 GB bf16-Gewichte müssen neben einem KV-Cache für 24.576 Token und bis zu zwei Bilder passen, also ist eine einzelne 24-GB-Karte technisch ausreichend und unangenehm knapp, und 40–48 GB oder zwei 24-GB-Karten sind die realistische Untergrenze. Kalkulieren Sie außerdem einen Renderer ein, denn jede Aussage über die Qualität dieses Modells wurde dadurch getroffen, dass seine HTML-Ausgabe in einem Sandbox-Browser gerendert wurde – wenn Sie wissen möchten, ob Ihre eigenen Ausgaben gut sind, müssen Sie genau diese Testumgebung aufsetzen. Und beachten Sie, dass der Kontext mit 24.576 Token auf einzelnen Infografik-Seiten getestet wurde, nicht auf den Multi-Slide-Decks, für die das Modell beworben wird, sodass Kontextdruck bei einem echten Deck ungetestetes Terrain ist.

Verfügbarkeit ist die andere Hälfte desselben Punktes. AesCode-8B ist kein Modell, das OrcaRouter routet, und wir konnten es auch nirgendwo sonst finden, wo es bereitgestellt wird; eine Evaluierung heute bedeutet Gewichte auf Ihrer eigenen Hardware. Sein Vorfahre ist eine andere Geschichte — Qwen3-VL-8B-Instruct ist derzeit über OrcaRouter zu 0,18 $ pro Million Eingabe-Tokens und 0,70 $ pro Million Ausgabe-Tokens bei einem Kontext von 131.072 Tokens aufrufbar, was es zur günstigsten Möglichkeit macht zu sehen, was die ungetunte Version genau dieser Architektur bei Ihren eigenen Infografik-Prompts leistet. Weiter oben in derselben Linie ist Qwen3.8-27B für 0,33 $ und 2,40 $ routbar. Der Listenpreis des Anbieters wird ohne Aufschlag durchgereicht, und der Failover zwischen Anbietern erfolgt automatisch, sodass das Prototyping des Prompts gegen das gehostete Backbone einen Schlüssel statt einer GPU-Woche kostet, und nur die Prompts, die tatsächlich gut rendern, rechtfertigen die Reproduktionsarbeit.

A Hugging Face screenshot of the microsoft/AesCode-8B model card showing 0 likes at capture time, the Microsoft organisation follower count, the Image-Text-to-Text, Transformers, Safetensors and English tags with qwen3_vl and code-generation, an Apache-2.0 licence badge, and the opening card text describing AesCode as generating information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS, followed by the line that AesCode-8B starts from Qwen3-VL-8B-Instruct.

Welche du willst, hängt vom Artefakt ab.

Wähle AesCode-8B, wenn das Ergebnis eine Seite ist und sie editierbar sein muss. Strukturierte HTML-Ausgabe, die sich in Git diffen lässt, Tabellen als echte Tabellen und Diagramme als ECharts-Spezifikationen, ist ein wirklich anderes Artefakt als ein Absatz Text, und keine noch so große allgemeine Fähigkeit ersetzt das. Geh den Kompromiss bewusst ein: ein nicht angekündigter Research-Checkpoint mit einer zweistelligen Downloadzahl, ein 24K-Kontext, nur Englisch, keine unabhängige Evaluierung, eine Style-Obergrenze, die der eigene Anbieter veröffentlicht, und eine Serving-Rechnung, die sich in zig Gigabyte bemisst.

Wählen Sie Qwen3-8B für alles andere – was für die meisten Teams alles ist. Es ist der bewährte Generalist in dieser Gewichtsklasse, es hat einen längeren Kontext, es spricht einhundertneunzehn Sprachen, es läuft auf Hardware, die Sie bereits besitzen, und hinter den Entscheidungen, die Sie gleich treffen werden, stehen achtzehn Monate Produktionserfahrung anderer. Wenn Sie keinen spezifischen Bedarf haben, gerenderte Seiten auszugeben, hat dieser Vergleich nur eine Antwort.

Das Argument dafür, beides haben zu wollen, ist stichhaltig, und es ist kein Tie-Break. Eine Pipeline, die Dokumente liest und Decks erzeugt, verwendet zwei Modelle mit zwei wirklich unterschiedlichen Ausgabetypen, und die sinnvolle Haltung ist, den Seitenrenderer auf Hardware zu belassen, die ihn betreiben kann, und die Lese- und Reasoning-Arbeit an etwas weiterzuleiten, das hinter demselben Endpunkt wie alles andere gehostet wird.

Was würde diese Seite zu einer Abschlussseite machen?

Drei Dinge, und nur eines davon betrifft Benchmarks. Eine unabhängige Reproduktion der 82,94 und des Rückgangs um 1,00 Punkte gegenüber der Referenz würde AesCode-8B von der Anbieterbehauptung zum Ergebnis machen und würde es ermöglichen, die 8B-gegen-8B-Größenfrage nach sachlichen Kriterien zu beantworten. Ein Anbieter, der den Checkpoint aufnimmt, würde die Deployment-Spalte kollabieren lassen und „eine GPU-Woche“ in „einen API-Aufruf“ verwandeln. Und das Paper, das die Karte als unter Begutachtung stehend zitiert – „AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards“ –, würde die Frage beantworten, die die Modellkarte nicht beantworten kann: was die visuelle Rubrik macht, wenn der Design-Graph, gegen den sie bewertet, selbst falsch ist.

Bis eines davon eintrifft, ist die vertretbare Lesart die eng gefasste. AesCode-8B ist das interessantere der beiden Modelle und das weniger brauchbare. Es ist sehr gut in den Teilen des visuellen Designs, die eine Maschine überprüfen kann, mittelmäßig in dem Teil, der sich nicht automatisieren lässt, und es gehört zur selben Familie der Qwen3-Generation wie das Modell, mit dem es verglichen wird, ohne von diesem abzustammen. Qwen3-8B ist dasjenige, das man heute Nachmittag in eine Pipeline einbinden kann.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert