
AesCode 32B vs. Qwen3.8 27B: Microsoft hat es auf Qwen aufgebaut, und eines von beiden ist aufrufbar
- OrcaNEUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 pro 1 Mio. Tokens · 87 tok/s
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
Das Detail, das diesen ganzen Vergleich neu ordnet, steht in der zweiten Zeile der Modellkarte: AesCode 32B geht von Qwen3-VL-32B-Instruct aus. Microsofts designspezifisches Codemodell ist ein Qwen3-VL-Fine-Tune, Apache 2.0, in einem am 29. September 2026 erstellten Hugging-Face-Repository, mit dem Commit mit dem Titel „Release AesCode-32B“ vom 7. Oktober 2026 – und ohne jegliche Ankündigung von Microsoft. Qwen3.8 27B ist das andere Ende dieser Abstammungslinie: das eigene offene 27B-Dense-Multimodell des Anbieters, veröffentlicht am 14. August 2026 unter Apache 2.0, die Nachfolgerarchitektur des VL-Checkpoints, den Microsoft feinabgestimmt hat. Es geht hier also nicht um ein Duell zwischen den Flaggschiff-Bemühungen zweier Anbieter. Es ist ein Duell zwischen dem universellen Open-Weights-Modell eines Labors und dem Forschungs-Fine-Tune eines Wettbewerbers auf Basis derselben Familie, und der praktische Unterschied zwischen beiden dreht sich am Ende fast ausschließlich darum, was man mit der Datei tun darf, wenn man sie erst einmal hat.
Gleiche Lizenz, gleiche Familie, unterschiedliche Modellmenge
Beide sind Apache 2.0, beide nehmen sowohl Bilder als auch Text entgegen, und beide geben Text zurück. Alles danach weicht voneinander ab, und die Deployment-Zeile weicht am stärksten ab.
• Parameter — AesCode 32B: 33B dense auf einer Qwen3-VL-32B-Instruct-Basis. Qwen3.8 27B: 27B dense, 28B einschließlich des Vision-Encoders, 64 Schichten bei einer Hidden-Size von 5120.
• Speicher für den Betrieb – AesCode 32B: Die Modellkarte empfiehlt, allein für die bf16-Parameter mit rund 65 GB Beschleuniger-Speicher zu rechnen, und ihr eigenes Serving-Beispiel nutzt vierfachen Tensor-Parallelismus. Qwen3.8 27B: etwa 55,6 GB in bf16.
• Kontext — AesCode 32B: 24.576 Tokens in der gemeldeten Konfiguration, wobei Prompts und Antworten während des Trainings auf 8.192 begrenzt sind. Qwen3.8 27B: 262.144 Tokens nativ, mit YaRN-Skalierung auf 1.000.000 erweiterbar.
• Attention — AesCode 32B: vom Qwen3-VL-Backbone übernommen. Qwen3.8 27B: hybrid, 48 Gated-DeltaNet-Linear-Attention-Layer zu 16 Full-Attention-Layern im Verhältnis 3:1, was ein 262K-Fenster bezahlbar zu bedienen macht.
• Wofür es gedacht ist — AesCode 32B: das Generieren informationsreicher visueller Artefakte als bearbeitbares HTML und CSS sowie Forschung zur multimodalen Codegenerierung. Qwen3.8 27B: allgemeine agentische und multimodale Arbeit — Programmierung, Computernutzung, Dokument- und Videoverständnis, Tool-Aufrufe.
• Wo man es bekommt — AesCode 32B: ein Hugging-Face-Download; kein Inferenzanbieter stellt es bereit. Qwen3.8 27B: Gewichte oder ein gehosteter Endpunkt.
Doppelt so viel Kontext, etwas kleinerer Footprint, ein um eine Generation neueres Backbone und eine Lizenz, die identisch ist. Die einzige Zeile, in der AesCode 32B klar gewinnt, ist die erste – und sie gewinnt sie durch ein aufgabenspezifisches Fine-Tuning.
Worauf jedes tatsächlich gemessen wurde
Die beiden Bewertungsregime berühren sich nicht, und so zu tun, als wäre es anders, ist der Standardfehler auf Seiten wie dieser.
Die Modellkarte von Qwen3.8 27B ist zugleich breit gefächert und spezifisch. Programmierung: Terminal-Bench 2.1 bei 73,0, SWE-bench Pro bei 61,7, QwenSWEBench bei 79,0, LiveCodeBench v6 bei 90,3. Reasoning: GPQA Diamond 89,2, Humanity's Last Exam 30,8. Computernutzung: OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9. Vision: MathVision 94,6 mit der Inferenzzeit-Optimierung des Anbieters und 90,0 ohne sie, OmniDocBench 1.5 bei 91,1. All das sind die eigenen Zahlen des Anbieters auf dem eigenen Test-Harness des Anbieters — mit einer lesenswerten Fußnote, dass für die SWE-bench-Pro- und QwenSWEBench-Läufe das Claude-Code-Harness verwendet wurde und sie daher nicht direkt mit Modellen vergleichbar sind, die auf einem anderen Test-Harness bewertet wurden.
AesCode 32B hat einen einzigen Benchmark, und dieser ist zweckgebunden: 300 Infografik-Beispiele, drei Generierungen pro Prompt ohne Auswahl, gerendert und über sieben Kanäle bewertet. Die Schlagzeile ist ein Overall von 85,89 mit dem bereitgestellten Referenzbild, gegenüber 81,28 für GPT-5.5 und 80,39 für Claude Opus 4.8 unter demselben Testaufbau — plus die Behauptung, dass AesCode 32B sein eigenes Qwen3-VL-32B-Backbone um 22,4 Punkte in der Dimension Visual und um 24,8 bei Overall übertrifft.
Stell die beiden nebeneinander, und nichts passt zusammen. Terminal-Bench misst, ob eine Shell-Aufgabe abgeschlossen wird; die AesCode-Evaluation misst, ob der Text einer Infografik lesbar ist, ihr Layout die Zeichenfläche nicht überläuft und ihre Tabelle eine echte HTML-Tabelle ist. Es gibt keine gemeinsame Metrik, kein gemeinsames Harness und keine gemeinsame Aufgabe. Die einzige ehrliche Aussage ist, dass AesCode 32B bei Design-Artefakten deutlich besser ist als sein eigenes Backbone und Qwen3.8 27B ein starkes allgemeines Modell ist – und keine der beiden Aussagen sagt etwas über die andere aus.

Die Evidenzlücke ist diesmal real, in einer Richtung.
Hersteller-Benchmarks sind in dieser Branche die Norm, daher ist es wichtig, dass sich diese beiden darin unterscheiden, wie viel von ihren Herstellerangaben jemand anderes überprüft hat.
Qwen3.8 27B wurde mit der eigenen Tabelle des Anbieters ausgeliefert und sammelte dann innerhalb weniger Wochen externe Ergebnisse. Die unabhängige Bilanz des Modells umfasst eine Legal-Agent-Studie, die das Legal-AI-Unternehmen Harvey zusammen mit dem Memory-Startup Engram durchgeführt hat, bei der ein angepasstes Qwen3.8 27B alle von der Studie getesteten Modelle anführte, einschließlich Claude Opus 4.8, bei 250 juristischen Aufgaben – mit dem wichtigen Vorbehalt, dass das angepasste Modell zuvor den 100-Millionen-Token-Korpus der Testkanzlei studiert hatte, es also ebenso sehr ein Ergebnis über die Anpassung wie über das Modell ist. Sie umfasst eine Platzierung in Code Arenas WebDev-Bestenliste und den Spitzenplatz unter den Open-Weight-Modellen in Arena.ais Image-to-WebDev-Bestenliste, bei denen es sich beides Mal um vom Anbieter weitergegebene Ranking-Behauptungen statt um veröffentlichte Methodik handelt. Und sie umfasst eine Drittanbieter-Bestenliste mit veröffentlichter Punktzahl: Artificial Analysis führt Qwen3.8 27B mit 33,70 in seinem Intelligence Index bei Kosten von rund 1,01 US-Dollar pro abgeschlossener Aufgabe und veröffentlicht die dahinterstehende Token-Aufschlüsselung.
AesCode 32B hat nichts davon. Keine Arena-Platzierung, kein Leaderboard-Eintrag, keine Reproduktion durch Dritte, kein unabhängiger Durchsatztest — und das nicht, weil jemand nachgesehen und es für mangelhaft befunden hätte, sondern weil ein Checkpoint, den kein Anbieter bereitstellt, gar nicht erst von einer externen Testumgebung evaluiert werden kann. Seine Zahlen stammen vom Anbieter, berechnet mit demselben Verifier-Stack, der das Modell trainiert hat, anhand von Stichproben, die der Anbieter ausgewählt hat, gegen Baselines, die der Anbieter ausgeführt hat. Die Veröffentlichung ist ungewöhnlich transparent, was die Methode betrifft — die Namen der Reward-Kanäle, die Rollout-Zahlen, die Dekodierungsparameter und die Fehlerraten sind alle veröffentlicht —, aber Transparenz darüber, wie eine Zahl erzeugt wurde, ist nicht dasselbe, wie wenn jemand anderes sie erzeugt.
Diejenige, für die eine hinterlegte Karte erforderlich ist
Hier ist der Punkt, an dem die Abstammungslinie aufhört, Nebensache zu sein, und anfängt, die Entscheidung zu sein.
AesCode 32B verlangt von Ihnen 65 GB Accelerator-Speicher, einen multimodalen Serving-Pfad und die Bereitschaft, als Early Adopter ein nicht angekündigtes Modell auszuführen. Sein eigenes Serving-Beispiel setzt auf vierfachen Tensor-Parallelismus, und das Modell ist für einen 24.576-Token-Kontext dokumentiert, ohne dass es eine gehostete Option gibt, auf die man zurückgreifen könnte. Wenn Sie die Hardware bereits besitzen und Ihre Pipeline tatsächlich designspezifisches Fine-Tuning benötigt, ist das ein vertretbarer Kompromiss. Für die meisten Teams ist es ein zweiwöchiges Projekt, bevor der erste nützliche Output entsteht.
Qwen3.8 27B wird auf OrcaRouters eigener Infrastruktur selbst gehostet und ist ab sofort für 0,33 $ pro Million Input-Tokens und 2,40 $ pro Million Output-Tokens abrufbar, mit einem Kontext von 262.144 Tokens sowie Text-, Bild- und Videoeingabe. Das sind Listenpreise, die ohne Aufschlag unsererseits durchgereicht werden, und es läuft unter demselben Schlüssel wie über 200 weitere Modelle, sodass der Vergleich mit jeder Alternative im Katalog ein Request-Parameter ist und kein zweiter Vertrag. Das ist das ganze praktische Argument, und es ist ein gewichtiges: Das Modell, das gemessen an der Modellfamilie eine Generation hinter dem Backbone von AesCode 32B zurückliegt, ist genau dasjenige, das Sie heute Nachmittag mit Ihren eigenen Prompts für den Preis von ein paar Cent evaluieren können.
Hier gibt es einen Punkt zweiter Ordnung, den der Routing-Aspekt konkretisiert. Da AesCode 32B ein Fine-Tuning eines Qwen3-VL-Checkpoints ist, bietet die Familie eine günstige Möglichkeit zu testen, ob die gehostete Seite der Architektur überhaupt funktioniert, bevor Sie sich darauf festlegen, irgendetwas selbst zu hosten. Qwen3-VL 235B A22B Instruct ist für 0,40 $ pro Million Input-Tokens und 1,60 $ Output-Tokens verfügbar, und Qwen3-VL 8B Instruct für 0,18 $ und 0,70 $. Keines von beiden ist AesCode 32B, und keines wurde auf Designqualität trainiert — aber „Kann ein Vision-Language-Modell unsere Screenshots lesen und das Markup schreiben, das wir brauchen?“ lässt sich mit ihnen für ein paar Cent beantworten, und automatisches Failover unter demselben Endpoint bedeutet, dass ein schlechter Anbietertag die Pipeline nicht lahmlegt.

Wer sollte welche auswählen?
Nimm AesCode 32B, wenn das Artefakt das Lieferergebnis ist. Du produzierst Folien, Dashboards, Poster oder Berichte in großem Umfang, du brauchst strukturierte Ausgaben, die bearbeitbar und diffbar bleiben — das Modell gibt ein vollständiges HTML-Dokument aus, verwendet echte HTML-Tabellenstrukturen und ECharts-Spezifikationen, damit beides inspizierbar bleibt — und du hast die Hardware oder das Budget, sie zu mieten. Geh mit der Akzeptanz dreier Dinge hinein: keine unabhängige Verifizierung irgendeiner Zahl, rund 65 GB für die Gewichte und ein 24K-Kontext, der lange Dokumente einschränken wird. Die schwerwiegende Canvas-Grenzfehlerrate von 4,3 %, die die Karte meldet, gegenüber 34,7 % für GPT-5.5, ist die ermutigendste einzelne Zahl in der Veröffentlichung, und sie ist auch die von Microsoft.
Nimm Qwen3.8 27B, wenn du ein allgemeines multimodales Modell mit offenen Gewichten brauchst, das du tatsächlich ausführen und tatsächlich bereitstellen kannst. 262K Kontext, erweiterbar auf eine Million; eine Bereitstellungsgröße, die dort passt, wo AesCode 32B nicht passt; eine Lizenzsituation, die sich nicht unterscheidet; unabhängige Messungen sowohl seiner Qualität als auch seiner Kosten pro abgeschlossener Aufgabe; und eine gehostete Option, die bedeutet, dass du heute starten und später selbst hosten kannst, ohne die Integration neu zu schreiben. Sein gestuftes, schichtweises Attention-Design ist der Grund, warum der lange Kontext bezahlbar ist, und langer Kontext ist genau das, was Design- und Dokument-Pipelines am meisten brauchen.
Und wenn Sie beides brauchen – einen Generator für Design-Artefakte und ein allgemeines Arbeitstier –, dann ist die sinnvolle Aufteilung nicht, zwei Vision-Language-Modelle der 30B-Klasse auf Ihrer eigenen Hardware zu betreiben. Leiten Sie den allgemeinen Datenverkehr an die gehostete Seite und betreiben Sie den Spezialisten selbst gehostet, hinter einem Schlüssel, wobei ein Anbieterausfall auf einem der beiden Wege ein Failover-Ereignis ist und kein Incident.

Worauf man achten sollte
Die Position von AesCode 32B ändert sich vollständig, wenn es aufrufbar wird. Derzeit ist die einzige echte Schwäche des Modells der Zugang, und das ist ein vorübergehender Zustand – ein Inferenzanbieter, der den Checkpoint übernimmt, oder Microsoft, das einen Endpoint veröffentlicht, verwandelt eine 65-GB-Beschaffung in eine Modellauswahl. Bis dahin lautet die ehrliche Zusammenfassung dieses Duells, dass das Fine-Tuning bei einer Aufgabe besser ist, das allgemeine Modell besser darin ist, nutzbar zu sein, und das allgemeine Modell zufällig der Vorfahre ist: Microsoft entschied sich für einen Qwen3-VL-Checkpoint als Basis, weil er die stärkste verfügbare offene multimodale Grundlage war, was wiederum das Nützlichste ist, was dieser Vergleich über Qwen3.8 27B zu sagen hat.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
