Une carte de titre principale pour « AesCode 32B vs Qwen3.8 27B », sous-titrée « le fine-tune et l'ancêtre », dessinée sous la forme d'un diagramme de lignée : une carte de checkpoint Qwen3-VL-32B-Instruct à gauche alimente par une flèche une carte « fine-tune AesCode 32B » portant la mention « auto-hébergement uniquement, 65 GB », tandis qu'une carte plus récente distincte, en bas à droite et intitulée « Qwen3.8 27B », arbore un marqueur d'API en direct indiquant « appelable dès aujourd'hui » ; le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

AesCode 2 vs Qwen3.8 27B : Microsoft l'a construit sur Qwen, et l'un des deux est appelable

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le détail qui réorganise toute cette comparaison se trouve à la deuxième ligne de la fiche du modèle : AesCode 32Bpart de Qwen3-VL-32B-Instruct. Le modèle de code spécifique au design de Microsoft est un fine-tune de Qwen3-VL, sous Apache 2.0, hébergé dans un dépôt Hugging Face créé le 29 septembre 2026, avec le commit intitulé « Release AesCode-32B » daté du 7 octobre 2026 et aucune annonce de Microsoft nulle part. Qwen3.8 27Best l'autre extrémité de cette lignée : le modèle multimodal dense 27B à poids ouverts du fournisseur lui-même, publié le 14 août 2026 sous Apache 2.0, l'architecture successeure du checkpoint VL que Microsoft a fine-tuné. Il ne s'agit donc pas d'une confrontation entre les efforts phares de deux fournisseurs. C'est une confrontation entre le modèle généraliste à poids ouverts d'un laboratoire et le fine-tune de recherche d'un concurrent sur cette famille, et la différence pratique entre eux s'avère presque entièrement liée à ce que vous êtes autorisé à faire du fichier une fois que vous l'avez.

Même licence, même famille, quantité de modèles différente

Les deux sont sous Apache 2.0, tous deux acceptent des images ainsi que du texte, et tous deux renvoient du texte. Tout ce qui suit diverge, et c’est la ligne du déploiement qui diverge le plus.

• Paramètres — AesCode 32B : 33B dense sur une base Qwen3-VL-32B-Instruct. Qwen3.8 27B : 27B dense, 28B en comptant l'encodeur visuel, 64 couches pour une dimension cachée de 5120.

• Mémoire nécessaire pour l’exécuter — AesCode 32B : la fiche conseille de prévoir environ 65 Go de mémoire d’accélérateur pour les seuls paramètres bf16, et son propre exemple de service utilise un parallélisme tensoriel à quatre voies. Qwen3.8 27B : environ 55,6 Go en bf16.

• Contexte — AesCode 32B : 24 576 tokens dans la configuration rapportée, avec des prompts et des réponses lors de l'entraînement plafonnés à 8 192. Qwen3.8 27B : 262 144 tokens natifs, extensibles jusqu'à 1 000 000 avec la mise à l'échelle YaRN.

• Attention — AesCode 32B : héritée du backbone Qwen3-VL. Qwen3.8 27B : hybride, 48 couches d'attention linéaire Gated DeltaNet pour 16 couches d'attention complète dans un ratio de 3:1, ce qui rend une fenêtre de 262K abordable à servir.

• À quoi il sert — AesCode 32B : générer des artefacts visuels riches en informations sous forme de HTML et CSS modifiables, ainsi que la recherche sur la génération de code multimodal. Qwen3.8 27B : travail agentique et multimodal général — codage, utilisation de l'ordinateur, compréhension de documents et de vidéos, appel d'outils.

• Où l’obtenir — AesCode 32B : un téléchargement depuis Hugging Face ; aucun fournisseur d’inférence ne le déploie. Qwen3.8 27B : les poids, ou un point de terminaison hébergé.

Deux fois plus de contexte, une empreinte légèrement plus petite, un backbone d'une génération plus récente et une licence identique. La seule ligne où AesCode 32B l'emporte nettement est la première, et il la remporte grâce à un fine-tune spécifique à la tâche.

Sur quoi chacun a réellement été mesuré

Les deux régimes d’évaluation ne se touchent pas, et prétendre le contraire est l’erreur classique sur des pages comme celle-ci.

La fiche de Qwen3.8 27B est à la fois vaste et précise. Codage : Terminal-Bench 2.1 à 73,0, SWE-bench Pro à 61,7, QwenSWEBench à 79,0, LiveCodeBench v6 à 90,3. Raisonnement : GPQA Diamond 89,2, Humanity's Last Exam 30,8. Utilisation d'ordinateur : OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9. Vision : MathVision 94,6 avec l'amélioration en temps d'inférence du fournisseur et 90,0 sans elle, OmniDocBench 1.5 à 91,1. Tout cela, ce sont les chiffres du fournisseur lui-même sur son propre harnais — avec une note de bas de page qui vaut la peine d'être lue, à savoir que les exécutions SWE-bench Pro et QwenSWEBench ont utilisé le harnais Claude Code, de sorte qu'elles ne sont pas directement comparables avec des modèles évalués sur un autre.

AesCode 32B n'a qu'un seul benchmark, et il n'a qu'une seule finalité : 300 échantillons d'infographies, trois générations par prompt sans sélection, rendues et notées sur sept canaux. Le chiffre phare est un Overall de 85,89 avec l'image de référence fournie, contre 81,28 pour GPT-5.5 et 80,39 pour Claude Opus 4.8 dans le même harnais — plus l'affirmation qu'AesCode 32B dépasse son propre socle Qwen3-VL-32B de 22,4 points sur la dimension Visual et de 24,8 sur l'Overall.

Mettez-les côte à côte et rien ne s’aligne. Terminal-Bench mesure si une tâche shell s’accomplit ; l’évaluation AesCode mesure si le texte d’une infographie est lisible, si sa mise en page ne déborde pas du canevas et si son tableau est un véritable tableau HTML. Il n’y a ni métrique commune, ni harnais commun, ni tâche commune. La seule affirmation honnête est qu’AesCode 32B est bien meilleur sur les artefacts de conception que son propre modèle de base, et que Qwen3.8 27B est un modèle généraliste solide — et aucune de ces deux affirmations ne vous dit quoi que ce soit sur l’autre.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

Le déficit de preuves est réel cette fois-ci, dans un seul sens

Les benchmarks de fournisseurs sont la norme dans ce secteur, il est donc significatif que ces deux-là diffèrent quant à la part de leurs affirmations de fournisseur que quelqu'un d'autre a vérifiée.

Qwen3.8 27B est arrivé avec le propre tableau du fournisseur, puis a accumulé des résultats externes en quelques semaines. Le palmarès indépendant du modèle comprend une étude sur les agents juridiques menée par la société d'IA juridique Harvey avec la startup de mémoire Engram, dans laquelle un Qwen3.8 27B adapté a devancé tous les modèles testés par l'étude, y compris Claude Opus 4.8, sur 250 tâches juridiques — avec la mise en garde importante que le modèle adapté avait d'abord étudié le corpus de 100 M de tokens du cabinet testé, il s'agit donc d'un résultat autant sur l'adaptation que sur le modèle. Il comprend une place au classement WebDev de Code Arena et la première place des modèles à poids ouverts au classement Image-to-WebDev d'Arena.ai, deux affirmations de classement relayées par le fournisseur plutôt qu'une méthodologie publiée. Et il comprend un classement tiers avec un score publié : Artificial Analysis enregistre Qwen3.8 27B à 33,70 sur son Intelligence Index, avec un coût par tâche terminée d'environ 1,01 $, et publie la répartition des tokens derrière ce chiffre.

AesCode 32B n’a rien de tout cela. Aucun positionnement en arène, aucune inscription dans un classement, aucune reproduction par un tiers, aucun test de débit indépendant — et non parce que quelqu’un aurait regardé et l’aurait trouvé insuffisant, mais parce qu’un checkpoint qu’aucun fournisseur ne sert ne peut de toute façon pas être évalué par un harnais externe. Ses chiffres sont ceux du fournisseur, calculés par la même pile de vérification qui a entraîné le modèle, sur des échantillons choisis par le fournisseur, par rapport à des performances de référence mesurées par le fournisseur. La publication est d’une transparence inhabituelle quant à la méthode — les noms des canaux de récompense, les nombres de rollouts, les paramètres de décodage et les taux d’échec sont tous publiés — mais la transparence sur la façon dont un chiffre a été produit n’est pas la même chose que le fait que quelqu’un d’autre le produise.

Celui qui nécessite une carte enregistrée

C'est ici que la lignée cesse d'être une anecdote pour devenir la décision.

AesCode 32B vous demande 65 Go de mémoire d'accélérateur, un chemin de service multimodal et la volonté d'exécuter un modèle non annoncé en tant qu'adopteur précoce. Son propre exemple de service fait appel à un parallélisme tensoriel à quatre voies, et le modèle est documenté pour un contexte de 24 576 jetons, sans option hébergée sur laquelle se rabattre. Si vous possédez déjà le matériel et que votre pipeline a réellement besoin d'un affinage spécifique à la conception, c'est un compromis raisonnable. Pour la plupart des équipes, c'est un projet de deux semaines avant la première sortie utile.

Qwen3.8 27B est auto-hébergé sur l'infrastructure propre d'OrcaRouter et appelable dès aujourd'hui à 0,33 $ par million de jetons en entrée et 2,40 $ en sortie, avec un contexte de 262 144 jetons et une entrée image et vidéo. Ces tarifs catalogue sont répercutés sans supplément de notre côté, et le modèle est accessible avec la même clé que plus de 200 autres modèles ; la comparaison avec n'importe quelle entrée du catalogue relève donc d'un paramètre de requête et non d'un second contrat. Voilà tout l'argument pratique, et il est de taille : le modèle qui, en termes de famille, accuse une génération de retard sur la colonne vertébrale d'AesCode 32B est précisément celui que vous pouvez évaluer cet après-midi, sur vos propres prompts, pour quelques centimes.

Il y a ici un point de second ordre que l'angle du routage rend concret. Comme AesCode 32B est un fine-tuning d'un checkpoint Qwen3-VL, la famille vous offre un moyen peu coûteux de vérifier si le versant hébergé de l'architecture fonctionne tout court, avant de vous engager dans l'auto-hébergement de quoi que ce soit. Qwen3-VL 235B A22B Instruct est disponible à 0,40 $ par million en entrée et 1,60 $ en sortie, et Qwen3-VL 8B Instruct à 0,18 $ et 0,70 $. Ni l'un ni l'autre n'est AesCode 32B, et ni l'un ni l'autre n'a été entraîné pour la qualité du design — mais « un modèle vision-langage peut-il lire nos captures d'écran et écrire le balisage dont nous avons besoin » trouve sa réponse avec eux pour quelques centimes, et le basculement automatique sous le même endpoint signifie qu'une mauvaise journée chez un fournisseur ne fait pas tomber le pipeline.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

Qui devrait choisir lequel ?

Prenez AesCode 32B si l’artefact est le livrable. Vous produisez des diapositives, des tableaux de bord, des affiches ou des rapports en volume, vous avez besoin d’une sortie structurée qui reste éditable et diffable — le modèle génère un document HTML complet, utilise de véritables structures de tableaux HTML et des spécifications ECharts afin que les deux restent inspectables — et vous disposez du matériel ou du budget pour le louer. Partez en acceptant trois choses : aucune vérification indépendante d’un quelconque chiffre, environ 65 Go pour les poids, et un contexte de 24 K qui limitera les longs documents. Le taux d’échec grave de 4,3 % aux limites du canevas rapporté par la fiche, contre 34,7 % pour GPT-5.5, est le chiffre le plus encourageant de cette version, et c’est aussi celui de Microsoft.

Prenez Qwen3.8 27B si vous avez besoin d’un modèle multimodal généraliste à poids ouverts que vous pouvez réellement exécuter et réellement servir. Un contexte de 262 K, extensible jusqu’à un million ; une empreinte de déploiement qui passe là où AesCode 32B ne passe pas ; une position de licence pas différente ; une mesure indépendante à la fois de sa qualité et de son coût par tâche terminée ; et une option hébergée qui vous permet de commencer aujourd’hui et de vous auto-héberger plus tard sans réécrire l’intégration. Sa conception d’attention par étapes, couche par couche, est ce qui rend le contexte long abordable, et le contexte long est ce dont les pipelines de design et de documents ont tendance à avoir le plus besoin.

Et si vous avez besoin des deux — un générateur d'artefacts de conception et une bête de somme polyvalente —, le partage judicieux ne consiste pas à faire tourner deux modèles vision-langage de classe 30B sur votre propre matériel. Dirigez le trafic général vers la solution hébergée et gardez le spécialiste en auto-hébergement, derrière une seule clé, où une panne de fournisseur sur l'un ou l'autre chemin est un événement de basculement plutôt qu'un incident.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

Ce qu'il faut surveiller

La position d'AesCode 32B change complètement s'il devient appelable. Pour l'instant, la seule véritable faiblesse du modèle est l'accès, et c'est une condition temporaire : la récupération du checkpoint par un fournisseur d'inférence, ou la publication d'un endpoint par Microsoft, transforme une acquisition de 65 Go en un choix de modèle. D'ici là, le résumé honnête de cette confrontation est que le modèle affiné est meilleur sur une tâche, que le modèle général est meilleur en matière d'utilisabilité, et que le modèle général se trouve être l'ancêtre : Microsoft a choisi un checkpoint Qwen3-VL sur lequel bâtir parce qu'il était la base multimodale ouverte la plus performante disponible, ce qui est en soi l'élément le plus utile que cette comparaison ait à dire sur Qwen3.8 27B.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement