Une carte de titre générée intitulée « AesCode-8B vs Gemma 4 12B », avec deux cartes aux coins arrondis côte à côte. La carte de gauche, AesCode-8B, arbore une icône de fenêtre de navigateur et les lignes « point de contrôle de recherche Microsoft » et « Émet une page HTML rendue » ; la carte de droite, Gemma 4 12B, arbore une icône de loupe sur un document et les lignes « Google DeepMind, lancé le 2026-06-03 » et « Répond aux questions sur les images ». Un séparateur entre elles indique « l’un rend, l’autre répond », et un bandeau de légende en haut indique « sortie non annoncée – poids uniquement, aucun point de terminaison hébergé ». Le logo OrcaRouter est incrusté en bas à droite.
Guides & Insights

AesCode-8B vs Gemma 4 12B : deux petits modèles de vision, deux résultats complètement différents

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

AesCode-8B et Gemma 4 12B prennent tous les deux une image et une phrase et sont tous les deux des checkpoints Apache-2.0 que vous téléchargez au lieu de les louer, c’est pourquoi les moteurs de recherche les mettront volontiers côte à côte. La ressemblance est réelle, et elle est aussi superficielle. Gemma 4 12B renvoie une réponse — une description, une transcription, un extrait de code, une trace de raisonnement. AesCode-8B renvoie une page rendue : une diapositive, une affiche ou un tableau de bord sous la forme d’un document HTML et CSS complet que vous pouvez ouvrir dans un navigateur et modifier à la main. Même forme d’entrée, à peu près la même classe de poids, et une sortie qui n’a presque rien en commun avec l’autre. Cette seule différence détermine presque toutes les questions pratiques ci-dessous, y compris celle de savoir lequel vous pouvez mettre devant un utilisateur dès demain.

Il convient de le dire d’emblée, car cela détermine le poids que l’on peut accorder aux chiffres : Gemma 4 12B a été lancé par DeepMind le 3 juin 2026 avec une fiche de modèle, de la documentation et un écosystème, et il a depuis été testé de manière indépendante. AesCode-8B n’a pas été lancé du tout. Le dépôt Microsoft associé a été créé le 29 septembre 2026 et les poids ont été publiés dans un commit intitulé « Release AesCode-8B » à 03:35 UTC le 7 octobre 2026, le code d’entraînement et d’évaluation apparaissant sur GitHub le lendemain. Il n’y a aucun article Microsoft Research, aucune page produit, aucune note de version et aucune prépublication — la citation de la fiche de modèle indique « Under review » avec l’année provisoire 2027. Au moment de la rédaction, le dépôt 8B affiche deux téléchargements et un like. Tout ce qui est quantitatif concernant AesCode-8B provient donc de Microsoft lui-même, et rien n’a été reproduit par qui que ce soit d’autre.

Les deux modèles, selon leurs propres termes

Gemma 4 12B est un modèle ouvert de taille intermédiaire, un checkpoint dense de 11,95 milliards de paramètres dont le choix de conception déterminant est qu’il n’a pas d’encodeur visuel ou audio séparé : les patches d’image et les formes d’onde audio entrent directement dans le transformer. Il dispose d’un contexte de 256 K tokens et nécessite environ 16 Go de VRAM, avec des poids BF16 d’environ 27 Go et des versions quantifiées en dessous de 7 Go. La fiche du fournisseur — rapportée par le fournisseur, et signalée comme telle ici — indique DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 et LiveCodeBench v6 72,0 en mode réflexion. L’évaluation indépendante est la partie qui compte le plus : Artificial Analysis évalue la configuration de raisonnement à un Intelligence Index de 14, mesure environ 114 tokens par seconde et estime le coût d’un appel servi typique à près de 0,10 $ par million de tokens d’entrée et 0,30 $ par million de tokens de sortie. Il compte déjà trois mois et demi de déploiement derrière lui.

AesCode-8B est un fine-tune de Qwen3-VL-8B-Instruct, publié avec quatre shards safetensors totalisant 17 543 339 408 — soit environ 8,8 milliards de paramètres bf16, ce qui explique pourquoi le champ de taille arrondi de Hugging Face affiche 9B alors que le fournisseur indique 8B. La recette publiée est celle d'un Qwen3-VL : 36 couches cachées, taille cachée 4 096, 32 têtes d'attention avec 8 têtes de clé, un vocabulaire de 151 936 tokens, et une exigence de transformers 4.57 ou version ultérieure. Les exécutions rapportées par Microsoft ont utilisé un contexte de 24 576 tokens avec jusqu'à 12 000 tokens de sortie, une température de 0,8, un top-p de 0,95 et trois générations par prompt sans sélection. La licence est Apache 2.0, sans restriction d'accès, sans avenant d'usage acceptable. Ce qui n'est pas inclus, ce sont les données d'entraînement et d'évaluation, ainsi que tout point de terminaison hébergé — nous n'avons trouvé AesCode-8B servi nulle part, et il ne figure pas dans notre propre catalogue.

Ce à quoi les modèles ont réellement été entraînés à faire

Le brief de conception est cité dans la fiche du modèle et vaut la peine d’être lu comme la thèse tout entière : le code « ne peut pas voir comment la mise en page, la hiérarchie et la couleur se rejoignent sur le canevas », tandis que les générateurs d’images « composent des pages visuellement convaincantes mais reproduisent souvent mal le texte, les nombres et les relations logiques ». AesCode est la tentative de conserver à la fois le sens de la composition et la vérifiabilité.

Le mécanisme est inhabituel à un égard bien précis. Chaque invite d’entraînement est associée à une image de référence générée à partir de cette même invite, laquelle fournit la mise en page et le style, tandis que l’invite textuelle reste l’autorité en matière de contenu. Ensuite, à l’inférence, le modèle n’a presque pas besoin de l’image : privez AesCode-8B de la référence et son score Visual chute de 1,00 point sur cent. Privez Qwen3-VL-8B-Instruct de cette référence et la chute est de 19,55. Privez GPT-5.5 de cette référence, évalué dans le même harnais, et la chute est de 10,04. Le prior visuel s’est retrouvé dans les poids plutôt que dans l’entrée, et c’est là le véritable résultat de recherche qui se cache sous le titre.

La cible d’entraînement de Gemma 4 12B est celle, ordinaire, du multimodal, et le dire n’est pas une critique : lire l’image, répondre à la question, suivre l’instruction, appeler l’outil. Rien dans sa fiche ne suggère qu’il ait jamais été destiné à produire un artefact rendu, et aucune évaluation publiée de Gemma 4 12B ne mesure la qualité de la mise en page d’un document, le débordement du canevas ou la cohérence du design, car ce ne sont pas les métriques du modèle.

Le tableau des scores, et à qui appartient la grille d’évaluation

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• Paramètres — AesCode-8B : 8,8B bf16, dense. Gemma 4 12B : 11,95B dense.

• Entrées — AesCode-8B : texte plus une image de référence facultative. Gemma 4 12B : texte, image, audio et vidéo.

• Sortie — AesCode-8B : un document HTML et CSS complet. Gemma 4 12B : texte, y compris les appels d’outils.

• Contexte — AesCode-8B : 24 576 tokens dans la configuration rapportée. Gemma 4 12B : 256 K tokens.

• Licence — les deux sous Apache 2.0, en accès libre, poids inclus.

• Preuves — AesCode-8B : la propre grille d'évaluation d'infographies à 300 échantillons de Microsoft, trois générations par invite, aucune reproduction indépendante. Gemma 4 12B : une fiche fournisseur, plus un indice d'intelligence indépendant de 14 et un débit mesuré sur Artificial Analysis.

Maintenant, la partie que le tableau de scores ne peut pas porter. Microsoft rapporte AesCode-8B à 82,94 Overall sur cet ensemble de 300 échantillons, devant GPT-5.5 conditionné par référence à 81,28 et Claude Opus 4.8 à 80,39, et 31,1 points Visuels d'avance sur son propre socle Qwen3-VL-8B. Considérez tout cela comme rapporté par le fournisseur et non reproduit, selon une grille d'évaluation construite par le fournisseur, sur des échantillons choisis par le fournisseur, notés par un harnais d'évaluation contre lequel le fournisseur a entraîné le modèle. La fiche est assez honnête pour publier une dimension sur laquelle aucun modèle de la comparaison ne dépasse 60 — Style, où AesCode-8B se situe à 53,21 et GPT-5.5 mène à 57,91 — et la définition de cette dimension par Microsoft lui-même est un design qui n'a besoin d'aucune révision visuelle supplémentaire avant livraison. Sur le seul axe qui demande si un humain livrerait la page sans la modifier, le modèle 8B n'est pas le leader. C'est le chiffre à retenir quand quelqu'un cite le 82,94.

Là où ils se chevauchent réellement

Il existe exactement une étagère partagée, et elle est plus étroite qu’elle n’en a l’air. Si vous évaluez de petits modèles de vision ouverts pour un pipeline à forte composante documentaire, les deux sont candidats — l’un pour lire un document, l’autre pour en produire un. Une équipe qui génère des tableaux de bord internes en HTML et doit aussi extraire des chiffres de PDF importés touche aux deux produits dans la même semaine.

La séparation à l’intérieur de ce chevauchement est nette. Gemma 4 12B est le modèle vers lequel vous dirigez un document entrant. AesCode-8B est le modèle vers lequel vous dirigez un brief lorsque le livrable est une page. Ni l’un ni l’autre ne remplace l’autre, et un pipeline qui veut les deux est un pipeline à deux modèles plutôt qu’un choix.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

Le déploiement, c'est là que l'asymétrie fait vraiment mal

L’histoire du déploiement de Gemma 4 12B est terminée. Vous le téléchargez, le quantifiez si vous le souhaitez, l’exécutez sur 16 Go de VRAM, et il existe déjà une vaste base d’outils qui font cela. Si vous préférez ne pas l’exécuter du tout, un appel servi est bon marché et son prix est indépendant.

L'histoire de la mise en service d'AesCode-8B tient en une ligne de commande et quelques calculs. La fiche du modèle indique directement la route — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, avec transformers 4.57 ou plus récent pour la voie non-vLLM. 17,5 Go de poids bf16 doivent cohabiter avec un cache KV pour 24 576 tokens et jusqu'à deux images, donc une seule carte de 24 Go suffit techniquement et reste inconfortablement juste ; 40-48 Go, ou deux cartes de 24 Go, constituent le plancher réaliste. Prévoyez aussi un moteur de rendu, car chaque affirmation de qualité sur ce modèle passe par le rendu de sa sortie HTML dans un navigateur sandboxé, donc évaluer vos propres résultats implique de mettre en place quelque chose de type Playwright avec les requêtes externes bloquées.

Ensuite, il y a l'état honnête de la disponibilité. Nous ne routons pas AesCode-8B, et, pour autant que nous puissions le constater, personne d'autre ne le fait non plus ; une évaluation aujourd'hui implique des poids sur votre propre matériel. La chose la plus proche qui soit appelable est l'architecture à partir de laquelle le modèle a été affiné. Qwen3-VL-8B-Instruct est routable via OrcaRouter désormais à 0,18 $ par million de tokens d'entrée et 0,70 $ par million de tokens de sortie sur un contexte de 131 072 tokens, et les deux checkpoints que nous proposons sont tarifés de la même manière — Gemma 4 26B-A4B à 0,06 et 0,33 $, Gemma 4 31B à 0,13 et 0,38 $. Le prix catalogue du fournisseur est répercuté sans marge ajoutée, et le basculement entre fournisseurs se fait automatiquement, donc le moyen le moins cher de savoir si vos prompts fonctionnent bien le moins du monde est de tester d'abord le backbone non affiné et de consacrer la semaine de GPU uniquement aux prompts qui survivent.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

Lequel tu veux vraiment ?

Choisissez AesCode-8B si le livrable est une page. Le modèle produit du HTML structuré et éditable — des tableaux sous forme de tableaux HTML, des graphiques sous forme de spécifications ECharts — ce qui signifie que la sortie produit un diff dans Git et peut être restylée par un designer sans la régénérer. Acceptez le compromis : un checkpoint de recherche non annoncé avec un nombre de téléchargements à deux chiffres, aucune évaluation indépendante, aucun point de terminaison hébergé, un contexte de 24K qui n’a été validé que sur des pages infographiques uniques, et une étiquette de langue anglais uniquement sur la fiche.

Choisissez Gemma 4 12B pour tout le reste. Il lit les documents mieux que la plupart des modèles deux fois plus gros que lui, il gère l'audio, il suit les instructions d'outils, il dispose d'un quart de million de tokens de contexte, et il bénéficie de trois mois et demi d'expérience accumulée par d'autres. Si vous devez choisir l'un de ces deux modèles pour être votre petit modèle de vision, et qu'on ne vous a pas spécifiquement demandé de produire des présentations sous forme de code, c'est la réponse.

Et si l’exigence réelle est de faire les deux, ne la traitez pas comme un critère de départage. Acheminez le travail de lecture vers un modèle hébergé et conservez le travail de rendu sur toute machine capable de contenir les poids.

Qu’est-ce qui changerait cette page ?

Trois signaux. Une reproduction indépendante du score de 82,94 et de la baisse de référence de 1,00 point ferait passer AesCode-8B d'une revendication de fournisseur à un résultat, et rendrait la question de la taille 8B contre 12B vraiment intéressante plutôt que simplement nominale. Un fournisseur d'inférence qui reprendrait le checkpoint ferait s'effondrer la colonne du déploiement, qui constitue actuellement toute la différence pratique. Et l'article que Microsoft cite comme étant en cours d'évaluation — « AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards » — répondrait aux questions auxquelles la fiche de modèle ne peut pas répondre, à commencer par la façon dont la grille d'évaluation visuelle se comporte lorsque le graphe de conception lui-même est erroné. Tant qu'aucun de ces éléments n'aboutit, l'interprétation défendable est étroite et réelle : AesCode-8B est très bon dans les parties du design visuel qu'une machine peut vérifier, moyen dans celle qu'elle ne peut pas, et Gemma 4 12B est un produit fini qui fait un autre travail.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement