
AesCode-8B vs North Mini Code : même licence, même bouton de téléchargement, problèmes opposés
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 par million de tokens · 85 tok/s
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
Le nombre le plus utile dans cette confrontation est 150 000. C'est le nombre de téléchargements que Cohere a attribué à North Mini Code le 14 août 2026, deux mois après le lancement du modèle le 9 juin 2026, et c'est le chiffre qui rend la comparaison avec AesCode-8B lisible. AesCode-8B, la version affinée par Microsoft de Qwen3-VL-8B-Instruct, affiche deux téléchargements sur son dépôt Hugging Face. Les deux sont sous Apache 2.0, les deux sont sans restriction, les deux sont téléchargeables cet après-midi, et l'un d'eux est entre les mains de la production depuis un trimestre, tandis que l'autre n'a pas quitté le laboratoire. Cet écart n'est pas un verdict de qualité — personne n'a mesuré AesCode-8B de manière indépendante, donc il n'y a pas de quoi se montrer suffisant d'un côté comme de l'autre — mais c'est le point de départ honnête, parce qu'il vous dit lequel a une communauté à qui vous pouvez poser des questions.
Les deux sont arrivés de manière très différente, ce qui conditionne ce que l'on peut vérifier. North Mini Code est une publication à poids ouverts de Cohere et Cohere Labs, accompagnée d'une fiche de modèle, d'un billet de blog à l'appui, d'une trace documentaire des choix de harnais et d'une API intégrée qui le rendait accessible à 0,00 $ par million de jetons pendant la période de lancement. AesCode-8B n'a fait l'objet d'aucune annonce : Microsoft a créé le dépôt le 29 septembre 2026, a enregistré les poids dans un commit portant le message « Release AesCode-8B » à 03:35 UTC le 7 octobre 2026, et a poussé le code d'entraînement sur GitHub le 8 octobre 2026. Aucun article de Microsoft Research, aucune note de version, aucune page produit, et une ligne de citation indiquant « Under review » avec l'année provisoire 2027. Le modèle 8B produit des diaporamas, des affiches et des tableaux de bord en HTML et CSS ; North Mini Code écrit du code dans un harnais d'agent. Ils ne sont pas tant des concurrents que des voisins dans le catalogue, ce qui est en soi une forme de constat.
Ce que chacun a été entraîné à émettre
La façon la plus claire de voir que ces deux-là ne font pas le même travail est de regarder ce qui en sort.
• Sortie — AesCode-8B : un document HTML et CSS complet, une page rendue par requête. North Mini Code : du texte et des appels d'outils, ce qui en pratique signifie des patchs, des commandes shell et des trajectoires d'agent.
• Taille — AesCode-8B : 8,8 B en bf16 dense, répartis en quatre fragments safetensors totalisant 17 543 339 408 octets. North Mini Code : 30 B au total avec 3 B de paramètres actifs, un mélange d'experts creux (sparse) avec 128 experts et 8 actifs par token.
• Contexte — AesCode-8B : 24 576 jetons dans la configuration rapportée, avec les prompts et réponses au moment de l’entraînement plafonnés à 8 192 chacun. North Mini Code : 256 K en entrée, 64 K de génération maximale.
• Entrées — AesCode-8B : texte plus une image de référence facultative. North Mini Code : texte uniquement, le harnais fournissant tout le reste.
• Entraîné sur — AesCode-8B : 3 000 démonstrations de démarrage à froid, puis un apprentissage par renforcement GDPO sur 7 408 prompts pendant 400 étapes, évalué par six vérificateurs déterministes ainsi qu’une grille d’évaluation visuelle après le rendu de chaque candidat dans un navigateur en sandbox. North Mini Code : des harnais d’agents — SWE-Agent, mini-SWE-Agent, OpenCode et Terminus 2 — afin qu’il fonctionne dans celui que vous utilisez déjà, plutôt que de vous enfermer dans un seul.
• Licence — Apache 2.0 dans les deux cas, poids inclus, aucune restriction d'usage sectorielle, aucun palier de contributeur. Sur cet axe, ils sont identiques et cela ne tranche rien.
• Preuve — AesCode-8B : la grille d'évaluation d'infographie de 300 échantillons de Microsoft, non reproduite. North Mini Code : un chiffre du fournisseur plus une mesure indépendante.
L'asymétrie des preuves, qui est plus étroite qu'elle n'y paraît
Le côté est de cette comparaison comporte un outsider, et cela vaut plus que l’écart dans les benchmarks. Artificial Analysis a lui-même exécuté North Mini Code et lui attribue 33,4 sur son Coding Index et 27,6 sur son Intelligence Index — compétitif avec les modèles ouverts de taille similaire, voire au-dessus. Cohere rapporte 61,0 % de pass@1 sur SWE-Bench Verified et jusqu’à 2,8× le débit de sortie de Devstral Small 2 de Mistral, deux chiffres fournis par le fournisseur. C’est l’exécution indépendante qui a mis le doigt sur le hic : North Mini Code émet environ trois fois plus de tokens de sortie que la médiane de sa classe de taille pour terminer la même suite de benchmarks, environ 75-77 millions de tokens de sortie contre une médiane de 25-38 millions. Au prix de lancement de zéro, cela ne coûte rien en espèces. Cela coûte de la latence, et cela donne un aperçu de la facture une fois le tarif promotionnel terminé.
AesCode-8B n'a pas d'équivalent en dehors de la mesure. Microsoft rapporte 82,94 Overall sur sa propre évaluation d'infographies de 300 échantillons, trois générations par prompt sans sélection, devant GPT-5.5 conditionné par référence à 81,28 et Claude Opus 4.8 à 80,39, et 31,1 points Visual d'avance sur son propre backbone. Il rapporte également que des récompenses conditionnées par référence ont fait passer le Visual prompt-only de 25,17 à 69,71, et que le fait de ne pas fournir l'image de référence à l'inférence ne coûte au modèle qu'1,00 point Visual, contre 19,55 pour le backbone. Ce sont là des affirmations inhabituellement précises, et le harness est open source, ce qui est plus que ce que proposent la plupart des tableaux de fournisseurs. Rien de tout cela n'a été reproduit par qui que ce soit. Il n'y a pas d'inscription dans une arène, pas de placement dans un classement, pas de mesure de débit et pas de relecture de la grille d'évaluation par un tiers.
Notez ce que cela implique précisément pour la comparaison : il n'existe pas de chiffre commun. Un modèle est évalué sur la réussite de tâches d'ingénierie logicielle et sur le nombre de tokens qu'elles coûtent ; l'autre est évalué sur la lisibilité du texte d'une infographie et sur le maintien de sa mise en page à l'intérieur du canevas. Placer 33,4 à côté de 82,94 revient à comparer un indice de codage à un score global d'infographie.
Où chacun d’eux est déployé, et ce que cela coûte

L'histoire du déploiement de North Mini Code est la raison pour laquelle il a dépassé les 150 000 téléchargements. Un MoE à 3B de paramètres actifs se quantifie en environ 20-24 Go de mémoire, l'équipe de Cohere l'a démontré sur un Mac Studio via MLX, et c'est cette empreinte active de 3B qui rend l'inférence locale économique. Il tourne sur un seul H100 en pleine précision. Cohere l'a servi à 0,00 $ par million de tokens d'entrée et de sortie pendant la période de lancement, et propose une voie de déploiement géré par instance pour l'échelle de production. Le chiffre lui-même est celui de Cohere, agrégé sur tous les canaux de distribution sans ventilation par plateforme, et le chiffre mensuel public de Hugging Face est d'un ordre de grandeur inférieur, ce qui est cohérent avec un agrégat couvrant l'API, les passerelles hébergées, les gestionnaires de paquets et les téléchargements locaux. À lire comme un élan plutôt que comme de la télémétrie.
Le déploiement d'AesCode-8B se résume à une ligne de commande. La fiche le donne directement — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, avec transformers 4.57 ou plus récent pour la voie non-vLLM. 17,5 Go de poids bf16 occupent de la place aux côtés d'un cache KV pour 24 576 tokens et jusqu'à deux images, donc une seule carte de 24 Go suffit techniquement, mais c'est juste en pratique ; 40-48 Go est le plancher réaliste. Ajoutez une pile de rendu si vous voulez évaluer les sorties comme les auteurs l'ont fait, car toutes les affirmations de qualité concernant ce modèle ont été faites en rendant son HTML dans un navigateur avec les requêtes externes bloquées. Il n'existe aucun point de terminaison hébergé que nous puissions trouver, et il ne figure pas dans notre catalogue.
Ce dernier point est le plus pratique pour quiconque compare ces deux solutions du point de vue de la disponibilité. North Mini Code est accessible via l’API propre du fournisseur et plusieurs plateformes tierces, ainsi que via les poids eux-mêmes. AesCode-8B n’est disponible que sur Hugging Face et GitHub. Si votre contrainte est « je dois pouvoir l’appeler depuis un service dès demain », une seule de ces deux solutions répond oui.
La question de composition qu’aucun des deux modèles ne résout
Voici le piège dans les deux volets de cette comparaison, et c’est le même piège. Adopter l’un ou l’autre revient à maintenir un chemin de service auto-hébergé pour un spécialiste. AesCode-8B a besoin d’une pile multimodale et d’un moteur de rendu pour être évalué correctement. North Mini Code a besoin d’un emplacement pour un MoE à 3B actifs, plus un harnais d’agent autour, et sa verbosité fait que la trajectoire coûte plus que ne le laisse supposer le nombre de tokens. Une équipe qui veut les deux capacités — un générateur de pages et un agent de dépôt — fait désormais tourner deux déploiements d’inférence, et, pour tout ce qui n’est ni l’un ni l’autre, un troisième.
C'est le cas où un point d'accès unique devant de nombreux modèles fait un vrai travail plutôt que de n'être qu'un simple confort. Gardez le spécialiste sur votre propre matériel là où l'économie et le traitement des données le justifient, et acheminez le trafic de routine vers le modèle hébergé qui lui convient le mieux cette semaine, le tout derrière une seule clé, avec le prix catalogue du fournisseur répercuté à 0 % de majoration et un basculement automatique en cas de défaillance d'un fournisseur. Le squelette de la famille Qwen3 illustre bien la finesse de la frontière : Microsoft a construit AesCode-8B sur Qwen3-VL-8B-Instruct, et les membres vision-langage de cette famille sont appelables via OrcaRouter — Qwen3-VL-8B-Instruct à 0,18 $ par million de jetons en entrée et 0,70 $ en sortie sur un contexte de 131 072 jetons, et Qwen3-VL 235B A22B à 0,40 $ et 1,60 $. Ni l'un ni l'autre n'est AesCode-8B ; le fine-tuning appartient à Microsoft et aucun fournisseur ne le sert. Mais si ce que vous en vouliez, c'était un modèle qui lit une capture d'écran et écrit du code, et que vous n'aviez pas spécifiquement besoin du fine-tuning en design esthétique, l'option appelable coûte une fraction du GPU et prend un après-midi à essayer plutôt qu'un cycle d'approvisionnement.

Comment décider, étant donné qu’aucune des deux n’est polyvalente
Écartons d'abord la licence, car c'est une égalité et cela ne décidera rien.
Demandez ce que vous voulez que le résultat soit. Si la réponse est une page rendue et modifiable — une présentation, un rapport, un tableau de bord — North Mini Code ne peut pas vous aider, et AesCode-8B est le seul des deux à s’attaquer au problème. Avancez les yeux ouverts : un point de contrôle de recherche non annoncé, deux téléchargements, un contexte de 24 K validé uniquement sur des pages d’infographie uniques, une balise de langue en anglais uniquement, et aucune évaluation indépendante nulle part. Le plafond Style dans le tableau de Microsoft lui-même est de 53,21 sur une dimension définie comme n’ayant besoin d’aucune autre révision visuelle avant livraison, ce qui revient à dire que le fournisseur vous indique qu’un humain retouche encore le résultat.
Si la réponse est une modification d’un dépôt — une migration, un correctif, une tâche de terminal en plusieurs étapes —, North Mini Code est celui qui dispose d’un entraînement sur harness, de la fenêtre de 256K, du profil de déploiement 3B-actifs, d’une API fournisseur fonctionnelle et d’une mesure externe à la fois de sa qualité et de sa verbosité. Prévoyez le budget en fonction du nombre de tokens plutôt que du tarif affiché, car le constat indépendant est qu’il écrit environ trois fois plus que ses pairs pour parvenir au même résultat.
Et si votre trimestre comprend à la fois un artefact de conception et une migration de dépôt, ne traitez pas cela comme une décision à deux modèles. Exécutez le spécialiste là où il rentabilise son GPU, acheminez le reste, et cessez de maintenir des chemins de service dont vous n’aviez pas besoin.

La différence qui perdure au-delà des benchmarks
Une dernière chose sépare ces deux-là, et elle n’est pas technique. North Mini Code a un fournisseur qui a publié une fiche, une publication, un Space pour l’essayer et une méthodologie que l’on peut contester, plus l’expérience d’autres personnes représentant 150 000 téléchargements. AesCode-8B a un dépôt, un README et une citation qui indique « en cours d’évaluation ».
Cela change même la nature des questions ouvertes. Avec North Mini Code, la question qui se pose aujourd'hui est de savoir si sa verbosité le rend non rentable à grande échelle une fois le tarif promotionnel terminé — et vous pouvez y répondre en le faisant tourner, car beaucoup d'autres l'ont déjà fait. Avec AesCode-8B, la question qui se pose aujourd'hui est ce que Microsoft compte en faire : un artefact de recherche, le premier lancement d'une gamme de produits, ou quelque chose qui sera discrètement supplanté d'ici six semaines. Rien dans le dépôt ne répond à cela, et vous aurez beau lire la fiche de modèle, vous n'y trouverez pas de réponse. Surveillez trois signaux — une annonce officielle, une reproduction indépendante du 82,94, ou un fournisseur qui reprend le checkpoint — et considérez l'absence de ces trois signaux comme l'état actuel des preuves, plutôt que comme une raison de trouver le modèle inintéressant. Ce qui le rend intéressant, c'est la baisse de référence de 1,00 point, et ce chiffre est toujours là, attendant que quelqu'un d'autre que Microsoft le vérifie.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
