
AesCode-8B vs North Mini Code: dezelfde licentie, dezelfde downloadknop, tegenovergestelde problemen
- OrcaNIEUWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 mln tokens · 87 tok/s
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
Het meest bruikbare getal in deze vergelijking is 150.000. Dat is het aantal downloads dat Cohere aan North Mini Code op 2026-08-14 koppelde, twee maanden na de lancering van het model op 2026-06-09, en het is het cijfer dat de vergelijking met AesCode-8B begrijpelijk maakt. AesCode-8B, Microsofts fine-tune van Qwen3-VL-8B-Instruct, toont twee downloads op zijn Hugging Face-repository. Beide zijn Apache 2.0, beide zijn vrij toegankelijk, beide zijn vanmiddag te downloaden, en een van hen is al een kwartaal in handen van productieteams, terwijl de andere het lab nog niet heeft verlaten. Dat verschil is geen kwaliteitsoordeel — niemand heeft AesCode-8B onafhankelijk gemeten, dus er is aan geen van beide kanten iets om zelfvoldaan over te zijn — maar het is het eerlijke uitgangspunt, want het vertelt je welke van de twee een community heeft waar je vragen aan kunt stellen.
De twee verschenen heel verschillend, en dat bepaalt wat je kunt verifiëren. North Mini Code is een open-weights-release van Cohere en Cohere Labs, met een modelcard, een blogpost erachter, een papieren spoor van harnesskeuzes, en een vendored API die het tijdens de lanceringsperiode aanbood voor $0,00 per miljoen tokens. AesCode-8B heeft helemaal geen aankondiging: Microsoft maakte de repository aan op 2026-09-29, committe de gewichten met als bericht "Release AesCode-8B" om 03:35 UTC op 2026-10-07, en pushte de trainingscode naar GitHub op 2026-10-08. Geen Microsoft Research-post, geen release-opmerking, geen productpagina, en een citatieregel met "Under review" en het placeholder-jaar 2027. Het 8B-model genereert slidedecks, posters en dashboards als HTML en CSS; North Mini Code schrijft code in een agent-harness. Ze zijn niet zozeer concurrenten als wel buren in de catalogus, wat op zichzelf al een soort bevinding is.
Wat elk ervan is getraind om te produceren
De duidelijkste manier om te zien dat deze twee niet hetzelfde werk doen, is kijken naar wat eruit komt.
• Uitvoer — AesCode-8B: een compleet HTML- en CSS-document, één gerenderde pagina per verzoek. North Mini Code: tekst en tool-aanroepen, wat in de praktijk neerkomt op patches, shell-opdrachten en agent-trajecten.
• Grootte — AesCode-8B: 8,8B bf16 dense, in vier safetensors-shards met een totale grootte van 17.543.339.408 bytes. North Mini Code: 30B totaal met 3B actieve parameters, een sparse mixture-of-experts met 128 experts en 8 actief per token.
•Context — AesCode-8B: 24.576 tokens in de gerapporteerde configuratie, met prompts en responses tijdens de training die elk zijn beperkt tot 8.192. North Mini Code: 256K invoer, 64K maximale generatie.
• Invoer — AesCode-8B: tekst plus een optionele referentieafbeelding. North Mini Code: alleen tekst, waarbij de harness al het overige levert.
• Getraind op — AesCode-8B: 3.000 cold-start demonstraties en daarna GDPO reinforcement learning over 7.408 prompts gedurende 400 stappen, beoordeeld door zes deterministische verifiers plus een visuele rubric nadat elke kandidaat in een sandbox-browser was gerenderd. North Mini Code: agent harnesses — SWE-Agent, mini-SWE-Agent, OpenCode en Terminus 2 — zodat het werkt binnen degene die je al draait, in plaats van je aan één vast te pinnen.
• Licentie — beide Apache 2.0, gewichten inbegrepen, geen carve-out voor specifiek gebruiksgebied, geen apart niveau voor bijdragers. Op deze as zijn ze identiek en dat beslist niets.
• Bewijs — AesCode-8B: Microsofts eigen infographic-rubric met 300 samples, niet gereproduceerd. North Mini Code: een leverancierscijfer plus een onafhankelijke meting.
De bewijsasymmetrie, die smaller is dan het lijkt
De oostzijde van deze vergelijking bevat een buitenstaander, en dat is meer waard dan de benchmarkkloof. Artificial Analysis heeft North Mini Code zelf gedraaid en scoort het 33,4 op zijn Coding Index en 27,6 op zijn Intelligence Index — concurrerend met of hoger dan vergelijkbaar grote open modellen. Cohere rapporteert 61,0% pass@1 op SWE-Bench Verified en tot 2,8× de outputdoorvoer van Mistral's Devstral Small 2, beide leverancierscijfers. De onafhankelijke run is degene die het addertje onder het gras vond: North Mini Code produceert ongeveer drie keer zoveel outputtokens als de mediaan van zijn grootteklasse om dezelfde benchmark-suite te voltooien, ongeveer 75-77 miljoen outputtokens tegen een mediaan van 25-38 miljoen. Bij de introductieprijs van nul kost dat niets in contanten. Het kost latentie, en het geeft een voorproefje van de rekening zodra het promotietarief afloopt.
AesCode-8B heeft geen equivalent buiten de eigen meting. Microsoft rapporteert 82,94 Overall op zijn eigen infographic-evaluatie met 300 samples, drie generaties per prompt zonder selectie, voor op reference-conditioned GPT-5.5 met 81,28 en Claude Opus 4.8 met 80,0, en 31,1 Visual-punten boven zijn eigen backbone. Het meldt ook dat reference-conditioned rewards de prompt-only Visual van 25,17 naar 69,71 tilden, en dat het weglaten van de referentieafbeelding bij inferentie het model slechts 1,00 Visual-punt kost tegenover 19,55 voor de backbone. Dat zijn ongewoon specifieke claims en de harness is open-source, wat meer is dan de meeste leverancierstabellen bieden. Niets ervan is door iemand gereproduceerd. Er is geen arena-vermelding, geen plek op een leaderboard, geen throughput-meting en geen third-party controle van de rubric.
Let op wat dat specifiek voor de vergelijking betekent: er is geen gedeeld getal. Het ene model wordt beoordeeld op of software-engineeringtaken slagen en hoeveel tokens ze kosten; het andere wordt beoordeeld op of een infographic leesbaar blijft en de lay-out ervan binnen het kader blijft. Het naast elkaar zetten van 33,4 en 82,94 vergelijkt een code-index met een algemene infographicscore.
Waar elk ervan wordt ingezet, en wat dat kost

Het uitrolverhaal van North Mini Code is de reden waarom het de 150.000 downloads heeft gepasseerd. Een 3B-active MoE kwantiseert naar ongeveer 20-24 GB geheugen, het team van Cohere demonstreerde het op een Mac Studio via MLX, en het is de actieve voetafdruk van 3B die lokale inferentie economisch maakt. Het draait op één enkele H100 op volledige precisie. Cohere heeft het tijdens de lanceringsperiode aangeboden tegen $0,00 per miljoen input- en outputtokens, en biedt een beheerde implementatieroute per instantie voor productieschaal. Het aantal zelf is een eigen cijfer van Cohere, samengevoegd over elk distributiekanaal zonder uitsplitsing per platform, en het openbare maandelijkse cijfer van Hugging Face is een orde van grootte kleiner, wat consistent is met het feit dat het totaal de API, gehoste gateways, pakketbeheerders en lokale pulls omvat. Lees het als momentum, niet als telemetrie.
Het deploymentverhaal van AesCode-8B is een commandoregel. De modelkaart geeft die direct — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, met transformers 4.57 of nieuwer voor het niet-vLLM-pad. 17,5 GB aan bf16-gewichten staat naast een KV-cache voor 24.576 tokens en maximaal twee afbeeldingen, dus een enkele kaart van 24 GB is technisch gezien genoeg en in de praktijk krap; 40-48 GB is het realistische minimum. Voeg een renderingstack toe als je de uitvoer wilt scoren zoals de auteurs deden, want elke kwaliteitsclaim over dit model is gemaakt door de HTML in een browser te renderen met externe verzoeken geblokkeerd. Er is geen gehost endpoint dat we kunnen vinden, en het staat niet in onze catalogus.
Dat laatste punt is het praktische punt voor iedereen die deze twee op beschikbaarheid vergelijkt. North Mini Code is beschikbaar via de eigen API van de leverancier en verschillende platforms van derden, evenals de gewichten zelf. AesCode-8B is alleen beschikbaar op Hugging Face en GitHub. Als jouw beperking is: ‘Ik moet dit morgen vanuit een service kunnen aanroepen’, dan antwoordt slechts één van deze twee met ja.
De compositievraag die geen van beide modellen oplost
Hier is de valkuil in beide helften van deze vergelijking, en het is dezelfde valkuil. Het adopteren van een van beide betekent dat je een self-hosted servingpad voor een specialist moet onderhouden. AesCode-8B heeft een multimodale stack en een renderer nodig om goed te kunnen worden geëvalueerd. North Mini Code heeft een slot nodig voor een 3B-actieve MoE plus een agent-harnas eromheen, en de breedsprakigheid ervan betekent dat het traject meer kost dan het tokenaantal doet vermoeden. Een team dat beide capaciteiten wil — een paginagenerator en een repo-agent — draait nu twee inferentie-deployments, en voor alles wat geen van beide is, een derde.
Dat is het geval waarin één endpoint vóór vele modellen echt werk verzet in plaats van een gemak te zijn. Houd de specialist op je eigen hardware waar de economie en de gegevensverwerking dat rechtvaardigen, en leid het routineverkeer naar welk gehost model er deze week ook het beste voor is, allemaal achter één sleutel, met de lijstprijs van de aanbieder doorgegeven tegen 0% opslag en automatische failover als een aanbieder hapert. De ruggengraat van de Qwen3-familie is een goede illustratie van hoe dun de scheidslijn wordt: Microsoft bouwde AesCode-8B op Qwen3-VL-8B-Instruct, en vision-language-leden van die familie zijn aanroepbaar via OrcaRouter — Qwen3-VL-8B-Instruct tegen $0,18 per miljoen invoertokens en $0,70 voor uitvoer bij een context van 131.072 tokens, en Qwen3-VL 235B A22B tegen $0,40 en $1,60. Geen van beide is AesCode-8B; de fine-tune is van Microsoft en geen enkele aanbieder biedt die aan. Maar als wat je ervan wilde een model was dat een screenshot leest en code schrijft, en je niet specifiek de aesthetic-design-fine-tune nodig had, kost de aanroepbare optie een fractie van de GPU en kost het een middag om te proberen in plaats van een inkooptraject.

Hoe te beslissen, gegeven dat geen van beide algemeen inzetbaar is
Neem eerst de licentie, want het is een gelijkspel en het gaat niet de doorslag geven.
Vraag je af wat je wilt dat de output is. Als het antwoord een gerenderde, bewerkbare pagina is — een deck, een rapport, een dashboard — dan kan North Mini Code je niet helpen en is AesCode-8B de enige van de twee die zich op het probleem richt. Ga er met open ogen in: een onaangekondigd onderzoekscheckpoint, twee downloads, een 24K-context die alleen is gevalideerd op afzonderlijke infographicpagina's, een taaltag voor alleen Engels, en nergens een onafhankelijke evaluatie. Het Style-plafond in de eigen tabel van Microsoft is 53,21 op een dimensie die is gedefinieerd als: geen verdere visuele revisie nodig vóór oplevering, wat erop neerkomt dat de leverancier je vertelt dat een mens de output nog steeds bewerkt.
Als het antwoord een wijziging aan een repository is — een migratie, een fix, een terminal met meerdere stappen — dan is North Mini Code degene met harness-training, het 256K-venster, het deploymentprofiel met 3B actieve parameters, een werkende leveranciers-API en een externe meting van zowel de kwaliteit als de breedsprakigheid ervan. Reken op het tokenaantal in plaats van op het tarief in de kop, want wat onafhankelijk is vastgesteld, is dat het ongeveer drie keer zoveel schrijft als zijn concurrenten om hetzelfde resultaat te bereiken.
En als je kwartaal zowel een ontwerpartefact als een repo-migratie bevat, behandel dit dan niet als een beslissing tussen twee modellen. Zet de specialist in waar hij zijn GPU verdient, routeer de rest, en stop met het onderhouden van serveerpaden die je niet nodig had.

Het verschil dat de benchmarks overleeft
Eén laatste ding scheidt deze twee, en het is niet technisch. North Mini Code heeft een leverancier die een kaart, een post, een Space om het in te proberen en een methodologie waarover je kunt discussiëren heeft gepubliceerd, plus de ervaring van anderen uit 150.000 downloads. AesCode-8B heeft een repository, een README en een citatie die zegt dat het nog in beoordeling is.
Dat verandert zelfs wat de openstaande vragen zijn. Bij North Mini Code is de actuele vraag of de breedsprakigheid ervan het op schaal onrendabel maakt zodra het promotietarief afloopt — en dat kun je beantwoorden door het te draaien, want talloze anderen hebben dat al gedaan. Bij AesCode-8B is de actuele vraag wat Microsoft ermee van plan is: onderzoeksartefact, eerste release van een productlijn, of iets dat binnen zes weken stilletjes achterhaald is. Niets in de repository beantwoordt dat, en hoe vaak je de modelkaart ook leest, dat zal niet veranderen. Let op drie signalen — een officiële aankondiging, een onafhankelijke reproductie van de 82,94, of een provider die het checkpoint oppikt — en beschouw de afwezigheid van alle drie als de huidige stand van het bewijs, niet als een reden waarom het model oninteressant zou zijn. De reden dat het interessant is, is de referentiedaling van 1,00 punt, en dat getal zit daar nog steeds te wachten tot iemand anders dan Microsoft het controleert.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
