
AesCode-8B vs North Mini Code: Samma licens, samma nedladdningsknapp, motsatta problem
- OrcaNYOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M tokens · 87 tok/s
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
Det mest användbara numret i den här jämförelsen är 150 000. Det är antalet nedladdningar som Cohere angav för North Mini Code den 14 augusti 2026, två månader efter att modellen lanserades den 9 juni 2026, och det är siffran som gör jämförelsen med AesCode-8B begriplig. AesCode-8B, Microsofts finjustering av Qwen3-VL-8B-Instruct, visar två nedladdningar på sitt Hugging Face-repositorium. Båda är Apache 2.0, båda är utan åtkomstbegränsningar, båda går att ladda ner i eftermiddag, och en av dem har varit i produktion i ett kvartal medan den andra inte har lämnat labbet. Det gapet är inte ett kvalitetsomdöme — ingen har mätt AesCode-8B oberoende, så det finns inget att vara självbelåten över på någon av sidorna — men det är den ärliga utgångspunkten, eftersom det berättar för dig vilken av dem som har ett community du kan ställa frågor till.
De två dök upp på mycket olika sätt, och det formar vad du kan verifiera. North Mini Code är ett släpp med öppna vikter från Cohere och Cohere Labs med ett modellkort, ett blogginlägg bakom sig, en dokumenterad historik över ramverksval och ett vendorerat API som betjänade den för $0.00 per miljon tokens under lanseringsperioden. AesCode-8B har inget tillkännagivande alls: Microsoft skapade repot den 29 september 2026, committade vikterna med meddelandet "Release AesCode-8B" kl. 03:35 UTC den 7 oktober 2026 och pushade träningskoden till GitHub den 8 oktober 2026. Inget inlägg från Microsoft Research, ingen utgivningsnotis, ingen produktsida och en citeringsrad som lyder "Under review" med platshållaråret 2027. 8B-modellen genererar bildspel, affischer och instrumentpaneler som HTML och CSS; North Mini Code skriver kod inuti ett agentramverk. De är inte så mycket konkurrenter som grannar i katalogen, vilket i sig är en slags upptäckt.
Vad var och en tränades att sända ut
Det tydligaste sättet att se att dessa två inte gör samma jobb är att titta på vad som kommer ut ur dem.
• Utdata — AesCode-8B: ett komplett HTML- och CSS-dokument, en renderad sida per begäran. North Mini Code: text och verktygsanrop, vilket i praktiken innebär patchar, shellkommandon och agenttrajektorier.
• Storlek — AesCode-8B: 8,8B bf16 dense, i fyra safetensors-shardar som totalt uppgår till 17 543 339 408 byte. North Mini Code: 30B totalt med 3B aktiva parametrar, en gles mixture-of-experts med 128 experter och 8 aktiva per token.
• Kontext — AesCode-8B: 24 576 tokens i den rapporterade konfigurationen, med promptar och svar under träning som vardera begränsas till 8 192. North Mini Code: 256K indata, 64K maximal generering.
• Indata — AesCode-8B: text plus en valfri referensbild. North Mini Code: endast text, medan testramverket tillhandahåller allt annat.
• Tränad på — AesCode-8B: 3 000 coldstartdemonstrationer och därefter GDPO-förstärkningsinlärning över 7 408 promptar i 400 steg, poängsatt av sex deterministiska verifierare plus en visuell bedömningsmatris efter att varje kandidat har renderats i en sandlådewebbläsare. North Mini Code: agentramverk — SWE-Agent, mini-SWE-Agent, OpenCode och Terminus 2 — så att den fungerar i vilket du än redan kör, i stället för att låsa fast dig vid ett.
• Licens — Apache 2.0 i båda fallen, vikter inkluderade, inget undantag för användningsområde, ingen nivå för bidragsgivare. På denna axel är de identiska och den avgör ingenting.
• Evidens — AesCode-8B: Microsofts egen infografikbedömningsmall med 300 sampel, ej reproducerad. North Mini Code: en leverantörssiffra plus en oberoende mätning.
Bevisasymmetrin, som är smalare än den ser ut
Den östra sidan av denna jämförelse har en outsider i sig, och det är värt mer än benchmarkgapet. Artificial Analysis har själva kört North Mini Code och ger den 33,4 på Coding Index och 27,6 på Intelligence Index – konkurrenskraftigt mot eller bättre än öppna modeller av liknande storlek. Cohere rapporterar 61,0 % pass@1 på SWE-Bench Verified och upp till 2,8× utdatagenomströmningen för Mistrals Devstral Small 2, båda är siffror från leverantören. Den oberoende körningen är den som hittade haken: North Mini Code genererar ungefär tre gånger så många utdatatoken som medianen för sin storleksklass för att slutföra samma benchmarksvit, runt 75–77 miljoner utdatatoken mot en median på 25–38 miljoner. Med lanseringspriset noll kostar det ingenting i kontanter. Det kostar latens, och det förhandsvisar notan när kampanjpriset tar slut.
AesCode-8B har ingen motsvarighet utanför mätningen. Microsoft rapporterar 82,94 Overall i sin egen infografikutvärdering med 300 exempel, tre genereringar per prompt utan urval, före referensbetingad GPT-5.5 på 81,28 och Claude Opus 4.8 på 80,39, samt 31,1 Visual-poäng bättre än sin egen basmodell. Den rapporterar också att referensbetingade belöningar lyfte prompt-only-Visual från 25,17 till 69,71, och att det bara kostar modellen 1,00 Visual-poäng att utelämna referensbilden vid inferens, jämfört med 19,55 för basmodellen. Det är ovanligt specifika påståenden, och utvärderingsramverket är öppen källkod, vilket är mer än vad de flesta leverantörstabeller erbjuder. Inget av detta har reproducerats av någon. Det finns ingen listning i någon arena, ingen placering på någon resultattavla, ingen genomströmningsmätning och ingen tredjepartsgranskning av bedömningsmallen.
Notera vad det innebär för just jämförelsen: det finns inget gemensamt tal. En modell poängsätts utifrån huruvida mjukvaruutvecklingsuppgifter klarar sig och hur många tokens de kostar; den andra poängsätts utifrån huruvida en infografiks text förblir läsbar och dess layout förblir inom canvasen. Att ställa 33,4 bredvid 82,94 jämför ett kodningsindex med en infografiks totalpoäng.
Var var och en driftsätts, och vad det kostar

North Mini Codes utplaceringsberättelse är anledningen till att den passerade 150 000 nedladdningar. En 3B-aktiv MoE kvantiseras till ungefär 20–24 GB minne, Coheres team demonstrerade den på en Mac Studio via MLX, och det 3B-aktiva avtrycket är vad som gör lokal inferens ekonomisk. Den körs på en enda H100 med full precision. Cohere har serverat den till $0.00 per miljon in- och uttoken under lanseringsperioden, och erbjuder en hanterad per-instans-utplaceringsväg för produktionsskala. Själva siffran är Coheres egen siffra, aggregerad över alla distributionskanaler utan uppdelning per plattform, och det offentliga Hugging Face-månadsnumret är en storleksordning mindre, vilket är förenligt med att aggregatet omfattar API:et, hostade gateways, pakethanterare och lokala hämtningar. Läs det som momentum snarare än telemetri.
AesCode-8B:s driftsättningshistoria är en kommandorad. Modellkortet anger den direkt – vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, med transformers 4.57 eller nyare för den icke-vLLM-baserade vägen. 17,5 GB bf16-vikter ligger tillsammans med en KV-cache för 24 576 token och upp till två bilder, så ett enda 24 GB-kort är tekniskt sett tillräckligt men i praktiken på gränsen; 40–48 GB är den realistiska nedre gränsen. Lägg till en renderingsstack om du vill poängsätta utdata på samma sätt som författarna gjorde, eftersom varje kvalitetsanspråk om den här modellen gjordes genom att rendera dess HTML i en webbläsare med externa förfrågningar blockerade. Det finns ingen hostad endpoint som vi kan hitta, och den finns inte i vår katalog.
Den sista punkten är den praktiska för alla som jämför dessa två utifrån tillgänglighet. North Mini Code finns tillgängligt via leverantörens eget API och flera tredjepartsplattformar, liksom via själva vikterna. AesCode-8B finns endast på Hugging Face och GitHub. Om din begränsning är "jag behöver kunna anropa det här från en tjänst i morgon", svarar bara en av dessa två ja.
Kompositionsfrågan som ingen av modellerna löser
Här är fällan i båda halvorna av den här jämförelsen, och det är samma fälla. Att införa endera innebär att underhålla en självhostad serveringsväg för en specialist. AesCode-8B behöver en multimodal stack och en renderare för att kunna utvärderas ordentligt. North Mini Code behöver en plats för en 3B-aktiv MoE plus ett agentramverk runt den, och dess mångordighet gör att trajektorian kostar mer än tokenantalet antyder. Ett team som vill ha båda förmågorna – en sidgenerator och en repoagent – kör nu två inferensdriftsättningar, och för allt som är varken det ena eller det andra, en tredje.
Det är fallet där en slutpunkt framför många modeller gör verkligt arbete i stället för att bara vara en bekvämlighet. Behåll specialisten på din egen hårdvara där ekonomin och datahanteringen motiverar det, och skicka den rutinmässiga trafiken till den hostade modell som är bäst för ändamålet den här veckan, allt bakom en enda nyckel med leverantörens listpris vidarebefordrat med 0 % påslag och automatisk failover om en leverantör vacklar. Qwen3-familjens stomme är en bra illustration av hur tunn gränsen blir: Microsoft byggde AesCode-8B på Qwen3-VL-8B-Instruct, och de medlemmar i familjen som hanterar både bild och språk kan anropas via OrcaRouter — Qwen3-VL-8B-Instruct till $0.18 per miljon indatatoken och $0.70 utdata över en kontext på 131 072 token, och Qwen3-VL 235B A22B till $0.40 och $1.60. Ingen av dem är AesCode-8B; finjusteringen är Microsofts och ingen leverantör tillhandahåller den. Men om det du ville ha från den var en modell som läser en skärmbild och skriver kod, och du inte specifikt behövde finjusteringen för estetisk design, kostar det anropbara alternativet en bråkdel av GPU:n och tar en eftermiddag att prova i stället för en upphandlingscykel.

Hur ska man bestämma sig, med tanke på att ingendera är generell?
Ta licensen av bordet först, för det står lika och kommer inte att avgöra något.
Fråga vad du vill att resultatet ska vara. Om svaret är en renderad, redigerbar sida – en presentation, en rapport, en instrumentpanel – kan North Mini Code inte hjälpa dig, och AesCode-8B är den enda av de två som är inriktad på problemet. Gå in med öppna ögon: en oannonserad forskningscheckpoint, två nedladdningar, en 24K-kontext som endast har validerats på enskilda infografiska sidor, en språktagg för enbart engelska och ingen oberoende utvärdering någonstans. Style-taket i Microsofts egen tabell är 53,21 på en dimension som definieras som att den inte kräver ytterligare visuell revidering före leverans, vilket är leverantören som talar om för dig att en människa fortfarande redigerar resultatet.
Om svaret är en ändring i ett kodförråd – en migrering, en fix, ett terminaljobb i flera steg – är North Mini Code den som har harness-träning, 256K-fönstret, en 3B-aktiv driftsättningsprofil, ett fungerande leverantörs-API och en extern mätning av både dess kvalitet och dess mångordighet. Budgetera utifrån tokenantalet snarare än rubrikpriset, eftersom det oberoende rönet är att den skriver ungefär tre gånger så mycket som sina gelikar för att nå samma resultat.
Och om ditt kvartal innehåller både en designartefakt och en repomigrering ska du inte behandla detta som ett beslut mellan två modeller. Kör specialisten där den förtjänar sin GPU, routa resten och sluta underhålla serveringsvägar som du inte behövde.

Skillnaden som varar längre än benchmarkresultaten
En sista sak skiljer dessa två åt, och den är inte teknisk. North Mini Code har en leverantör som har publicerat ett kort, ett inlägg, ett Space att prova det i och en metodik man kan argumentera emot, plus andra människors erfarenhet från 150 000 nedladdningar. AesCode-8B har ett repository, en README och en citering som anger att den är under granskning.
Det förändrar vilka de öppna frågorna ens är. Med North Mini Code är den aktuella frågan huruvida dess mångordighet gör den oekonomisk i skala när kampanjpriset tar slut – och det kan du besvara genom att köra den, eftersom många andra redan har gjort det. Med AesCode-8B är den aktuella frågan vad Microsoft avser att göra med den: forskningsartefakt, första släppet i en produktlinje eller något som tyst har ersatts inom sex veckor. Inget i kodförrådet svarar på det, och hur mycket man än läser modellkortet kommer det inte att göra det heller. Håll utkik efter tre signaler – ett officiellt tillkännagivande, en oberoende reproduktion av 82,94, eller att en leverantör plockar upp checkpointen – och betrakta frånvaron av alla tre som det rådande bevisläget snarare än som ett skäl till att modellen är ointressant. Anledningen till att den är intressant är referensnedgången på 1,00 punkt, och den siffran ligger fortfarande kvar och väntar på att någon annan än Microsoft ska kontrollera den.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
