Una card del titolo generata con l'intestazione "AesCode-8B vs North Mini Code", con due card arrotondate affiancate. La card sinistra AesCode-8B riporta un'icona di finestra del browser che mostra un layout di dashboard e le righe "2 download su Hugging Face" e "8.8B, emette pagine HTML"; la card destra North Mini Code riporta un'icona di prompt del terminale e le righe "150.000+ download" e "30B-A3B, programmazione agentica". Un separatore tra loro recita "stessa licenza, scaffale diverso" e una fascia di didascalia in alto recita "Apache 2.0 per entrambi - il pulsante di download è il punto in cui si separano". Il logo OrcaRouter è composto in basso a destra.
Guides & Insights

AesCode-8B vs North Mini Code: stessa licenza, stesso pulsante di download, problemi opposti

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il numero più utile in questo confronto è 150.000. È il conteggio dei download che Cohere ha associato a North Mini Code il 2026-08-14, due mesi dopo il lancio del modello, avvenuto il 2026-06-09, ed è la cifra che rende leggibile il confronto con AesCode-8B. AesCode-8B, il fine-tuning di Microsoft di Qwen3-VL-8B-Instruct, mostra due download sul suo repository Hugging Face. Entrambi sono Apache 2.0, entrambi sono ad accesso libero, entrambi scaricabili questo pomeriggio, e uno dei due è tra le mani della produzione da un trimestre mentre l'altro non ha ancora lasciato il laboratorio. Quel divario non è un verdetto sulla qualità — nessuno ha misurato AesCode-8B in modo indipendente, quindi non c'è nulla di cui compiacersi da nessuna delle due parti — ma è il punto di partenza onesto, perché ti dice quale dei due ha una community a cui puoi porre domande.

I due sono arrivati in modi molto diversi, e questo determina ciò che si può verificare. North Mini Code è un rilascio a pesi aperti di Cohere e Cohere Labs, con una model card, un post sul blog alle spalle, una traccia documentale delle scelte relative all'harness e un'API integrata che lo serviva a 0,00 $ per milione di token durante il periodo di lancio. AesCode-8B non ha alcun annuncio: Microsoft ha creato il repository il 2026-09-29, ha eseguito il commit dei pesi con il messaggio "Release AesCode-8B" alle 03:35 UTC del 2026-10-07 e ha pubblicato il codice di addestramento su GitHub il 2026-10-08. Nessun post di Microsoft Research, nessuna nota di rilascio, nessuna pagina di prodotto, e una riga di citazione che recita "In revisione" con l'anno segnaposto 2027. Il modello 8B genera presentazioni, poster e dashboard come HTML e CSS; North Mini Code scrive codice all'interno di un harness per agenti. Non sono tanto concorrenti quanto vicini nel catalogo, il che è una scoperta a sé stante.

Ciò che ciascuno è stato addestrato a emettere

Il modo più chiaro per vedere che questi due non svolgono lo stesso compito è guardare ciò che ne esce.

• Output — AesCode-8B: un documento HTML e CSS completo, una pagina renderizzata per richiesta. North Mini Code: testo e chiamate agli strumenti, che in pratica significa patch, comandi shell e traiettorie dell'agente.

• Dimensione — AesCode-8B: 8,8B bf16 dense, in quattro shard safetensors per un totale di 17.543.339.408 byte. North Mini Code: 30B totali con 3B parametri attivi, un mixture-of-experts sparso con 128 esperti e 8 attivi per token.

• Contesto — AesCode-8B: 24.576 token nella configurazione riportata, con prompt e risposte in fase di addestramento limitati ciascuno a 8.192. North Mini Code: 256K in input, 64K di generazione massima.

• Input — AesCode-8B: testo più un'immagine di riferimento opzionale. North Mini Code: solo testo, con l'harness che fornisce tutto il resto.

• Addestrato su — AesCode-8B: 3.000 dimostrazioni di cold-start e poi apprendimento per rinforzo GDPO su 7.408 prompt per 400 passi, valutato da sei verificatori deterministici più una rubrica visiva dopo il rendering di ogni candidato in un browser in sandbox. North Mini Code: harness per agenti — SWE-Agent, mini-SWE-Agent, OpenCode e Terminus 2 — così funziona all'interno di quello che già usi, invece di vincolarti a uno solo.

• Licenza — Apache 2.0 per entrambe, pesi inclusi, nessuna esclusione per campo d'uso, nessun livello di contributore. Su questo asse sono identiche e questo non decide nulla.

• Prova — AesCode-8B: la rubrica infografica da 300 campioni di Microsoft, non riprodotta. North Mini Code: un dato del fornitore più una misurazione indipendente.

L'asimmetria delle prove, che è più stretta di quanto sembri

Il lato est di questo confronto include un outsider, e questo vale più del divario nei benchmark. Artificial Analysis ha eseguito North Mini Code in prima persona e gli assegna 33,4 sul suo Coding Index e 27,6 sull'Intelligence Index — competitivo, o superiore, rispetto a modelli aperti di dimensioni simili. Cohere riporta il 61,0% di pass@1 su SWE-Bench Verified e fino a 2,8× il throughput di output di Devstral Small 2 di Mistral, entrambi dati del fornitore. È l'esecuzione indipendente quella che ha scoperto l'inghippo: North Mini Code emette circa tre volte i token di output della mediana della sua classe di dimensione per completare la stessa suite di benchmark, circa 75-77 milioni di token di output contro una mediana di 25-38 milioni. Al prezzo di lancio pari a zero non costa nulla in denaro. Costa in latenza, e prefigura il conto una volta che la tariffa promozionale termina.

AesCode-8B non ha equivalenti al di fuori della misurazione. Microsoft riporta 82,94 Overall sulla propria valutazione infografica su 300 campioni, tre generazioni per prompt senza selezione, davanti a GPT-5.5 condizionato al riferimento a 81,28 e a Claude Opus 4.8 a 80,39, e con 31,1 punti Visual di vantaggio sul proprio backbone. Riporta inoltre che le ricompense condizionate al riferimento hanno fatto salire il Visual in modalità solo prompt da 25,17 a 69,71, e che omettere l'immagine di riferimento in fase di inferenza costa al modello solo 1,00 punto Visual contro 19,55 per il backbone. Sono affermazioni insolitamente specifiche e l'harness è open source, il che è più di quanto offrano la maggior parte delle tabelle dei fornitori. Niente di tutto ciò è stato riprodotto da nessuno. Non esiste alcuna scheda in arena, alcuna posizione in classifica, alcuna misurazione del throughput e alcun controllo della rubrica da parte di terzi.

Nota cosa significa questo nello specifico per il confronto: non esiste un numero condiviso. Un modello viene valutato in base al superamento delle attività di ingegneria del software e a quanti token costano; l'altro viene valutato in base al fatto che il testo di un'infografica rimanga leggibile e che il suo layout resti all'interno dell'area di disegno. Mettere 33,4 accanto a 82,94 mette a confronto un indice di programmazione con un punteggio complessivo di un'infografica.

Dove ciascuno viene distribuito e quanto costa

A generated two-column scoreboard titled "AesCode-8B vs North Mini Code - the scoreboard". Left column AesCode-8B reads Size 8.8B dense, Output a rendered HTML page, Context 24,576 tokens, Deploy about 40-48 GB, Evidence Microsoft rubric, Downloads 2. Right column North Mini Code reads Size 30B-A3B mixture-of-experts, Output code and tool calls, Context 256K in and 64K out, Deploy about 20-24 GB quantised, Evidence AA Coding Index 33.4, Downloads 150,000+ vendor count. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; North Mini Code figures per Artificial Analysis and Cohere." The OrcaRouter logo is composited bottom-right.

La storia di deployment di North Mini Code è il motivo per cui ha superato i 150.000 download. Un MoE con 3B attivi si quantizza in circa 20-24 GB di memoria, il team di Cohere l'ha dimostrato su un Mac Studio tramite MLX, ed è il footprint di 3B attivi a rendere economica l'inferenza locale. Gira su una singola H100 a piena precisione. Cohere lo ha servito a 0,00 $ per milione di token di input e output durante il periodo di lancio, e offre una modalità di deployment gestito per istanza per la scala di produzione. Il conteggio in sé è un dato di Cohere, aggregato su tutti i canali di distribuzione senza una ripartizione piattaforma per piattaforma, e il numero mensile pubblico di Hugging Face è di un ordine di grandezza inferiore, il che è coerente con un aggregato che copre l'API, i gateway ospitati, i package manager e i download locali. Leggilo come slancio, più che come telemetria.

La storia di deployment di AesCode-8B è una riga di comando. La scheda la fornisce direttamente — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, con transformers 4.57 o successivo per il percorso non-vLLM. 17,5 GB di pesi bf16 risiedono accanto a una cache KV per 24.576 token e fino a due immagini, quindi una singola scheda da 24 GB è tecnicamente sufficiente ma al limite nella pratica; 40-48 GB sono il minimo realistico. Aggiungi uno stack di rendering se vuoi valutare gli output come hanno fatto gli autori, perché ogni affermazione sulla qualità di questo modello è stata fatta eseguendo il rendering del suo HTML in un browser con richieste esterne bloccate. Non esiste un endpoint ospitato che siamo riusciti a trovare, e non è nel nostro catalogo.

Quell'ultimo punto è quello pratico per chiunque confronti questi due in termini di disponibilità. North Mini Code è disponibile tramite l'API del fornitore stesso e diverse piattaforme di terze parti, oltre che tramite i pesi stessi. AesCode-8B è disponibile solo su Hugging Face e GitHub. Se il tuo vincolo è «devo poterlo invocare da un servizio domani», solo uno di questi due risponde sì.

La questione compositiva che nessuno dei due modelli risolve

Ecco la trappola in entrambe le metà di questo confronto, ed è la stessa trappola. Adottare l'una o l'altra significa mantenere un percorso di serving self-hosted per uno specialista. AesCode-8B ha bisogno di uno stack multimodale e di un renderer per essere valutato adeguatamente. North Mini Code ha bisogno di uno slot per un MoE con 3B attivi più un harness per agenti attorno ad esso, e la sua verbosità fa sì che la traiettoria costi più di quanto il conteggio dei token lasci intendere. Un team che vuole entrambe le capacità — un generatore di pagine e un repo — ora gestisce due deployment di inferenza, e per tutto ciò che non è né l'una né l'altra, un terzo.

Questo è il caso in cui un unico endpoint davanti a molti modelli svolge un lavoro concreto anziché essere una semplice comodità. Tieni lo specialista sul tuo hardware, dove l'economia e la gestione dei dati lo giustificano, e instrada il traffico ordinario verso il modello ospitato che in questo momento è il migliore per quel compito, il tutto dietro un'unica chiave, con il prezzo di listino del fornitore passato attraverso a un ricarico dello 0% e failover automatico se un fornitore vacilla. La spina dorsale della famiglia Qwen3 è una buona illustrazione di quanto il confine diventi sottile: Microsoft ha costruito AesCode-8B su Qwen3-VL-8B-Instruct, e i membri vision-language di quella famiglia sono richiamabili tramite OrcaRouter — Qwen3-VL-8B-Instruct a $0,18 per milione di token in input e $0,70 in output su un contesto di 131.072 token, e Qwen3-VL 235B A22B a $0,40 e $1,60. Nessuno dei due è AesCode-8B; il fine-tune è di Microsoft e nessun fornitore lo eroga. Ma se ciò che volevi da esso era un modello che legge uno screenshot e scrive codice, e non avevi specificamente bisogno del fine-tune di design estetico, l'opzione richiamabile costa una frazione della GPU e richiede un pomeriggio per essere provata, anziché un ciclo di approvvigionamento.

A GitHub screenshot of the microsoft/AesCode repository showing the MIT licence badge, 1 star, 14 commits on main, a README table listing assets, data_prep, eval and other directories, and the latest commit message "README: overview, results, and the reproduction guide". The repository description area reads "No description, website, or topics provided."

Come decidere, dato che nessuno dei due è di uso generale

Togli prima la licenza dal tavolo, perché è un pareggio e non deciderà nulla.

Chiedi cosa vuoi che sia l'output. Se la risposta è una pagina renderizzata e modificabile — una presentazione, un report, una dashboard — North Mini Code non può aiutarti e AesCode-8B è l'unico dei due puntato sul problema. Vai avanti con gli occhi aperti: un checkpoint di ricerca non annunciato, due download, un contesto da 24K validato solo su singole pagine infografiche, un tag di lingua solo inglese e nessuna valutazione indipendente da nessuna parte. Il tetto di Style nella tabella di Microsoft stessa è 53,21 su una dimensione definita come esente da ulteriori revisioni visive prima della consegna, il che significa che il fornitore ti sta dicendo che un umano modifica ancora l'output.

Se la risposta è una modifica a un repository — una migrazione, una correzione, un lavoro terminale multi-step — North Mint Code è quello con training su harness, la finestra da 256K, il profilo di deployment con 3B attivi, un'API del fornitore funzionante, e una misurazione esterna sia della sua qualità che della sua verbosità. Fai il budget in base al conteggio dei token piuttosto che alla tariffa principale, perché la scoperta indipendente è che scrive circa tre volte tanto rispetto ai suoi pari per arrivare allo stesso punto.

E se il tuo trimestre comprende sia un artefatto di progettazione sia una migrazione di repository, non trattarlo come una decisione tra due modelli. Esegui lo specialista dove ripaga la sua GPU, instrada il resto e smetti di mantenere percorsi di serving di cui non avevi bisogno.

A Hugging Face screenshot of the CohereLabs North-Mini-Code-1.0 model card showing a trend arrow, 577 likes and 381k organisation followers, the Text Generation, Transformers, Safetensors and cohere2_moe tags with conversational, chat, code and agent tags, an Apache-2.0 licence badge, a Directly Available for Download badge, and the model summary reading "North Mini Code is an open weights research release of a 30B-A3B parameter model optimized for code generation, agentic software engineering, and terminal tasks", developed by Cohere and Cohere Labs.

La differenza che dura più a lungo dei benchmark

Un'ultima cosa separa questi due, e non è tecnica. North Mini Code ha un fornitore che ha pubblicato una card, un post, uno Space in cui provarlo e una metodologia su cui si può discutere, più l'esperienza altrui accumulata con 150.000 download. AesCode-8B ha un repository, un README e una citazione che riporta «in revisione».

Questo cambia persino quali siano le domande aperte. Con North Mini Code la domanda attuale è se la sua verbosità lo renda antieconomico su larga scala una volta terminata la tariffa promozionale — e puoi rispondere eseguendolo, perché molte altre persone l'hanno già fatto. Con AesCode-8B la domanda attuale è cosa intende fare Microsoft con esso: artefatto di ricerca, prima release di una linea di prodotti, o qualcosa silenziosamente superato in sei settimane. Niente nel repository risponde a questo, e nessuna quantità di lettura della scheda del modello lo farà. Tieni d'occhio tre segnali — un annuncio ufficiale, una riproduzione indipendente dell'82,94, o un provider che adotta il checkpoint — e considera l'assenza di tutti e tre come lo stato attuale delle prove piuttosto che come una ragione per cui il modello non è interessante. La ragione per cui è interessante è il calo di riferimento di 1,00 punti, e quel numero è ancora lì che aspetta che qualcuno diverso da Microsoft lo verifichi.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno