Wygenerowana karta tytułowa z nagłówkiem „AesCode-8B vs North Mini Code” i dwiema zaokrąglonymi kartami obok siebie. Lewa karta AesCode-8B zawiera ikonę okna przeglądarki przedstawiającą układ pulpitu oraz wiersze „2 pobrania na Hugging Face” i „8.8B, generuje strony HTML”; prawa karta North Mini Code zawiera ikonę znaku zachęty terminala oraz wiersze „150 000+ pobrań” i „30B-A3B, kodowanie agentowe”. Separator między nimi głosi „ta sama licencja, inna półka”, a pasek podpisu u góry głosi „Apache 2.0 w obu – przycisk pobierania jest tym, co je różni”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

AesCode-8B vs North Mini Code: ta sama licencja, ten sam przycisk pobierania, przeciwstawne problemy

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej przydatną liczbą w tym starciu jest 150 000. To liczba pobrań, którą Cohere przypisało do North Mini Code w dniu 2026-08-14, dwa miesiące po premierze modelu 2026-06-09, i to ta liczba sprawia, że porównanie z AesCode-8B jest czytelne. AesCode-8B, czyli dostrojona przez Microsoft wersja Qwen3-VL-8B-Instruct, ma dwa pobrania w swoim repozytorium na Hugging Face. Oba są na licencji Apache 2.0, oba mają otwarty dostęp, oba można pobrać jeszcze dziś po południu, a jeden z nich jest od kwartału używany produkcyjnie, podczas gdy drugi nie opuścił laboratorium. Ta różnica nie jest werdyktem o jakości — nikt nie zmierzył AesCode-8B niezależnie, więc nie ma powodu do samozadowolenia po żadnej ze stron — ale jest uczciwym punktem wyjścia, ponieważ mówi ci, który z nich ma społeczność, do której możesz zwrócić się z pytaniami.

Te dwa modele pojawiły się w bardzo różny sposób, co kształtuje to, co można zweryfikować. North Mini Code to wydanie open-weights firmy Cohere i Cohere Labs, z kartą modelu, stojącym za nim wpisem na blogu, śladem dokumentacyjnym wyborów dotyczących harnessu oraz dołączonym API, które obsługiwało go po $0.00 za milion tokenów w okresie premiery. AesCode-8B nie ma żadnej zapowiedzi: Microsoft utworzył repozytorium 2026-09-29, wykonał commit z wagami o treści „Release AesCode-8B” o 03:35 UTC 2026-10-07 i wypchnął kod treningowy na GitHub 2026-10-08. Żadnego wpisu Microsoft Research, żadnej noty wydania, żadnej strony produktu, a wiersz cytowania brzmi „Under review”, z zastępczym rokiem 2027. Model 8B generuje pokazy slajdów, plakaty i dashboardy jako HTML i CSS; North Mini Code pisze kod wewnątrz harnessu agentowego. Nie tyle są konkurentami, ile sąsiadami w katalogu, co samo w sobie stanowi pewnego rodzaju odkrycie.

Co każdy z nich został wytrenowany do emitowania

Najlepszym sposobem, by zobaczyć, że te dwa nie pełnią tej samej funkcji, jest spojrzenie na to, co z nich wychodzi.

• Dane wyjściowe — AesCode-8B: kompletny dokument HTML i CSS, jedna wyrenderowana strona na żądanie. North Mini Code: tekst i wywołania narzędzi, co w praktyce oznacza poprawki, polecenia powłoki i trajektorie agenta.

• Rozmiar — AesCode-8B: gęsty model bf16 o 8,8 mld parametrów, w czterech shardach safetensors o łącznym rozmiarze 17 543 339 408 bajtów. North Mini Code: łącznie 30 mld parametrów, z 3 mld aktywnych parametrów, rzadki model typu mixture-of-experts ze 128 ekspertami i 8 aktywnymi na token.

• Kontekst — AesCode-8B: 24 576 tokenów w raportowanej konfiguracji, przy czym prompty i odpowiedzi podczas treningu są ograniczone do 8 192 każdy. North Mini Code: 256K na wejściu, 64K maksymalnej generacji.

• Dane wejściowe — AesCode-8B: tekst plus opcjonalny obraz referencyjny. North Mini Code: tylko tekst, a wszystko inne dostarcza harness.

• Trenowany na — AesCode-8B: 3 000 demonstracji cold-start, a następnie uczenie ze wzmocnieniem GDPO na 7 408 promptach przez 400 kroków, oceniane przez sześć deterministycznych weryfikatorów oraz rubrykę wizualną po wyrenderowaniu każdego kandydata w przeglądarce w piaskownicy. North Mini Code: środowiska agentowe — SWE-Agent, mini-SWE-Agent, OpenCode i Terminus 2 — dzięki czemu działa w tym, którego już używasz, zamiast przywiązywać cię do jednego.

• Licencja — w obu przypadkach Apache 2.0, wraz z wagami, bez wyłączenia zakresu użycia, bez progu dla współtwórców. Na tej osi są identyczne i o niczym nie decydują.

• Dowody — AesCode-8B: własna 300-próbkowa rubryka infograficzna Microsoftu, nieodtworzona. North Mini Code: dane dostawcy plus niezależny pomiar.

Asymetria dowodów, która jest węższa, niż się wydaje

Wschodnia strona tego porównania ma u siebie outsidera, a to jest warte więcej niż różnica w benchmarkach. Artificial Analysis samodzielnie uruchomiło North Mini Code i przyznaje mu 33,4 w swoim Coding Index oraz 27,6 w Intelligence Index — co jest konkurencyjne wobec podobnych rozmiarowo otwartych modeli lub je przewyższa. Cohere podaje 61,0% pass@1 w SWE-Bench Verified oraz do 2,8× większą przepustowość wyjściową niż Devstral Small 2 od Mistrala — obie wartości pochodzą od dostawcy. To właśnie niezależne uruchomienie wychwyciło haczyk: North Mini Code generuje około trzy razy więcej tokenów wyjściowych niż mediana w jego klasie rozmiaru, aby ukończyć ten sam zestaw benchmarków — około 75–77 mln tokenów wyjściowych wobec mediany 25–38 mln. Przy cenie startowej wynoszącej zero nie kosztuje to nic w gotówce. Kosztuje opóźnienie i daje przedsmak rachunku, gdy skończy się stawka promocyjna.

AesCode-8B nie ma odpowiednika poza samym pomiarem. Microsoft podaje 82,94 Overall w swojej własnej ocenie infografik na 300 próbkach, trzy generacje na prompt, bez selekcji, wyprzedzając warunkowany referencją GPT-5.5 z 81,28 i Claude Opus 4.8 z 80,39 oraz mając 31,1 punktu Visual przewagi nad własnym backbone’em. Podaje również, że nagrody warunkowane referencją podniosły wynik Visual oparty wyłącznie na promptcie z 25,17 do 69,71, a pominięcie obrazu referencyjnego podczas wnioskowania kosztuje model tylko 1,00 punktu Visual w porównaniu z 19,55 dla backbone’u. To wyjątkowo konkretne twierdzenia, a harness jest udostępniony jako open source, co stanowi więcej, niż oferuje większość tabel dostawców. Nikt nie odtworzył żadnej z tych rzeczy. Nie ma żadnego wpisu na arenie, żadnego miejsca na leaderboardzie, żadnego pomiaru przepustowości ani żadnego przeglądu rubryki przez stronę trzecią.

Zauważ, co to konkretnie oznacza dla porównania: nie ma wspólnej liczby. Jeden model jest oceniany pod kątem tego, czy zadania inżynierii oprogramowania są zaliczane i ile tokenów kosztują; drugi jest oceniany pod kątem tego, czy tekst infografiki pozostaje czytelny, a jej układ nie wychodzi poza kanwę. Zestawienie 33,4 z 82,94 porównuje wskaźnik kodowania z ogólnym wynikiem infografiki.

Gdzie każde z nich zostanie wdrożone i ile to kosztuje

A generated two-column scoreboard titled "AesCode-8B vs North Mini Code - the scoreboard". Left column AesCode-8B reads Size 8.8B dense, Output a rendered HTML page, Context 24,576 tokens, Deploy about 40-48 GB, Evidence Microsoft rubric, Downloads 2. Right column North Mini Code reads Size 30B-A3B mixture-of-experts, Output code and tool calls, Context 256K in and 64K out, Deploy about 20-24 GB quantised, Evidence AA Coding Index 33.4, Downloads 150,000+ vendor count. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; North Mini Code figures per Artificial Analysis and Cohere." The OrcaRouter logo is composited bottom-right.

Historia wdrożenia North Mini Code to powód, dla którego przekroczył 150 000 pobrań. MoE z 3 mld aktywnych parametrów kwantyzuje się do około 20–24 GB pamięci, zespół Cohere zaprezentował go na Mac Studio przez MLX, a to właśnie 3 mld aktywnych parametrów sprawia, że lokalne wnioskowanie jest ekonomiczne. Działa na pojedynczym H100 przy pełnej precyzji. Cohere udostępniał go po $0.00 za milion tokenów wejściowych i wyjściowych w okresie premiery oraz oferuje zarządzaną ścieżkę wdrożenia na instancję na potrzeby skali produkcyjnej. Sam wynik to własna liczba Cohere, zagregowana ze wszystkich kanałów dystrybucji, bez rozbicia na poszczególne platformy, a publiczna miesięczna liczba z Hugging Face jest o rząd wielkości mniejsza, co jest spójne z tym, że agregat obejmuje API, hostowane bramy, menedżery pakietów i lokalne pobrania. Należy to czytać jako rozpęd, a nie telemetrię.

Historia wdrożenia AesCode-8B to jedna linia poleceń. Karta podaje ją wprost — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, z transformers w wersji 4.57 lub nowszej dla ścieżki bez vLLM. 17,5 GB wag bf16 leży obok pamięci podręcznej KV na 24 576 tokenów i maksymalnie dwa obrazy, więc pojedyncza karta 24 GB teoretycznie wystarcza, a w praktyce jest ciasno; 40–48 GB to realistyczne minimum. Dodaj stos renderujący, jeśli chcesz oceniać wyniki tak, jak zrobili to autorzy, ponieważ każde twierdzenie o jakości tego modelu powstało przez renderowanie jego HTML w przeglądarce z zablokowanymi żądaniami zewnętrznymi. Nie udało nam się znaleźć żadnego hostowanego punktu końcowego, a modelu nie ma w naszym katalogu.

Ten ostatni punkt jest praktyczny dla każdego, kto porównuje te dwa modele pod kątem dostępności. North Mini Code działa za pośrednictwem własnego API dostawcy i kilku platform zewnętrznych, a także samych wag. AesCode-8B jest dostępny tylko na Hugging Face i GitHub. Jeśli Twoim ograniczeniem jest „muszę wywołać to z usługi jutro”, tylko jeden z tych dwóch odpowiada twierdząco.

Pytanie o kompozycję, którego nie rozwiązuje żaden z dwóch modeli

Oto pułapka w obu połowach tego porównania i jest to ta sama pułapka. Wdrożenie któregokolwiek z nich oznacza utrzymywanie samodzielnie hostowanej ścieżki serwowania dla specjalisty. AesCode-8B potrzebuje stosu multimodalnego i renderera, aby można go było właściwie ocenić. North Mini Code potrzebuje slotu dla MoE z 3B aktywnymi parametrami oraz otaczającego go harnessu agentowego, a jego gadatliwość sprawia, że trajektoria kosztuje więcej, niż sugeruje liczba tokenów. Zespół, który chce obu możliwości — generatora stron i agenta repozytorium — prowadzi teraz dwa wdrożenia inferencyjne, a dla wszystkiego, co nie jest ani jednym, ani drugim, trzecie.

To jest przypadek, w którym jeden punkt końcowy przed wieloma modelami wykonuje prawdziwą pracę, a nie tylko pełni funkcję udogodnienia. Trzymaj specjalistę na własnym sprzęcie, tam gdzie uzasadniają to ekonomia i obsługa danych, a rutynowy ruch kieruj do tego hostowanego modelu, który w tym tygodniu jest dla niego najlepszy — wszystko za jednym kluczem, z ceną katalogową dostawcy przekazywaną przy 0% narzutu i automatycznym przełączaniem awaryjnym, jeśli dostawca zacznie zawodzić. Szkielet rodziny Qwen3 dobrze pokazuje, jak cienka staje się ta granica: Microsoft zbudował AesCode-8B na Qwen3-VL-8B-Instruct, a modele wizyjno-językowe z tej rodziny można wywoływać przez OrcaRouter — Qwen3-VL-8B-Instruct w cenie $0.18 za milion tokenów wejściowych i $0.70 za wyjściowe przy kontekście 131 072 tokenów, oraz Qwen3-VL 235B A22B w cenie $0.40 i $1.60. Żaden z nich nie jest AesCode-8B; fine-tuning należy do Microsoftu i żaden dostawca go nie obsługuje. Ale jeśli chciałeś dzięki niemu uzyskać model, który czyta zrzut ekranu i pisze kod, a nie potrzebowałeś konkretnie fine-tuningu do projektowania estetycznego, wywoływalna opcja kosztuje ułamek GPU i jej wypróbowanie zajmuje popołudnie, a nie cykl zakupowy.

A GitHub screenshot of the microsoft/AesCode repository showing the MIT licence badge, 1 star, 14 commits on main, a README table listing assets, data_prep, eval and other directories, and the latest commit message "README: overview, results, and the reproduction guide". The repository description area reads "No description, website, or topics provided."

Jak podjąć decyzję, skoro żaden z nich nie jest uniwersalny?

Najpierw zdejmijmy licencję ze stołu, ponieważ to remis i niczego nie rozstrzygnie.

Zapytaj, jaki ma być wynik. Jeśli odpowiedź brzmi: wyrenderowana, edytowalna strona — prezentacja, raport, dashboard — North Mini Code nie może ci pomóc, a AesCode-8B jest jedynym z tej dwójki skierowanym na ten problem. Wchodź w to z pełną świadomością: nieogłoszony punkt kontrolny badań, dwa pobrania, kontekst 24K zweryfikowany tylko na pojedynczych stronach infograficznych, znacznik języka wyłącznie angielskiego i brak jakiejkolwiek niezależnej oceny. Pułap dla metryki Style w tabeli samego Microsoftu to 53,21 w wymiarze zdefiniowanym jako niewymagający dalszych poprawek wizualnych przed dostarczeniem, co oznacza, że dostawca mówi ci, że wynik wciąż edytuje człowiek.

Jeśli odpowiedzią jest zmiana w repozytorium — migracja, poprawka, wieloetapowe zadanie terminalowe — North Mini Code jest tym z treningiem harness, oknem 256K, profilem wdrożeniowym z 3B aktywnymi parametrami, działającym API dostawcy oraz zewnętrznym pomiarem zarówno jego jakości, jak i gadatliwości. Zaplanuj budżet na liczbę tokenów, a nie na stawkę z nagłówka, ponieważ niezależne ustalenie mówi, że pisze około trzy razy więcej niż jego odpowiedniki, aby dotrzeć do tego samego miejsca.

A jeśli twój kwartał obejmuje zarówno artefakt projektowy, jak i migrację repozytorium, nie traktuj tego jako decyzji o dwóch modelach. Uruchamiaj specjalistę tam, gdzie zwraca koszt swojego GPU, przekieruj resztę i przestań utrzymywać ścieżki serwowania, których nie potrzebujesz.

A Hugging Face screenshot of the CohereLabs North-Mini-Code-1.0 model card showing a trend arrow, 577 likes and 381k organisation followers, the Text Generation, Transformers, Safetensors and cohere2_moe tags with conversational, chat, code and agent tags, an Apache-2.0 licence badge, a Directly Available for Download badge, and the model summary reading "North Mini Code is an open weights research release of a 30B-A3B parameter model optimized for code generation, agentic software engineering, and terminal tasks", developed by Cohere and Cohere Labs.

Różnica, która przetrwa wszelkie benchmarki

Jedna ostatnia rzecz odróżnia te dwa, i nie jest to kwestia techniczna. North Mini Code ma dostawcę, który opublikował kartę, wpis, Space do wypróbowania i metodologię, z którą można polemizować, plus doświadczenie innych ludzi zebrane z 150 000 pobrań. AesCode-8B ma repozytorium, README i cytację, w której jest napisane, że jest w recenzji.

To zmienia to, jakie są w ogóle otwarte pytania. W przypadku North Mini Code aktualne pytanie brzmi, czy jego gadatliwość czyni go nieekonomicznym przy dużej skali, gdy skończy się stawka promocyjna — a odpowiedź można uzyskać, uruchamiając go, bo wiele innych osób już to zrobiło. W przypadku AesCode-8B aktualne pytanie brzmi, co Microsoft zamierza z nim zrobić: artefakt badawczy, pierwsze wydanie linii produktowej czy coś, co po cichu zostanie zastąpione w ciągu sześciu tygodni. Nic w repozytorium na to nie odpowiada i żadna ilość lektury karty modelu tego nie zmieni. Wypatruj trzech sygnałów — oficjalnego ogłoszenia, niezależnego odtworzenia wyniku 82,94 albo dostawcy, który przejmie checkpoint — a brak wszystkich trzech traktuj jako aktualny stan dowodów, a nie powód, dla którego model jest nieciekawy. Powód, dla którego jest interesujący, to spadek referencyjny o 1,00 punktu, a ta liczba wciąż tam czeka, aż sprawdzi ją ktoś inny niż Microsoft.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie