Główna karta tytułowa dla „AesCode 32B vs Qwen3.8 27B” z podtytułem „model dostrojony i przodek”, narysowana jako diagram rodowodu: karta checkpointu Qwen3-VL-32B-Instruct po lewej stronie prowadzi strzałkę do karty „AesCode 32B fine-tune” oznaczonej „tylko self-hosting, 65 GB”, podczas gdy osobna, nowsza karta poniżej po prawej, oznaczona „Qwen3.8 27B”, zawiera aktywny znacznik API o treści „można wywołać już dziś”; logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

AesCode 32B vs Qwen3.8 27B: Microsoft zbudował go na Qwen, a jeden z nich można wywołać

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Szczegół, który przestawia całe to porównanie, kryje się w drugiej linii karty modelu: AesCode 32B wychodzi od Qwen3-VL-32B-Instruct. Specjalistyczny model Microsoftu przeznaczony do projektowania to fine-tuning Qwen3-VL, Apache 2.0, umieszczony w repozytorium Hugging Face utworzonym 29 września 2026 r., z commitem zatytułowanym „Release AesCode-32B” z 7 października 2026 r. i bez jakiegokolwiek ogłoszenia ze strony Microsoftu. Qwen3.8 27B to drugi koniec tej linii: własny otwarty wagowo, gęsty, multimodalny model 27B tego dostawcy, wydany 14 sierpnia 2026 r. na licencji Apache 2.0, architektura będąca następcą checkpointu VL, którego fine-tuning przeprowadził Microsoft. Nie jest to więc starcie flagowych dokonań dwóch dostawców. To starcie między ogólnego przeznaczenia modelem o otwartych wagach jednego laboratorium a badawczym fine-tunem tej rodziny ze strony konkurenta, a praktyczna różnica między nimi sprowadza się niemal wyłącznie do tego, co wolno ci zrobić z plikiem, gdy już go masz.

Ta sama licencja, ta sama rodzina, różna ilość modelu

Oba są na licencji Apache 2.0, oba przyjmują obrazy, a także tekst, i oba zwracają dane. Wszystko poza tym się rozchodzi, a wiersz dotyczący wdrożenia rozchodzi się najbardziej.

• Parametry — AesCode 32B: 33B gęsty na bazie Qwen3-VL-32B-Instruct. Qwen3.8 27B: 27B gęsty, 28B z wliczonym enkoderem wizyjnym, 64 warstwy przy wymiarze ukrytym 5120.

• Pamięć potrzebna do jego uruchomienia — AesCode 32B: karta zaleca zaplanowanie około 65 GB pamięci akceleratora na same parametry bf16, a jej własny przykład obsługi wykorzystuje czterokierunkowy paralelizm tensorowy. Qwen3.8 27B: około 55,6 GB w bf16.

• Kontekst — AesCode 32B: 24 576 tokenów w raportowanej konfiguracji, przy czym prompty i odpowiedzi podczas treningu są ograniczone do 8 192. Qwen3.8 27B: 262 144 tokeny natywnie, z możliwością rozszerzenia do 1 000 000 dzięki skalowaniu YaRN.

• Mechanizm uwagi — AesCode 32B: odziedziczony z backbone'u Qwen3-VL. Qwen3.8 27B: hybrydowy, 48 warstw liniowej uwagi Gated DeltaNet do 16 warstw pełnej uwagi w stosunku 3:1, co sprawia, że serwowanie okna 262K jest opłacalne.

• Do czego służy — AesCode 32B: generowanie bogatych w informacje artefaktów wizualnych w formie edytowalnego HTML i CSS oraz badania nad multimodalnym generowaniem kodu. Qwen3.8 27B: ogólna praca agentowa i multimodalna — kodowanie, korzystanie z komputera, rozumienie dokumentów i wideo, wywoływanie narzędzi.

• Gdzie to zdobyć — AesCode 32B: pobranie z Hugging Face; żaden dostawca inferencji go nie wdraża. Qwen3.8 27B: wagi albo hostowany endpoint.

Dwukrotnie większy kontekst, nieco mniejszy rozmiar, o jedną generację nowszy backbone i identyczna licencja. Jedyny wiersz, w którym AesCode 32B wygrywa bezapelacyjnie, to pierwszy, a wygrywa go dzięki dostrojeniu do konkretnego zadania.

Na czym każdy z nich był faktycznie mierzony

Te dwa systemy oceny nie stykają się ze sobą, a udawanie, że jest inaczej, to typowy błąd na stronach takich jak ta.

Karta modelu Qwen3.8 27B jest jednocześnie szeroka i konkretna. Kodowanie: Terminal-Bench 2.1 – 73,0, SWE-bench Pro – 61,7, QwenSWEBench – 79,0, LiveCodeBench v6 – 90,3. Rozumowanie: GPQA Diamond 89,2, Humanity's Last Exam 30,8. Korzystanie z komputera: OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9. Wizja: MathVision 94,6 z ulepszeniem w czasie wnioskowania od dostawcy i 90,0 bez niego, OmniDocBench 1.5 – 91,1. Wszystko to liczby samego dostawcy na jego własnym środowisku testowym — z przypisem, który warto przeczytać: przebiegi SWE-bench Pro i QwenSWEBench korzystały ze środowiska Claude Code, więc nie są bezpośrednio porównywalne z modelami ocenianymi na innym.

AesCode 32B ma tylko jeden benchmark i jest on jednozadaniowy: 300 próbek infografik, po trzy generacje na prompt bez selekcji, renderowane i oceniane w siedmiu kanałach. Główny wynik to Overall 85,89 przy dostarczonym obrazie referencyjnym, wobec 81,28 dla GPT-5.5 i 80,39 dla Claude Opus 4.8 w ramach tego samego środowiska testowego — a do tego twierdzenie, że AesCode 32B przewyższa własny backbone Qwen3-VL-32B o 22,4 punktu w wymiarze Visual i 24,8 w Overall.

Zestaw je obok siebie i nic się nie zgadza. Terminal-Bench mierzy, czy zadanie powłoki zostaje ukończone; ewaluacja AesCode mierzy, czy tekst infografiki jest czytelny, czy jej układ nie wykracza poza kanwę i czy jej tabela jest prawdziwą tabelą HTML. Nie ma wspólnej metryki, wspólnego środowiska testowego ani wspólnego zadania. Jedynym uczciwym stwierdzeniem jest to, że AesCode 32B znacznie lepiej radzi sobie z artefaktami projektowymi niż jego własny model bazowy, a Qwen3.8 27B to mocny model ogólnego przeznaczenia — i żadne z tych twierdzeń nie mówi nic o drugim.

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

Tym razem luka w dowodach jest realna, w jednym kierunku

Benchmarki dostawców są w tej branży normą, więc istotne jest to, że te dwa różnią się pod względem tego, jak dużą część twierdzeń ich dostawców zweryfikował ktoś z zewnątrz.

Qwen3.8 27B został wydany z własną tabelą dostawcy, a w ciągu kilku tygodni zgromadził zewnętrzne wyniki. Niezależny dorobek modelu obejmuje badanie agenta prawniczego przeprowadzone przez firmę legal-AI Harvey wraz ze startupem pamięci Engram, w którym dostosowany Qwen3.8 27B przewyższył każdy model testowany w badaniu, w tym Claude Opus 4.8, na 250 zadaniach prawniczych — z ważnym zastrzeżeniem, że dostosowany model najpierw przestudiował korpus 100 mln tokenów testowanej firmy, więc to wynik tyleż o adaptacji, co o samym modelu. Obejmuje też miejsce na liście rankingowej WebDev Code Arena oraz najwyższą pozycję wśród modeli open-weight na liście Image-to-WebDev Arena.ai, przy czym oba te twierdzenia rankingowe są przekazywane przez dostawcę, a nie oparte na opublikowanej metodologii. A ponadto obejmuje ranking podmiotu trzeciego z opublikowanym wynikiem: Artificial Analysis odnotowuje Qwen3.8 27B na poziomie 33,70 w swoim Intelligence Index, przy koszcie ukończonego zadania około 1,01 USD, i publikuje stojący za tym podział tokenów.

AesCode 32B nie ma nic z tego. Żadnego miejsca w arenie, żadnej pozycji na liście rankingowej, żadnej reprodukcji przez strony trzecie, żadnego niezależnego testu przepustowości — i nie dlatego, że ktoś je sprawdził i uznał za niewystarczające, lecz dlatego, że checkpoint, którego nie udostępnia żaden dostawca, i tak nie może zostać oceniony przez zewnętrzne narzędzie ewaluacyjne. Jego liczby są liczbami dostawcy, obliczonymi przez ten sam stos weryfikujący, który trenował model, na próbkach wybranych przez dostawcę i w porównaniu z baseline'ami uruchomionymi przez dostawcę. To wydanie jest nietypowo przejrzyste pod względem metody — nazwy kanałów nagród, liczby rolloutów, parametry dekodowania i wskaźniki błędów są publikowane — ale przejrzystość co do tego, jak powstała liczba, nie jest tym samym co to, że wytworzył ją ktoś inny.

Ten, który obciąża kartę zapisaną na koncie

To tutaj rodowód przestaje być ciekawostką i zaczyna być decyzją.

AesCode 32B wymaga od Ciebie 65 GB pamięci akceleratora, ścieżki obsługi multimodalnej i gotowości do uruchomienia nieogłoszonego modelu jako wczesny użytkownik. Jego własny przykład obsługi sięga po czterokierunkowy paralelizm tensorowy, a model jest udokumentowany dla kontekstu 24 576 tokenów bez hostowanej opcji awaryjnej. Jeśli już posiadasz sprzęt, a Twój pipeline naprawdę wymaga dostrajania specyficznego dla projektu, to rozsądny kompromis. Dla większości zespołów to dwutygodniowy projekt, zanim pojawi się pierwszy użyteczny wynik.

Qwen3.8 27B jest hostowany samodzielnie na własnej infrastrukturze OrcaRouter i można go wywołać już dziś za 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych, z kontekstem 262 144 tokenów oraz wejściem tekstowym, obrazowym i wideo. To stawki cennikowe przekazywane dalej bez żadnej marży doliczanej po naszej stronie, a model działa na tym samym kluczu co ponad 200 innych modeli, więc porównanie z dowolną alternatywą z katalogu to parametr zapytania, a nie druga umowa. To całość praktycznego uzasadnienia — i jest ono niemałe: model, który w kategoriach rodziny pozostaje o jedną generację za rdzeniem AesCode 32B, jest tym, który możesz ocenić jeszcze dziś po południu, na własnych promptach, za cenę kilku centów.

Jest tu pewien punkt drugiego rzędu, który perspektywa routingu czyni konkretnym. Ponieważ AesCode 32B to dostrojona wersja checkpointu Qwen3-VL, ta rodzina daje ci tani sposób sprawdzenia, czy hostowana część architektury w ogóle działa, zanim zobowiążesz się do samodzielnego hostowania czegokolwiek. Qwen3-VL 235B A22B Instruct jest dostępny w cenie 0,40 USD za milion tokenów wejściowych i 1,60 USD za wyjściowe, a Qwen3-VL 8B Instruct za 0,18 i 0,70 USD. Żaden z nich nie jest AesCode 32B i żaden nie został wytrenowany pod kątem jakości projektowej — ale na pytanie „czy model wizyjno-językowy potrafi odczytać nasze zrzuty ekranu i napisać znaczniki, których potrzebujemy” można za ich pomocą odpowiedzieć za grosze, a automatyczne przełączanie awaryjne pod tym samym punktem końcowym oznacza, że zły dzień u dostawcy nie położy całego potoku.

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

Kto powinien wybrać, które

Wybierz AesCode 32B, jeśli to artefakt jest produktem końcowym. Tworzysz slajdy, dashboardy, plakaty lub raporty masowo, potrzebujesz ustrukturyzowanych wyników, które pozostają edytowalne i poddają się porównywaniu w diffie — model generuje kompletny dokument HTML, używa prawdziwych struktur tabel HTML i specyfikacji ECharts, dzięki czemu jedno i drugie pozostaje możliwe do inspekcji — i masz sprzęt albo budżet, by go wynająć. Podejmując się tego, zaakceptuj trzy rzeczy: brak niezależnej weryfikacji jakichkolwiek liczb, około 65 GB na wagi oraz kontekst 24K, który ograniczy długie dokumenty. Podawany przez kartę modelu wskaźnik poważnych awarii na granicach canvasu wynoszący 4,3%, w porównaniu z 34,7% dla GPT-5.5, to najbardziej zachęcająca pojedyncza liczba w tym wydaniu — a jednocześnie należy ona do Microsoftu.

Wybierz Qwen3.8 27B, jeśli potrzebujesz ogólnego multimodalnego modelu o otwartych wagach, który naprawdę możesz uruchomić i naprawdę serwować. Kontekst 262K, rozszerzalny do miliona; ślad wdrożeniowy, który mieści się tam, gdzie AesCode 32B się nie mieści; pozycja licencyjna nie różni się; pewien niezależny pomiar zarówno jego jakości, jak i kosztu na ukończone zadanie; oraz opcja hostowana, dzięki której możesz zacząć już dziś, a później hostować samodzielnie bez przepisywania integracji. Jego stopniowana, warstwowa konstrukcja mechanizmu uwagi jest powodem, dla którego długi kontekst jest przystępny kosztowo, a długi kontekst to coś, czego potoki projektowe i dokumentowe zwykle potrzebują najbardziej.

A jeśli potrzebujesz obu — generatora artefaktów projektowych i ogólnego konia roboczego — rozsądny podział nie polega na uruchamianiu dwóch modeli językowo-wizualnych klasy 30B na własnym sprzęcie. Kieruj ogólny ruch do strony hostowanej, a specjalistę pozostaw hostowanego samodzielnie, za jednym kluczem, gdzie awaria dostawcy na którejkolwiek ścieżce jest zdarzeniem przełączenia awaryjnego, a nie incydentem.

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

Rzecz, na którą warto zwrócić uwagę

Pozycja AesCode 32B zmienia się całkowicie, jeśli stanie się wywoływalny. Obecnie jedyną prawdziwą słabością tego modelu jest dostęp, a to stan tymczasowy — przejęcie checkpointu przez dostawcę inferencji lub opublikowanie endpointu przez Microsoft zamienia 65 GB zakupu na wybór modelu. Do tego czasu uczciwym podsumowaniem tego starcia jest to, że dostrojony model jest lepszy w jednym zadaniu, model ogólny jest bardziej użyteczny, a model ogólny okazuje się przodkiem: Microsoft wybrał checkpoint Qwen3-VL jako podstawę do dalszego rozwoju, ponieważ był to najsilniejszy dostępny otwarty multimodalny model bazowy, co samo w sobie jest najużyteczniejszą rzeczą, jaką to porównanie ma do powiedzenia o Qwen3.8 27B.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie