
AesCode-8B vs Qwen3-8B: Wyglądają jak rodzic i dziecko, ale nimi nie są
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 85 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Te nazwy zachęcają do pomyłki. AesCode-8B to model 8B oparty na Qwen3-VL-8B-Instruct, Qwen3-8B to własny model 8B tego dostawcy, a oczywista interpretacja jest taka, że pierwszy jest dostrojeniem drugiego. Tak jednak nie jest. Opublikowana konfiguracja AesCode-8B deklaruje Qwen3-VL-8B-Instruct jako bazę — wizyjno-językowego brata, inny checkpoint o innym zadaniu — a metadane Hugging Face wymieniają go jako dostrojenie tego modelu, a nie tekstowego Qwen3-8B. Dwa modele AesCode w tej klasie wag są kuzynami, a nie rodzicem i dzieckiem, i ta różnica jest całym powodem, dla którego ta strona jest przydatna: mówi, co Microsoft kupił, zaczynając od checkpointu wizyjno-językowego, ile to kosztowało po stronie tekstowej i dlaczego porównanie ze zwykłym generalistą 8B z tej rodziny kończy się mierzeniem forka, a nie ulepszenia.
Oba są objęte licencją Apache 2.0 i oba można pobrać, ale ich historia publikacji nie mogłaby się bardziej różnić. Qwen3-8B trafił na rynek w kwietniu 2025 r. w ramach linii generacji Qwen3 tego dostawcy, mając za sobą dokumentację, integrację z ekosystemem i osiemnaście miesięcy wdrożeń innych osób. AesCode-8B nie zawiera nigdzie w swoich plikach daty wydania. Firma Microsoft utworzyła repozytorium na Hugging Face 29 września 2026 r., zatwierdziła wagi z komunikatem „Release AesCode-8B” o 03:35 UTC 7 października 2026 r., a następnego dnia umieściła kod treningowy na GitHubie. Nie ma żadnego wpisu Microsoft Research, żadnej noty wydania, żadnej strony produktu ani żadnej publikacji — cytowanie w karcie modelu brzmi „Under review” z zastępczym rokiem 2027, a repozytorium wykazywało dwa pobrania w chwili pisania tego tekstu. Wszystko, co ilościowe na temat AesCode-8B poniżej, pochodzi od samego Microsoftu i nie zostało przez nikogo powtórzone.
Drzewo genealogiczne, które kryją nazwiska
Linia generacji Qwen3 zawiera kilka checkpointów klasy 8B, które mają wspólne pochodzenie i niewiele poza tym. Qwen3-8B to generalista wyłącznie tekstowy: około 8,2 miliarda łącznych parametrów, z czego około 7 miliardów to parametry niebędące osadzeniami, uwaga z grupowanymi zapytaniami, natywny kontekst 32K tokenów rozszerzalny do 131K dzięki YaRN oraz trening obejmujący 119 języków i dialektów. Rozumuje, prowadzi rozmowy, pisze kod i wywołuje narzędzia, i właśnie z tych powodów jest jednym z najczęściej samodzielnie hostowanych modeli 8B w otwartym ekosystemie. Qwen3-VL-8B-Instruct to członek multimodalny: ta sama generacja rodziny, dedykowana wieża wizyjna na wierzchu, obraz i tekst na wejściu, tekst na wyjściu.
Microsoft zaczął od drugiej. Konfiguracja AesCode-8B odczytuje się jako Qwen3VLForConditionalGeneration, z 36 warstwami ukrytymi, rozmiarem ukrytym 4096, 32 głowami uwagi i 8 głowami klucz-wartość, słownikiem 151 936 tokenów i przeplatanymi pozycjami mrope, i wymaga transformers w wersji 4.57 lub nowszej. Shardy sumują się do 17 543 339 408 bajtów, około 8,8 miliarda parametrów bf16, dlatego zaokrąglone pole rozmiaru w Hugging Face podaje 9B, podczas gdy dostawca podaje 8B. To zaokrąglenie, a nie rozbieżność, a liczba parametrów to nie ten fork, który ma znaczenie — liczą się modalność wejściowa i kontekst obsługi wynoszący 24 576 tokenów.
Uczciwe ujęcie nie brzmi więc: „generalista kontra jego dostrojona wersja”. Brzmi ono: tekstowy generalista z długim kontekstem i osiemnastomiesięczną historią produkcyjną przeciw multimodalnemu checkpointowi badawczemu, który generuje dokument i nigdy nie był niezależnie oceniany.

Na co Microsoft wydał budżet szkoleniowy
Brief projektowy jest przytoczony na karcie modelu i wyjaśnia ten podział: modele kodu „nie widzą, jak układ, hierarchia i kolor współgrają na kanwie”, natomiast generatory obrazów „komponują atrakcyjne wizualnie strony, ale często błędnie renderują tekst, liczby i zależności logiczne”. AesCode to próba przejęcia wyczucia kompozycji od jednych, a weryfikowalności od drugich; przepis jest nietypowy w konkretny sposób.
Każdy prompt treningowy jest sparowany z obrazem referencyjnym wygenerowanym z tego samego promptu — własne uruchomienia Microsoftu użyły GPT-Image-2 do obrazu i GPT-5.5 do rozszerzenia krótkiego zarysu w szczegółowy prompt treściowy. Referencja przenosi wyłącznie układ i styl; prompt tekstowy pozostaje rozstrzygający co do treści. Następnie, podczas wnioskowania, model ledwo jej potrzebuje: pozbaw AesCode-8B referencji, a jego wynik Visual spada o 1,00 punktu na sto, wobec 19,55 dla backbone'a i 10,04 dla GPT-5.5. Powiązany wynik jest taki, że nagrody oparte na referencjach podniosły Visual oparty tylko na promptcie z 25,17 do 69,71, więc prior wizualny przeniósł się do wag zamiast pozostawać na wejściu.
Reszta to opowieść o projektowaniu nagród. Nadzór to „graf projektu” węzłów i krawędzi — tekst, wykresy, tabele, karty, regiony, pola obrazów, z zawieraniem, wyrównaniem, kolejnością i połączeniem jako krawędziami — wybrany tak, aby każda właściwość na kanwie należała do nazwanego elementu i mogła być oceniana osobno. Siedem kanałów ocenia wynik: sześć deterministycznych weryfikatorów do wykonania, tekstu, granic, danych tabel i wykresów, układu semantycznego i przestrzeni białej, plus jeden specyficzny dla próbki Visual Graph Rubric oceniany przez model wizyjno-językowy. Kandydaci są renderowani w piaskownicy przeglądarki Playwright z zablokowanymi zewnętrznymi żądaniami, a harness odczytuje DOM, obliczone style, ramki ograniczające i zrzut ekranu, dlatego tabele muszą być tabelami HTML, a wykresy muszą być specyfikacjami ECharts. Trening rozpoczął się od nadzorowanego dostrajania z zimnym startem na 3000 demonstracji, następnie GDPO na 7408 promptach przez 400 kroków na pojedynczym węźle ośmiu NVIDIA B200, przy czym każdy kanał nagrody był normalizowany w obrębie swojej grupy rollout, aby gęsty sygnał oparty na regułach nie zagłuszył rzadkiego sygnału wizualnego. Microsoft mierzy tę normalizację na 5,12 punktów Visual w porównaniu do zwykłego skalarnego GRPO.
Żaden z tych mechanizmów nie istnieje po to, by uczynić AesCode-8B lepszym ogólnym asystentem. Istnieje po to, by dane wyjściowe były sprawdzalne, i dlatego kontekst tego modelu jest taki, jaki jest.
Obok siebie, z oznaczonymi numerami
• Base — AesCode-8B: Qwen3-VL-8B-Instruct, wizyjno-językowy checkpoint. Qwen3-8B: tekstowy generalista tej samej generacji.
• Parametry — AesCode-8B: około 8,8 mld bf16 w czterech shardach. Qwen3-8B: łącznie około 8,2 mld, około 7 mld parametrów niebędących embeddingami.
• Dane wejściowe — AesCode-8B: tekst plus opcjonalny obraz referencyjny. Qwen3-8B: tekst.
• Dane wyjściowe — AesCode-8B: kompletny dokument HTML i CSS. Qwen3-8B: tekst, wywołania narzędzi, kod.
• Kontekst — AesCode-8B: 24 576 tokenów w raportowanej konfiguracji. Qwen3-8B: 32K natywnie, 131K rozszerzone przez YaRN.
• Języki — AesCode-8B: tag karty to wyłącznie „en”. Qwen3-8B: 119 języków i dialektów.
• Dowody — AesCode-8B: własna rubryka infograficzna Microsoftu oparta na 300 próbkach, trzy generacje na prompt, bez zewnętrznego powielania. Qwen3-8B: osiemnaście miesięcy niezależnych benchmarków, prac nad kwantyzacją i wdrożeń produkcyjnych.
• Licencja — w obu przypadkach Apache 2.0, bez ograniczeń dostępu. Remis, i to nie taki czynnik różnicujący, za jaki ludzie go uważają.
Luka dowodowa to prawdziwe porównanie
Microsoft podaje, że AesCode-8B uzyskuje 82,94 pkt ogółem w swojej rubryce oceny, wyprzedzając GPT-5.5 z warunkowaniem referencyjnym z wynikiem 81,28 i Claude Opus 4.8 z 80,39, oraz o 31,1 punktu w kategorii Visual więcej niż jego własny model bazowy z warunkowaniem referencyjnym. Trzy liczby z tej tabeli znaczą więcej niż nagłówek. Pierwsza to Styl, w którym AesCode-8B ma 53,21, a żaden model w porównaniu nie przekracza 60 — a definicja Stylu według Microsoftu to projekt, który nie wymaga dalszych wizualnych poprawek przed dostarczeniem, więc w tym jednym wymiarze, który pyta, czy człowiek wysłałby stronę bez edycji, model nie jest liderem. Druga to błąd graniczny: poważne przepełnienie kanwy powtarza się w 4,3% z 300 próbek, wobec 34,7% w przypadku GPT-5.5. Trzecia to fakt, że wizualna połowa wyniku pochodzi od nieujawnionego sędziego wizualno-językowego, co oznacza, że deterministyczna połowa jest odtwarzalna przez osobę z zewnątrz, a druga połowa nie.
Wyniki Qwen3-8B pochodzą z zupełnie innego źródła i to ma większe znaczenie niż to, który zestaw jest wyższy. Osiemnaście miesięcy niezależnej ewaluacji, kwantyzacji tworzonych przez społeczność, benchmarków serwowania i wdrożeń produkcyjnych to inny rodzaj dowodu: to nie jest twierdzenie, to udokumentowany dorobek. Możesz sprawdzić, jak Qwen3-8B zachowuje się przy kwantyzacji do czterech bitów na konkretnej karcie, ponieważ ktoś to opublikował. Nie możesz tego zrobić w przypadku AesCode-8B, ponieważ według stanu na ten tydzień nikt poza Microsoftem nie uruchomił go na żadnym sprzęcie.
I nie ma wspólnego wskaźnika między tymi dwiema tabelami. Qwen3-8B nie ma wyniku dla układu infografiki; AesCode-8B nie ma w ogóle opublikowanego benchmarku ogólnego rozumowania. To porównanie nie jest bliskie ani nie jest bliskie — jest niedostępne.
Co tak naprawdę potrzeba, aby uruchomić każdy z nich

Qwen3-8B jest tym łatwiejszym. Model tekstowy 8.2B kwantyzuje się na pojedynczą kartę konsumencką, ma za sobą osiemnaście miesięcy narzędzi we wszystkich frameworkach serwujących i lokalnych środowiskach uruchomieniowych oraz zachowuje się przewidywalnie. Rozszerzenie kontekstu do 131K jest udokumentowane, a nie oparte na folklorze, a obsługa 119 języków sprawia, że pojawia się w tak wielu wielojęzycznych potokach.
AesCode-8B to projekt serwowania. Polecenie z samej karty to vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, z biblioteką transformers w wersji 4.57 lub nowszej dla ścieżki bez vLLM. 17,5 GB wag bf16 musi zmieścić się obok pamięci podręcznej KV dla 24 576 tokenów i maksymalnie dwóch obrazów, więc pojedyncza karta 24 GB jest technicznie wystarczająca i niekomfortowo ciasna, a 40–48 GB albo dwie karty 24 GB to realistyczne minimum. Zaplanuj też renderer, ponieważ wszystkie twierdzenia o jakości tego modelu opierają się na renderowaniu jego wyników HTML w przeglądarce w piaskownicy — jeśli chcesz wiedzieć, czy własne wyniki są dobre, to właśnie to stanowisko testowe musisz postawić. I pamiętaj, że kontekst 24 576 tokenów testowano na pojedynczych stronach infografik, a nie na wieloslajdowych prezentacjach, do których model jest kierowany, więc presja na kontekst w prawdziwej prezentacji to nieprzetestowany obszar.
Dostępność to druga połowa tego samego zagadnienia. AesCode-8B nie jest czymś, co OrcaRouter routuje, i nie udało nam się znaleźć go udostępnianego nigdzie indziej; ocena dzisiaj oznacza wagi na własnym sprzęcie. Jego przodek to zupełnie inna historia — Qwen3-VL-8B-Instruct można wywołać przez OrcaRouter już teraz za 0,18 USD za milion tokenów wejściowych i 0,70 USD za milion tokenów wyjściowych przy kontekście 131 072 tokenów, co czyni go najtańszym sposobem, by zobaczyć, jak dostrojona wersja tej dokładnie architektury radzi sobie z Twoimi własnymi promptami do infografik. Dalej w tej samej linii Qwen3.8-27B jest routowalny za 0,33 i 2,40 USD. Cena katalogowa dostawcy jest przekazywana bez doliczania marży, a przełączanie awaryjne między dostawcami odbywa się automatycznie, więc prototypowanie promptu na hostowanym backbone kosztuje jeden klucz, a nie tydzień GPU, i tylko prompty, które faktycznie dobrze się renderują, zasługują na pracę nad reprodukcją.

To, który z nich chcesz, zależy od artefaktu.
Wybierz AesCode-8B, gdy produktem końcowym jest strona i musi być edytowalna. Ustrukturyzowany wynik HTML, który można diffować w Git, tabele jako prawdziwe tabele, a wykresy jako specyfikacje ECharts, to naprawdę inny artefakt niż akapit tekstu, a żadna ilość ogólnych zdolności go nie zastąpi. Przyjmij ten kompromis świadomie: nieogłoszony checkpoint badawczy z dwucyfrową liczbą pobrań, kontekst 24K, tylko angielski, brak niezależnej oceny, pułap Style publikowany przez samego dostawcę oraz rachunek za serwowanie mierzony w dziesiątkach gigabajtów.
Wybierz Qwen3-8B do wszystkiego innego — co dla większości zespołów oznacza wszystko. To sprawdzony generalista w tej klasie wag, ma dłuższy kontekst, mówi w stu dziewiętnastu językach, działa na sprzęcie, który już posiadasz, a za decyzjami, które zamierzasz podjąć, stoi osiemnaście miesięcy produkcyjnego doświadczenia innych osób. Jeśli nie masz konkretnej potrzeby emitowania renderowanych stron, to porównanie ma jedną odpowiedź.
Argument za tym, by chcieć oba, jest realny i nie jest to rozstrzygnięcie remisu. Potok, który czyta dokumenty i tworzy prezentacje, używa dwóch modeli o dwóch naprawdę różnych typach danych wyjściowych, a użytecznym podejściem jest utrzymanie renderera stron na sprzęcie, który jest w stanie go pomieścić, i kierowanie pracy związanej z czytaniem i rozumowaniem do czegoś hostowanego za tym samym punktem końcowym co wszystko inne.
Co sprawiłoby, że ta strona byłaby bliższa?
Trzy rzeczy — i tylko jedna z nich dotyczy benchmarków. Niezależne odtworzenie spadku referencyjnego o 82,94 punktu i 1,00 punktu przeniosłoby AesCode-8B z twierdzenia dostawcy do wyniku i pozwoliłoby merytorycznie rozstrzygnąć kwestię rozmiaru 8B kontra 8B. Dostawca, który przejąłby ten checkpoint, zwinąłby kolumnę wdrożeniową i zamienił „tydzień GPU” w „wywołanie API”. A praca, którą karta wskazuje jako znajdującą się w recenzji — „AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards” — odpowiedziałaby na pytanie, na które karta modelu nie potrafi odpowiedzieć: co robi rubryka wizualna, gdy sam graf projektu, względem którego dokonuje oceny, jest błędny.
Dopóki któreś z nich się nie pojawi, interpretacja, którą można obronić, to ta wąska. AesCode-8B jest ciekawszym z tych dwóch modeli, ale też mniej użytecznym. Jest bardzo dobry w tych częściach projektowania wizualnego, które maszyna może sprawdzić, przeciętny w tej części, której nie da się zautomatyzować, i należy do tej samej rodziny generacji Qwen3 co model, z którym jest porównywany, choć nie wywodzi się od niego. Qwen3-8B to ten, który możesz wpiąć w pipeline już dziś po południu.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
