Wygenerowana karta tytułowa z nagłówkiem „AesCode-8B vs Gemma 4 12B” i dwiema zaokrąglonymi kartami obok siebie. Lewa karta AesCode-8B ma ikonę okna przeglądarki oraz wiersze „Checkpoint badawczy Microsoft” i „Emituje wyrenderowaną stronę HTML”; prawa karta Gemma 4 12B ma ikonę lupy nad dokumentem oraz wiersze „Google DeepMind, wydana 2026-06-03” i „Odpowiada na pytania dotyczące obrazów”. Separator między nimi głosi „jeden renderuje, drugi odpowiada”, a pasek podpisu u góry głosi „niezapowiedziane wydanie – tylko wagi, brak hostowanego punktu końcowego”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

AesCode-8B vs Gemma 4 12B: Dwa małe modele wizyjne, całkowicie różne wyniki

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

AesCode-8B i Gemma 4 12B przyjmują zarówno obraz, jak i zdanie, a oba są checkpointami Apache-2.0, które się pobiera, a nie wynajmuje, dlatego wyszukiwarki chętnie stawiają je obok siebie. Podobieństwo jest prawdziwe, ale też powierzchowne. Gemma 4 12B zwraca odpowiedź — opis, transkrypcję, fragment kodu, ślad rozumowania. AesCode-8B zwraca wyrenderowaną stronę: slajd, plakat lub pulpit nawigacyjny jako kompletny dokument HTML i CSS, który możesz otworzyć w przeglądarce i edytować ręcznie. Ten sam kształt danych wejściowych, ta sama przybliżona klasa wag i wynik, który nie ma prawie nic wspólnego z drugim. Ta pojedyncza różnica rozstrzyga niemal każde praktyczne pytanie poniżej, w tym to, którą z nich możesz jutro postawić przed użytkownikiem.

Warto powiedzieć na wstępie, bo kształtuje to, jak dużą wagę mogą mieć te liczby: Gemma 4 12B została udostępniona przez DeepMind 3 czerwca 2026 r. wraz z kartą modelu, dokumentacją i ekosystemem, i od tego czasu jest niezależnie testowana. AesCode-8B nie został udostępniony w ogóle. Repozytorium Microsoftu dla niego utworzono 29 września 2026 r., a wagi trafiły do commita zatytułowanego „Release AesCode-8B” o 03:35 UTC 7 października 2026 r., przy czym kod treningowy i ewaluacyjny pojawił się na GitHubie następnego dnia. Nie ma wpisu Microsoft Research, strony produktu, informacji o wydaniu ani preprintu — cytowanie w karcie modelu brzmi „Under review”, z zastępczym rokiem 2027. W chwili pisania tego tekstu repozytorium 8B pokazuje dwa pobrania i jedno polubienie. Wszystko ilościowe dotyczące AesCode-8B pochodzi więc od samego Microsoftu, a nic nie zostało odtworzone przez nikogo innego.

Te dwa modele, na własnych warunkach

Gemma 4 12B to średniej wielkości otwarty model, gęsty checkpoint o 11,95 miliarda parametrów, którego kluczowym wyborem projektowym jest brak osobnego enkodera wizji lub audio: fragmenty obrazu i przebiegi audio trafiają prosto do transformera. Ma kontekst 256 tys. tokenów i wymaga około 16 GB VRAM, przy czym wagi BF16 zajmują około 27 GB, a skwantyzowane wersje poniżej 7 GB. Karta samego dostawcy — dane raportowane przez dostawcę i tak tu oznaczone — wymienia DocVQA 94,9, InfoVQA 88,4, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 i LiveCodeBench v6 72,0 w trybie myślenia. Niezależna ewaluacja jest tą częścią, która liczy się bardziej: Artificial Analysis ocenia konfigurację rozumowania na 14 w Intelligence Index, mierzy około 114 tokenów na sekundę i wycenia typowe obsługiwane wywołanie na około 0,10 USD za milion tokenów wejściowych i 0,30 USD za milion tokenów wyjściowych. Ma za sobą trzy i pół miesiąca wdrożenia.

AesCode-8B to dostrojona wersja Qwen3-VL-8B-Instruct, opublikowana w czterech shardach safetensors o łącznym rozmiarze 17 543 339 408 bajtów — około 8,8 miliarda parametrów bf16, dlatego zaokrąglone pole rozmiaru w Hugging Face pokazuje 9B, podczas gdy dostawca podaje 8B. Opublikowana konfiguracja to dokładnie przepis Qwen3-VL: 36 warstw ukrytych, rozmiar ukryty 4096, 32 głowy uwagi z 8 głowami klucz-wartość, słownik 151 936 tokenów oraz wymaganie transformers w wersji 4.57 lub nowszej. Opisane przez Microsoft przebiegi wykorzystywały kontekst 24 576 tokenów z maksymalnie 12 000 tokenów wyjściowych, temperaturę 0,8, top-p 0,95 oraz trzy generacje na prompt bez selekcji. Licencja to Apache 2.0, bez ograniczeń dostępu, bez aneksu dotyczącego akceptowalnego użycia. Czego nie ma w pakiecie, to dane treningowe i ewaluacyjne oraz jakikolwiek hostowany endpoint — nie udało się nam znaleźć AesCode-8B udostępnianego gdziekolwiek, a nie ma go też w naszym własnym katalogu.

Do czego modele były faktycznie trenowane

Brief projektowy jest przytoczony w karcie modelu i warto odczytać go jako pełną tezę: modele kodu „nie potrafią dostrzec, jak układ, hierarchia i kolor współgrają na kanwie”, podczas gdy generatory obrazów „komponują atrakcyjne wizualnie strony, ale często błędnie renderują tekst, liczby i relacje logiczne”. AesCode to próba zachowania jednocześnie wyczucia kompozycji i weryfikowalności.

Mechanizm jest nietypowy pod jednym konkretnym względem. Każdy prompt treningowy jest sparowany z obrazem referencyjnym wygenerowanym na podstawie tego samego promptu, który dostarcza układ i styl, podczas gdy to prompt tekstowy pozostaje wyznacznikiem treści. Następnie, podczas wnioskowania, model niemal nie potrzebuje obrazu: bez obrazu referencyjnego wynik Visual AesCode-8B spada o 1,00 punktu na sto. Bez niego Qwen3-VL-8B-Instruct odnotowuje spadek o 19,55. Bez niego GPT-5.5, oceniany w tym samym zestawie ewaluacyjnym, odnotowuje spadek o 10,04. Prior wizualny ostatecznie znalazł się w wagach, a nie w danych wejściowych, i to jest autentyczny wynik badawczy kryjący się pod nagłówkiem.

Cel treningowy Gemma 4 12B to zwykły cel multimodalny i stwierdzenie tego nie jest krytyką: odczytaj obraz, odpowiedz na pytanie, wykonaj instrukcję, wywołaj narzędzie. Nic w jej karcie nie sugeruje, by kiedykolwiek była ukierunkowana na tworzenie wyrenderowanego artefaktu, a żadna opublikowana ewaluacja Gemma 4 12B nie mierzy jakości układu dokumentu, przepełnienia kanwy ani spójności projektu, ponieważ nie są to metryki tego modelu.

Tablica wyników i czyja to rubryka

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• Parametry — AesCode-8B: 8,8B bf16, gęsty. Gemma 4 12B: 11,95B gęsty.

• Dane wejściowe — AesCode-8B: tekst plus opcjonalny obraz referencyjny. Gemma 4 12B: tekst, obraz, audio i wideo.

• Wynik — AesCode-8B: kompletny dokument HTML i CSS. Gemma 4 12B: tekst, w tym wywołania narzędzi.

• Kontekst — AesCode-8B: 24 576 tokenów w zgłoszonej konfiguracji. Gemma 4 12B: 256 tys. tokenów.

• Licencja — obie na licencji Apache 2.0, bez ograniczeń dostępu, wagi w zestawie.

• Dowody — AesCode-8B: własna, oparta na 300 próbkach rubryka infograficzna firmy Microsoft, trzy generacje na prompt, brak niezależnego odtworzenia. Gemma 4 12B: karta dostawcy oraz niezależny Intelligence Index wynoszący 14 i zmierzona przepustowość w Artificial Analysis.

Teraz część, której tablica wyników nie może udźwignąć. Microsoft podaje, że AesCode-8B osiąga 82,94 ogółem na tym zestawie 300 próbek, wyprzedzając GPT-5.5 z warunkowaniem referencyjnym z wynikiem 81,28 i Claude Opus 4.8 z wynikiem 80,39, oraz o 31,1 punktu Visual przed własnym modelem bazowym Qwen3-VL-8B. Odczytuj to wszystko jako dane zgłoszone przez dostawcę i nieodtworzone, według rubryki, którą dostawca opracował, na próbkach, które dostawca wybrał, oceniane przez system testowy, pod kątem którego dostawca trenował model. Karta jest wystarczająco uczciwa, aby opublikować wymiar, na którym żaden model w porównaniu nie przebija 60 — Style, gdzie AesCode-8B plasuje się na 53,21, a GPT-5.5 prowadzi z 57,91 — a sama definicja tego wymiaru według Microsoftu to projekt, który nie wymaga dalszej rewizji wizualnej przed dostarczeniem. Na jednej osi, która pyta, czy człowiek wypuściłby stronę bez edycji, model 8B nie jest liderem. To liczba, której trzeba się trzymać, gdy ktoś cytuje 82,94.

Tam, gdzie naprawdę się pokrywają

Istnieje dokładnie jedna wspólna półka — i jest węższa, niż się wydaje. Jeśli oceniasz małe otwarte modele wizyjne pod kątem pipeline'u z dużą liczbą dokumentów, oba są kandydatami — jeden do odczytywania dokumentu, drugi do jego tworzenia. Zespół, który generuje wewnętrzne dashboardy jako HTML, a także musi wyodrębniać dane liczbowe z przesłanych plików PDF, sięga po oba produkty w tym samym tygodniu.

Podział wewnątrz tego nakładania się jest czysty. Gemma 4 12B to model, do którego kierujesz przychodzący dokument. AesCode-8B to model, do którego kierujesz brief, gdy rezultatem ma być strona. Żaden nie zastępuje drugiego, a potok, który chce mieć oba, jest potokiem dwumodelowym, a nie wyborem.

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

Wdrożenie, i to właśnie tam asymetria naprawdę daje się we znaki

Kwestia serwowania modelu Gemma 4 12B jest już rozwiązana. Pobierasz go, kwantyzujesz, jeśli chcesz, uruchamiasz na 16 GB VRAM, a istnieje duża baza narzędzi, które już to robią. Jeśli wolisz w ogóle go nie uruchamiać, wywołanie w ramach usługi jest tanie i niezależnie wyceniane.

Serwowanie AesCode-8B to jedna linia polecenia i trochę arytmetyki. Karta modelu podaje drogę wprost — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576, z transformers w wersji 4.57 lub nowszej dla ścieżki innej niż vLLM. 17,5 GB wag bf16 musi współistnieć z pamięcią podręczną KV dla 24 576 tokenów i maksymalnie dwóch obrazów, więc pojedyncza karta 24 GB jest technicznie wystarczająca i niekomfortowo ciasna; 40–48 GB albo dwie karty 24 GB to realistyczne minimum. Zaplanuj też renderer, ponieważ każde twierdzenie o jakości tego modelu opiera się na wyrenderowaniu jego wyjścia HTML w przeglądarce w piaskownicy, więc ocena własnych wyników oznacza postawienie czegoś w rodzaju Playwrighta z zablokowanymi żądaniami zewnętrznymi.

Potem pozostaje szczery obraz dostępności. Nie kierujemy ruchu do AesCode-8B i, o ile udało nam się ustalić, nikt inny również tego nie robi; ocena dzisiaj oznacza wagi na własnym sprzęcie. Najbliższą rzeczą, którą da się wywołać, jest architektura, na której model został dostrojony. Qwen3-VL-8B-Instruct można teraz kierować przez OrcaRouter za 0,18 USD za milion tokenów wejściowych i 0,70 USD za milion tokenów wyjściowych przy kontekście 131 072 tokenów, a dwa checkpointy, które faktycznie oferujemy, są wyceniane w ten sam sposób — Gemma 4 26B-A4B po 0,06 i 0,33 USD, Gemma 4 31B po 0,13 i 0,38 USD. Ceny katalogowe dostawców są przekazywane bez doliczania marży, a przełączanie awaryjne między dostawcami następuje automatycznie, więc tanim sposobem na sprawdzenie, czy twoje prompty w ogóle dobrze się renderują, jest najpierw przetestowanie niedostrojonego szkieletu i poświęcenie tygodnia GPU wyłącznie na prompty, które przetrwają.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

Którego właściwie chcesz

Wybierz AesCode-8B, jeśli rezultatem ma być strona. Model generuje ustrukturyzowany, edytowalny HTML — tabele jako tabele HTML, wykresy jako specyfikacje ECharts — co oznacza, że wynik można porównywać w Git i projektant może zmienić jego styl bez ponownego generowania. Zaakceptuj kompromis: niezapowiedziany checkpoint badawczy z dwucyfrową liczbą pobrań, bez niezależnej ewaluacji, bez hostowanego endpointu, kontekst 24K zwalidowany wyłącznie na pojedynczych stronach infograficznych oraz tag językowy ograniczony do angielskiego na karcie.

Wybierz Gemma 4 12B do wszystkiego innego. Czyta dokumenty lepiej niż większość modeli dwukrotnie większych, obsługuje dźwięk, wykonuje instrukcje narzędzi, ma ćwierć miliona tokenów kontekstu, a za sobą trzy i pół miesiąca doświadczeń innych osób. Jeśli wybierasz jeden z tych dwóch na swój mały model wizyjny i nie poproszono cię konkretnie o tworzenie prezentacji jako kod, to jest odpowiedź.

A jeśli uczciwe wymaganie obejmuje jedno i drugie, nie traktuj tego jako rozstrzygnięcia remisu. Skieruj pracę odczytu do modelu hostowanego, a pracę renderowania pozostaw na dowolnej maszynie, która zdoła utrzymać wagi.

Co zmieniłoby tę stronę?

Trzy sygnały. Niezależne odtworzenie 82,94 i spadku referencyjnego o 1,00 punktu przeniosłoby AesCode-8B z twierdzenia dostawcy do wyniku i uczyniłoby pytanie o rozmiar 8B kontra 12B naprawdę interesującym, a nie tylko nominalnie. Dostawca usług wnioskowania, który przejąłby ten checkpoint, zwinąłby kolumnę wdrożeniową, która obecnie stanowi całą praktyczną różnicę. A artykuł, na który Microsoft powołuje się jako na będący w recenzji — „AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards” — odpowiedziałby na pytania, na które karta modelu nie może, zaczynając od tego, jak zachowuje się rubryka wizualna, gdy sam graf projektu jest błędny. Dopóki któreś z nich nie nastąpi, możliwa do obrony interpretacja jest wąska i realna: AesCode-8B jest bardzo dobry w tych częściach projektowania wizualnego, które maszyna może sprawdzić, przeciętny w tej, której nie może, a Gemma 4 12B to ukończony produkt wykonujący inną pracę.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie