Wygenerowana karta tytułowa porównująca Aion 3.5 Mini po lewej stronie, opisanego jako „zamknięte API – brak opublikowanych wyników”, z Gemma 4 12B po prawej stronie, opisanego jako „Apache 2.0 – karta oceny dostawcy”, ze wstążką poniżej o treści „Ta sama praca, inne dowody”.
Guides & Insights

Aion 3.5 Mini vs Gemma 4 12B: Jeden z nich ma tablicę wyników, a drugi metkę z ceną

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Aion 3.5 Mini i Gemma 4 12B to taki sam rodzaj zakupu pod jednym tylko względem: oba są małymi modelami, które można dziś wywołać przez API. AionLabs wydało Aion 3.5 Mini 23 września 2026 r. jako zamknięty, tekstowy system wielomodelowy w cenie 0,70 USD za milion tokenów wejściowych i 1,40 USD za wyjściowe. DeepMind wydało Gemma 4 12B 3 czerwca 2026 r. jako model o otwartych wagach z 11,95 mld parametrów na licencji Apache 2.0, z bezenkoderową multimodalną ścieżką wejściową i opublikowaną kartą oceny. Praktyczna różnica nie polega na liczbie parametrów ani wysokości ceny. Polega na tym, że jeden z tych modeli można zmierzyć, zanim podejmiesz decyzję, a drugiego nie da się zmierzyć wcale.

Wszystko, co poniżej dotyczy Aion 3.5 Mini, pochodzi z opublikowanej przez sam AionLabs listy modeli oraz z konfiguracji udostępnianej przez API AionLabs. Wszystko, co dotyczy Gemma 4 12B, pochodzi z karty modelu dostawcy, czyli źródła, z którego wywodzą się jego liczby, a także od zewnętrznego zestawu narzędzi ewaluacyjnych, który faktycznie go uruchomił. Tam, gdzie dana liczba jest zgłoszona przez dostawcę, oznaczono ją jako taką. Nie istnieje żadna niezależna ewaluacja jakiegokolwiek modelu Aion i zostało to stwierdzone jako fakt, a nie jako zastrzeżenie.

Gdzie te dwa faktycznie się pokrywają

Mniej miejsc, niż sugeruje etykieta „mały model”, a te, które się zgadzają, warto precyzyjnie ująć, bo to właśnie je kupujący sprawdza w pierwszej kolejności.

• Kontekst — Aion 3.5 Mini ma 262 144 tokeny. Gemma 4 12B ma okno 256K. Nominalnie to remis, a w praktyce oba są na tyle duże, że kontekst nie jest decydującym czynnikiem.

• Maksymalna długość wyjścia — Aion 3.5 Mini ogranicza pojedynczą odpowiedź do 32 768 tokenów, co jest limitem wspólnym dla całego katalogu Aion. Gemma 4 12B nie publikuje na swojej karcie żadnego równoważnego limitu wyrażonego pojedynczą liczbą, więc to parametr, który trzeba by przetestować, a nie odczytać.

• Wywoływanie narzędzi — oba to obsługują. Aion 3.5 Mini przyjmuje definicje narzędzi, format odpowiedzi JSON i temperaturę w punkcie końcowym zgodnym z OpenAI. Gemma 4 12B dostarcza wywoływanie funkcji w swojej postaci dostrojonej do instrukcji.

• Kontrola rozumowania — Aion 3.5 Mini rozumuje przy każdym wywołaniu i udostępnia trzy poziomy wysiłku: max, high i low, przy czym high jest domyślny; rozumowanie nie jest opcjonalne. Gemma 4 12B występuje w wariantach z rozumowaniem i bez rozumowania, a oba uzyskują różne wyniki w tym samym zestawie testowym, ponieważ wykonują różną ilość pracy.

• Modalność wejściowa — to pierwsza linia, w której mocno się różnią. Aion 3.5 Mini to tekst na wejściu, tekst na wyjściu, a architektura nie przewiduje wejścia obrazu. Gemma 4 12B przyjmuje tekst, obraz, dźwięk i wideo, a zwraca tekst.

Co Gemma 4 12B może Ci pokazać

Gemma 4 12B trafia do nas z kartą oceny dostawcy, a widniejące na niej liczby są raportowane przez dostawcę, a nie niezależnie odtworzone — ale istnieją, są konkretne i obejmują osie, o które kupujący faktycznie się spiera.

• Rozumowanie i wiedza według dostawcy — MMLU Pro 77.2, GPQA Diamond 78.8, HLE bez narzędzi 5.2, BigBench Extra Hard 53.0, MMMLU 83.4.

• Zgłoszone przez dostawcę wyniki w zakresie programowania — LiveCodeBench v6 72,0, Codeforces ELO 1659, AIME 2026 bez narzędzi 77,5.

• Agentowość raportowana przez dostawcę — Tau2 ze średnią z trzech przebiegów wynoszącą 69,0, a Codeforces ELO ponownie jako najmocniejszy pojedynczy wynik na karcie.

• Multimodalne według dostawcy — MMMU Pro 69,1, MATH-Vision 79,7, MedXPertQA MM 48,7. Karta nie zawiera wiersza DocVQA; najbliższa wartość dokumentowa to średnia odległość edycyjna OmniDocBench 1.5 wynosząca 0,164.

• Przywoływanie długiego kontekstu — MRCR v2, 8-needle, 128k, 43.4. To uczciwy słaby punkt na karcie i warto go przeczytać, zanim założysz, że okno 256K zachowuje się jak okno 256K na dalekim końcu.

• Pomiar strony trzeciej — Artificial Analysis w swoim własnym zestawie testowym podaje dla modelu Gemma 4 12B Reasoning Intelligence Index na poziomie 14 i Non-reasoning Index na poziomie 9, prędkość generowania wynoszącą około 113 tokenów na sekundę w trybie rozumowania oraz cenę katalogową 0,10 USD za milion tokenów wejściowych i 0,30 USD za milion tokenów wyjściowych. Rewizje indeksu zmieniają się między migawkami, więc traktuj indeks jako orientacyjny, a cenę i szybkość jako trwałe wartości.

A screenshot of the Hugging Face model card for google/gemma-4-12b, showing the model blurb 'Google | Gemma 4 | 12B | Apache 2.0 | Text, Image, Audio, Video -> Text | 256K context' and the description that Gemma 4 models are multimodal, handling text and image input and generating text output.

Co może ci pokazać Aion 3.5 Mini

Cena, okno, opis architektury — i nic więcej. AionLabs nie publikuje żadnych wyników SWE-bench Verified, Terminal-Bench, GPQA ani MMLU-Pro dla żadnego modelu w swoim katalogu, a materiały premierowe 3.5 nie zawierają w ogóle tabeli benchmarków. Artificial Analysis nie ma strony dla Aion 3.5 Mini, Aion 3.5, Aion 3.0 ani Aion 3.0 Mini — żaden z tych czterech nie występuje w indeksie modeli.

Ta nieobecność nie jest automatycznie obciążająca i błędem byłoby przedstawiać ją jako taką. AionLabs opisuje swoje modele jako systemy wielomodelowe stworzone do pracy nad narracją i opowiadaniem historii, z opartym na współpracy procesem generowania, w którym kilka wyspecjalizowanych modeli wnosi wkład do odpowiedzi. Złożone wskaźniki powyżej są zestawiane z zadań z matematyki, programowania i ekonomii — to niewłaściwe narzędzie do oceny prozy. Model może być naprawdę dobry w zadaniu, do którego został stworzony, a mimo to słabo wypaść w rankingu programistycznym albo nigdy nie zostać do takiego rankingu zgłoszony.

To, co oznacza ten brak, jest węższe i trudniejsze: nie można obliczyć kosztu na ukończone zadanie. Ceny $0.70 i $1.40 dla Aion 3.5 Mini to ceny katalogowe bez zmierzonego mianownika. Ceny $0.10 i $0.30 dla Gemma 4 12B mają przypisany zmierzony mianownik, a ten sam harness, który go zmierzył, podaje również koszt na zadanie. Na tym polega asymetria i przetrwa ona każdy spór o to, czy te benchmarki są właściwe.

Różnica w cenie jest większa, niż prawdopodobnie będzie różnica w możliwościach.

Postaw obok siebie dwa cenniki, a kształt decyzji się zmieni. Aion 3.5 Mini pobiera 0,70 USD za milion tokenów wejściowych i 1,40 USD za milion tokenów wyjściowych. W przypadku Gemma 4 12B podano 0,10 USD za wejście i 0,30 USD za wyjście w zewnętrznym środowisku testowym, które ją mierzy. To siedmiokrotnie wyższa stawka za wejście i około cztery i pół raza wyższa stawka za wyjście — w przypadku modelu, którego własny dostawca nie publikuje żadnego wyniku, z którym można by go porównać.

Dwie rzeczy komplikują proste mnożenie i obie dodatkowo przemawiają na korzyść Gemma 4 12B. Po pierwsze, Aion 3.5 Mini przeprowadza rozumowanie przy każdym wywołaniu, więc wiersz wyjściowy zawiera tokeny, o które nie prosiłeś i których nie możesz ograniczyć — AionLabs nie publikuje żadnego oświadczenia o tym, ile tokenów model zużywa na myślenie na żadnym z trzech poziomów wysiłku. Gemma 4 12B pozwala wyłączyć etap myślenia, co zmienia zarówno rachunek, jak i opóźnienie. Po drugie, Gemma 4 12B ma otwarte wagi na licencji Apache 2.0, więc $0.10 i $0.30 to jedna z kilku opcji, a nie jedyny sposób, aby go uruchomić.

Nic z tego nie rozstrzyga, który model pisze lepiej, ponieważ nikt nie zmierzył żadnego z nich na tej osi. Rozstrzyga natomiast, którego z nich możesz postawić przed interesariuszem.

Uruchamianie ich obu razem

Przydatnym posunięciem nie jest wybór jednego z nich. Aion 3.5 Mini i Gemma 4 12B stoją za różnymi interfejsami, ale mają tę samą konwencję wywołań — AionLabs udostępnia endpoint zgodny z OpenAI, a Gemma 4 12B jest obsługiwana przez typowe środowiska uruchomieniowe zgodne z OpenAI. To czyni je wymiennymi na poziomie base-URL, dzięki czemu zbudowanie łańcucha jest tanie: najpierw Aion 3.5 Mini dla promptów, w których to ensemble jest powodem, dla którego go wywołujesz, a za nim Gemma 4 12B do wszystkiego, gdzie chcesz wyważonego modelu, przełączalnego kroku myślenia i cennika o jedną czwartą mniejszego.

Brama, która obsługuje kilkaset modeli pod jednym kluczem, sprawia, że ten łańcuch to linijka konfiguracji, a nie druga integracja, i to właśnie tam reguła przełączania awaryjnego zarabia na siebie — błąd 429 lub awaria dostawcy zostaje pochłonięta, zanim rozpocznie się odpowiedź, zamiast ujawnić się jako nieudane zadanie. Gdy dostawca zmienia swój cennik, router przekazujący rozlicza cenę katalogową dostawcy z niczym dodanym na token, więc zmiana wchodzi w życie tego samego dnia, a nie dopiero w następnym cyklu rozliczeniowym. Jeden szczegół wart sprawdzenia, a nie założenia: ani Aion 3.5 Mini, ani Gemma 4 12B nie są obsługiwane na każdej platformie hostującej modele tej wielkości, a Gemma 4 12B w szczególności nie występuje w niektórych katalogach, które mają jej większe odpowiedniki. Sprawdź, czy identyfikator się rozwiązuje, zanim go podłączysz.

A screenshot of AionLabs' own documentation site, the Introduction / LLM API page, showing that the vendor serves its models through an OpenAI-compatible REST API at https://api.aionlabs.ai/v1 supporting chat completions and model discovery, with API-key authentication and a signed-in browser workspace for testing prompts.

Jak podjąć decyzję

• Jeśli potrzebujesz liczby, zanim podejmiesz decyzję — Gemma 4 12B. To jedyny z tych dwóch z opublikowaną kartą oceny i indeksem strony trzeciej, a ocena powstała przed twoją decyzją, a nie po niej.

• Jeśli potrzebujesz danych wejściowych w postaci obrazu, dźwięku lub wideo — Gemma 4 12B. Aion 3.5 Mini deklaruje wyłącznie tekst na tekst i nic więcej.

• Jeśli potrzebujesz mieć to na własność — Gemma 4 12B. Wagi na licencji Apache 2.0 oznaczają, że możesz ją dostroić, skwantyzować lub hostować samodzielnie; Aion 3.5 Mini to zamknięty system bez wag do pobrania.

• Jeśli narracja i dłuższe formy prozatorskie to cała robota — to jedyny przypadek, w którym porównanie nie rozstrzyga za ciebie. Aion 3.5 Mini został stworzony do tej pracy, a Gemma 4 12B powstała jako model ogólnego przeznaczenia, i żadna opublikowana liczba nie mówi ci, który z nich pisze lepiej. Wypróbuj go na ścieżce, której utratę możesz sobie pozwolić.

• Jeśli koszt przypadający na ukończone zadanie jest decydującym kryterium — Gemma 4 12B, już na podstawie samej arytmetyki, a różnica rośnie tym bardziej, im bardziej zadanie zależy od tokenów wyjściowych.

Oba modele są nowe, oba działają, a tylko jeden z nich prosi, żebyś uwierzył mu na słowo. Możliwa do obrony konkluzja jest taka, że Gemma 4 12B to mierzalny domyślny wybór, a Aion 3.5 Mini to specjalista, którego wdraża się celowo, a nie przez porównanie — a jeśli już go wdrożysz, wdrażaj go obok rozwiązania zapasowego, a nie zamiast niego.

A generated scoreboard comparing Aion 3.5 Mini and Gemma 4 12B across six rows: published scores (none vs vendor card), price in / out ($0.70 / $1.40 vs $0.10 / $0.30), context (262,144 vs 256K), inputs (text only vs text, image, audio, video), weights (closed vs Apache 2.0) and reasoning (mandatory, 3 levels vs switchable off). Footnoted that Aion figures are unaudited and vendor-published and that Gemma figures are vendor-reported with the index per Artificial Analysis.