Wygenerowana karta tytułowa dla Microsoft-Decision-1 vs Gemma 2 12B z podtytułem „oceniający bez tokenów wyjściowych kontra piszący bez zamkniętego zbioru”, z chipami: prawdopodobieństwa kontra proza, kontekst 32 768 tokenów kontra 256 000, tylko tekst kontra tekst, obraz i wideo oraz hostowane API kontra otwarte wagi.
Guides & Insights

Microsoft-Decision-1 vs Gemma 4 12B: Jeden wybiera z Twojej listy, drugi pisze Ci nową

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Microsoft-Decision-1 i Gemma 4 12B obok siebie, a różnica, która rozstrzyga o wszystkim, to nie rozmiar, dokładność czy licencja — lecz to, co dzieje się po tym, jak model przeczyta twoje dane wejściowe. Gemma 4 12B, bezenkoderowy model multimodalny DeepMind o 11,96 mld parametrów, wydany 3 czerwca 2026 na licencji Apache 2.0, czyta tekst, obrazy, dźwięk lub wideo, a następnie pisze ci odpowiedź, token po tokenie, w oknie 256 000 tokenów i w ponad 140 językach. Microsoft-Decision-1 został ogólnie udostępniony w Microsoft Foundry 8 października 2026 jako wyłącznie tekstowy model oceniający dotrenowany na Qwen3.5-9B: przekazujesz mu stan i pytanie, którego odpowiedzi już wyliczyłeś, a on zwraca skalibrowane prawdopodobieństwo dla każdej opcji w jednym przebiegu przez maksymalnie 32 768 tokenów, nic nie generując. Jeden model mówi ci, która z twoich opcji jest właściwa. Drugi mówi ci, jakie te opcje powinny były być — i wystawia rachunek za każde słowo z tego.

Ujmowanie tego jako konkursu byłoby błędem kategorii i warto to powiedzieć przed liniami specyfikacji, a nie po nich. Te dwie rzeczy nie są zamiennikami; znajdują się na przeciwnych końcach przepływu pracy. Użyteczne pytanie brzmi: który koniec tak naprawdę budujesz, ponieważ odpowiedź przesądza o tym, czy kupujesz sędziego, czy pisarza.

Rachunek jest tym punktem, w którym różnica przestaje być filozoficzna.

Gemma 4 12B jest rozliczany tak samo jak każdy model generatywny: zarówno tokeny wejściowe, jak i tokeny wyjściowe. Kiedy prosisz go o ustrukturyzowany JSON, każdy znak tego JSON-a jest generowany, próbkowany i opłacany — a im bardziej zagnieżdżony jest twój schemat, tym dłuższa odpowiedź i większa ta pozycja rozliczeniowa. To nie jest wada modelu. To właśnie robi dekoder — i to jest dokładnie ta pozycja rozliczeniowa, której usunięcie jest zadaniem decydentów.

Microsoft-Decision-1 nie ma strony wyjściowej, za którą trzeba płacić. Wykonuje pojedynczy przebieg w przód po twoim stanie, pytaniu i zestawie opcji, odczytuje wynik dla każdego kandydata i zwraca wynik. Konsekwencja kumuluje się wraz z wolumenem, a nie z rozmiarem promptu: potok, który etykietuje dziesięć tysięcy rekordów za pomocą Gemma 4 12B, tworzy dziesięć tysięcy dokumentów JSON, a ten sam potok z użyciem oceniającego decyzyjnego tworzy dziesięć tysięcy promptów i nic więcej. To, czy bezwzględna oszczędność jest duża, zależy wyłącznie od twojego wolumenu i grubości twojego schematu, a każdy, kto ma budżet na token, może to rozstrzygnąć w arkuszu kalkulacyjnym. Kierunek nie podlega dyskusji.

Istnieje druga, mniejsza asymetria: Microsoft nie podaje stawki na stronie modelu Microsoft-Decision-1. Cennik odsyła do własnej witryny cenowej Microsoft, więc koszt na decyzję odczytuje się z Azure, a nie z karty. Strona ustala natomiast, że 0% wywołania to tokeny wyjściowe oraz że wnioskowanie wsadowe jest wyłączone — nie można amortyzować masowego uruchomienia scoringu przez kanał wsadowy tak, jak ma to miejsce w przypadku modelu generatywnego.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

Ten sam wkład, dwie różne odpowiedzi

Podaj obu modelom zgłoszenie do działu obsługi klienta i pytanie. Microsoft-Decision-1 zwraca coś takiego jak 0,83 dla „rozliczeń”, 0,11 dla „spraw technicznych”, 0,04 dla „anulowania”, 0,02 dla „nie można stwierdzić”. Masz etykietę, której można nadać nazwę, liczbę, względem której można ustawić próg, oraz ścieżkę wstrzymania się od odpowiedzi — Microsoft dokumentuje, że opcja w stylu „nie można stwierdzić” jest obsługiwana, gdy dostarczone dowody są niewystarczające, co sprawia, że logika eskalacji działa. Nie dostajesz natomiast powodu.

Przekaż zgłoszenie Gemma 4 12B, a otrzymasz akapit. Potrafi rozumować o żądaniu dzięki konfigurowalnemu myśleniu, wywoływać funkcje, odczytać zeskanowaną fakturę załączoną do zgłoszenia, transkrybować wiadomość głosową przypiętą do niego i odpowiedzieć w języku klienta. Każda z tych czynności to coś, czego Decision-1 nie potrafi zrobić z żadną dokładnością: jego powierzchnia wejściowa to wyłącznie tekst i nic więcej, a ponadto wyraźnie nie został zaprojektowany do udzielania odpowiedzi na otwarte pytania, prowadzenia rozmów, tłumaczenia ani streszczania.

Żadne wyjście modelu Gemma 4 12B nie jest prawdopodobieństwem. Poproś go o decyzję routingową z poziomem ufności, a otrzymasz tekst prozą zawierający liczbę — i ta liczba będzie tym, co wygenerował sampler, a nie softmaxem po dostarczonym przez Ciebie zestawie opcji. Jeśli próg w dalszym przetwarzaniu zależy od tego, że ta liczba coś znaczy, masz na głowie projekt kalibracji, a nie scorer.

To, czy twoje pytanie ma zbiór domknięty, to cała decyzja.

To jest test, który należy przeprowadzić przed czymkolwiek innym, a jego wykonanie zajmuje około dziesięciu minut przy tablicy.

• Jeśli twoja odpowiedź pochodzi z listy, którą możesz z góry wyliczyć — etykieta, ocena, tak/nie, wynik według rubryki, trasa — Microsoft-Decision-1 jest właściwym narzędziem, a Gemma 4 12B to marnotrawny i mniej niezawodny sposób wybierania z tej listy. Płaciłbyś dekoderowi za zgadywanie liczby, której zakres już określiłeś.

• Jeśli twoja odpowiedź nie jest zbiorem zamkniętym — streść to, wyjaśnij tamto, napisz odpowiedź, opisz wykres — Microsoft-Decision-1 nie może pomóc za żadną cenę. Nie ma ścieżki do prozy, pola uzasadnienia ani mechanizmu generowania czegokolwiek, czego nie wyliczyłeś jako opcję.

• Jeśli jest to jedno i drugie, masz potok dwumodelowy, a nie wybór, a ciekawe pytanie projektowe brzmi: który z nich odpowiada za próg eskalacji. Scorer ustawia go; writer uzupełnia, co dzieje się powyżej i poniżej niego.

Tam, gdzie Gemma 4 12B to po prostu inny sport

Poza ramami decyzyjnymi Gemma 4 12B nie jest z przodu w szeregu — gra w inną grę, a udawanie, że jest inaczej, byłoby nieuczciwe.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• Modalności — Microsoft-Decision-1 przyjmuje wyłącznie tekst, a zwraca dane numeryczne. Gemma 4 12B natywnie obsługuje tekst, obraz, dźwięk i wideo dzięki konstrukcji bez enkodera, która rzutuje surowe fragmenty i przebiegi falowe bezpośrednio w przestrzeń embeddingów, z możliwością przeplatania danych wejściowych w dowolnej kolejności.

• Kontekst — 32 768 tokenów dla Microsoft-Decision-1 w porównaniu z 256 000 dla Gemma 4 12B, który uzyskuje 43,4% w MRCR v2 eight-needle przy 128k na własnej karcie Google.

• Język — 25 obsługiwanych języków dla Microsoft-Decision-1, przy czym Microsoft ostrzega, że zakres, jakość i kalibracja „mogą się różnić w zależności od języka”, i wskazuje niżej zasobowe języki inne niż angielski jako słaby punkt; ponad 140 w przypadku Gemma 4 12B, z ocenianym wynikiem MMMLU na poziomie 83,4 dla tego rozmiaru.

• Opublikowana wydajność — zakładka Benchmarks modelu Microsoft-Decision-1 zawiera metodykę, ale nie zawiera żadnych liczb; Google publikuje 77,2% w MMLU Pro, 77,5% w AIME 2026 bez narzędzi, 72,0% w LiveCodeBench v6, 78,8% w GPQA Diamond, 69,1% w MMMU Pro i 79,7% w MATH-Vision dla Gemma 4 12B.

• Dystrybucja — Microsoft-Decision-1 to hostowane API dostępne wyłącznie w Foundry, bez wag, bez możliwości pobrania i bez ścieżki dostrajania. Gemma 4 12B to wagi Apache 2.0, które trafiły do ekosystemu gotowego od pierwszego dnia, obejmującego LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang i Unsl.

• Runtime — ocena decyzji odbywa się w jednym przebiegu, bez pętli dekodowania, więc opóźnienie skaluje się wraz z długością promptu, a nie długością odpowiedzi; Gemma 4 12B generuje token po tokenie, a materiały premierowe Google’a podają 16 GB VRAM lub pamięci zunifikowanej.

Na wiersz z benchmarkami warto się zatrzymać, w kierunku, który najmniej schlebia Microsoftowi. Liczby Gemma 4 12B również pochodzą od dostawcy — ale mają za sobą miesiące użytkowania przez strony trzecie, w publicznych środowiskach testowych, na sprzęcie należącym do innych osób. Wpis Microsoftu w tej kategorii jest najnowszy i najmniej weryfikowalny z tych dwóch, mimo że pochodzi od większej firmy.

Ile kosztuje Cię faktyczne wywołanie każdego z nich

Gemma 4 12B w wersji 12B nie znajduje się w naszym katalogu — jeśli to jest rozmiar, którego szukasz, pobierasz 11,96 miliarda parametrów BF16 i hostujesz go samodzielnie. To, co nasz katalog faktycznie oferuje, to reszta linii Gemma 4, i jest niedroga: Gemma 4 26B A4B za 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion tokenów wyjściowych, a Gemma 4 31B za 0,13 USD i 0,38 USD, oba z kontekstem 262 144 tokenów. To są ceny katalogowe dostawców przekazywane bez doliczania marży po naszej stronie, za jednym kluczem zgodnym z OpenAI, obok ponad 200 innych modeli. Jeśli twój problem okaże się ogólnym rozumowaniem, a nie decyzją ze zbioru zamkniętego, jeden z tych dwóch rozmiarów jest tanią opcją do porównania z własnym, samodzielnie obsługiwanym scorerem — a jeśli wolisz nie wiązać się z jednym modelem piszącym, automatyczne przełączanie awaryjne utrzymuje działanie części generacyjnej pętli oceniania, gdy jeden z dostawców traci wydajność.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 to wdrożenie Foundry, które aprowizujesz samodzielnie, i nie jest ono dostępne za naszym pośrednictwem. Nic w tym artykule nie stanowi twierdzenia o jego dostępności – ani po jednej, ani po drugiej stronie wywołania.

Konkluzja

Microsoft-Decision-1 stał się ogólnie dostępny na Microsoft Foundry 8 października 2026 r.: to tekstowy scorer o 32 768 tokenach na bazie Qwen3.5-9B, który zwraca skalibrowane prawdopodobieństwa dla opcji, które wyliczasz, generując zero tokenów wyjściowych, bez wag i bez publikowanych wyników benchmarków. Gemma 4 12B to multimodalny generalista o 11,96 mld parametrów, bez enkodera, wydany 3 czerwca 2026 r. na licencji Apache 2.0, który rozumuje, czyta obrazy i audio oraz pisze odpowiedzi w oknie do 256 000 tokenów. Wybieraj po kształcie swojej odpowiedzi, a nie po liczbie parametrów: zbiór zamknięty należy do scorera, otwarty – do modelu piszącego, a płacenie dekoderowi za wybór z listy, którą już napisałeś, to najczęstszy sposób, w jaki zespoły wydają dziesięć razy więcej, niż kosztuje decyzja.

W naszej ofercie znajduje się natomiast reszta linii Gemma 4 i jest ona niedroga: Gemma 4 26B A4B w cenie 0,06 USD za milion tokenów wejściowych i 0,33 USD za milion wyjściowych , a Gemma 4 31B za 0,13 i 0,38 USD.