Wygenerowana karta tytułowa do porównania Perceptron Mk1.5 i Gemma 4 12B, z nagłówkiem „Perceptron Mk1.5 vs Gemma 4 12B”, podtytułem „Jeden odpowiada zdaniami. Drugi odpowiada współrzędnymi.” oraz trzema kartami o treści „kontekst Mk1.5: 36 864 tokeny”, „kontekst Gemma 4 12B: 256K” i „dane wyjściowe Mk1.5: ramki i ścieżki”, z przypisem „Dane liczbowe dla Mk1.5 podane przez producenta.”
Guides & Insights

Perceptron Mk1.5 vs Gemma 4 12B: jeden odpowiada zdaniami, drugi współrzędnymi

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Oto liczba, która powinna cię zatrzymać w pierwszej kolejności: Perceptron Mk1.5 to model stworzony do wideo i agentów ucieleśnionych, a jego okno kontekstowe wynosi 36 864 tokeny. Gemma 4 12B to generalista o otwartych wagach i rozmiarze 12B z oknem 256K. Na osi, której większość ludzi używa do porównywania modeli wizyjnych — ile materiału wideo mogę mu przekazać — mniejszy, zamknięty model specjalnego przeznaczenia wypada siedmiokrotnie gorzej niż ten, który można pobrać. To odwrócenie nie jest wadą żadnego z tych produktów. Mówi, do czego każdy z nich został faktycznie stworzony, a te dwa zadania są od siebie dalej, niż sugeruje wspólny wiersz „multimodal input” na ich kartach specyfikacji.

Perceptron Mk1.5 to model rozumowania ucieleśnionego, który Perceptron wypuścił 25 września 2026 r., następca Perceptron Mk1 z maja; przyjmuje tekst, obrazy, wideo i dźwięk, a zwraca tekst oraz geometrię możliwą do parsowania maszynowego. Gemma 4 12B to pozbawiony enkodera multimodalny model Google DeepMind z otwartymi wagami o 11,96 mld parametrów, udostępniony 3 czerwca 2026 r. na licencji Apache 2.0, który przyjmuje tekst, obraz, dźwięk i wideo, a zwraca tekst. Oba są tanie, oba odczytują strumień z kamery, a tylko jeden z nich przekaże twojemu kontrolerowi ramkę ograniczającą bez drugiego etapu parsowania. Wybór między nimi to wybór tego, co musi zostać zwrócone.

Co każde z nich ma zwracać

Postaw je obok siebie, a różnica nie polega na dokładności. Polega na typie danych wyjściowych. Zapytaj Gemma 4 12B, gdzie jest wózek widłowy, a otrzymasz zdanie, a w większości zastosowań produktem jest właśnie to zdanie — opis, podsumowanie, odpowiedź na pytanie dotyczące zdjęcia. Zapytaj Perceptron Mk1.5, a obok jego prozy możesz poprosić o punkt, ramkę ograniczającą, wielokąt, klip lub o <track>, czyli element, który zawiera obserwację przestrzenną i znacznik czasu, do którego należy. 60-sekundowy klip jest zwracany jako sekwencja pozycji w czasie, a nie jedno uśrednione zgadywanie dotyczące sceny.

To jest cały argument za istnieniem Mk1.5 i warto być precyzyjnym co do tego, dlaczego to ma znaczenie. Opis sceny jest gotowym artefaktem. Współrzędna jest danymi wejściowymi do czegoś innego — planisty chwytania, kontroli defektów, ścieżki audytu ze znacznikami czasu. Jeśli twój dalszy kod musi czytać prozę i wywnioskować z niej pozycję, zbudowałeś parser między dwoma modelami, a ten parser jest teraz twoją powierzchnią awarii. Haczyk Mk1.5 polega na tym, że geometria przychodzi w postaci typowanej.

Kontrargument Gemma 4 12B nie polega na tym, że ona też to robi. Polega on na tym, że możesz mieć wagi. Apache 2.0, 11,96 mld parametrów, wydana w wariantach wstępnie wytrenowanych i dostrojonych do instrukcji, działająca na sprzęcie, który kontrolujesz, z opublikowaną kartą ewaluacyjną i stojącym za nią indeksem strony trzeciej. To różne rodzaje zasobów i żaden z nich nie zastępuje drugiego.

Gdzie te dwa faktycznie się pokrywają

Mniej miejsc, niż sugeruje etykieta „multimodal 2026”, ale wspólna podstawa jest realna i warto ją precyzyjnie wskazać, właśnie dlatego, że zwykle od niej zaczyna się lista kontrolna kupującego.

• Modalność wejściowa — oba są autentycznie czteromodalne. Perceptron Mk1.5 obsługuje tekst, obrazy, wideo i dźwięk (WAV, MP3, FLAC). Gemma 4 12B obsługuje tekst, obraz, dźwięk i wideo przez jedną ujednoliconą ścieżkę bez enkodera.

• Modalność wyjściowa — żaden z nich nie generuje dźwięku ani obrazów. Oba zwracają tekst. Różnica polega na tym, że tekst Mk1.5 może przenosić ustrukturyzowane adnotacje przestrzenne, a Gemma 4 12B nie.

• Wywoływanie funkcji — oba to obsługują. Mk1.5 udostępnia wywoływanie funkcji w uzupełnieniach czatu i akceptuje ograniczone odpowiedzi przez JSON Schema oraz wyrażenia regularne. Gemma 4 12B oferuje wywoływanie funkcji w wersji dostrojonej do instrukcji i konfigurowalny tryb myślenia.

• Kontrola rozumowania — Mk1.5 zastępuje starą flagę logiczną vision_config.enable_thinking polem reasoning_effort przyjmującym wartości high, medium, low, minimal lub none i domyślnie ustawionym na high. Gemma 4 12B udostępnia warianty z myśleniem i bez rozumowania, które osiągają różne wyniki w tym samym zestawie testowym, ponieważ wykonują różną ilość pracy.

• Kontekst — 36 864 tokeny dla Mk1.5 w porównaniu z 256K dla Gemma 4 12B. To największa różnica na liście, a następna sekcja jest jej poświęcona.

• Wagi i licencja — Mk1.5 to zamknięty model hostowany z SDK, a nie do pobrania. Gemma 4 12B jest objęta licencją Apache 2.0, więc cena wersji hostowanej to jedna z kilku opcji, a nie jedyny sposób, aby ją uruchomić.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

Okno 36K to decyzja projektowa, a nie niedobór.

Ucieleśniony model z oknem 36 864 tokenów brzmi jak błąd, dopóki nie spojrzysz na to, co Perceptron zbudował obok niego. Mk1.5 przyjmuje asset_idx jako pole, więc jedno żądanie może odwoływać się do kilku obrazów lub filmów i adresować każdy osobno. Ogranicza audio do 16 384 tokenów na element — dokumentacja Perceptronu podaje, że to około 21,8 minuty mowy przy około 750 tokenach na minutę. A powód, dla którego okno może pozostać małe, jest taki, że zadanie jest wąskie: znajdź i śledź konkretne rzeczy w klatkach, odpowiadaj na ich temat, zatrzymaj się.

To inny kształt pracy niż w przypadku Gemma 4 12B. Okno 256K służy do utrzymywania dokumentu, repozytorium lub długiej rozmowy i wnioskowania na podstawie ich całości. Okno Mk1.5 to budżet na jedno zadanie percepcyjne z ustrukturyzowaną odpowiedzią, a Perceptron dopasował je do tego zadania, a nie do rankingu liderów. Różnica daje o sobie znać w momencie, gdy twoim zadaniem jest „obejrzyj cały ten 40-minutowy film z inspekcji i powiedz mi wszystko” — okno 36K nie pomieści naraz transkrypcji, klatek i odpowiedzi, a okno Gemma 4 12B wraz z jego wynikiem przywoływania długiego kontekstu jest uczciwym narzędziem do tego.

Drugą połową tego kompromisu jest szybkość. Perceptron donosi o nawet 4,7× szybszym działaniu end-to-end na podstawie mediany z trzech przebiegów na pojedynczym H100, z zastrzeżeniem, że 4,7× to najlepszy z trzech pomiarów, a nie typowy przypadek: odpowiedzi czatu skróciły się z 5,2 sekundy do 1,1, QA obrazów skróciło się z 1,7 sekundy do 0,51 (około 3,3×), a 60-sekundowy film przy ośmiokrotnej współbieżności skrócił się z 19 sekund do 9,1 (około 2,1×). W przypadku obciążenia wideo, które faktycznie wykonuje agent ucieleśniony, uczciwy mnożnik wynosi około dwa.

Jedno z tych zostało zmierzone przez kogoś innego.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

To najczystsza asymetria w tym pojedynku i nie jest nawet blisko.

Gemma 4 12B ma kartę oceny dostawcy i indeks strony trzeciej. Karta zawiera dane raportowane przez dostawcę — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 bez narzędzi 77,5, Tau2 uśredniony z trzech przebiegów 69,0 — oraz jedną szczerą słabość w MRCR v2 8-needle przy 128k, która wynosi 43,4 i jest wierszem, który należy przeczytać, zanim założy się, że okno 256K zachowuje się jak okno na dalekim końcu. Ponadto dochodzi niezależny pomiar: Artificial Analysis umieszcza Gemma 4 12B na Indeksie Inteligencji wynoszącym 14, na 22. miejscu spośród 142 modeli w swojej klasie, przy 113,7 tokena wyjściowego na sekundę — 20. na 142 pod względem szybkości — z ceną katalogową 0,10 USD za wejście i 0,30 USD za wyjście za milion tokenów.

Perceptron Mk1.5 nie ma niczego takiego. Nie istnieje żaden wpis w indeksie Artificial Analysis ani żaden wynik Arena dla Mk1.5 czy Mk1, więc każda liczba dotycząca możliwości tego modelu została wygenerowana przez firmę, która go sprzedaje. Ten zestaw jest konkretny, a nie mglisty, i warto go przeczytać: 0,9433 w egocentrycznym hand_box wobec 0,4467 dla Gemini 3.1 Pro i 0,6179 dla najlepszego Gemini w teście przeprowadzonym przez sam Perceptron; EgoSchema 80,40 wobec 81,20 u tego samego konkurenta, strata 0,80 punktu w szerokim benchmarku rozumienia przy deklarowanej 12-procentowej przewadze na podzbiorze EgoSchema-hard na poziomie 63,75; 0,647 centre-F1 i 0,628 point-HOTA na Molmo2-Track; DailyOmni 74,67 i AVHBench 80,56 po stronie audio. Wzorzec widoczny w tych liczbach — rozstrzygający w przypadku drobnoziarnistej geometrii, mniej więcej równy lub nieco słabszy w ogólnym rozumieniu wideo — jest spójny i pasuje do historii produktu. Ale benchmark dostawcy na własnym modelu to tylko twierdzenie, a dwa modele opisane w tym artykule nie są przedstawiane na podstawie tego samego rodzaju dowodów.

Jeden wiersz w tej tabeli zasługuje na konkretne ostrzeżenie. Porównanie trackingu Perceptrona wymienia Qwen3-VL-8B z wynikiem 0,180 centre-F1, pochodzącym z pracy tego modelu, obok zmierzonych wyników dla własnego modelu, i zestawia go z Qwen3.5-27B na poziomie 0,530 oraz 0,476 w różnych checkpointach i konfiguracjach ewaluacji. Wynik z publikacji w kolumnie wyników zmierzonych nie jest wierszem porównywalnym jeden do jednego i jest to właśnie ten rodzaj wiersza, który bywa cytowany bez podania źródła pochodzenia. Ta sama ostrożność obowiązuje w drugą stronę w przypadku wpisów 56,0 Mk1.5 na LiveVQA-W z włączonymi narzędziami — ten wynik pochodzi z głosowania większościowego na czterech próbkach, podczas gdy w przypadku 53,2, z którym się go porównuje dla Gemini 3.8 Flash z ugruntowaniem wyszukiwania, tak nie jest, a głosowanie większościowe na czterech próbkach to uzasadniona technika, która stawia wynik w korzystniejszym świetle względem pojedynczego przebiegu zachłannego.

Kalkulacja kosztów rzeczywistego obciążenia

Cenniki są do siebie bliższe niż same produkty. Perceptron Mk1.5 kosztuje $0.15 za milion tokenów wejściowych i $1.50 za milion tokenów wyjściowych, a buforowane wejście kosztuje $0.0375 — dokładnie jedną czwartą standardowej stawki za wejście i taniej w przeliczeniu na buforowany token niż standardowe wejście Gemma 4 12B za $0.10. Gemma 4 12B jest wyceniana na $0.10 i $0.30 w zewnętrznym narzędziu testowym, które ją mierzy, i jest objęta licencją Apache 2.0, więc własny hosting całkowicie eliminuje koszt krańcowy, jeśli masz odpowiedni sprzęt.

Dwie rzeczy komplikują bezpośrednie porównanie i wskazują w przeciwnych kierunkach. Po pierwsze, w Mk1.5 reasoning_effort domyślnie przyjmuje wartość high, co oznacza, że każde wywołanie, którego nie skonfigurujesz, kupuje najdroższą ścieżkę rozumowania, jaką oferuje model; zejście do poziomu medium lub low to zmiana w jednej linii, która bezpośrednio wpływa na rachunek, i to najtańszy eksperyment w tym wydaniu. Po drugie, Gemma 4 12B pozwala całkowicie wyłączyć krok myślenia, co zmienia zarówno rachunek, jak i opóźnienie, a w ustalonym zadaniu, takim jak klasyfikacja na poziomie klatek, przebieg bez rozumowania jest często właściwym wyborem.

Przeprowadź obliczenia na czymś realnym: potok wizyjny przetwarzający 40 000 klatek dziennie przy około tysiącu tokenów danych wejściowych obrazu na każdą. To daje 40 mln tokenów wejściowych dziennie. Przy stawce Mk1.5 wynoszącej 0,15 USD za dane wejściowe, z buforowanymi klatkami, gdy ta sama scena się powtarza, schodzisz do kilku dolarów dziennie za dane wejściowe — tanio według każdych standardów. Gemma 4 12B przy 0,10 USD za dane wejściowe jest jeszcze tańsza, a na marginesie darmowa, jeśli hostujesz ją samodzielnie. Żaden z tych modeli nie jest drogi. Decyzja tutaj nie jest decyzją budżetową; to kwestia tego, czy potrzebujesz współrzędnych, okna 256K, czy jednego i drugiego.

Wywoływanie obu z nich bez drugiej integracji

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Praktyczną przeszkodą w przeprowadzeniu tego porównania nie jest cena — jest nią to, że Perceptron Mk1.5 i Gemma 4 12B nie znajdują się w tym samym katalogu. Żaden z nich nie jest dziś obsługiwany w routingu OrcaRouter: wpisy Gemma 4, które udostępniamy, to warianty 31B Instruct i 26B-A4B, a Mk1.5 nie ma żadnej trasy, więc uczciwa wskazówka jest taka, aby sięgnąć po Mk1.5 przez własne API dostawcy pod api.perceptron.inc — pip install "perceptron>=0.4.0", klucz w PERCEPTRON_API_KEY — a po Gemma 4 12B albo przez hosta zewnętrznego, albo poprzez samodzielne serwowanie wag na licencji Apache-2.0.

Do czego w tej sytuacji naprawdę służy warstwa routingu, to decyzja, której jeszcze nie podjąłeś. Jeśli ustrukturyzowane wyjście Mk1.5 jest tym, czego potrzebuje Twoja aplikacja, a okno Gemma 4 12B tym, czego potrzebuje Twoje inne obciążenie, to dwie integracje i dwie domeny awarii; umieszczenie ich za jednym punktem końcowym zgodnym z OpenAI z automatycznym przełączaniem awaryjnym oznacza, że chwilowy problem dostawcy po którejkolwiek ze stron przechodzi w tryb zapasowy, a nie w nieudane zadanie, a reguła routingu może kierować pracę nad geometrią i pracę z długim kontekstem do różnych modeli, a Twoja aplikacja nie musi wiedzieć, który jest który. Gdy dostawca zmienia swój cennik, router typu pass-through rozlicza cenę katalogową dostawcy z zerową dopłatą za token, więc zmiana obowiązuje tego samego dnia, a nie dopiero w następnym cyklu rozliczeniowym. DSL routingu pozwala też zaaranżować porównanie — przydzielić każdemu modelowi część rzeczywistego ruchu, mierzonego na własnych ramkach, zamiast opierać się na argumencie z benchmarku.

Którego właściwie chcesz

Wybierz Perceptron Mk1.5, jeśli odpowiedź ma być czytelna maszynowo. Jeśli czymś sterujesz albo rejestrujesz coś, gdzie liczą się pozycja i czas, żadna dodatkowa ilość okna kontekstowego nie zastąpi wpisanej współrzędnej, a Mk1.5 to jedyny model w tej parze, który ją generuje. Zaczynaj z otwartymi oczami, jeśli chodzi o trzy sprawy: budżet 36 864 tokenów, wysokiego domyślnego poziomu rozumowania oraz fakt, że każda liczba dotycząca możliwości, jaka jest do niego przypisana, pochodzi od samego dostawcy.

Najtańszym sposobem, by to rozstrzygnąć, jest skierowanie części rzeczywistego ruchu do każdego z nich i zmierzenie na własnych ramkach; oba są dostępne zajednym punktem końcowym zgodnym z OpenAI w OrcaRouter, co sprawia, że test obok siebie to jedna linia konfiguracji, a nie druga integracja.

Weź Gemma 4 12B, jeśli potrzebujesz pomieścić dużo materiału, jeśli potrzebujesz wag albo jeśli musisz uzasadnić ten wybór komuś, kto nie przyjmuje benchmarków producenta na wiarę. Ma niezależny indeks, opublikowaną kartę oceny, licencję Apache 2.0 i siedmiokrotnie większe okno — a scenę opisze, zamiast ją mierzyć. To ostatnie zdanie rozstrzyga o całej decyzji. Jeden z tych modeli to generalista, którego możesz mieć na własność i audytować; drugi to specjalista, którego wynajmujesz, bo zwraca geometrię, a fakt, że specjalista ma mniejsze okno i brak oceny od podmiotów trzecich, nie jest sprzecznością. Tak właśnie wygląda z zewnątrz narzędzie zbudowane do wąskiego celu.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie