Een gegenereerde titelkaart voor een vergelijking van Perceptron Mk1.5 en Gemma 4 12B, met als kop 'Perceptron Mk1.5 vs Gemma 4 12B' en als ondertitel 'De ene antwoordt in zinnen. De andere antwoordt in coördinaten.', en drie kaarten met de tekst 'Mk1.5-context: 36.864 tokens', 'Gemma 4 12B-context: 256K' en 'Mk1.5-uitvoer: boxen en tracks', met als voetnoot 'Mk1.5-cijfers door de leverancier gerapporteerd.'
Guides & Insights

Perceptron Mk1.5 vs Gemma 4 12B: de een antwoordt in zinnen, de ander in coördinaten

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Hier is het getal dat je als eerste zou moeten laten stoppen: Perceptron Mk1.5 is een model dat is gebouwd voor video en embodied agents, en het contextvenster is 36.864 tokens. Gemma 4 12B is een 12B open-weights generalist met een venster van 256K. Op de as die de meeste mensen gebruiken om visionmodellen te vergelijken — hoeveel beeldmateriaal kan ik eraan geven — verliest het kleinere, gesloten, speciaal gebouwde model met een factor zeven van het downloadbare model. Die omkering is geen gebrek in een van beide producten. Ze vertelt je waarvoor elk daadwerkelijk is gebouwd, en de twee taken liggen verder uit elkaar dan de gedeelde regel "multimodale input" op hun specificatiebladen suggereert.

Perceptron Mk1.5 is het model voor belichaamd redeneren dat Perceptron op 25 september 2026 uitbracht, de opvolger van Perceptron Mk1 uit mei, dat tekst, afbeeldingen, video en audio opneemt en tekst plus machine-parseerbare geometrie teruggeeft. Gemma 4 12B is het 11,96B encoderloze multimodale open-weightsmodel van Google DeepMind, uitgebracht op 3 juni 2026 onder Apache 2.0, dat tekst, afbeelding, audio en video opneemt en tekst teruggeeft. Beide zijn goedkoop, beide lezen een camerafeed, en slechts één van hen geeft je controller een bounding box zonder een tweede parseerfase. De keuze tussen hen is een keuze over wat er terug moet komen.

Wat elk ervan is gebouwd om terug te geven

Zet de twee naast elkaar en het verschil is niet nauwkeurigheid. Het is het type uitvoer. Vraag Gemma 4 12B waar de heftruck is en je krijgt een zin, en in de meeste toepassingen is die zin het product — een beschrijving, een samenvatting, een antwoord op een vraag over een foto. Vraag Perceptron Mk1.5 en je kunt, naast zijn proza, vragen om een punt, een begrenzingsvak, een polygoon, een clip, of een <track> element dat een ruimtelijke observatie draagt en de tijdstempel waar die bij hoort. Een clip van 60 seconden komt terug als een reeks posities in de tijd in plaats van één gemiddelde schatting van de scène.

Dat is het hele argument waarom Mk1.5 bestaat, en het is de moeite waard om precies te zijn over waarom dat ertoe doet. Een beschrijving van een scène is een afgerond artefact. Een coördinaat is een input voor iets anders — een grijpplanner, een defectcontrole, een audittrail met tijdstempels. Als je downstreamcode proza moet lezen en daaruit de positie moet afleiden, heb je een parser tussen twee modellen gebouwd, en die parser is nu je faaloppervlak. De propositie van Mk1.5 is dat de geometrie getypeerd binnenkomt.

Het tegenargument van Gemma 4 12B is niet dat het dit ook doet. Het is dat je de gewichten kunt hebben. Apache 2.0, 11,96B parameters, gepubliceerd in vooraf getrainde en instructie-afgestemde varianten, draaiend op hardware die je zelf beheert, met een gepubliceerde evaluatiekaart en een index van derden erachter. Dat zijn verschillende soorten bezittingen, en geen van beide vervangt de ander.

Waar die twee daadwerkelijk overeenkomen

Minder plekken dan het label "multimodal 2026" doet vermoeden, maar de gemeenschappelijke basis is reëel en het is de moeite waard om die precies te benoemen, want daar begint de checklist van een koper meestal.

• Invoermodaliteit — beide zijn echt viermodaal. Perceptron Mk1.5 accepteert tekst, afbeeldingen, video en audio (WAV, MP3, FLAC). Gemma 4 12B accepteert tekst, afbeelding, audio en video via één uniform pad zonder encoder.

• Uitvoermodaliteit — geen van beide genereert audio of afbeeldingen. Beide leveren tekst op. Het verschil is dat de tekst van Mk1.5 gestructureerde ruimtelijke annotaties kan bevatten, terwijl dat bij Gemma 4 12B niet het geval is.

• Functieaanroep — beide ondersteunen het. Mk1.5 biedt functieaanroep bij chatvoltooiingen en accepteert beperkte antwoorden via JSON Schema en regex. Gemma 4 12B wordt geleverd met functieaanroep in zijn instructieafgestemde vorm en configureerbare denkmodus.

• Redeneerbesturing — Mk1.5 vervangt de oude vision_config.enable_thinking-booleaanse waarde door een reasoning_effort-veld dat high, medium, low, minimal of none aanneemt, en standaard ingesteld staat op high. Gemma 4 12B biedt varianten met en zonder redenering die verschillend scoren op dezelfde testharness omdat ze verschillende hoeveelheden werk verrichten.

• Context — 36.864 tokens voor Mk1.5 tegenover 256K voor Gemma 4 12B. Dit is de grootste kloof op de lijst en de volgende sectie gaat erover.

• Gewichten en licentie — Mk1.5 is een gesloten gehost model met een SDK, geen download. Gemma 4 12B is Apache 2.0, dus de hostingprijs is één van meerdere opties in plaats van de enige manier om het te draaien.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

Het 36K-venster is een ontwerpkeuze, geen tekortkoming

Een belichaamd model met een contextvenster van 36.864 tokens klinkt als een vergissing, tot je kijkt naar wat Perceptron daarnaast heeft gebouwd. Mk1.5 accepteert een asset_idx-veld, zodat één verzoek naar meerdere afbeeldingen of video's kan verwijzen en elk afzonderlijk kan adresseren. Audio wordt beperkt tot 16.384 tokens per item — volgens de documentatie van Perceptron komt dat neer op ongeveer 21,8 minuten spraak bij circa 750 tokens per minuut. En de reden dat het venster klein kan blijven, is dat de taak smal is: specifieke dingen in frames vinden en volgen, er vragen over beantwoorden, stoppen.

Dat is een andere vorm van werk dan die van Gemma 4 12B. Een 256K-venster is bedoeld om een document, een repository of een lang gesprek te bevatten en over het geheel te redeneren. Het venster van Mk1.5 is een budget voor één perceptietaak met een gestructureerd antwoord, en Perceptron heeft het op die taak afgestemd in plaats van op een ranglijst. Waar het verschil toeslaat, is het moment dat je taak is: "bekijk deze hele inspectievideo van 40 minuten en vertel me alles" — een 36K-venster kan het transcript en de frames en het antwoord niet tegelijk bevatten, en het venster van Gemma 4 12B plus zijn long-context-recallscore is het eerlijke instrument daarvoor.

De tweede helft van die ruil is snelheid. Perceptron meldt tot 4,7× sneller end-to-end op basis van de mediaan van drie runs op één H100, met de kanttekening dat 4,7× de beste van drie metingen is en niet het typische geval: chatantwoorden gingen van 5,2 seconden naar 1,1, beeld-QA ging van 1,7 seconden naar 0,51 (ongeveer 3,3×), en een video van 60 seconden bij achtvoudige gelijktijdigheid ging van 19 seconden naar 9,1 (ongeveer 2,1×). Op de videoworkload die een belichaamde agent daadwerkelijk draait, is de eerlijke factor ongeveer twee.

Een van deze is door iemand anders gemeten.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

Dit is de zuiverste asymmetrie in de matchup en het is niet eens nipt.

Gemma 4 12B heeft een leveranciersevaluatiekaart en een index van derden. De kaart bevat door de leverancier gerapporteerde cijfers — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 zonder tools 77,5, Tau2 gemiddeld over drie runs 69,0 — en één eerlijk zwak punt in MRCR v2 8-needle bij 128k, dat uitkomt op 43,4 en de rij is om te lezen voordat je aanneemt dat een 256K-venster zich aan het uiteinde gedraagt als een venster van die grootte. Daarbovenop staat een onafhankelijke meting: Artificial Analysis plaatst Gemma 4 12B op een Intelligence Index van 14, gerangschikt als 22e van de 142 modellen in zijn klasse, met 113,7 outputtokens per seconde — 20e van de 142 op snelheid — met een lijstprijs van $0,10 input en $0,30 output per miljoen tokens.

Perceptron Mk1.5 heeft niets van dien aard. Er is geen Artificial Analysis-indexvermelding en geen arena-score voor Mk1.5 of voor Mk1, dus elk capaciteitscijfer dat voor dit model bestaat, is geproduceerd door het bedrijf dat het verkoopt. Die set is specifiek, niet vaag, en het is de moeite waard om die te lezen: 0,9433 op egocentrische hand_boxtegen 0,4467 voor Gemini 3.1 Pro en 0,6179 voor de beste Gemini in Perceptrons eigen run; EgoSchema 80,40 tegen 81,20 voor dezelfde concurrent, een verlies van 0,80 punt op de brede begripsbenchmark met een geclaimde voorsprong van 12% op de EgoSchema-hard-subset op 63,75; 0,647 centre-F1 en 0,628 point-HOTA op Molmo2-Track; DailyOmni 74,67 en AVHBench 80,56 aan de audiozijde. Het patroon in die cijfers — beslissend op fijnmazige geometrie, ongeveer gelijk of iets achter op algemeen videobegrip — is coherent en het komt overeen met het productverhaal. Maar de benchmark van een leverancier voor zijn eigen model is een bewering, en de twee modellen in dit artikel worden niet met hetzelfde soort bewijs beschreven.

Eén rij in die tabel verdient een specifieke waarschuwing. De trackingvergelijking van Perceptron vermeldt Qwen3-VL-8B op 0.180 centre-F1, afkomstig uit de paper van dat model, naast gemeten cijfers voor zijn eigen model, en plaatst het naast Qwen3.5-27B op 0.530 en 0.476 over verschillende checkpoints en evaluatieopstellingen. Een cijfer uit een paper in een kolom van gemeten cijfers is geen gelijkwaardige rij, en het is het soort regel dat wordt geciteerd zonder de herkomst. Dezelfde waarschuwing geldt omgekeerd voor de 56.0 Mk1.5-berichten op LiveVQA-W met tools ingeschakeld — dat cijfer komt uit een meerderheidsstemming over vier steekproeven, terwijl de 53.2 waarmee het wordt vergeleken voor Gemini 3.8 Flash met search grounding dat niet is, en meerderheidsstemming over vier steekproeven is een legitieme techniek die een score flatteert ten opzichte van een enkele greedy pass.

Kosten berekenen voor een werkelijke workload

De tariefkaarten liggen dichter bij elkaar dan de producten. Perceptron Mk1.5 kost $0,15 per miljoen inputtokens en $1,50 per miljoen output, met gecachte invoer tegen $0,0375 — precies een kwart van het standaardtarief voor invoer, en per gecachte token goedkoper dan de standaardinvoer van Gemma 4 12B van $0,10. Gemma 4 12B staat vermeld voor $0,10 en $0,30 op de third-party harness die het meet, en het is Apache 2.0, dus zelf hosten haalt de marginale kosten volledig weg als je de hardware hebt.

Twee dingen compliceren een rechtstreekse vergelijking en ze wijzen in tegengestelde richtingen. Ten eerste: bij Mk1.5 staat de reasoning_effort standaard op high, wat betekent dat elke aanroep die je niet configureert het duurste redeneerpad koopt dat het model biedt; terugschakelen naar medium of low is een wijziging van één regel met direct effect op de rekening, en het is het goedkoopste experiment in de release. Ten tweede: met Gemma 4 12B kun je de denkstap helemaal uitschakelen, wat zowel de rekening als de latentie verandert, en bij een vaste taak zoals classificatie op frameniveau is een niet-redenerende pass vaak de juiste.

Doe de rekensom eens voor een realistisch geval: een vision-pipeline die 40.000 frames per dag verwerkt, met ruwweg duizend tokens aan beeldinvoer per frame. Dat is 40 miljoen invoertokens per dag. Tegen het invoertarief van $0,15 van Mk1.5, met gecachte frames waar dezelfde scène terugkomt, zit je voor invoer op slechts enkele dollars per dag — naar elke maatstaf goedkoop. Gemma 4 12B tegen $0,10 invoer is nog goedkoper, en in de marge gratis als je het zelf host. Geen van beide modellen is duur. De beslissing hier is geen budgetbeslissing; het is de vraag of je coördinaten nodig hebt, een 256K-venster, of beide.

Beide aanroepen zonder een tweede integratie

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

De praktische hindernis bij het maken van deze vergelijking is niet de prijs — het is dat Perceptron Mk1.5 en Gemma 4 12B niet in dezelfde catalogus staan. Geen van beide is vandaag via OrcaRouter gerouteerd: de Gemma 4-vermeldingen die wij aanbieden zijn de varianten 31B Instruct en 26B-A4B, en Mk1.5 heeft helemaal geen route, dus het eerlijke advies is om Mk1.5 te bereiken via de eigen API van de leverancier op api.perceptron.inc — pip install "perceptron>=0.4.0", sleutel in PERCEPTRON_API_KEY — en Gemma 4 12B ofwel via een host van derden, ofwel door de Apache-2.0-gewichten zelf te hosten.

Waar een routeringslaag in deze situatie echt voor dient, is de beslissing die je nog niet hebt genomen. Als de gestructureerde output van Mk1.5 is wat je applicatie nodig heeft en het venster van Gemma 4 12B is wat je andere workload nodig heeft, dan zijn dat twee integraties en twee storingsdomeinen; ze achter één OpenAI-compatibel endpoint met automatische failover plaatsen, betekent dat een hapering bij een van beide providers ontaardt in een fallback in plaats van een mislukte taak, en een routeringsregel kan het geometriewerk en het lang-contextwerk naar verschillende modellen sturen zonder dat je applicatie weet welk model welk is. Waar een leverancier zijn tariefkaart wijzigt, factureert een pass-through-router de listprijs van de provider met niets extra per token, zodat de wijziging dezelfde dag ingaat in plaats van bij je volgende factuurcyclus. De routerings-DSL is ook hoe je een vergelijking zou opzetten — een deel van het echte verkeer naar elk model, gemeten op je eigen frames, in plaats van een benchmarkdiscussie.

Welke je eigenlijk wilt

Neem Perceptron Mk1.5 als het antwoord machineleesbaar moet zijn. Als je iets aanstuurt, of iets logt waarbij het om positie en tijd draait, kan geen enkele hoeveelheid extra contextvenster een getypte coördinaat vervangen, en Mk1.5 is het enige model in deze combinatie dat er een oplevert. Ga er met open ogen in en let op drie dingen: het budget van 36.864 tokens, de hoge standaardinstelling voor redeneren, en het feit dat elk capaciteitscijfer dat eraan hangt van de leverancier zelf is.

De goedkoopste manier om het te beslechten is een deel van het echte verkeer naar elk te routeren en op je eigen frames te meten; beide bevinden zich achter één OpenAI-compatibel endpoint op OrcaRouter, waardoor een side-by-side test een configuratieregel is in plaats van een tweede integratie.

Kies Gemma 4 12B als je veel materiaal moet kunnen bevatten, als je de gewichten nodig hebt, of als je de keuze moet verantwoorden tegenover iemand die leveranciersbenchmarks niet op goed vertrouwen aanneemt. Het heeft een onafhankelijke index, een gepubliceerde evaluatiekaart, Apache 2.0-licentie en een venster dat zeven keer groter is — en het zal een scène beschrijven in plaats van die te meten. Die laatste zinsnede is de hele beslissing. Een van deze modellen is een generalist die je kunt bezitten en auditen; de andere is een specialist die je huurt omdat hij geometrie oplevert, en het feit dat de specialist het kleinere venster heeft en geen score van derden, is geen tegenstrijdigheid. Zo ziet een gereedschap dat voor een smal doel is gebouwd er van buitenaf uit.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt