En genererad titelbild för en jämförelse av Perceptron Mk1.5 och Gemma 4 12B, med rubriken ”Perceptron Mk1.5 vs Gemma 4 12B” och underrubriken ”Den ena svarar i meningar. Den andra svarar i koordinater.”, samt tre kort med texten ”Mk1.5-kontext: 36 864 tokens”, ”Gemma 4 12B-kontext: 256K” och ”Mk1.5-utdata: boxar och spår”, med fotnoten ”Mk1.5-siffror rapporterade av leverantören.”
Guides & Insights

Perceptron Mk1.5 vs Gemma 4 12B: Den ena svarar i meningar, den andra svarar i koordinater

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Här är siffran som borde få dig att stanna upp först: Perceptron Mk1.5 är en modell byggd för video och förkroppsligade agenter, och dess kontextfönster är 36 864 tokens. Gemma 4 12B är en 12B-generalist med öppna vikter och ett 256K-fönster. Längs den axel som de flesta använder för att jämföra visionsmodeller — hur mycket videomaterial kan jag ge den — förlorar den mindre, slutna, specialbyggda modellen med en faktor sju mot den nedladdningsbara. Den omkastningen är inte ett fel hos någon av produkterna. Den säger vad var och en faktiskt byggdes för att göra, och de två uppgifterna ligger längre ifrån varandra än den gemensamma raden ”multimodal input” på deras specifikationsblad antyder.

Perceptron Mk1.5 är den förkroppsligade resonemangsmodellen som Perceptron släppte den 25 september 2026, efterföljaren till Perceptron Mk1 från maj, som tar in text, bilder, video och ljud och returnerar text plus maskinläsbar geometri. Gemma 4 12B är Google DeepMinds encoderfria multimodala modell med öppna vikter på 11,96B, släppt den 3 juni 2026 under Apache 2.0, som tar in text, bild, ljud och video och returnerar text. Båda är billiga, båda läser en kameraström, och bara en av dem ger din styrenhet en avgränsningsruta utan ett andra tolkningssteg. Valet mellan dem är ett val om vad som måste komma tillbaka.

Vad var och en är byggd för att returnera

Ställ de två sida vid sida och skillnaden är inte noggrannhet. Det är utdatatypen. Fråga Gemma 4 12B var gaffeltrucken är och du får en mening, och i de flesta applikationer är den meningen produkten – en beskrivning, en sammanfattning, ett svar på en fråga om ett foto. Fråga Perceptron Mk1.5 och, vid sidan av dess prosa, kan du be om en punkt, en avgränsningsbox, en polygon, ett klipp eller ett <track>-element som bär en rumslig observation och tidsstämpeln som den hör till. Ett 60-sekundersklipp kommer tillbaka som en sekvens av positioner över tid i stället för en enda genomsnittlig gissning om scenen.

Det är hela argumentet för att Mk1.5 finns, och det är värt att vara precis om varför det spelar roll. En beskrivning av en scen är en färdig artefakt. En koordinat är indata till något annat – en grepplanerare, en defektkontroll, ett tidsstämplat revisionsspår. Om din nedströmskod måste läsa prosa och härleda position från den har du byggt en parser mellan två modeller, och den parsern är nu din felyta. Mk1.5:s pitch är att geometrin kommer typad.

Gemma 4 12B:s motargument är inte att den också gör detta. Det är att du kan få vikterna. Apache 2.0, 11,96B parametrar, publicerad i förtränade och instruktionsjusterade varianter, som körs på hårdvara du kontrollerar, med ett publicerat utvärderingskort och ett tredjepartsindex bakom sig. Det är olika typer av tillgångar, och ingen av dem ersätter den andra.

Där de två faktiskt stämmer överens

Färre platser än vad etiketten "multimodal 2026" antyder, men den gemensamma grunden är verklig och värd att formulera exakt, eftersom det är där en köpares checklista vanligtvis börjar.

• Indatamodalitet – båda är genuint fyrmodala. Perceptron Mk1.5 tar emot text, bilder, video och ljud (WAV, MP3, FLAC). Gemma 4 12B tar emot text, bild, ljud och video via en enda encoderfri enhetlig väg.

• Utdatamodalitet — ingen av dem genererar ljud eller bilder. Båda matar ut text. Skillnaden är att Mk1.5:s text kan bära strukturerade rumsliga annoteringar och Gemma 4 12B:s gör det inte.

• Funktionsanrop – båda stöder det. Mk1.5 exponerar funktionsanrop i chattkompletteringar och accepterar begränsade svar via JSON Schema och regex. Gemma 4 12B levereras med funktionsanrop i sin instruktionstränade form och konfigurerbart tankeläge.

• Resonemangskontroll — Mk1.5 ersätter den gamla vision_config.enable_thinking booleska variabeln med ett reasoning_effort fält som tar värdena high, medium, low, minimal eller none, och standardvärdet är high. Gemma 4 12B exponerar varianter med tänkande och utan resonemang som får olika resultat i samma testram eftersom de utför olika mycket arbete.

• Kontext — 36 864 tokens för Mk1.5 mot 256K för Gemma 4 12B. Detta är den största klyftan på listan och nästa avsnitt handlar om det.

• Vikter och licens — Mk1.5 är en sluten hostad modell med ett SDK, inte en nedladdning. Gemma 4 12B är Apache 2.0, så det hostade priset är ett alternativ bland flera snarare än det enda sättet att köra den.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

36K-fönstret är ett designbeslut, inte en brist

En förkroppsligad modell med ett fönster på 36 864 tokens låter som ett misstag tills man tittar på vad Perceptron byggde vid sidan av den. Mk1.5 accepterar ett asset_idx-fält, så en begäran kan referera till flera bilder eller videor och adressera var och en separat. Den begränsar ljud till 16 384 tokens per objekt – Perceptrons dokumentation uppskattar det till ungefär 21,8 minuters tal vid cirka 750 tokens per minut. Och anledningen till att fönstret kan förbli litet är att uppgiften är snäv: hitta och spåra specifika saker i bildrutor, svara på frågor om dem, stanna.

Det är en annan sorts arbete än Gemma 4 12B:s. Ett fönster på 256K är till för att hålla ett dokument, ett kodförråd eller en lång konversation och resonera över allt i det. Mk1.5:s fönster är en budget för ett enda perceptionsjobb med ett strukturerat svar, och Perceptron har dimensionerat det efter det jobbet snarare än efter en resultattavla. Där skillnaden biter är i det ögonblick då din uppgift är "titta på hela den här 40 minuter långa inspektionsvideon och berätta allt" – ett fönster på 36K rymmer inte transkriptet och bildrutorna och svaret på en gång, och Gemma 4 12B:s fönster plus dess poäng för återkallelse över lång kontext är det ärliga instrumentet för det.

Den andra halvan av den avvägningen är hastighet. Perceptron rapporterar upp till 4,7× snabbare end-to-end från ett medianvärde av tre körningar på en enda H100, med förbehållet att 4,7× är den bästa av tre mätningar och inte det typiska fallet: chattsvar gick från 5,2 sekunder till 1,1, bild-QA gick från 1,7 sekunder till 0,51 (cirka 3,3×), och en 60-sekundersvideo vid åttafaldig samtidighet gick från 19 sekunder till 9,1 (cirka 2,1×). På den videoarbetsbelastning som en förkroppsligad agent faktiskt kör är den ärliga multipeln ungefär två.

En av dessa har mätts av någon annan.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

Det här är den tydligaste asymmetrin i matchningen, och det är inte ens nära.

Gemma 4 12B har ett utvärderingskort från leverantören och ett tredjepartsindex. Kortet innehåller leverantörsrapporterade siffror – MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 utan verktyg 77,5, Tau2 i genomsnitt över tre körningar 69,0 – och en ärlig svag punkt i MRCR v2 8-needle vid 128k, som hamnar på 43,4 och är raden att läsa innan man antar att ett fönster på 256K beter sig som ett vid den bortre änden. Ovanpå det finns en oberoende mätning: Artificial Analysis placerar Gemma 4 12B på ett Intelligence Index på 14, rankad 22:a av 142 modeller i sin klass, vid 113,7 utdatatoken per sekund – 20:e av 142 i hastighet – med ett listpris på 0,10 USD för indata och 0,30 USD för utdata per miljon tokens.

Perceptron Mk1.5 har inget sådant. Det finns ingen post i Artificial Analysis-index och ingen arenapoäng för Mk1.5 eller för Mk1, så varje förmågesiffra som finns för den här modellen har tagits fram av företaget som säljer den. Den uppsättningen är specifik snarare än vag, och den är värd att läsa: 0,9433 på egocentrisk hand_box mot 0,4467 för Gemini 3.1 Pro och 0,6179 för den bästa Gemini i Perceptrons egen körning; EgoSchema 80,40 mot 81,20 för samma konkurrent, en förlust på 0,80 punkter på det breda förståelsebenchmarket med ett påstått försprång på 12 % på EgoSchema-hard-delmängden vid 63,75; 0,647 centre-F1 och 0,628 point-HOTA på Molmo2-Track; DailyOmni 74,67 och AVHBench 80,56 på ljudsidan. Mönstret i dessa siffror – avgörande på finkornig geometri, ungefär jämnt eller något efter på allmän videoförståelse – är sammanhängande och det matchar produktberättelsen. Men en leverantörs benchmark av sin egen modell är ett påstående, och de två modellerna i den här artikeln beskrivs inte med samma typ av bevis.

En rad i den tabellen förtjänar en särskild varning. Perceptrons spårningsjämförelse listar Qwen3-VL-8B på 0,180 centre-F1, hämtat från den modellens artikel, bredvid uppmätta siffror för den egna modellen, och parar ihop det med Qwen3.5-27B på 0,530 och 0,476 över olika checkpoints och utvärderingsupplägg. En artikelsiffra i en kolumn av uppmätta sådana är inte en jämförbar rad, och det är den typ av rad som citeras utan sitt ursprung. Samma varning gäller omvänt för Mk1.5:s 56,0 på LiveVQA-W med verktyg aktiverade — den siffran kommer från en majoritetsröstning över fyra sampel, medan 53,2 som den jämförs mot för Gemini 3.8 Flash med sökgrundning inte gör det, och majoritetsröstning över fyra sampel är en legitim teknik som smickrar en poäng i förhållande till en enda girig körning.

Kostnadsberäkning av en faktisk arbetsbelastning

Prislistorna ligger närmare varandra än produkterna gör. Perceptron Mk1.5 kostar 0,15 USD per miljon indatatoken och 1,50 USD per miljon utdatatoken, med cachad indata till 0,0375 USD – exakt en fjärdedel av standardpriset för indata, och billigare per cachad token än Gemma 4 12B:s standardpris för indata på 0,10 USD. Gemma 4 12B listas till 0,10 och 0,30 USD i det tredjeparts-testramverk som mäter den, och den är Apache 2.0, så egen hosting tar bort marginalkostnaden helt om du har hårdvaran.

Två saker komplicerar en rak jämförelse och de pekar i motsatta riktningar. För det första har Mk1.5:s reasoning_effort har standardvärdet high, vilket innebär att varje anrop du inte konfigurerar köper den dyraste resonemangsvägen modellen erbjuder; att sänka till medium eller low är en enradsändring med direkt effekt på räkningen, och det är det billigaste experimentet i utgåvan. För det andra låter Gemma 4 12B dig stänga av tankesteget helt, vilket förändrar både räkningen och latensen, och på en fast uppgift som klassificering på frame-nivå är en icke-resonerande körning ofta den korrekta.

Räkna på något verkligt: en visionspipeline som bearbetar 40 000 bildrutor om dagen med ungefär tusen tokens bildindata vardera. Det är 40M indatatokens per dag. Med Mk1.5:s indatapris på $0.15, med cachade bildrutor där samma scen återkommer, ligger du på låga ensiffriga dollar per dag för indata – billigt oavsett måttstock. Gemma 4 12B med ett indatapris på $0.10 är ännu billigare, och gratis i marginalen om du kör den själv. Ingen av modellerna är dyr. Beslutet här är inte ett budgetbeslut; det är en fråga om du behöver koordinater, ett 256K-fönster eller båda.

Att anropa båda två utan en andra integration

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Det praktiska hindret för att göra den här jämförelsen är inte priset – det är att Perceptron Mk1.5 och Gemma 4 12B inte finns i samma katalog. Ingen av dem dirigeras via OrcaRouter i dag: de Gemma 4-poster vi serverar är varianterna 31B Instruct och 26B-A4B, och Mk1.5 har ingen rutt alls, så den ärliga rekommendationen är att nå Mk1.5 via leverantörens eget API på api.perceptron.inc – pip install "perceptron>=0.4.0", nyckel i PERCEPTRON_API_KEY – och Gemma 4 12B antingen via en tredjepartsvärd eller genom att själv servera Apache-2.0-vikterna.

Vad ett routningslager verkligen är till för i den här situationen är det beslut du ännu inte har fattat. Om Mk1.5:s strukturerade utdata är vad din applikation behöver och Gemma 4 12B:s fönster är vad din andra arbetsbelastning behöver, är det två integrationer och två feldomäner; att placera dem bakom en OpenAI-kompatibel slutpunkt med automatisk failover innebär att en leverantörsstörning på endera sidan degraderas till en reservlösning i stället för ett misslyckat jobb, och en routningsregel kan skicka geometriarbetet och arbetet med lång kontext till olika modeller utan att din applikation vet vilken som är vilken. När en leverantör ändrar sin prislista fakturerar en pass-through-router leverantörens listpris med inget påslag per token, så ändringen slår igenom samma dag i stället för vid din nästa faktureringscykel. Routnings-DSL:en är också hur du skulle sätta upp en jämförelse – en andel av den verkliga trafiken till varje modell, mätt på dina egna frames, i stället för ett benchmarkargument.

Vilken av dem du faktiskt vill ha

Ta Perceptron Mk1.5 om svaret måste vara maskinläsbart. Om du styr något, eller loggar något där position och tid är själva poängen, ersätter ingen mängd extra kontextfönster en angiven koordinat, och Mk1.5 är den enda modellen i det här paret som producerar en. Gå in med öppna ögon inför tre saker: tokenbudgeten på 36 864, den höga standardinställningen för resonemang, och det faktum att varje kapacitetssiffra som hör till den är leverantörens egen.

Det billigaste sättet att avgöra det är att dirigera en andel av den verkliga trafiken till var och en och mäta på dina egna ramar; båda ligger bakom en OpenAI-kompatibel endpoint på OrcaRouter, vilket är det som gör ett sida-vid-sida-test till en konfigurationsrad i stället för en andra integration.

Ta Gemma 4 12B om du behöver rymma mycket material, om du behöver vikterna, eller om du behöver motivera valet för någon som inte tar leverantörsbenchmark på tro. Den har ett oberoende index, ett publicerat utvärderingskort, Apache 2.0-licens och ett fönster som är sju gånger större — och den kommer att beskriva en scen snarare än att mäta den. Den sista satsen är hela beslutet. En av dessa modeller är en generalist som du kan äga och granska; den andra är en specialist som du hyr eftersom den returnerar geometri, och det faktum att specialisten har det mindre fönstret och ingen tredjepartspoäng är inte en motsägelse. Det är vad ett smalt byggt verktyg ser ut som utifrån.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen