Eine generierte Titelkarte für einen Vergleich von Perceptron Mk1.5 und Gemma 4 12B, mit der Überschrift „Perceptron Mk1.5 vs Gemma 4 12B“, dem Untertitel „Der eine antwortet in Sätzen. Der andere antwortet in Koordinaten.“ und drei Karten mit der Aufschrift „Mk1.5 Kontext: 36.864 Token“, „Gemma 4 12B Kontext: 256K“ und „Mk1.5 Ausgabe: Boxen und Tracks“, mit der Fußnote „Mk1.5-Angaben vom Anbieter.“
Guides & Insights

Perceptron Mk1.5 vs. Gemma 4 12B: Der eine antwortet in Sätzen, der andere in Koordinaten

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist die Zahl, bei der Sie zuerst innehalten sollten: Perceptron Mk1.5 ist ein Modell, das für Video und verkörperte Agenten gebaut wurde, und sein Kontextfenster umfasst 36.864 Token. Gemma 4 12B ist ein 12B-Open-Weights-Generalist mit einem 256K-Fenster. Auf der Achse, die die meisten Leute zum Vergleich von Vision-Modellen heranziehen – wie viel Filmmaterial kann ich ihm übergeben –, verliert das kleinere, geschlossene, zweckgebundene Modell um den Faktor sieben gegenüber dem herunterladbaren. Diese Umkehrung ist kein Mangel eines der beiden Produkte. Sie sagt Ihnen, wofür jedes tatsächlich gebaut wurde, und die beiden Aufgaben liegen weiter auseinander, als die gemeinsame Zeile „multimodaler Input“ auf ihren Datenblättern vermuten lässt.

Perceptron Mk1.5 ist das Embodied-Reasoning-Modell, das Perceptron am 25. September 2026 veröffentlichte, der Nachfolger von Perceptron Mk1 vom Mai; es nimmt Text, Bilder, Video und Audio entgegen und gibt Text plus maschinenlesbare Geometrie aus. Gemma 4 12B ist Google DeepMinds encoder-freies multimodales Open-Weights-Modell mit 11,96B Parametern, veröffentlicht am 3. Juni 2026 unter Apache 2.0, das Text, Bild, Audio und Video entgegennimmt und Text zurückgibt. Beide sind günstig, beide lesen einen Kamera-Feed, und nur eines von ihnen wird Ihrem Controller eine Bounding Box aushändigen, ohne dass eine zweite Parsing-Stufe nötig ist. Die Wahl zwischen ihnen ist eine Entscheidung darüber, was zurückkommen muss.

Was jedes einzelne zurückgeben soll

Stellen Sie die beiden nebeneinander, und der Unterschied liegt nicht in der Genauigkeit. Er liegt im Ausgabetyp. Fragen Sie Gemma 4 12B, wo der Gabelstapler ist, erhalten Sie einen Satz, und in den meisten Anwendungen ist dieser Satz das Produkt – eine Beschreibung, eine Zusammenfassung, eine Antwort auf eine Frage zu einem Foto. Fragen Sie Perceptron Mk1.5, und Sie können neben seiner Prosa einen Punkt, eine Bounding Box, ein Polygon, einen Clip oder ein <track>-Element anfordern, das eine räumliche Beobachtung und den Zeitstempel, zu dem sie gehört, trägt. Ein 60-Sekunden-Clip kommt als eine Abfolge von Positionen über die Zeit zurück statt als eine einzige gemittelte Vermutung über die Szene.

Das ist das ganze Argument dafür, dass Mk1.5 existiert, und es lohnt sich, präzise zu sein, warum das wichtig ist. Eine Beschreibung einer Szene ist ein fertiges Artefakt. Eine Koordinate ist eine Eingabe für etwas anderes — einen Greifplaner, eine Fehlerprüfung, einen mit Zeitstempeln versehenen Prüfpfad. Wenn Ihr nachgelagerter Code Prosa lesen und daraus die Position ableiten muss, haben Sie einen Parser zwischen zwei Modellen gebaut, und dieser Parser ist jetzt Ihre Fehleroberfläche. Mk1.5 wirbt damit, dass die Geometrie typisiert ankommt.

Gemma 4 12Bs Gegenargument ist nicht, dass es das auch tut. Es ist, dass man die Gewichte haben kann. Apache 2.0, 11,96B Parameter, veröffentlicht in vortrainierten und instruktionsoptimierten Varianten, ausgeführt auf Hardware, die man kontrolliert, mit einer veröffentlichten Evaluierungskarte und einem Drittanbieter-Index dahinter. Das sind unterschiedliche Arten von Assets, und keines ersetzt das andere.

Wo die beiden tatsächlich übereinstimmen

Weniger Orte, als die Bezeichnung „multimodal 2026" nahelegt, doch die gemeinsame Basis ist real und es lohnt sich, sie präzise zu benennen, gerade weil genau dort die Checkliste eines Käufers üblicherweise beginnt.

• Eingabemodalität – beide sind echt viermodal. Perceptron Mk1.5 akzeptiert Text, Bilder, Video und Audio (WAV, MP3, FLAC). Gemma 4 12B akzeptiert Text, Bild, Audio und Video über einen einzigen encoderfreien, vereinheitlichten Pfad.

• Ausgabemodalität – weder das eine noch das andere erzeugt Audio oder Bilder. Beide geben Text aus. Der Unterschied besteht darin, dass der Text von Mk1.5 strukturierte räumliche Annotationen enthalten kann, der von Gemma 4 12B hingegen nicht.

• Funktionsaufruf — beide unterstützen ihn. Mk1.5 bietet Funktionsaufruf bei Chat-Completions und akzeptiert eingeschränkte Antworten über JSON Schema und Regex. Gemma 4 12B liefert Funktionsaufruf in seiner instruktionsoptimierten Form und mit konfigurierbarem Denkmodus.

• Reasoning-Steuerung — Mk1.5 ersetzt das alte vision_config.enable_thinking-Boolean durch ein reasoning_effort-Feld, das high, medium, low, minimal oder none annimmt und standardmäßig auf high steht. Gemma 4 12B bietet Thinking- und Nicht-Reasoning-Varianten, die auf demselben Harness unterschiedlich abschneiden, weil sie unterschiedlich viel Arbeit verrichten.

• Kontext — 36.864 Token für Mk1.5 gegenüber 256K für Gemma 4 12B. Dies ist die größte Lücke auf der Liste, und der nächste Abschnitt handelt davon.

• Gewichte und Lizenz — Mk1.5 ist ein geschlossenes gehostetes Modell mit einem SDK, kein Download. Gemma 4 12B steht unter Apache 2.0, daher ist der gehostete Preis eine Option unter mehreren und nicht die einzige Möglichkeit, es zu betreiben.

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

Das 36K-Fenster ist eine Designentscheidung und kein Mangel

Ein verkörpertes Modell mit einem Fenster von 36.864 Tokens klingt nach einem Fehler – bis man sich ansieht, was Perceptron daneben gebaut hat. Mk1.5 akzeptiert ein asset_idx-Feld, sodass eine Anfrage mehrere Bilder oder Videos referenzieren und jedes einzeln ansprechen kann. Audio wird auf 16.384 Tokens pro Element begrenzt – laut Perceptrons Dokumentation entspricht das etwa 21,8 Minuten Sprache bei rund 750 Tokens pro Minute. Und der Grund, warum das Fenster klein bleiben kann, ist, dass die Aufgabe eng umrissen ist: bestimmte Dinge in Frames finden und verfolgen, Fragen dazu beantworten, aufhören.

Das ist eine andere Form der Arbeit als die von Gemma 4 12B. Ein 256K-Fenster ist dafür da, ein Dokument, ein Repository oder ein langes Gespräch zu halten und über alle Inhalte hinweg Schlussfolgerungen zu ziehen. Das Fenster von Mk1.5 ist ein Budget für eine einzige Wahrnehmungsaufgabe mit einer strukturierten Antwort, und Perceptron hat es auf diese Aufgabe ausgelegt und nicht auf ein Leaderboard. Wo der Unterschied dann wirklich spürbar wird, ist der Moment, in dem Ihre Aufgabe lautet: „Sehen Sie sich dieses ganze 40-minütige Inspektionsvideo an und sagen Sie mir alles“ – ein 36K-Fenster kann das Transkript, die Frames und die Antwort nicht auf einmal fassen, und das Fenster von Gemma 4 12B plus dessen Long-Context-Recall-Score ist das ehrliche Instrument dafür.

Die zweite Hälfte dieses Kompromisses ist Geschwindigkeit. Perceptron meldet bis zu 4,7× schneller Ende-zu-Ende, basierend auf dem Median aus drei Läufen auf einer einzelnen H100, mit der Einschränkung, dass 4,7× der beste von drei Messwerten und nicht der typische Fall ist: Chat-Antworten gingen von 5,2 Sekunden auf 1,1, Image-QA ging von 1,7 Sekunden auf 0,51 (etwa 3,3×), und ein 60-Sekunden-Video bei achtfacher Nebenläufigkeit ging von 19 Sekunden auf 9,1 (etwa 2,1×). Bei der Video-Workload, die ein verkörperter Agent tatsächlich ausführt, liegt der ehrliche Beschleunigungsfaktor bei ungefähr zwei.

Eines davon wurde von jemand anderem gemessen.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

Dies ist die eindeutigste Asymmetrie in diesem Duell, und das ist nicht mal knapp.

Gemma 4 12B hat eine Hersteller-Bewertungskarte und einen Drittanbieter-Index. Die Karte enthält vom Hersteller gemeldete Werte – MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 ohne Tools 77,5, Tau2, gemittelt über drei Durchläufe, 69,0 – und eine ehrliche Schwachstelle bei MRCR v2 8-Needle bei 128k, die bei 43,4 liegt und die Zeile ist, die man lesen sollte, bevor man annimmt, dass sich ein 256K-Fenster am hinteren Ende wie eines verhält. Darüber hinaus gibt es eine unabhängige Messung: Artificial Analysis setzt Gemma 4 12B bei einem Intelligence Index von 14 auf Rang 22 von 142 Modellen seiner Klasse, bei 113,7 Ausgabe-Tokens pro Sekunde – Rang 20 von 142 bei der Geschwindigkeit – mit einem Listenpreis von 0,10 $ für Eingabe und 0,30 $ für Ausgabe pro Million Tokens.

Perceptron Mk1.5 hat nichts dergleichen. Es gibt keinen Eintrag im Artificial Analysis Index und keinen Arena-Score für Mk1.5 oder für Mk1, also stammt jede Fähigkeitskennzahl, die für dieses Modell existiert, von dem Unternehmen, das es verkauft. Diese Menge ist konkret und nicht vage, und sie ist lesenswert: 0,9433 bei egozentrischem hand_box gegenüber 0,4467 für Gemini 3.1 Pro und 0,6179 für das beste Gemini in Perceptrons eigenem Durchlauf; EgoSchema 80,40 gegenüber 81,20 für denselben Wettbewerber, ein Verlust von 0,80 Punkten beim breiten Verständnis-Benchmark, bei einem behaupteten Vorsprung von 12 % beim EgoSchema-hard-Subset mit 63,75; 0,647 Centre-F1 und 0,628 Point-HOTA auf Molmo2-Track; DailyOmni 74,67 und AVHBench 80,56 auf der Audioseite. Das Muster in diesen Zahlen – entscheidend bei feingranularer Geometrie, ungefähr gleichauf oder leicht dahinter beim allgemeinen Videoverständnis – ist kohärent und passt zur Produktgeschichte. Doch ein Hersteller-Benchmark des eigenen Modells ist eine Behauptung, und die beiden Modelle in diesem Artikel werden nicht mit derselben Art von Belegen beschrieben.

Eine Zeile in dieser Tabelle verdient eine besondere Warnung. Perceptrons Tracking-Vergleich führt Qwen3-VL-8B mit 0,180 Centre-F1 auf, entnommen aus dem Paper dieses Modells, neben gemessenen Zahlen für sein eigenes Modell, und stellt es Qwen3.5-27B mit 0,530 und 0,476 über verschiedene Checkpoints und Evaluations-Setups hinweg gegenüber. Eine Paper-Zahl in einer Spalte mit gemessenen Werten ist keine direkt vergleichbare Zeile, und es ist die Art von Zeile, die ohne ihre Herkunft zitiert wird. Dieselbe Vorsicht gilt umgekehrt für die 56,0-Mk1.5-Einträge auf LiveVQA-W mit aktivierten Tools – diese Zahl stammt aus einer Mehrheitsentscheidung über vier Stichproben, während die 53,2, mit der sie für Gemini 3.8 Flash mit Such-Grounding verglichen wird, nicht daraus stammt, und eine Mehrheitsentscheidung über vier Stichproben ist eine legitime Technik, die einen Wert gegenüber einem einzelnen Greedy-Durchlauf schönt.

Kostenberechnung für eine tatsächliche Workload

Die Preislisten liegen näher beieinander als die Produkte. Perceptron Mk1.5 kostet $0,15 pro Million Eingabe-Tokens und $1,50 pro Million Ausgabe-Tokens, wobei zwischengespeicherte Eingabe $0,0375 kostet – genau ein Viertel des Standard-Eingabepreises und pro zwischengespeichertem Token günstiger als die $0,10 Standard-Eingabe von Gemma 4 12B. Gemma 4 12B wird auf dem Drittanbieter-Harness, der es misst, mit $0,10 und $0,30 gelistet, und es ist Apache 2.0, sodass Self-Hosting die Grenzkosten vollständig beseitigt, wenn Sie die Hardware haben.

Zwei Dinge erschweren einen direkten Vergleich, und sie weisen in entgegengesetzte Richtungen. Erstens: Bei Mk1.5 ist reasoning_effort standardmäßig auf high eingestellt, was bedeutet, dass jeder Aufruf, den Sie nicht konfigurieren, den teuersten Reasoning-Pfad kauft, den das Modell bietet; ein Wechsel auf medium oder low ist eine einzeilige Änderung mit direkter Wirkung auf die Rechnung, und es ist das billigste Experiment im Release. Zweitens: Gemma 4 12B lässt Sie den Denkschritt ganz abschalten, was sowohl die Rechnung als auch die Latenz verändert, und bei einer festen Aufgabe wie der Klassifizierung auf Frame-Ebene ist ein Durchlauf ohne Reasoning oft der richtige.

Rechnen Sie das an etwas Realem durch: eine Vision-Pipeline, die täglich 40.000 Frames verarbeitet, bei ungefähr tausend Tokens Bild-Input pro Frame. Das sind täglich 40 Mio. Input-Tokens. Bei der Input-Rate von Mk1.5 von 0,15 $ und mit gecachten Frames, bei denen dieselbe Szene wiederkehrt, liegen Sie beim Input im niedrigen einstelligen Dollarbereich pro Tag — günstig nach jedem Maßstab. Gemma 4 12B ist bei 0,10 $ Input noch günstiger und marginal kostenlos, wenn Sie selbst hosten. Keines der beiden Modelle ist teuer. Die Entscheidung hier ist keine Budgetentscheidung; sie ist die Frage, ob Sie Koordinaten, ein 256K-Fenster oder beides brauchen.

Beide ohne eine zweite Integration aufrufen

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Das praktische Hindernis beim Durchführen dieses Vergleichs ist nicht der Preis – es ist, dass Perceptron Mk1.5 und Gemma 4 12B nicht im selben Katalog sind. Keines von beiden ist heute auf OrcaRouter geroutet: Die Gemma-4-Einträge, die wir anbieten, sind die Varianten 31B Instruct und 26B-A4B, und Mk1.5 hat überhaupt keine Route, daher ist die ehrliche Empfehlung, Mk1.5 über die eigene API des Anbieters unter api.perceptron.inc — pip install "perceptron>=0.4.0", Schlüssel in PERCEPTRON_API_KEY — zu erreichen und Gemma 4 12B entweder über einen Drittanbieter-Host oder indem Sie die Apache-2.0-Gewichte selbst bereitstellen.

Wofür eine Routing-Schicht in dieser Situation wirklich da ist, ist die Entscheidung, die Sie noch nicht getroffen haben. Wenn die strukturierte Ausgabe von Mk1.5 das ist, was Ihre Anwendung braucht, und das Fenster von Gemma 4 12B das, was Ihre andere Workload braucht, dann sind das zwei Integrationen und zwei Fehlerdomänen; sie hinter einem OpenAI-kompatiblen Endpunkt mit automatischem Failover zu bringen, bedeutet, dass ein Schluckauf eines Anbieters auf einer der beiden Seiten in einen Fallback mündet statt in einen fehlgeschlagenen Job, und eine Routing-Regel kann die Geometrie-Arbeit und die Langkontext-Arbeit an verschiedene Modelle schicken, ohne dass Ihre Anwendung weiß, welches welches ist. Wenn ein Anbieter seine Preisliste ändert, berechnet ein Pass-through-Router den Listenpreis des Anbieters mit nichts pro Token zusätzlich, sodass die Änderung noch am selben Tag ankommt statt erst in Ihrem nächsten Abrechnungszyklus. Die Routing-DSL ist auch der Weg, wie Sie einen Vergleich aufsetzen würden — einen Anteil des echten Traffics an jedes Modell, gemessen auf Ihren eigenen Frames, statt eines Benchmark-Arguments.

Welche willst du eigentlich?

Nimm Perceptron Mk1.5, wenn die Antwort maschinenlesbar sein muss. Wenn du etwas steuerst oder etwas protokollierst, bei dem es auf Position und Zeit ankommt, kann keine noch so große Menge an zusätzlichem Kontextfenster eine typisierte Koordinate ersetzen, und Mk1.5 ist das einzige Modell in dieser Paarung, das eine erzeugt. Sei dir über drei Dinge im Klaren: das 36.864-Token-Budget, die hohe Reasoning-Standardeinstellung und die Tatsache, dass jede damit verbundene Fähigkeitszahl vom Anbieter selbst stammt.

Der günstigste Weg, das zu klären, ist, einen Teil des echten Traffics an beide zu leiten und anhand eurer eigenen Frames zu messen; beide liegen hinter einem OpenAI-kompatiblen Endpunkt auf OrcaRouter, was einen Side-by-Side-Test zu einer Konfigurationszeile statt einer zweiten Integration macht.

Nimm Gemma 4 12B, wenn du viel Material unterbringen musst, wenn du die Gewichte brauchst oder wenn du die Wahl gegenüber jemandem rechtfertigen musst, der Hersteller-Benchmarks nicht einfach auf Treu und Glauben hinnimmt. Es hat einen unabhängigen Index, eine veröffentlichte Evaluierungskarte, Apache-2.0-Lizenzierung und ein siebenmal größeres Kontextfenster – und es wird eine Szene beschreiben, statt sie zu vermessen. Dieser letzte Teilsatz ist die ganze Entscheidung. Eines dieser Modelle ist ein Generalist, den du besitzen und prüfen kannst; das andere ist ein Spezialist, den du mietest, weil er Geometrie zurückliefert, und dass der Spezialist das kleinere Fenster und keine Bewertung von Drittanbietern hat, ist kein Widerspruch. So sieht ein eng gebautes Werkzeug von außen aus.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert