Eine Hero-Titelkarte für Perceptron Mk1.5 mit dem Untertitel „Strukturierte räumliche Ausgabe für verkörperte Agenten" und drei flachen Linien-Icons über dem Titel: eine Bounding Box, die um ein kleines Objekt gezeichnet ist, eine gepunktete Bewegungsbahn mit zwei Wegpunkten und eine Schallwelle. Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Guides & Insights

Perceptron Mk1.5 bringt strukturierte räumliche Ausgabe für verkörperte Agenten — und schickt Isaac noch am selben Tag in den Ruhestand

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Perceptron Mk1.5 ist jetzt allgemein verfügbar, und das Interessante daran ist nicht die Benchmark-Tabelle – es ist das, was im Response-Body zurückkommt. Fragt man ein normales Vision-Language-Modell, wo der Gabelstapler ist, erhält man einen Satz. Fragt man Perceptron Mk1.5 auf einem Video-Frame, kann man neben seiner Prosa maschinenlesbare Geometrie erhalten: einen Punkt, eine Bounding Box, ein Polygon, einen Clip oder ein <track>-Element, das mit Zeitstempeln versehene räumliche Beobachtungen über die gesamte Datei hinweg trägt. Das ist der Unterschied zwischen einem Modell, das eine Szene beschreibt, und einem Modell, das eine Robotersteuerung ohne eine zweite Parsing-Stufe konsumieren kann. Es ist der direkte Nachfolger von Perceptron Mk1, der ersten Veröffentlichung des Unternehmens im Mai 2026, und es wurde am 25. September zusammen mit der Einstellung der vorangegangenen Checkpoints Isaac 0.1 und 0.2 veröffentlicht.

Was Mk1.5 tatsächlich zurückgibt

Das Modell ist ein verkörpertes Reasoning-System für physische Agenten. Auf der Eingabeseite verarbeitet es Text, Bilder, Video und Audio. Auf der Ausgabeseite erzeugt es Text plus optionale strukturierte Annotationen: Punkte, Boxen, Polygone, Clips und Tracks. Die Tracking-Ausgabe ist der Teil, bei dem es sich lohnt, zu verweilen. Perceptrons Dokumentation beschreibt einen <track>Block, dessen Einträge sowohl eine räumliche Beobachtung als auch den zugehörigen Zeitstempel enthalten, sodass ein 60-Sekunden-Clip als zeitliche Abfolge von Objektpositionen zurückkommt und nicht als einzelne gemittelte Schätzung der Szene.

Ein zweites Detail, das für alle wichtig ist, die dies in eine Pipeline mit mehr als einem Asset einbinden: asset_idx Feld, sodass eine einzelne Anfrage mehrere Bilder oder Videos referenzieren und sie getrennt ansprechen kann. Wenn es bei Ihrer Aufgabe darum geht, ein Referenzfoto mit einem Live-Kamerabild zu vergleichen — eine Schleife zur Fehlerprüfung, ein Schritt zur Montageverifizierung —, dann gehört das in einen Aufruf, nicht in zwei.

Das Modell unterstützt außerdem eingeschränkte Antworten, sowohl JSON Schema als auch Regex, womit Sie aus „grob richtig“ ein Schema machen, das Ihr nachgelagerter Code validieren kann. Funktionsaufrufe werden bei Chat-Completions unterstützt, und der gehostete MCP-Server von Perceptron verwendet jetzt standardmäßig perceptron-mk1.5; die explizite Angabe von model: "perceptron-mk1" ist, wie Sie den vorherigen Standard festlegen.

Das Datenblatt – und was es kostet

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

Die Zahlen hier sollte man klar nennen, denn sie sind an Stellen bescheiden, an denen ein Leser sie vielleicht nicht erwarten würde. Das Kontextfenster umfasst 36.864 Tokens – nicht eine Million, nicht 256K. Die maximale Ausgabe beträgt 8.192 Tokens. Dies ist kein Modell, dem man ein zweistündiges Video und ein 300-seitiges Handbuch übergibt. Es ist auf eine eng gefasste Wahrnehmungsaufgabe mit einer strukturierten Antwort zugeschnitten.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• Kontext — 36.864 Token, im Vergleich zum 32K-Fenster, mit dem Perceptron Mk1 ausgeliefert wurde
• Maximale Ausgabe — 8.192 Token
• Eingabe — Text, Bilder, Video, Audio (WAV, MP3, FLAC)
• Cache-Eingabe — $0,0375/M, ein Viertel des Standard-Eingabepreises von $0,15/M
• Ausgabe — $1,50/M
• Reasoning-Steuerung — reasoning_effort auf high, medium, low, minimal oder none, standardmäßig high

Diese letzte Zeile ist eine Breaking Change in Verkleidung. Mk1.5 ersetzt das alte vision_config.enable_thinking-Boolean durch reasoning_effort, sodass jede Anfrage, die Sie gegen das vorherige Modell gebaut haben, bearbeitet werden muss, statt nur umgehängt zu werden. Der Standardwert high ist aus einem anderen Grund bemerkenswert: Wenn Sie das Feld nicht setzen, kaufen Sie bei jedem Aufruf den teuersten Reasoning-Pfad.

Audio und Video, das seinen eigenen Soundtrack mitbringt

Audioeingabe ist hier wirklich neu. Perceptron akzeptiert sie auf drei Wegen – inline input_audio, eine audio_url oder eine audio_file_id – mit einer Obergrenze von 16.384 Audio-Tokens pro Element. Die Doku beziffert das auf rund 21,8 Minuten Sprache bei etwa 750 Tokens pro Minute, was ein vernünftiges Budget für eine Aufnahme zur Schichtübergabe oder ein Wartungsprotokoll ist.

Ungewöhnlicher ist der Videopfad. Standardmäßig liest Mk1.5 Videos als Frames und ignoriert die Audiospur. Wenn man vision_config.enable_audio_in_video: true setzt, wird die Tonspur wieder eingeschaltet – die Einstellung, die man für alles braucht, bei dem das Geräusch das Signal ist: eine Maschine, die sich falsch anhört, bevor sie falsch aussieht, eine gesprochene Anweisung außerhalb des Kamerabilds, ein Alarm im Hintergrund eines Rundgangs über eine Anlage. Sie ist standardmäßig deaktiviert, sodass ein Video mit einem hörbaren Fehler stillschweigend als Stummfilm analysiert wird, wenn man nichts anderes verlangt.

Das Benchmark-Bild, mit explizit gemachter Quellenangabe

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

Jede der unten aufgeführten Zahlen stammt aus Perceptrons eigener Ankündigung und wurde von Perceptron gemessen. Es gibt weder einen Eintrag im Artificial Analysis Index noch eine Arena-Wertung für Mk1.5 oder dessen Vorgänger, daher gibt es in diesem Vergleich keine Drittanbieter-Zahl, die man ihnen gegenüberstellen könnte. Betrachten Sie die Zahlen als eine Aussage eines Anbieters über sein eigenes Produkt, nicht als neutrales Ergebnis.

Beim egozentrischen Hand-Tracking ist die Lücke groß und spezifisch: Mk1.5 erzielt 0,9433 bei hand_box gegenüber 0,4467 für Gemini 3.1 Pro und 0,6179 für das beste Gemini im Durchlauf von Perceptron, das die Ankündigung als Gemini 3.8 Flash identifiziert. Das sind die +111 % und +53 %, mit denen der Launch-Post aufwartet, und es ist die stärkste Einzelzahl in der Veröffentlichung.

Beim allgemeinen Verständnis egozentrischer Videos ist das Bild deutlich ausgeglichener. Perceptron meldet für Mk1.5 80,40 bei EgoSchema gegenüber 81,20 für Gemini 3.8 Flash – ein Verlust von 0,80 Punkten – und beansprucht gleichzeitig einen Vorsprung von 12 % im EgoSchema-hard-Subset bei 63,75. Ein Modell, das bei feingranularer Handgeometrie klar gewinnt und beim breiten Verständnis-Benchmark knapp verliert, ist eine ganz bestimmte Art von Werkzeug – und es wird als genau das verkauft.

Videoobjektsegmentierung erreicht 0,647 center-F1 und 0,628 point-HOTA auf Molmo2-Track. Perceptron sagt, dass dies bei Molmo2-Track, Ref-DAVIS17 und ReasonVOS führt, während es auf MeViS valid_u hinter MolmoPoint-8B zurückliegt. Im Vergleich zur Qwen-Vision-Reihe lohnt sich ein genauer Blick auf den Tracking-Vergleich: Die Ankündigung listet Qwen3-VL-8B mit 0,180 center-F1 aus seiner Veröffentlichung und Qwen3.5-27B mit 0,530 und 0,476 — unterschiedliche Checkpoints, unterschiedliche Evaluations-Setups und eine Paper-Zahl, die in derselben Spalte wie gemessene Zahlen steht. Das ist keine direkt vergleichbare Zeile.

Audioergebnisse werden als DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 und AVHBench 80,56 angegeben, ohne dass eine Vergleichszeile beigefügt ist. Bei der multimodalen Suche mit aktivierten Tools erzielt Mk1.5 56,0 auf LiveVQA-W aus einer Mehrheitsabstimmung über vier Stichproben, gegenüber 53,2 für Gemini 3.8 Flash mit Google-Search-Grounding, 51,0 für GPT-6 sol mit OpenAI-Websuche und 33,2 für GPT-5.2 online. Perceptron beansprucht zudem einen Zuwachs von 36,1 Punkten bei MMSearch, sobald Tools eingeschaltet werden. Die Mehrheitsabstimmung über vier Stichproben ist eine legitime Technik, und sie schmeichelt dem Ergebnis im Vergleich zu einem einzelnen Greedy-Durchlauf, sodass die 56,0 und die 53,2 nicht auf dieselbe Weise gemessen werden.

Latenz und wie der 4,7×-Wert gemessen wurde

Die Geschwindigkeitsaussage ist diejenige, die am ehesten ohne ihren Kontext zitiert wird, hier ist also der Kontext. Perceptron berichtet von bis zu 4,7× schnellerer Ende-zu-Ende-Leistung, basierend auf dem Median aus drei Läufen auf einer einzelnen H100, unter Verwendung von LMArena-Prompts mit auf 256 Token begrenzten Antworten, plus MIA-Bench und Video-MME mit Perception Test. Die 4,7× beziehen sich auf den Chat-Fall: 5,2 Sekunden runter auf 1,1. Die Beantwortung von Bildfragen geht von 1,7 Sekunden auf 0,51, was etwa 3,3× entspricht. Ein 60-Sekunden-Video, das acht auf einmal verarbeitet wird, geht von 19 Sekunden auf 9,1, ungefähr 2,1×.

Der Schlagzeilen-Faktor ist also der beste der drei, nicht der typische Fall. Auf einer einzelnen H100, bei kurzen Antworten, ist der Chat-Pfad tatsächlich 4,7× schneller. Bei der Video-Workload, die ein verkörperter Agent tatsächlich ausführen würde, sind es eher 2×. Beide sind gute Zahlen; nur eine davon ist die Schlagzeile.

Isaac 0.1 und 0.2 wurden am selben Tag eingestellt.

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Das Mk1.5-Changelog enthält einen zweiten Eintrag vom 25. September, und er hat es in sich für alle, die bereits in Produktion sind. Die isaac-0.1, isaac-0.2-1b und isaac-0.2-2b-preview Modell-IDs wurden aus der Perceptron-API entfernt. Sie erscheinen nicht mehr in GET /v1/models, sie sind vom gehosteten MCP-Server verschwunden, und Anfragen, die sie nennen, führen jetzt zu HTTP 404 model_not_found.

In demselben Eintrag steckt eine zweite Verhaltensänderung, die Code treffen wird, der die Isaac-Modelle nie erwähnt hat: Unbekannte Modell-IDs liefern jetzt 404 statt der bisherigen 400. Jegliche Wiederholungslogik, Fehlerverzweigung oder Alarmierungsregel, die bei einem ungültigen Modellnamen auf eine 400 angesprungen ist, trifft jetzt auf nichts zu. Der von Perceptron angegebene Migrationspfad ist perceptron-mk1.5.

Eine Modellfamilie an demselben Tag einzustellen, an dem man ihren Nachfolger ausliefert, ist eine saubere Migrationsgeschichte – und eine harte. Wenn du Isaac gepinnt hast, weil es funktioniert hat, hast du eine Deadline, die bereits verstrichen ist.

Wo man es ausführen kann und wie man es ausprobiert, ohne darauf zu wetten

Die Verfügbarkeit erfolgt über die eigene API des Anbieters und mehrere Drittanbieter-Plattformen. OrcaRouter routet Perceptron Mk1.5 derzeit nicht – das Modell ist nicht in unserem Katalog – daher ist die ehrliche Empfehlung, sich für das Modell direkt an api.perceptron.inc zu wenden, wofür genau das SDK und die PERCEPTRON_API_KEY Umgebungsvariable gedacht sind.

Was dennoch erwähnenswert ist, weil es eher die Entscheidung betrifft als das Modell: ein zwei Tage alter Checkpoint auf einem 36.864-Token-Fenster mit einer standardmäßigen Reasoning-Einstellung auf high ist genau das Profil von etwas, das man nicht ungeprüft auf einen Produktionspfad setzen sollte. Führe es zuerst gegen deine eigenen Frames aus und messe zwei Dinge gezielt — ob die strukturierten Ausgaben deine tatsächlichen Edge Cases überstehen und was reasoning_effort: "high" dich pro Aufruf kostet im Vergleich zum Heruntergehen auf medium oder low. Das zweite ist eine einzeilige Änderung mit direkter Auswirkung auf deine Rechnung, und es ist das günstigste Experiment in diesem Release.

Das größere Muster, in das dies passt – Wahrnehmungsmodelle, die Geometrie statt Adjektive zurückgeben –, ist eines, für das OrcaRouter gebaut ist. Eine API deckt über 200 Modelle ab, wobei die Listenpreise der Anbieter mit 0 % Aufschlag weitergegeben werden, sodass eine Preisänderung eines Anbieters bei jedem dieser Modelle am selben Tag auf unserer Seite live ist, und automatisches Failover bedeutet, dass ein Perception-Aufruf auf ein zweites Modell zurückfallen kann, statt die Anfrage fehlschlagen zu lassen. Wenn Mk1.5 das Einzige ist, was Ihre Genauigkeitslatte überspringt, hilft Ihnen das heute alles nicht. Wenn es ein Kandidat unter mehreren ist, ist der Vergleich über einen einzigen Endpunkt günstiger, als ein zweites SDK anzubinden, nur um es herauszufinden.

Was dieses Release ist und was nicht

Perceptron Mk1.5 ist ein fokussiertes Werkzeug, dem ein ungewöhnlich ehrliches Set an Grenzen anhaftet. Es gibt Koordinaten zurück, nicht nur eine Beschreibung. Es liest Audio, einschließlich des Soundtracks eines Videos, wenn man es aktiviert. Bei kurzen Chat-Antworten ist es schnell. Es ist außerdem ein 36.864-Token-Modell mit einer Ausgabegrenze von 8.192 Token, bepreist mit $0.15 und $1.50, vollständig vom eigenen Anbieter gebenchmarkt und von einem Unternehmen verkauft, das die vorherige Generation im selben Changelog-Eintrag eingestellt hat.

Wenn Ihr Problem lautet: „Finde die Hand, verfolge sie im Clip, sag mir, wohin sie gegangen ist und wann“, dann ist die Hand-Box-Kennzahl diejenige, die Sie testen sollten. Wenn Ihr Problem breites Videoverständnis im Vergleich zu einem Frontier-Generalisten ist, dann deutet die EgoSchema-Zeile – 80,40 gegenüber 81,20 – darauf hin, dass Sie einen Spezialisten zu ungefähr gleichwertiger Leistung einkaufen, und das Argument für einen Wechsel muss aus der strukturierten Ausgabe und der Latenz kommen, nicht aus der Genauigkeit.