Een hero-titelkaart voor Perceptron Mk1.5 met de ondertitel 'Gestructureerde ruimtelijke uitvoer voor belichaamde agenten' en drie platte lijniconen boven de titel: een begrenzingsvak rond een klein object, een gestippeld bewegingstraject met twee waypoints, en een geluidsgolf. Het OrcaRouter-logo staat in de rechteronderhoek.
Guides & Insights

Perceptron Mk1.5 brengt gestructureerde ruimtelijke output naar belichaamde agents — en zwaait dezelfde dag Isaac uit

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Perceptron Mk1.5 is nu algemeen beschikbaar, en het interessante eraan is niet de benchmarktabel — het is wat er in de responsbody terugkomt. Vraag een normaal visie-taalmodel waar de heftruck is en je krijgt een zin. Vraag Perceptron Mk1.5 op een videoframe en je kunt, naast zijn proza, machine-parseerbare geometrie krijgen: een punt, een bounding box, een polygoon, een clip, of een <track>-element dat van tijdstempels voorziene ruimtelijke waarnemingen over het hele bestand bevat. Dat is het verschil tussen een model dat een scène beschrijft en een model dat een robotcontroller kan gebruiken zonder een tweede parseerstap. Het is de directe opvolger van Perceptron Mk1, de eerste release van het bedrijf in mei 2026, en het werd op 25 september uitgebracht, samen met het buiten gebruik stellen van de Isaac 0.1- en 0.2-checkpoints die eraan voorafgingen.

Wat Mk1.5 daadwerkelijk retourneert

Het model is een belichaamd redeneersysteem voor fysieke agenten. Aan de invoerkant neemt het tekst, afbeeldingen, video en audio. Aan de uitvoerkant produceert het tekst plus optionele gestructureerde annotaties: punten, boxen, polygonen, clips en tracks. De tracking-uitvoer is het onderdeel dat het waard is om bij stil te staan. De documentatie van Perceptron beschrijft een <track> blok waarvan de items zowel een ruimtelijke observatie als de bijbehorende tijdsaanduiding bevatten, zodat een clip van 60 seconden terugkomt als een reeks objectposities in de tijd in plaats van als één gemiddelde schatting van de scène.

Een tweede detail dat van belang is voor iedereen die dit in een pijplijn met meer dan één asset integreert: Mk1.5 ondersteunt een asset_idx-veld, zodat één enkel verzoek naar meerdere afbeeldingen of video's kan verwijzen en deze afzonderlijk kan adresseren. Als het je taak is om een referentiefoto te vergelijken met een live camerabeeld — een lus voor defectcontrole, een stap voor assemblageverificatie — dan hoort dat in één aanroep, niet in twee.

Het model ondersteunt ook gestuurde responses, zowel JSON Schema als regex, en daarmee zet je "ongeveer goed" om in een schema dat je downstreamcode kan valideren. Function calling wordt ondersteund bij chat completions, en Perceptrons gehoste MCP-server gebruikt nu standaard perceptron-mk1.5; door model: "perceptron-mk1"expliciet mee te geven, zet je de vorige standaard vast.

Het specificatieblad, en wat het kost

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

De cijfers hier zijn het waard om ronduit genoemd te worden, omdat ze op plaatsen bescheiden zijn waar een lezer ze misschien niet zou verwachten. Het contextvenster is 36.864 tokens — niet een miljoen, niet 256K. De maximale uitvoer is 8.192 tokens. Dit is geen model waaraan je een video van twee uur en een handleiding van 300 pagina's geeft. Het is afgestemd op een strak afgebakende perceptietaak met een gestructureerd antwoord.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• Context — 36.864 tokens, tegenover het venster van 32K waarmee Perceptron Mk1 werd geleverd
• Maximale uitvoer — 8.192 tokens
• Invoer — tekst, afbeeldingen, video, audio (WAV, MP3, FLAC)
• Gecachte invoer — $0,0375/M, een kwart van het standaard invoertarief van $0,15/M
• Uitvoer — $1,50/M
• Redeneerbesturing — reasoning_effort op hoog, gemiddeld, laag, minimaal of geen, standaard ingesteld op hoog

Die laatste rij is een verkapte breaking change. Mk1.5 vervangt de oude vision_config.enable_thinking boolean door reasoning_effort, dus elk verzoek dat je voor het vorige model hebt gebouwd, moet worden aangepast in plaats van alleen opnieuw te worden gericht. De standaardwaarde high is om een andere reden het vermelden waard: als je het veld niet instelt, koop je bij elke aanroep het duurste redeneerpad.

Audio, en video die zijn eigen soundtrack meebrengt

Audio-invoer is hier echt nieuw. Perceptron accepteert het op drie manieren — inline input_audio, een audio_url, of een audio_file_id — met een limiet van 16.384 audiotokens per item. De documentatie schat dat op ongeveer 21,8 minuten spraak bij ongeveer 750 tokens per minuut, wat een redelijk budget is voor een overdrachtsopname of een onderhoudslogboek.

Ongewoner is het videopad. Standaard leest Mk1.5 video als frames en negeert de audiotrack. De instelling vision_config.enable_audio_in_video: true schakelt de soundtrack weer in, wat de instelling is die je wilt voor alles waarbij de ruis het signaal is — een machine die verkeerd klinkt voordat hij verkeerd uitziet, een gesproken instructie die buiten beeld wordt gegeven, een alarm op de achtergrond van een rondleiding op locatie. Deze staat standaard uit, dus een video met een hoorbare fout wordt stil geanalyseerd als een stomme film, tenzij je anders aangeeft.

Het benchmarkbeeld, met de herkomst expliciet gemaakt

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

Elk cijfer hieronder komt uit Perceptrons eigen aankondiging en is door Perceptron gemeten. Er is geen vermelding in de Artificial Analysis-index en geen arena-score voor zowel Mk1.5 als zijn voorganger, dus er is nergens in deze vergelijking een cijfer van een derde partij om tegenover die cijfers te stellen. Behandel de cijfers als een claim van een leverancier over zijn eigen product, niet als een neutraal resultaat.

Bij egocentrische handtracking is de kloof groot en specifiek: Mk1.5 scoort 0,9433 op hand_box tegenover 0,4467 voor Gemini 3.1 Pro en 0,6179 voor de beste Gemini in Perceptrons run, die de aankondiging identificeert als Gemini 3.8 Flash. Dat zijn de +111% en +53% waarmee de lanceringspost opent, en het is het sterkste afzonderlijke cijfer in de release.

Bij algemeen egocentrisch videobegrip ligt het veel dichter bij elkaar. Perceptron meldt EgoSchema op 80,40 voor Mk1.5 tegenover 81,20 voor Gemini 3.8 Flash — een verlies van 0,80 punten — terwijl het een voorsprong van 12% claimt op de EgoSchema-hard-subset met 63,75. Een model dat overtuigend wint op fijnmazige handgeometrie en nipt verliest op de brede begripsbenchmark is een specifiek soort hulpmiddel, en het wordt als zodanig verkocht.

Video-objectsegmentatie komt uit op 0,647 center-F1 en 0,628 point-HOTA op Molmo2-Track. Perceptron zegt dat dit Molmo2-Track, Ref-DAVIS17 en ReasonVOS aanvoert, maar achterblijft bij MolmoPoint-8B op MeViS valid_u. In vergelijking met de Qwen-visielijn loont het om de trackingvergelijking zorgvuldig te lezen: de aankondiging noemt Qwen3-VL-8B met 0,180 center-F1 uit zijn paper, en Qwen3.5-27B met 0,530 en 0,476 — verschillende checkpoints, verschillende evaluatieopstellingen, en een papergetal dat in dezelfde kolom staat als gemeten waarden. Dat is geen één-op-één vergelijkbare rij.

Audioresultaten worden gerapporteerd als DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 en AVHBench 80,56, zonder dat er een vergelijkingsrij aan vastzit. Bij multimodaal zoeken met ingeschakelde tools scoort Mk1.5 56,0 op LiveVQA-W op basis van een meerderheidsstemming over vier samples, tegenover 53,2 voor Gemini 3.8 Flash met Google Search-grounding, 51,0 voor GPT-6 sol met OpenAI-webzoekopdracht, en 33,2 voor GPT-5.2 online. Perceptron claimt ook een winst van 36,1 punten op MMSearch zodra tools worden ingeschakeld. Meerderheidsstemming over vier samples is een legitieme techniek en doet de score gunstiger uitvallen dan één enkele greedy pass, dus de 56,0 en de 53,2 zijn niet op dezelfde manier gemeten.

Latentie, en hoe de 4,7× werd gemeten

De snelheidsclaim is degene die het vaakst zonder context wordt geciteerd, dus hier is de context. Perceptron rapporteert tot 4,7× sneller end-to-end op basis van de mediaan van drie runs op één H100, met LMArena-prompts met antwoorden van maximaal 256 tokens, plus MIA-Bench en Video-MME met Perception Test. De 4,7× is het chatgeval: van 5,2 seconden naar 1,1. Het beantwoorden van vragen over afbeeldingen gaat van 1,7 seconden naar 0,51, wat ongeveer 3,3× is. Een video van 60 seconden die met acht tegelijk wordt verwerkt, gaat van 19 seconden naar 9,1, ongeveer 2,1×.

Dus de headline-factor is de beste van de drie, niet het typische geval. Op één enkele H100, bij korte antwoorden, is het chat-pad echt 4,7× sneller. Op de video-workload die een belichaamde agent daadwerkelijk zou draaien, ligt het dichter bij 2×. Het zijn beide goede cijfers; slechts één ervan is het headline-cijfer.

Isaac 0.1 en 0.2 werden op dezelfde dag stopgezet.

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

De Mk1.5-changelog bevat een tweede vermelding van 25 september, en die heeft gevolgen voor iedereen die al in productie is. De isaac-0.1, isaac-0.2-1b en isaac-0.2-2b-preview model-ID's zijn teruggetrokken uit de Perceptron API. Ze verschijnen niet meer in GET /v1/models, ze zijn verdwenen uit de gehoste MCP-server, en verzoeken die ze noemen mislukken nu met HTTP 404 model_not_found.

Er is een tweede gedragswijziging begraven in hetzelfde item die code zal bijten die de Isaac-modellen helemaal niet noemde: onbekende model-ID's geven nu 404 terug in plaats van de eerdere 400. Elke retry-logica, foutvertakking of waarschuwingsregel die matchte op een 400 voor een slechte modelnaam, matcht nu op niets. Het migratiepad dat Perceptron geeft is perceptron-mk1.5.

Een modelfamilie uitfaseren op dezelfde dag dat je de opvolger uitbrengt, is een schoon migratieverhaal en een hard verhaal. Als je Isaac hebt gepind omdat het werkte, heb je een deadline die al verstreken is.

Waar je het kunt uitvoeren, en hoe je het kunt proberen zonder erop te wedden

Beschikbaarheid verloopt via de eigen API van de leverancier en verschillende platforms van derden. OrcaRouter routeert Perceptron Mk1.5 momenteel niet — het model staat niet in onze catalogus — dus het eerlijke advies is om rechtstreeks naar api.perceptron.inc te gaan, en dat is precies waar de SDK en de PERCEPTRON_API_KEY omgevingsvariabele voor dienen.

Wat toch het vermelden waard is, omdat het betrekking heeft op de beslissing en niet op het model: een checkpoint van twee dagen oud met een contextvenster van 36.864 tokens en een standaard redeneerinstelling op high is precies het profiel van iets dat je niet ongezien in een productiepad moet zetten. Draai het eerst tegen je eigen frames, en meet specifiek twee dingen — of de gestructureerde outputs je werkelijke edge cases overleven, en wat reasoning_effort: "high" je per aanroep kost in vergelijking met terugschakelen naar medium of low. Het tweede is een wijziging van één regel met direct effect op je factuur, en het is het goedkoopste experiment in deze release.

Het bredere patroon waar dit in past — perceptiemodellen die geometrie retourneren in plaats van adjectieven — is er een die OrcaRouter gebouwd is om op te vangen. Eén API dekt meer dan 200 modellen, met de lijstprijzen van providers doorgegeven tegen 0% opslag, dus een prijswijziging van een leverancier voor een van hen is dezelfde dag live aan onze kant, en automatische failover betekent dat een perceptieaanroep kan terugvallen op een tweede model in plaats van het verzoek te laten mislukken. Als Mk1.5 het enige is dat je nauwkeurigheidsdrempel haalt, helpt niets daarvan je vandaag. Als het één kandidaat is tussen meerdere, is het uitvoeren van de vergelijking via één endpoint goedkoper dan een tweede SDK aan te sluiten om erachter te komen.

Wat deze release wel en niet is

Perceptron Mk1.5 is een doelgerichte tool met een ongewoon eerlijke reeks beperkingen eraan verbonden. Hij retourneert coördinaten, niet alleen een beschrijving. Hij leest audio, inclusief de soundtrack van een video als je die inschakelt. Hij is snel bij korte chatantwoorden. Het is ook een model met 36.864 tokens en een uitvoerplafond van 8.192 tokens, geprijsd op $0,15 en $1,50, uitsluitend gebenchmarkt door de eigen leverancier, en verkocht door een bedrijf dat de vorige generatie in hetzelfde changelog-item buiten gebruik stelde.

Als je probleem is "vind de hand, volg hem door de clip, vertel me waar hij naartoe ging en wanneer", dan is het hand-boxnummer het juiste om te testen. Als je probleem brede videocomprehensie tegenover een frontier-generalist is, suggereert de EgoSchema-lijn — 80,40 tegen 81,20 — dat je een specialist aanschaft die ongeveer gelijkwaardig presteert, en dat het argument om over te stappen uit de gestructureerde output en de latentie moet komen, niet uit de nauwkeurigheid.