Ett hero-titelkort för Perceptron Mk1.5 med underrubriken 'Strukturerad spatial utdata för förkroppsligade agenter' och tre platta linjeikoner ovanför titeln: en avgränsningsruta ritad runt ett litet objekt, ett prickat rörelsespår med två vägpunkter och en ljudvåg. OrcaRouter-logotypen sitter i nedre högra hörnet.
Guides & Insights

Perceptron Mk1.5 ger strukturerad rumslig utdata till förkroppsligade agenter – och pensionerar Isaac samma dag

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Perceptron Mk1.5 är nu allmänt tillgänglig, och det intressanta med den är inte benchmark-tabellen — det är vad som kommer tillbaka i svarskroppen. Fråga en vanlig bildspråkmodell var gaffeltrucken är och du får en mening. Fråga Perceptron Mk1.5 om en videobild och du kan, vid sidan av dess prosa, få maskintolkbar geometri: en punkt, en avgränsningsruta, en polygon, ett klipp, eller ett <track> element som bär tidsstämplade rumsliga observationer över hela filen. Det är skillnaden mellan en modell som beskriver en scen och en modell som en robotstyrenhet kan konsumera utan ett andra tolkningssteg. Den är den direkta efterföljaren till Perceptron Mk1, företagets första lansering i maj 2026, och den släpptes den 25 september i samband med att Isaac 0.1- och 0.2-checkpointarna som föregick den pensionerades.

Vad Mk1.5 faktiskt returnerar

Modellen är ett förkroppsligat resonemangssystem för fysiska agenter. På ingångssidan tar den emot text, bilder, video och ljud. På utgångssidan producerar den text plus valfria strukturerade annoteringar: punkter, boxar, polygoner, klipp och spår. Spårningsutdata är den del som är värd att uppehålla sig vid. Perceptrons dokumentation beskriver ett <track>-block vars poster innehåller både en rumslig observation och den tidsstämpel den hör till, så ett 60-sekundersklipp kommer tillbaka som en sekvens av objektpositioner över tid i stället för en enda medelvärdesbildad gissning om scenen.

En andra detalj som spelar roll för alla som kopplar in detta i en pipeline med mer än en tillgång: Mk1.5 stöder ett asset_idx-fält, så en enda begäran kan referera till flera bilder eller videor och adressera dem separat. Om ditt jobb är att jämföra ett referensfoto mot en livekameraruta – en slinga för defektkontroll, ett steg för monteringsverifiering – hör det hemma i ett anrop, inte två.

Modellen stöder också begränsade svar, både JSON Schema och regex, vilket är så du omvandlar "på ett ungefär" till ett schema som din nedströmskod kan validera. Funktionsanrop stöds i chattkompletteringar, och Perceptrons hostade MCP-server använder nu som standard perceptron-mk1.5; att skicka model: "perceptron-mk1" uttryckligen är så du låser fast den tidigare standarden.

Specifikationsbladet, och vad det kostar

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

Siffrorna här är värda att säga rakt ut, eftersom de är blygsamma på sina håll där en läsare kanske inte förväntar sig det. Kontextfönstret är 36 864 tokens – inte en miljon, inte 256K. Maximal utdata är 8 192 tokens. Det här är inte en modell man ger en tvåtimmarsvideo och en 300-sidig manual. Den är dimensionerad för en snäv perceptionsuppgift med ett strukturerat svar.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• Kontext — 36 864 tokens, jämfört med 32K-fönstret som Perceptron Mk1 levererades med
• Maximal utdata — 8 192 tokens
• Indata — text, bilder, video, ljud (WAV, MP3, FLAC)
• Cachad indata — $0.0375/M, en fjärdedel av standardpriset för indata på $0.15/M
• Utdata — $1.50/M
• Resonemangsstyrning — reasoning_effort på high, medium, low, minimal eller none, med standardvärdet high

Den sista raden är en breaking change i förklädnad. Mk1.5 ersätter den gamla vision_config.enable_thinking-booleanen med reasoning_effort, så alla förfrågningar du byggde mot den tidigare modellen behöver redigeras snarare än bara pekas om. Standardvärdet high är värt att lägga märke till av en annan anledning: om du inte anger fältet köper du den dyraste resonemangsvägen vid varje anrop.

Ljud och video som har sitt eget ljudspår

Ljudinmatning är verkligen nytt här. Perceptron tar emot den på tre sätt – inline input_audio, en audio_url, eller ett audio_file_id – med ett tak på 16 384 ljudtoken per objekt. Dokumentationen uppskattar det till ungefär 21,8 minuters tal vid cirka 750 token per minut, vilket är en rimlig budget för en inspelning av en skiftöverlämning eller en underhållslogg.

Mer ovanligt är videospåret. Som standard läser Mk1.5 video som bildrutor och ignorerar ljudspåret. Att sätta vision_config.enable_audio_in_video: true slår på ljudspåret igen, vilket är inställningen du vill ha för allt där bruset är signalen — en maskin som låter fel innan den ser fel ut, en muntlig instruktion som ges utanför kameran, ett larm i bakgrunden vid en rundvandring på en anläggning. Den är avstängd som standard, så en video med ett hörbart fel analyseras tyst som en stumfilm om du inte begär något annat.

Benchmarkbilden, med källhänvisningen tydligt angiven

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

Alla siffror nedan kommer från Perceptrons eget tillkännagivande och mättes av Perceptron. Det finns ingen indexpost i Artificial Analysis och ingen arena-poäng för vare sig Mk1.5 eller dess föregångare, så det finns inget tredjepartstal någonstans i denna jämförelse att ställa mot dem. Betrakta siffrorna som en leverantörs påstående om sin egen produkt, inte som ett neutralt resultat.

För egocentrisk handspårning är gapet stort och specifikt: Mk1.5 får 0,9433 på hand_boxjämfört med 0,4467 för Gemini 3.1 Pro och 0,6179 för den bästa Gemini-modellen i Perceptrons körning, som tillkännagivandet identifierar som Gemini 3.8 Flash. Det är de +111 % och +53 % som lanseringsinlägget lyfter fram, och det är den starkaste enskilda siffran i releasen.

Inom allmän egocentrisk videoförståelse är läget mycket jämnare. Perceptron rapporterar EgoSchema på 80,40 för Mk1.5 mot 81,20 för Gemini 3.8 Flash – en förlust på 0,80 poäng – samtidigt som man hävdar ett försprång på 12 % på delmängden EgoSchema-hard med 63,75. En modell som vinner klart på finkornig handgeometri och förlorar med knapp marginal på det breda förståelsebenchmarket är en specifik typ av verktyg, och den säljs som ett sådant.

Videoobjektsegmentering hamnar på 0,647 center-F1 och 0,628 point-HOTA på Molmo2-Track. Perceptron säger att det ligger före Molmo2-Track, Ref-DAVIS17 och ReasonVOS, medan det ligger efter MolmoPoint-8B på MeViS valid_u. Mot Qwen-visionlinjen är spårningsjämförelsen värd att läsa noggrant: tillkännagivandet anger Qwen3-VL-8B till 0,180 center-F1 från dess artikel, och Qwen3.5-27B till 0,530 och 0,476 — olika checkpoints, olika utvärderingsupplägg, och ett artikelvärde i samma kolumn som uppmätta värden. Det är inte en rad som är direkt jämförbar.

Ljudresultat rapporteras som DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 och AVHBench 80,56, utan att någon jämförelserad bifogas. Vid multimodal sökning med verktyg aktiverade uppnår Mk1.5 56,0 på LiveVQA-W från en majoritetsröstning över fyra prover, mot 53,2 för Gemini 3.8 Flash med Google Search-grounding, 51,0 för GPT-6 sol med OpenAI webbsökning och 33,2 för GPT-5.2 online. Perceptron hävdar också en förbättring på 36,1 punkter på MMSearch när verktygen slås på. Majoritetsröstning över fyra prover är en legitim teknik och den smickrar resultatet jämfört med en enda greedy-körning, så 56,0 och 53,2 är inte uppmätta på samma sätt.

Latens, och hur 4,7× mättes

Snabbhetspåståendet är det som med störst sannolikhet citeras utan sitt sammanhang, så här är sammanhanget. Perceptron rapporterar upp till 4,7× snabbare end-to-end från ett medianvärde av tre körningar på en enda H100, med LMArena-prompter begränsade till svar på 256 tokens, plus MIA-Bench och Video-MME med Perception Test. 4,7× gäller chattfallet: 5,2 sekunder ned till 1,1. Frågebesvarande för bilder går från 1,7 sekunder till 0,51, vilket är ungefär 3,3×. En 60-sekundersvideo som bearbetas åtta åt gången går från 19 sekunder till 9,1, ungefär 2,1×.

Så rubriksiffran är den bästa av de tre, inte det typiska fallet. På en enda H100, för korta svar, är chattvägen verkligen 4,7× snabbare. På videobelastningen som en förkroppsligad agent faktiskt skulle köra, är den närmare 2×. Båda är bra siffror; bara en av dem är rubriken.

Isaac 0.1 och 0.2 togs ur bruk samma dag

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Mk1.5-ändringsloggen har en andra post daterad den 25 september, och det är den som biter för alla som redan är i produktion. Modell-ID:na isaac-0.1, isaac-0.2-1b och isaac-0.2-2b-preview togs bort från Perceptron API. De visas inte längre i GET /v1/models, de har försvunnit från den hostade MCP-servern, och förfrågningar som namnger dem misslyckas nu med HTTP 404 model_not_found.

Det finns en andra beteendeförändring dold i samma post som kommer att drabba kod som aldrig ens nämnde Isaac-modellerna: okända modell-ID:n returnerar nu 404 i stället för det tidigare 400. Återförsökslogik, felgrenar eller larmregler som matchade på en 400 för ett felaktigt modellnamn matchar nu ingenting. Migreringsvägen som Perceptron ger är perceptron-mk1.5.

Att pensionera en modellfamilj samma dag som man släpper dess ersättare är en smidig migrationshistoria och en hård sådan. Om du pinnade Isaac för att det fungerade har du en deadline som redan har passerat.

Var man kan köra det, och hur man kan testa det utan att satsa på det

Tillgängligheten sker via leverantörens eget API och flera tredjepartsplattformar. OrcaRouter dirigerar för närvarande inte Perceptron Mk1.5 — modellen finns inte i vår katalog — så den ärliga vägledningen är att gå direkt till api.perceptron.inc för det, vilket är precis vad SDK:n och miljövariabeln PERCEPTRON_API_KEY är till för.

Vad som ändå är värt att säga, eftersom det gäller beslutet snarare än modellen: en två dagar gammal checkpoint med ett fönster på 36 864 token och ett resonemangsstandardvärde satt till high är precis profilen för något man inte bör lägga på en produktionsväg utan att först ha tittat på det. Kör den mot dina egna frames först, och mät två saker särskilt — huruvida de strukturerade utdata överlever dina faktiska edge cases, och vad reasoning_effort: "high" kostar dig per anrop jämfört med att gå ner till medium eller low. Det andra är en ändring på en rad med direkt effekt på din faktura, och det är det billigaste experimentet i den här utgåvan.

Det bredare mönstret som detta passar in i – perceptionsmodeller som returnerar geometri i stället för adjektiv – är ett som OrcaRouter är byggd för att absorbera. Ett API täcker över 200 modeller med leverantörernas listpriser vidarebefordrade med 0 % påslag, så en prisändring från en leverantör på någon av dem slår igenom hos oss samma dag, och automatisk failover innebär att ett perceptionsanrop kan falla tillbaka på en andra modell i stället för att begäran misslyckas. Om Mk1.5 är det enda som klarar din noggrannhetsribba hjälper inget av det dig idag. Om det är en kandidat bland flera är det billigare att köra jämförelsen via en enda slutpunkt än att koppla upp ett andra SDK för att ta reda på det.

Vad den här utgåvan är och inte är

Perceptron Mk1.5 är ett fokuserat verktyg med en ovanligt ärlig uppsättning begränsningar kopplade till den. Den returnerar koordinater, inte bara en beskrivning. Den läser in ljud, inklusive ljudspåret i en video om du slår på funktionen. Den är snabb på korta chattsvar. Den är också en 36 864-tokenmodell med ett utdatatak på 8 192 token, prissatt till $0,15 och $1,50, benchmarkad helt och hållet av sin egen leverantör, och såld av ett företag som pensionerade den föregående generationen i samma post i ändringsloggen.

Om ditt problem är "hitta handen, följ den genom klippet, berätta för mig var den tog vägen och när", är hand-box-siffran den du bör testa. Om ditt problem är bred videoförståelse mot en frontier-generalist, tyder EgoSchema-raden – 80,40 mot 81,20 – på att du köper en specialist till i stort sett samma nivå, och argumentet för att byta måste komma från den strukturerade utdatan och latensen, inte från träffsäkerheten.