
Perceptron Mk1.5 wprowadza ustrukturyzowane dane wyjściowe przestrzenne dla agentów ucieleśnionych — i tego samego dnia wysyła Isaaca na emeryturę
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 578 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 182 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Perceptron Mk1.5 jest już ogólnie dostępny, a ciekawą rzeczą w nim nie jest tabela wyników — lecz to, co wraca w treści odpowiedzi. Zapytaj zwykły model językowo-wizyjny, gdzie znajduje się wózek widłowy, a otrzymasz zdanie. Zapytaj Perceptron Mk1.5 o klatkę wideo, a obok jego tekstu możesz otrzymać geometrię możliwą do przetworzenia maszynowo: punkt, ramkę ograniczającą, wielokąt, klip albo <track> element przenoszący opatrzone znacznikami czasu obserwacje przestrzenne w całym pliku. To różnica między modelem, który opisuje scenę, a modelem, który sterownik robota może wykorzystać bez drugiego etapu parsowania. Jest to bezpośredni następca Perceptron Mk1, pierwszego wydania firmy w maju 2026 r., i został udostępniony 25 września wraz z wycofaniem poprzedzających go checkpointów Isaac 0.1 i 0.2.
Co Mk1.5 tak naprawdę zwraca
Model jest ucieleśnionym systemem rozumowania dla agentów fizycznych. Po stronie wejścia przyjmuje tekst, obrazy, wideo i dźwięk. Po stronie wyjścia generuje tekst oraz opcjonalne ustrukturyzowane adnotacje: punkty, ramki, wielokąty, klipy i ścieżki. To nad wynikami śledzenia warto się zatrzymać. Dokumentacja Perceptron opisuje blok <track>, którego wpisy zawierają zarówno obserwację przestrzenną, jak i znacznik czasu, do którego należy, dzięki czemu 60-sekundowy klip wraca jako sekwencja pozycji obiektów w czasie, a nie jako pojedyncze uśrednione przypuszczenie dotyczące sceny.
Drugi szczegół, który ma znaczenie dla każdego, kto podłącza to do potoku z więcej niż jednym zasobem: Mk1.5 obsługujeasset_idx jako pole, dzięki czemu pojedyncze żądanie może odwoływać się do wielu obrazów lub filmów i adresować je osobno. Jeśli Twoim zadaniem jest porównywanie zdjęcia referencyjnego z klatką z kamery na żywo — pętla sprawdzania defektów, etap weryfikacji montażu — to powinno znaleźć się w jednym wywołaniu, a nie w dwóch.
Model obsługuje również odpowiedzi z ograniczeniami, zarówno w formie JSON Schema, jak i wyrażeń regularnych — to właśnie w ten sposób zamieniasz „mniej więcej tak" w schemat, który Twój dalszy kod może zweryfikować. Wywoływanie funkcji jest obsługiwane w uzupełnieniach czatu, a hostowany serwer MCP Perceptrona domyślnie korzysta teraz z perceptron-mk1.5; jawne przekazanie model: "perceptron-mk1" jest sposobem na przypięcie poprzedniej wartości domyślnej.
Karta specyfikacji i ile to kosztuje

Te liczby warto podać wprost, ponieważ są skromne w miejscach, których czytelnik może się nie spodziewać. Okno kontekstu wynosi 36 864 tokeny — nie milion, nie 256 tys. Maksymalna długość wyjścia to 8 192 tokeny. To nie jest model, któremu podaje się dwugodzinny film i 300-stronicowy podręcznik. Jest dobrany do zwięzłego zadania percepcyjnego z ustrukturyzowaną odpowiedzią.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• Kontekst — 36 864 tokenów, w porównaniu z oknem 32K, z którym trafił na rynek Perceptron Mk1
• Maksymalna liczba tokenów wyjściowych — 8 192
• Dane wejściowe — tekst, obrazy, wideo, dźwięk (WAV, MP3, FLAC)
• Wejście z pamięci podręcznej — 0,0375 USD/M, czyli jedna czwarta standardowej stawki 0,15 USD/M za wejście
• Wyjście — 1,50 USD/M
• Kontrola rozumowania — reasoning_effort na poziomie wysokim, średnim, niskim, minimalnym lub wyłączonym, domyślnie wysoki
Ten ostatni wiersz to zmiana łamiąca kompatybilność w przebraniu. Mk1.5 zastępuje starą wartość logiczną vision_config.enable_thinking przez reasoning_effort, więc każde żądanie, które zbudowałeś dla poprzedniego modelu, wymaga edycji, a nie tylko przekierowania. Domyślna wartość high jest warta uwagi z innego powodu: jeśli nie ustawisz tego pola, przy każdym wywołaniu kupujesz najdroższą ścieżkę rozumowania.
Audio i wideo, które zawiera własną ścieżkę dźwiękową
Wejście audio jest tu rzeczywiście nowością. Perceptron przyjmuje je na trzy sposoby — inline input_audio, przez audio_url lub audio_file_id — z limitem 16 384 tokenów audio na element. Dokumentacja szacuje to na około 21,8 minuty mowy przy mniej więcej 750 tokenach na minutę, co stanowi rozsądny budżet na nagranie przekazania zmiany lub dziennik konserwacji.
Bardziej nietypowa jest ścieżka wideo. Domyślnie Mk1.5 odczytuje wideo jako klatki i ignoruje ścieżkę audio. Ustawienie vision_config.enable_audio_in_video: trueponownie włącza ścieżkę dźwiękową, co jest ustawieniem, którego chcesz użyć wszędzie tam, gdzie hałas jest sygnałem — maszyna, która brzmi nie tak, zanim wygląda nie tak, polecenie głosowe wydane poza kamerą, alarm w tle podczas obchodu obiektu. Domyślnie jest wyłączone, więc wideo ze słyszalną usterką zostanie po cichu przeanalizowane jako film niemy, chyba że zdecydujesz inaczej.
Obraz referencyjny z wyraźnie wskazanymi źródłami

Każda liczba poniżej pochodzi z własnego ogłoszenia firmy Perceptron i została zmierzona przez Perceptron. Nie ma wpisu w indeksie Artificial Analysis ani wyniku arena dla Mk1.5 ani jego poprzednika, więc w tym porównaniu nie ma żadnych liczb od stron trzecich, które można by im przeciwstawić. Traktuj te liczby jako twierdzenie dostawcy o własnym produkcie, a nie jako neutralny wynik.
W egocentrycznym śledzeniu dłoni różnica jest duża i konkretna: Mk1.5 osiąga 0,9433 na hand_box wobec 0,4467 dla Gemini 3.1 Pro i 0,6179 dla najlepszego Gemini w teście Perceptrona, którego ogłoszenie identyfikuje jako Gemini 3.8 Flash. To są +111% i +53%, od których zaczyna wpis premierowy, i to najmocniejsza pojedyncza liczba w tym wydaniu.
W przypadku ogólnego rozumienia wideo egocentrycznego obraz jest znacznie bardziej wyrównany. Perceptron podaje wynik EgoSchema na poziomie 80,40 dla Mk1.5 w porównaniu z 81,20 dla Gemini 3.8 Flash — strata 0,80 punktu — jednocześnie twierdząc, że ma 12% przewagi w podzbiorze EgoSchema-hard z wynikiem 63,75. Model, który zdecydowanie wygrywa w zakresie szczegółowej geometrii dłoni, a wąsko przegrywa w szerokim benchmarku rozumienia, jest specyficznym rodzajem narzędzia — i jako takie jest sprzedawany.
Segmentacja obiektów wideo osiąga 0.647 center-F1 i 0.628 point-HOTA na Molmo2-Track. Perceptron twierdzi, że prowadzi to na Molmo2-Track, Ref-DAVIS17 i ReasonVOS, ale pozostaje za MolmoPoint-8B na MeViS valid_u. W zestawieniu z linią wizyjną Qwen porównanie śledzenia warto czytać uważnie: ogłoszenie podaje Qwen3-VL-8B na poziomie 0.180 center-F1 z jego pracy oraz Qwen3.5-27B na 0.530 i 0.476 — inne checkpointy, inne konfiguracje ewaluacji, a liczba z pracy znajduje się w tej samej kolumnie co wyniki zmierzone. To nie jest wiersz porównywalny jeden do jednego.
Wyniki audio są podawane jako DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 i AVHBench 80,56, bez dołączonego wiersza porównawczego. W wyszukiwaniu multimodalnym z włączonymi narzędziami Mk1.5 osiąga 56,0 na LiveVQA-W na podstawie głosowania większościowego z czterech próbek, wobec 53,2 dla Gemini 3.8 Flash z ugruntowaniem Google Search, 51,0 dla GPT-6 sol z wyszukiwaniem internetowym OpenAI i 33,2 dla GPT-5.2 online. Perceptron twierdzi również, że zyskuje 36,1 punktu na MMSearch po włączeniu narzędzi. Głosowanie większościowe na podstawie czterech próbek to uzasadniona technika i zawyża wynik w stosunku do pojedynczego przebiegu zachłannego, więc 56,0 i 53,2 nie są mierzone w ten sam sposób.
Opóźnienie i sposób, w jaki zmierzono 4,7×
Twierdzenie o szybkości jest tym, które najczęściej bywa cytowane bez kontekstu, więc oto kontekst. Perceptron podaje nawet 4,7× szybciej end-to-end na podstawie mediany z trzech przebiegów na pojedynczym H100, przy użyciu promptów LMArena z odpowiedziami ograniczonymi do 256 tokenów, a także MIA-Bench i Video-MME z Perception Test. Wartość 4,7× dotyczy przypadku czatu: z 5,2 sekundy do 1,1. Odpowiadanie na pytania dotyczące obrazów: z 1,7 sekundy do 0,51, czyli około 3,3×. 60-sekundowe wideo przetwarzane po osiem naraz: z 19 sekund do 9,1, czyli około 2,1×.
A więc mnożnik z nagłówka to najlepszy z trzech, a nie typowy przypadek. Na pojedynczym H100, przy krótkich odpowiedziach, ścieżka czatu jest naprawdę 4,7× szybsza. W przypadku obciążenia wideo, które rzeczywiście uruchamiałby ucieleśniony agent, jest bliżej 2×. Obie liczby są dobre; tylko jedna z nich trafia do nagłówka.
Isaac 0.1 i 0.2 zostały wycofane tego samego dnia

W dzienniku zmian Mk1.5 znajduje się drugi wpis z 25 września — i to ten, który ma znaczenie dla każdego, kto już pracuje na produkcji. Następujące identyfikatory modeli: isaac-0.1, isaac-0.2-1b i isaac-0.2-2b-preview zostały wycofane z Perceptron API. Nie pojawiają się już w GET /v1/models, zniknęły z hostowanego serwera MCP, a żądania wymieniające je kończą się teraz błędem HTTP 404 model_not_found.
W tym samym wpisie kryje się druga zmiana w zachowaniu, która ugryzie kod, który w ogóle nie wspominał o modelach Isaac: nieznane identyfikatory modeli zwracają teraz 404 zamiast poprzedniego 400. Wszelka logika ponawiania, gałąź obsługi błędów lub reguła alertowania, które dopasowywały się do 400 dla błędnej nazwy modelu, teraz nie dopasowują się do niczego. Ścieżka migracji podana przez Perceptron to perceptron-mk1.5.
Wycofanie rodziny modeli tego samego dnia, w którym wypuszczasz jej następcę, to czysta historia migracji — i brutalna. Jeśli przypiąłeś Isaaca, bo działał, masz termin, który już minął.
Gdzie to uruchomić i jak to wypróbować bez obstawiania tego
Dostępność zapewnia własne API dostawcy oraz kilka platform firm trzecich. OrcaRouter obecnie nie kieruje ruchu do modelu Perceptron Mk1.5 — nie ma go w naszym katalogu — więc uczciwa rada jest taka, aby zwrócić się bezpośrednio do api.perceptron.inc, i właśnie do tego służy SDK oraz PERCEPTRON_API_KEY jako zmienna środowiskowa.
Co warto powiedzieć, ponieważ dotyczy to decyzji, a nie modelu: dwudniowy checkpoint na oknie 36 864 tokenów z domyślnym ustawieniem rozumowania na high to dokładnie profil czegoś, czego nie należy umieszczać na ścieżce produkcyjnej bez wcześniejszego sprawdzenia. Uruchom go najpierw na własnych ramkach i zmierz dwie rzeczy: czy strukturalne wyjścia przetrwają twoje rzeczywiste przypadki brzegowe oraz ile reasoning_effort: "high" kosztuje cię za wywołanie w porównaniu z obniżeniem do medium lub low. Ta druga to zmiana jednej linii, która ma bezpośredni wpływ na twój rachunek, i jest to najtańszy eksperyment w tym wydaniu.
Szerszy wzorzec, w który się to wpisuje — modele percepcji zwracające geometrię, a nie przymiotniki — to coś, do czego OrcaRouter został stworzony. Jedno API obejmuje ponad 200 modeli, a ceny katalogowe dostawców są przekazywane z 0% marżą, więc zmiana ceny przez dostawcę któregokolwiek z nich jest u nas widoczna tego samego dnia, a automatyczne przełączanie awaryjne sprawia, że wywołanie percepcji może zostać przekierowane na drugi model, zamiast kończyć się niepowodzeniem żądania. Jeśli Mk1.5 jest jedynym modelem, który spełnia twoje kryterium dokładności, nic z tego nie pomoże ci dzisiaj. Jeśli jest jednym z kilku kandydatów, przeprowadzenie porównania przez jeden punkt końcowy jest tańsze niż podłączanie drugiego SDK, żeby się o tym przekonać.
Czym jest to wydanie, a czym nie jest
Perceptron Mk1.5 to wyspecjalizowane narzędzie z niezwykle uczciwym zestawem ograniczeń. Zwraca współrzędne, nie tylko opis. Odczytuje dźwięk, w tym ścieżkę dźwiękową wideo, jeśli ją włączysz. Jest szybki w krótkich odpowiedziach czatu. To także model o 36 864 tokenach z limitem wyjściowym 8 192 tokenów, w cenie 0,15 i 1,50 USD, benchmarkowany w całości przez własnego dostawcę i sprzedawany przez firmę, która wycofała poprzednią generację w tym samym wpisie changelogu.
Jeśli twoim problemem jest „znajdź dłoń, śledź ją przez cały klip, powiedz mi, gdzie poszła i kiedy”, to właśnie liczbę hand-box warto sprawdzić. Jeśli twoim problemem jest szerokie rozumienie wideo w porównaniu z czołowym generalistą, wynik EgoSchema — 80,40 wobec 81,20 — sugeruje, że kupujesz specjalistę na mniej więcej równym poziomie, a argument za przesiadką musi wynikać z ustrukturyzowanego wyjścia i opóźnienia, a nie z dokładności.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
