
Perceptron Mk1.5 Menghadirkan Keluaran Spasial Terstruktur bagi Agen Berwujud — dan Memensiunkan Isaac pada Hari yang Sama
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 578 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 182 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Perceptron Mk1.5 kini tersedia secara umum, dan hal yang menarik darinya bukanlah tabel tolok ukur — melainkan apa yang dikembalikan di dalam isi respons. Tanyakan kepada model visi-bahasa biasa di mana forklift berada dan Anda akan mendapatkan sebuah kalimat. Tanyakan kepada Perceptron Mk1.5 pada sebuah bingkai video dan, bersama dengan prosanya, Anda bisa mendapatkan geometri yang dapat diurai mesin: sebuah titik, kotak pembatas, poligon, klip, atau <track> elemen yang membawa observasi spasial bertanda waktu di seluruh berkas. Itulah perbedaan antara model yang mendeskripsikan pemandangan dan model yang dapat dikonsumsi oleh pengendali robot tanpa tahap penguraian kedua. Ini adalah penerus langsung Perceptron Mk1, rilis pertama perusahaan pada Mei 2026, dan dirilis pada 25 September bersamaan dengan pensiunnya checkpoint Isaac 0.1 dan 0.2 yang mendahuluinya.
Apa yang sebenarnya dikembalikan oleh Mk1.5
Model ini adalah sistem penalaran berwujud untuk agen fisik. Di sisi masukan, model ini menerima teks, gambar, video, dan audio. Di sisi keluaran, model ini menghasilkan teks plus anotasi terstruktur opsional: titik, kotak, poligon, klip, dan track. Keluaran pelacakan adalah bagian yang layak ditelaah. Dokumentasi Perceptron menjelaskan blok <track> yang entri-entrinya membawa observasi spasial sekaligus stempel waktu yang terkait, sehingga klip berdurasi 60 detik kembali sebagai urutan posisi objek dari waktu ke waktu alih-alih satu tebakan rata-rata tentang pemandangan.
Detail kedua yang penting bagi siapa pun yang menghubungkan ini ke dalam pipeline dengan lebih dari satu aset: Mk1.5 mendukung asset_idx sebagai field, sehingga satu permintaan dapat merujuk ke beberapa gambar atau video dan menanganinya secara terpisah. Jika tugas Anda membandingkan foto referensi dengan frame kamera langsung — loop pemeriksaan cacat, langkah verifikasi perakitan — itu seharusnya berada dalam satu panggilan, bukan dua.
Model ini juga mendukung respons yang dibatasi, baik JSON Schema maupun regex, yang merupakan cara Anda mengubah "kira-kira sudah mendekati" menjadi skema yang dapat divalidasi oleh kode downstream Anda. Pemanggilan fungsi didukung pada chat completions, dan server MCP yang dihosting Perceptron sekarang secara default menggunakan perceptron-mk1.5; meneruskan model: "perceptron-mk1" secara eksplisit adalah cara Anda menyematkan default sebelumnya.
Lembar spesifikasi, dan berapa biayanya

Angka-angka ini layak dinyatakan secara gamblang karena tergolong moderat di beberapa aspek yang mungkin tidak diduga pembaca. Jendela konteksnya adalah 36.864 token — bukan sejuta, bukan 256K. Output maksimumnya adalah 8.192 token. Ini bukan model yang bisa Anda beri video berdurasi dua jam dan manual 300 halaman. Model ini dirancang untuk tugas persepsi yang ketat dengan jawaban terstruktur.
Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.
• Konteks — 36.864 token, dibandingkan dengan jendela 32K yang disertakan pada Perceptron Mk1
• Output maksimum — 8.192 token
• Input — teks, gambar, video, audio (WAV, MP3, FLAC)
• Input yang di-cache — $0,0375/M, seperempat dari tarif input standar $0,15/M
• Output — $1,50/M
• Kontrol penalaran — reasoning_effort pada high, medium, low, minimal, atau none, dengan default high
Baris terakhir itu adalah breaking change yang terselubung. Mk1.5 menggantikan vision_config.enable_thinking boolean lama dengan reasoning_effort, jadi setiap permintaan yang Anda buat untuk model sebelumnya perlu diedit, bukan sekadar diarahkan ulang. Default high patut diperhatikan karena alasan lain: jika Anda tidak mengatur field tersebut, Anda membeli jalur penalaran paling mahal pada setiap panggilan.
Audio, dan video yang membawa soundtrack-nya sendiri
Masukan audio benar-benar baru di sini. Perceptron menerimanya dengan tiga cara — secara inline input_audio, sebuah audio_url, atau sebuah audio_file_id — dengan batas 16.384 token audio per item. Dokumennya memperkirakan itu sekitar 21,8 menit ucapan pada sekitar 750 token per menit, yang merupakan anggaran wajar untuk rekaman serah terima shift atau log pemeliharaan.
Yang lebih tidak biasa adalah jalur video. Secara default, Mk1.5 membaca video sebagai frame dan mengabaikan trek audio. Pengaturan vision_config.enable_audio_in_video: true menyalakan kembali audio, yang merupakan pengaturan yang Anda inginkan untuk apa pun yang kebisingannya adalah sinyal — mesin yang terdengar salah sebelum terlihat salah, instruksi lisan yang diberikan di luar kamera, alarm di latar belakang saat penelusuran lokasi. Fitur ini nonaktif secara default, jadi video dengan gangguan yang dapat terdengar akan dianalisis secara diam-diam sebagai film bisu kecuali Anda meminta sebaliknya.
Gambaran benchmark, dengan sumber yang dinyatakan secara eksplisit

Setiap angka di bawah ini berasal dari pengumuman Perceptron sendiri dan diukur oleh Perceptron. Tidak ada entri indeks Artificial Analysis dan tidak ada skor arena untuk Mk1.5 maupun pendahulunya, jadi tidak ada angka pihak ketiga di mana pun dalam perbandingan ini untuk dijadikan pembanding bagi angka-angka tersebut. Perlakukan angka-angka itu sebagai klaim vendor tentang produknya sendiri, bukan sebagai hasil yang netral.
Pada pelacakan tangan egosentris, kesenjangannya lebar dan spesifik: Mk1.5 mencetak 0,9433 pada hand_boxdibandingkan dengan 0,4467 untuk Gemini 3.1 Pro dan 0,6179 untuk Gemini terbaik dalam uji coba Perceptron, yang dalam pengumuman diidentifikasi sebagai Gemini 3.8 Flash. Itulah +111% dan +53% yang menjadi andalan postingan peluncuran, dan itu adalah angka tunggal terkuat dalam rilis ini.
Dalam pemahaman video egosentris secara umum, gambarannya jauh lebih ketat. Perceptron melaporkan EgoSchema pada 80,40 untuk Mk1.5 berbanding 81,20 untuk Gemini 3.8 Flash — kalah 0,80 poin — sekaligus mengklaim keunggulan 12% pada subset EgoSchema-hard di 63,75. Model yang menang secara meyakinkan pada geometri tangan yang terperinci tetapi kalah tipis pada tolok ukur pemahaman yang luas adalah jenis alat yang spesifik, dan ia dijual sebagai alat seperti itu.
Segmentasi objek video mencapai 0,647 center-F1 dan 0,628 point-HOTA pada Molmo2-Track. Perceptron mengatakan bahwa itu memimpin Molmo2-Track, Ref-DAVIS17, dan ReasonVOS, tetapi tertinggal dari MolmoPoint-8B pada MeViS valid_u. Dibandingkan dengan lini visi Qwen, perbandingan pelacakan ini patut dibaca dengan cermat: pengumuman tersebut mencantumkan Qwen3-VL-8B pada 0,180 center-F1 dari makalahnya, dan Qwen3.5-27B pada 0,530 dan 0,476 — checkpoint yang berbeda, pengaturan evaluasi yang berbeda, dan angka dari makalah yang berada di kolom yang sama dengan angka hasil pengukuran. Itu bukan baris yang setara.
Hasil audio dilaporkan sebagai DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05, dan AVHBench 80,56, tanpa baris perbandingan yang disertakan. Pada pencarian multimodal dengan alat diaktifkan, Mk1.5 mencatat 56,0 pada LiveVQA-W dari pemungutan suara mayoritas empat sampel, dibandingkan 53,2 untuk Gemini 3.8 Flash dengan grounding Google Search, 51,0 untuk GPT-6 sol dengan pencarian web OpenAI, dan 33,2 untuk GPT-5.2 online. Perceptron juga mengklaim kenaikan 36,1 poin pada MMSearch setelah alat diaktifkan. Pemungutan suara mayoritas atas empat sampel adalah teknik yang sah dan membuat skor tampak lebih baik dibandingkan satu lintasan greedy tunggal, sehingga 56,0 dan 53,2 tidak diukur dengan cara yang sama.
Latensi, dan bagaimana 4,7× diukur
Klaim kecepatan adalah yang paling mungkin dikutip tanpa konteksnya, jadi inilah konteksnya. Perceptron melaporkan hingga 4,7× lebih cepat secara end-to-end dari median tiga kali pengujian pada satu H100, menggunakan prompt LMArena dengan jawaban dibatasi 256 token, plus MIA-Bench dan Video-MME dengan Perception Test. Angka 4,7× adalah kasus chat: dari 5,2 detik menjadi 1,1. Tanya jawab gambar dari 1,7 detik menjadi 0,51, yaitu sekitar 3,3×. Video 60 detik yang diproses delapan sekaligus dari 19 detik menjadi 9,1, sekitar 2,1×.
Jadi, kelipatan utama adalah yang terbaik dari ketiganya, bukan kasus tipikal. Pada satu H100, untuk jawaban pendek, jalur chat benar-benar 4,7× lebih cepat. Pada beban kerja video yang benar-benar akan dijalankan oleh agen berwujud, nilainya lebih mendekati 2×. Keduanya angka yang bagus; hanya satu di antaranya yang menjadi angka utama.
Isaac 0.1 dan 0.2 dipensiunkan pada hari yang sama

Catatan perubahan Mk1.5 memuat entri kedua bertanggal 25 September, dan entri itulah yang berdampak bagi siapa pun yang sudah berada di produksi. isaac-0.1, isaac-0.2-1b dan isaac-0.2-2b-preview adalah ID model yang telah dipensiunkan dari API Perceptron. ID model tersebut tidak lagi muncul di GET /v1/models, ID model tersebut sudah tidak ada di server MCP yang dihosting, dan permintaan yang menyebutkannya kini gagal dengan HTTP 404 model_not_found.
Ada perubahan perilaku kedua yang tersembunyi di entri yang sama yang akan berdampak pada kode yang sama sekali tidak menyebut model Isaac: ID model yang tidak dikenal sekarang mengembalikan 404 alih-alih 400 sebelumnya. Logika percobaan ulang, cabang error, atau aturan peringatan apa pun yang mencocokkan 400 untuk nama model yang tidak valid sekarang tidak mencocokkan apa pun. Jalur migrasi yang diberikan Perceptron adalah perceptron-mk1.5.
Memensiunkan sebuah keluarga model pada hari yang sama dengan peluncuran penggantinya adalah cerita migrasi yang mulus sekaligus keras. Jika Anda memakai Isaac karena ia berfungsi, Anda memiliki tenggat waktu yang sudah terlewat.
Di mana menjalankannya, dan bagaimana mencobanya tanpa harus bertaruh padanya
Ketersediaan disediakan melalui API milik vendor sendiri dan beberapa platform pihak ketiga. OrcaRouter saat ini tidak merutekan Perceptron Mk1.5 — model tersebut tidak ada dalam katalog kami — jadi panduan yang jujur adalah mengakses langsung ke api.perceptron.inc untuk mendapatkannya, yang memang merupakan fungsi SDK dan variabel lingkungan PERCEPTRON_API_KEY.
Apa yang tetap layak dikatakan, karena ini berlaku pada keputusan, bukan pada modelnya: checkpoint berusia dua hari pada jendela 36.864 token dengan default penalaran yang disetel ke high tepatnya adalah profil sesuatu yang seharusnya tidak Anda tempatkan di jalur produksi tanpa diperiksa terlebih dahulu. Jalankan dulu terhadap frame Anda sendiri, dan ukur dua hal secara spesifik — apakah output terstruktur bertahan pada kasus tepi aktual Anda, dan berapa biaya reasoning_effort: "high" per panggilan dibandingkan menurunkannya ke medium atau low. Yang kedua adalah perubahan satu baris dengan efek langsung pada tagihan Anda, dan itu eksperimen termurah dalam rilis ini.
Pola yang lebih luas yang cocok dengan ini — model persepsi yang mengembalikan geometri alih-alih kata sifat — adalah pola yang dirancang untuk diserap OrcaRouter. Satu API mencakup lebih dari 200 model dengan harga daftar penyedia yang diteruskan pada markup 0%, sehingga perubahan harga vendor pada salah satu model langsung berlaku di sisi kami pada hari yang sama, dan failover otomatis berarti panggilan persepsi dapat beralih ke model kedua alih-alih menggagalkan permintaan. Jika Mk1.5 adalah satu-satunya yang memenuhi standar akurasi Anda, semua itu tidak membantu Anda hari ini. Jika ia salah satu kandidat di antara beberapa, menjalankan perbandingan melalui satu endpoint lebih murah daripada menyiapkan SDK kedua hanya untuk mengetahuinya.
Apa yang termasuk dalam rilis ini dan apa yang tidak
Perceptron Mk1.5 adalah alat yang terfokus dengan kumpulan batasan yang jujur secara tidak biasa yang melekat padanya. Alat ini mengembalikan koordinat, bukan sekadar deskripsi. Alat ini membaca audio, termasuk soundtrack sebuah video jika Anda menyalakannya. Alat ini cepat untuk jawaban chat singkat. Alat ini juga model 36.864 token dengan plafon keluaran 8.192 token, dihargai $0.15 dan $1.50, di-benchmark sepenuhnya oleh vendornya sendiri, dan dijual oleh perusahaan yang memensiunkan generasi sebelumnya dalam entri changelog yang sama.
Jika masalah Anda adalah "temukan tangan, lacak di sepanjang klip, beri tahu saya ke mana ia pergi dan kapan," angka hand-box adalah yang perlu diuji. Jika masalah Anda adalah pemahaman video yang luas dibandingkan dengan generalis terdepan, skor EgoSchema — 80,40 versus 81,20 — menunjukkan bahwa Anda membeli spesialis pada tingkat yang kira-kira setara, dan argumen untuk beralih harus datang dari output terstruktur dan latensi, bukan dari akurasi.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
