Perceptron Mk1.5 的主視覺標題卡,副標題為「為具身代理提供的結構化空間輸出」,標題上方有三個扁平線性圖示:一個圍繞小物件繪製的邊界框、一條帶有兩個路徑點的虛線運動軌跡,以及一道聲波。OrcaRouter 標誌位於右下角。
Guides & Insights

{{1}}Perceptron Mk1.5{{/1}} 為具身代理帶來結構化空間輸出——並在同日讓 {{2}}Isaac{{/2}} 退役

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Perceptron Mk1.5 現已正式推出,而它真正有意思的地方不在於那張基準測試表——而在於回應主體中回傳的內容。問一般視覺語言模型堆高機在哪裡,你只會得到一句話。在影片畫面上詢問 Perceptron Mk1.5,除了它的文字描述之外,你還可以取得機器可解析的幾何資料:一個點、一個邊界框、一個多邊形、一個片段,或是一個 <track> 元素,承載著橫跨整個檔案、附有時間戳記的空間觀測結果。這就是一個只會描述場景的模型,與一個能讓機器人控制器無須第二階段解析即可直接取用的模型之間的差別。它是該公司於 2026 年 5 月首度發布的 Perceptron Mk1 的直接後繼者,並於 9 月 25 日推出,同時其前身 Isaac 0.1 與 0.2 檢查點也一併退役。

Mk1.5 實際上回傳什麼

該模型是為實體代理打造的具身推理系統。在輸入端,它接收文字、圖像、影片與音訊。在輸出端,它產生文字以及可選的結構化標註:點、邊框、多邊形、片段與軌跡。追蹤輸出是值得細究的部分。Perceptron 的文件描述了一個 <track> 區塊,其條目同時帶有空間觀測值與其所屬的時間戳,因此一段 60 秒的影片會以隨時間變化的物件位置序列回傳,而非對場景的單一平均猜測。

對任何要把這東西接進含有多個素材的流程管線的人來說,還有一個重要細節:Mk1.5 支援一個 asset_idx欄位,因此單一請求可以參照多張圖片或影片,並分別定址它們。如果你的工作是把參考照片與即時攝影機畫面進行比對——例如瑕疵檢查迴圈、組裝驗證步驟——那應該放在一次呼叫中,而不是兩次。

此模型也支援受約束的回應,包括 JSON Schema 與正則表達式,這正是將「大致到位」轉換為下游程式碼可驗證之結構描述的方法。聊天補全支援函式呼叫,而 Perceptron 的託管 MCP 伺服器現在預設為 perceptron-mk1.5;明確傳入 model: "perceptron-mk1" 就是將先前的預設值固定下來的方式。

規格表,以及它的價格

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

這裡的數字值得直白說明,因為它們在讀者可能意想不到的地方顯得不高。上下文視窗是 36,864 個 token——不是一百萬,也不是 256K。最大輸出是 8,192 個 token。這不是那種你會把兩小時影片和 300 頁手冊交給它的模型。它的規模是為了處理一項需要結構化答案的精簡感知任務。

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• 上下文 — 36,864 個 token,相較於 Perceptron Mk1 出貨時搭載的 32K 視窗
• 最大輸出 — 8,192 個 token
• 輸入 — 文字、圖像、影片、音訊(WAV、MP3、FLAC)
• 快取輸入 — 每百萬 $0.0375,是每百萬 $0.15 標準輸入費率的四分之一
• 輸出 — 每百萬 $1.50
• 推理控制 — reasoning_effort 可設為 high、medium、low、minimal 或 none,預設為 high

最後一列其實是變相的破壞性變更。Mk1.5 會取代舊有的 vision_config.enable_thinking 布林值,改用 reasoning_effort,因此任何你針對先前模型建立的請求都需要編輯,而不只是重新指向。而預設為 high 值得注意,原因不同:如果你未設定此欄位,你每次呼叫都會買到最昂貴的推理路徑。

音訊,以及帶有自身配樂的影片

音訊輸入在這裡確實是全新的。Perceptron 接受三種方式——內嵌 input_audio、audio_url,或 audio_file_id——每個項目上限為 16,384 個音訊 token。文件指出,以每分鐘約 750 個 token 計算,這大約相當於 21.8 分鐘的語音,對於交接班錄音或維護日誌來說是合理的額度。

更不尋常的是影片這條路徑。預設情況下,Mk1.5 會把影片讀取為影格,並忽略音訊軌。設定 vision_config.enable_audio_in_video: true 會重新開啟原聲帶,凡是「噪音本身就是訊號」的情況——機器在看起來不對之前聽起來就不對、在鏡頭外發出的口頭指示、廠區導覽背景中的警報聲——這正是你要的設定。它預設為關閉,因此除非你另行指定,否則帶有可聽出故障的影片會被無聲無息地當成默片來分析。

基準概況,並明確說明資料來源

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

以下每一項數據都來自 Perceptron 自家的公告,並由 Perceptron 自行量測。無論是 Mk1.5 或其前代產品,都沒有 Artificial Analysis 的索引條目,也沒有任何競技場評分,因此這份比較中沒有任何第三方數字可供對照。請將這些數據視為廠商對自家產品的宣稱,而非中立的結果。

在自我中心手部追蹤方面,差距既大又明確:Mk1.5 在 hand_box 上得分 0.9433,而 Gemini 3.1 Pro 為 0.4467,Perceptron 測試中表現最佳的 Gemini 為 0.6179,公告指出那是 Gemini 3.8 Flash。這就是發布貼文開頭主打的 +111% 與 +53%,也是本次發布中最強而有力的單一數字。

在一般第一人稱視角影片理解上,情況就接近得多。Perceptron 回報,Mk1.5 在 EgoSchema 上為 80.40,而 Gemini 3.8 Flash 為 81.20——落後 0.80 分——同時宣稱在 EgoSchema-hard 子集上以 63.75 取得 12% 的優勢。一個在細粒度手部幾何上決定性勝出、卻在廣泛理解基準上小幅落敗的模型,是某種特定類型的工具,而它正被當作這種工具來販售。

影片物件分割在 Molmo2-Track 上達到 0.647 center-F1 與 0.628 point-HOTA。Perceptron 表示這在 Molmo2-Track、Ref-DAVIS17 與 ReasonVOS 上領先,但在 MeViS valid_u 上落後 MolmoPoint-8B。相較於 Qwen 視覺系列,這項追蹤比較值得仔細閱讀:公告列出 Qwen3-VL-8B 為 0.180 center-F1(來自其論文),以及 Qwen3.5-27B 為 0.530 和 0.476——不同的檢查點、不同的評估設定,還有一個論文數字與實測數字並列在同一欄。那不是同基準的比較列。

音訊結果報告為 DailyOmni 74.67、WorldSense 50.32、OmniBench 51.05 與 AVHBench 80.56,且未附上任何比較列。在啟用工具的多模態搜尋上,Mk1.5 以四次取樣多數投票在 LiveVQA-W 拿下 56.0,相較之下,搭配 Google 搜尋依據的 Gemini 3.8 Flash 為 53.2,使用 OpenAI 網路搜尋的 GPT-6 sol 為 51.0,而線上版 GPT-5.2 為 33.2。Perceptron 也宣稱一旦開啟工具,在 MMSearch 上可獲得 36.1 分的提升。對四個樣本進行多數投票是正當的技術,而且相對於單次貪婪解碼,這麼做會讓分數顯得更好看,因此 56.0 與 53.2 並非以相同方式測得。

延遲,以及 4.7× 是如何測量的

關於速度的宣稱,是最有可能在脫離上下文的情況下被引用的說法,因此這裡提供其上下文。Perceptron 回報,在單張 H100 上取三次執行的中位數,端到端最高快 4.7 倍;使用 LMArena 提示詞並將回答上限設為 256 個 token,另加上 MIA-Bench,以及搭配 Perception Test 的 Video-MME。4.7 倍是聊天情境:從 5.2 秒降到 1.1 秒。影像問答則從 1.7 秒降到 0.51 秒,約為 3.3 倍。以一次處理八個的方式處理的 60 秒影片,從 19 秒降到 9.1 秒,大約 2.1 倍。

所以,那個被當成標題的倍數是三者中最好的,並非典型情況。在單張 H100 上,回答簡短時,聊天路徑確實快 4.7 倍。在具身代理實際會跑的影片工作負載上,則更接近 2 倍。兩個都是好數字;但只有其中一個會被當成標題。

Isaac 0.1 與 0.2 在同一天退役

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Mk1.5 更新日誌還有第二筆條目,日期為 9 月 25 日,而對任何已經在正式環境運行的人來說,這筆才是真正有殺傷力的。isaac-0.1、isaac-0.2-1b與isaac-0.2-2b-preview這幾個模型 ID 已從 Perceptron API 中退場。它們不再出現於 GET /v1/models,也已從代管的 MCP 伺服器移除,而現在指名它們的請求會失敗,並回傳 HTTP 404 model_not_found。

同一條目裡還藏有第二項行為變更,它會咬到那些完全未曾提及 Isaac 模型的程式碼:未知的模型 ID 現在會回傳 404,而非先前的 400。任何針對錯誤模型名稱而比對 400 的重試邏輯、錯誤分支或警示規則,現在都匹配不到任何東西。Perceptron 提供的遷移路徑是 perceptron-mk1.5。

在推出替代品當天就淘汰一個模型系列,是一則乾淨的遷移故事,也是一則殘酷的故事。如果你當初是因為 Isaac 能用而鎖定它,那你有一個早就過了的截止期限。

在哪裡執行它,以及如何在不押注於它的情況下試用它

可用性是透過供應商自家的 API 以及數個第三方平台取得。OrcaRouter 目前並未路由 Perceptron Mk1.5——此模型不在我們的目錄中——因此最誠實的指引是直接前往 api.perceptron.inc 取得,而這正是 SDK 與 PERCEPTRON_API_KEY 環境變數的用途所在。

無論如何,有一點還是值得說清楚,因為它關係到的是決策本身,而不是模型:一個才剛出爐兩天、掛在 36,864 個 token 視窗上、推理預設值又設為 high 的檢查點,正是那種不該在還沒親自驗證前就放上正式流程的東西。先拿你自己的 frames 跑一遍,並特別量測兩件事——結構化輸出在你的實際邊界案例下是否還撐得住,以及每次呼叫時 reasoning_effort: "high" 比降到 medium 或 low 要多花你多少成本。第二件事只需改一行,卻直接影響你的帳單,也是這次發布中最便宜的實驗。

這符合一個更大的模式——感知模型回傳的是幾何資訊,而非形容詞——而這正是 OrcaRouter 生來就要承接的。一個 API 就能涵蓋 200 多個模型,並以 0% 加價直接轉嫁供應商的定價清單,因此其中任何一家供應商調價,我們這邊當天就會同步生效,而且自動容錯移轉機制意味著感知呼叫可以改由第二個模型接手,而不是讓請求失敗。如果 Mk1.5 是唯一能達到你準確度門檻的選擇,那這一切今天都幫不上你。但如果它只是幾個候選之一,透過單一端點來做比較,會比另外接一套 SDK 來確認更划算。

本次發布是什麼,以及不是什麼

Perceptron Mk1.5 是一款專注的工具,附帶一組異常誠實的限制。它回傳的是座標,而不只是描述。它會讀取音訊,只要你開啟功能,也包括影片的音軌。它在簡短聊天回答上速度很快。它同時是一個 36,864-token 模型,輸出上限為 8,192 token,定價為 $0.15 與 $1.50,完全由其自家廠商進行基準測試,並由一家在同一則更新日誌中讓前一代退役的公司販售。

如果你的問題是「找到手、在整段影片中追蹤它、告訴我它去了哪裡、什麼時候去的」,那麼該測的就是 hand-box 的那個數字。如果你的問題是相對於前沿通用模型(frontier generalist)的廣泛影片理解,那麼 EgoSchema 那一行——80.40 對上 81.20——意味著你買到的是一個大致打成平手的專家模型,而改用它的理由必須來自結構化輸出與延遲,而不是準確率。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新