一張為 Perceptron Mk1.5 與 Qwen 3.8 的比較而生成的標題卡,主標題為「Perceptron Mk1.5 vs Qwen 3.8」,副標為「眼睛與規劃器不是同一個模型」,並有三張卡片寫著「Mk1.5:36,864 個 token,輸出座標」、「Qwen 3.8:2.4T MoE,AA Index 40」以及「接縫:影格給其中一個,規劃給另一個」,腳註為「Qwen 3.8 指數依據 Artificial Analysis」。
Guides & Insights

Perceptron Mk1.5 與 Qwen 3.8:機器人兩者都需要,而兩者皆無可替代

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

一台必須拿起東西的機器人,需要模型提供兩樣東西,而在這組搭配中,沒有任何單一模型能同時給你這兩者。Perceptron Mk1.5 回傳幾何資訊:給定影片影格,它能交回一個點、一個框、一個多邊形,或一個帶時間戳的 <track> 元素,而其上下文視窗為 36,864 個 token。Qwe​n 3.8——這個名稱對應到該供應商開放權重的 Qwen3.8-2.4T-A95B 核心——是一個 2.4 兆參數的混合專家推理模型,原生視窗為 262K,並可延伸至接近一百萬,而且它僅支援文字,因此完全無法查看影格。一個是感知層,每百萬個 token 收費 $0.15 和 $1.50;另一個是推理核心,輸入成本約為其十三倍、輸出成本約為其四倍,且在 Artificial Analysis Intelligence Index 上的獨立評分為 40,而該感知模型在任何地方都沒有獨立評分。

若把它們並列為競爭產品,它們會在不同方向上互有勝負,而這種比較產生不了任何可用的結果。若把它們並列為同一條管線的兩半,它們幾乎能解釋具身堆疊中的每一項成本與可靠性決策:影格在哪裡被解讀、計畫在哪裡被制定,以及當推理的那一半寫出比任務所需更多的詞元時,你的帳單會發生什麼事。

讓這種搭配說得通的那道分界

Perceptron Mk1.5 於 2026 年 9 月 25 日發布,是 Perceptron Mk1 的後繼產品,而它的職責有明確界定。它接受文字、圖像、影片和音訊,並回傳文字以及選用的結構化標註——點、邊界框、多邊形、片段與軌跡。<track> 輸出同時帶有空間觀測值及其所屬的時間戳,因此一段 60 秒的片段會以隨時間變化的位置回傳,而不是一個取平均後的單一猜測。asset_idx 欄位讓單一請求能分別處理多張圖像或多段影片,而這正是參考影格與即時影格比較所需要的。受約束的回應有兩種形式,JSON Schema 與 regex,而兩者的重點都在於輸出是有型別的。

Qwen 3.8 是另一種截然相反的工具。2.4T 核心是細粒度的 MoE——92 層,每層 512 個專家,其中 10 個為路由專家、另加一個共享專家,而那 92 層中有 69 層採用線性注意力——這正是如此龐大的架構得以達成其長上下文的方式。它的強項在於跨大量文本的推理:複雜的多步驟分析、冗長的推導、代理式規劃。它的不足之處則在輸入端。開放核心僅支援文字,而且它的推理無法關閉:無論你想不想要,每個回應都會以一段思考區塊開頭。

那不是推理模型的缺陷;那是感知模型的缺陷,而 Qwen 3.8 並不是感知模型。把兩者依序搭配起來,整體輪廓就顯而易見了——Mk1.5 回答「堆高機在哪裡,以及它何時移動」,Qwen 3.8 回答「有鑑於此,機械手臂該做什麼」。這兩個問題都不是另一個模型能回答的。

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Qwen 3.8 - the scoreboard', comparing six dimensions: role in a stack (perception, frames to geometry vs reasoning, text to plans); scale (hosted perception API vs 2.4T total / 95B active MoE); context (36,864 tokens vs 262K native, to roughly 1M); input (text, image, video, audio vs text only on the open core); price ($0.15 in / $1.50 out per 1M tokens vs $2.00 in / $6.00 out); and independent score ('none yet' vs AA Index 40 of 115). Footnoted that the Qwen 3.8 index is per Artificial Analysis and that all Mk1.5 figures are vendor-reported.

以實際計費的費率計算,每一半的成本是多少

• 輸入 — Perceptron Mk1.5 每百萬個 token $0.15。Qwen 3.8 在獨立測試框架所量測的託管版本上為每百萬 $2.00,套用 88% 快取折扣後,快取命中約為 $0.24。

• 輸出 — Mk1.5 每百萬 $1.50。Qwen 3.8 每百萬 $6.00。

• 快取——Mk1.5 的快取輸入為每百萬美元 $0.0375,恰好是其標準輸入費率的四分之一。Qwen 3.8 的折扣以百分比計算,但幅度更深,達 88%,因此其快取費率以絕對值而言是兩者中較便宜者,而未快取的費率則是 Mk1.5 的十倍以上。

• 每完成一項任務的成本——排名正是在這裡反轉。Artificial Analysis 將 Qwen 3.8 的每項 Intelligence Index 任務成本列為 $2.16,在同類 115 個模型中排名第 32,並在成本方面獲得四分之四的評級——儘管 token 昂貴,但每完成一項任務卻很便宜,因為該模型在數次指數測試中產生了 170M 個輸出 token,而相比之下,同場其他模型更加喋喋不休。Mk1.5 則沒有任何由任何人發布的對等數據。

• 上下文 — Mk1.5 為 36,864 個 token,相較於 Qwen 核心的原生 262K,在適當的服務配置下可擴展至一百萬。

• 推理控制 — Mk1.5 會公開 reasoning_effort 參數,可設為 high、medium、low、minimal 或 none,預設值為 high。Qwen 3.8 將思考功能強制開啟,因此每次呼叫你都得為思考權杖付費。

把那份清單讀兩遍,因為這兩個模型在成本上正好相反。以每 token 計,Mk1.5 便宜得多。以獨立基準測試中每項完成的任務計,Qwen 3.8 經測量屬便宜,而 Mk1.5 則未經測量。只有在假設兩者執行的是同一項工作時,這兩個說法才會互相矛盾,而它們並不是。

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning via reasoning_effort, function calling on chat completions, and constrained JSON Schema and regex responses) and the Pricing table below it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

這裡的證據指向相反的方向

在這一批比較中,大多數情況是開放權重那一方帶著一堆廠商自行報告的數字,而封閉 API 那一方則有第三方頁面。這裡的情況正好相反,而這個反轉值得精確指出,因為它改變了哪些東西你可以驗證、哪些不能。

Qwen 3.8 有獨立量測。Artificial Analysis Intelligence Index 將 2.4T 核心模型列為 40 分,在撰寫本文時於同級 115 個模型中排名第 5,輸出速度為每秒 39.6 個 token——在 115 個中排名第 56,屬於中段班,任何人在規劃以它為核心的互動式迴圈之前都值得知道。指數修訂會在不同快照之間變動,解讀這些數字的誠實方式是把它們視為方向性指標,但重點仍然成立:阿里巴巴以外有人跑過這個模型並公布了數字。

Perceptron Mk1.5 並沒有這種東西。Mk1.5 或其前代機型都沒有 Artificial Analysis 的條目,也沒有競技場評分,因此現存的每一項能力數據,都是 Perceptron 針對自家模型所產出的。那組數據異常具體,這一點對它有利——在廠商自家測試中,egocentric hand_box 上是 0.9433,而 Gemini 3.1 Pro 為 0.4467;EgoSchema 為 80.40,同一競爭對手則是 81.20,在廣泛理解基準上小輸,同時宣稱在較難的 EgoSchema 子集上以 63.75 取得 12% 的領先;在 Molmo2-Track 上則是 0.647 的 centre-F1 與 0.628 的 point-HOTA——但具體和經獨立驗證是兩種不同的性質,而唯有第二種才能告訴你,你的影片素材上會發生什麼事。

關於閱讀 Perceptron 這張表,有兩點提醒,而這兩點適用於任何引用該表的情況。LiveVQA-W 在啟用工具時得出的 56.0 這個數字,來自四次取樣的多數投票,而用來與之對比的 Gemini 3.8 Flash 搭配 Google Search 接地的 53.2,並非多數投票;這種做法本身站得住腳,但相對於單次貪婪推論,它會讓分數顯得好看。再者,追蹤那一列列出 Qwen3-VL-8B 的 0.180 centre-F1,數字取自該模型的論文,卻和另一個檢查點家族所實測的數字並列在同一欄。把論文數字放進實測欄位,就不是同一基準的對等列,而這正是那種最常被引用、卻不帶出處的條目。

2.4T 核心不是你可以從我們這裡呼叫的東西——但它的架構可以。

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the breadcrumb Home > Models > Qwen, the model id qwen/qwen3.8-max with text, image and video input, the $2.00 and $6.00 per million token rates and the 1,000,000-token context window stated on the page, the capabilities row covering vision, tools, JSON and reasoning, and the Qwen-published benchmark section dated 2026-08-03.

這是比較中,誠實答案與該模型名氣所暗示內容不同的那部分。Qwen 3.8 這個名稱被廣泛用來指涉其開放核心,而開放核心是一種下載,不是端點:2.4TB 的 BF16 權重,採用阿里巴巴自訂的 Qwen3.8-Max 授權條款,於 2026 年 8 月發布。我們不提供它,而且今天在我們這一側也沒有任何供應商提供它——該目錄項目是以已公告、尚未可用的追蹤頁面形式存在,而不是一條實際可用的路由。

我們真正提供的是建構於同一套 2.4T 架構之上的旗艦 API。它已上線為 qwen/qwen3.8-max,每百萬個 token 收費 $2.00 與 $6.00,直接沿用阿里巴巴自有的價格,每個 token 都不加價,並搭載 100 萬 token 的多模態視窗——文字、圖像與影片輸入——以及與開放核心相同的混合注意力設計。如果你的推理那一半需要看見任何東西,這就是那條路線,而且也是供應商調價當天就會反映在我們這一側,而不是等到你下一個帳單週期的路線。與它並列,我們在自己的基礎設施上提供阿里巴巴的稠密兄弟模型 qwen/qwen3.8-27b,每百萬個收費 $0.33 與 $2.40,具備 262,144 個 token 的視窗以及文字、圖像與影片輸入,適用於 27B 推理模型就已足夠、而 2.4T 的 40 這個索引超出任務所需的情況。

無需第二份契約即可串接這兩個半部

實務上,這個配對之所以比基準論證更重要,原因在於具身堆疊本來就已經是兩個模型,而第三個模型的整合成本,才是會悄悄扼殺整個設計的關鍵。Mk1.5 不在我們的目錄中,所以要用它就得走供應商自家的 API——pip install "perceptron>=0.4.0",金鑰放在 PERCEPTRON_API_KEY,端點是 api.perceptron.inc。Qwen 那一半只差一組金鑰。

閘道器真正發揮價值之處,就在接縫上。當兩者都位於同一個相容 OpenAI 的端點之後時,把每個帶問題的畫面送往感知模型、把每份純文字計畫送往推理模型的路由規則,不過就是一行設定;而自動容錯移轉意味著任一方的供應商事故都會降級為備援路徑,而不是讓機器人停擺。一個 API 涵蓋 200 多個模型、並以 0% 加價轉嫁牌價,也是回答本文無法回答之問題最便宜的方式:你的物件追蹤任務到底需不需要 Mk1.5 的座標,或者一個視窗大得多、評分又獨立的通用視覺模型本來就夠了。在候選方案之間分流一部分真實流量,並在你自己的畫面上衡量,成本低於任何你能委外的基準研究。

具體來說,這該怎麼處理?

如果你正在為實體系統建構感知能力,Perceptron Mk1.5 是這組配對中唯一以座標作答的模型,而這是一項能力,而非一個分數——請在你自己的影片上測試手部框的宣稱,刻意設定 reasoning_effort,而不是接受偏高的預設值,並把 36,864-token 視窗當成硬性限制而非軟性限制來規劃。如果你正在其上建構推理層,Qwen 3.8 在 Mk1.5 未被衡量的地方有衡量數據,而它的每完成任務成本才是你該據以規劃的數字,而非 $2.00 的宣傳標題數字——但要注意,它的思考無法關閉,因此一項不需要思維鏈的任務,無論如何都還是在為思維鏈付費。

把事情做錯的團隊,正是那些試圖讓單一模型同時包辦兩者的團隊。一個 36,864-token 的感知專家無法承載運作歷程,而一個純文字、2.4T 的推理器也永遠看不到畫面。這種配對並不是兩個產品之間的妥協。它就是真正的分工,而唯一有用的問題是:你的每一次呼叫究竟屬於這條分工線的哪一側。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新