
Perceptron Mk1.5 與 Qwen 3.8:機器人兩者都需要,而兩者皆無可替代
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 610 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 189 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
一台必須拿起東西的機器人,需要模型提供兩樣東西,而在這組搭配中,沒有任何單一模型能同時給你這兩者。Perceptron Mk1.5 回傳幾何資訊:給定影片影格,它能交回一個點、一個框、一個多邊形,或一個帶時間戳的 <track> 元素,而其上下文視窗為 36,864 個 token。Qwen 3.8——這個名稱對應到該供應商開放權重的 Qwen3.8-2.4T-A95B 核心——是一個 2.4 兆參數的混合專家推理模型,原生視窗為 262K,並可延伸至接近一百萬,而且它僅支援文字,因此完全無法查看影格。一個是感知層,每百萬個 token 收費 $0.15 和 $1.50;另一個是推理核心,輸入成本約為其十三倍、輸出成本約為其四倍,且在 Artificial Analysis Intelligence Index 上的獨立評分為 40,而該感知模型在任何地方都沒有獨立評分。
若把它們並列為競爭產品,它們會在不同方向上互有勝負,而這種比較產生不了任何可用的結果。若把它們並列為同一條管線的兩半,它們幾乎能解釋具身堆疊中的每一項成本與可靠性決策:影格在哪裡被解讀、計畫在哪裡被制定,以及當推理的那一半寫出比任務所需更多的詞元時,你的帳單會發生什麼事。
讓這種搭配說得通的那道分界
Perceptron Mk1.5 於 2026 年 9 月 25 日發布,是 Perceptron Mk1 的後繼產品,而它的職責有明確界定。它接受文字、圖像、影片和音訊,並回傳文字以及選用的結構化標註——點、邊界框、多邊形、片段與軌跡。<track> 輸出同時帶有空間觀測值及其所屬的時間戳,因此一段 60 秒的片段會以隨時間變化的位置回傳,而不是一個取平均後的單一猜測。asset_idx 欄位讓單一請求能分別處理多張圖像或多段影片,而這正是參考影格與即時影格比較所需要的。受約束的回應有兩種形式,JSON Schema 與 regex,而兩者的重點都在於輸出是有型別的。
Qwen 3.8 是另一種截然相反的工具。2.4T 核心是細粒度的 MoE——92 層,每層 512 個專家,其中 10 個為路由專家、另加一個共享專家,而那 92 層中有 69 層採用線性注意力——這正是如此龐大的架構得以達成其長上下文的方式。它的強項在於跨大量文本的推理:複雜的多步驟分析、冗長的推導、代理式規劃。它的不足之處則在輸入端。開放核心僅支援文字,而且它的推理無法關閉:無論你想不想要,每個回應都會以一段思考區塊開頭。
那不是推理模型的缺陷;那是感知模型的缺陷,而 Qwen 3.8 並不是感知模型。把兩者依序搭配起來,整體輪廓就顯而易見了——Mk1.5 回答「堆高機在哪裡,以及它何時移動」,Qwen 3.8 回答「有鑑於此,機械手臂該做什麼」。這兩個問題都不是另一個模型能回答的。

以實際計費的費率計算,每一半的成本是多少
• 輸入 — Perceptron Mk1.5 每百萬個 token $0.15。Qwen 3.8 在獨立測試框架所量測的託管版本上為每百萬 $2.00,套用 88% 快取折扣後,快取命中約為 $0.24。
• 輸出 — Mk1.5 每百萬 $1.50。Qwen 3.8 每百萬 $6.00。
• 快取——Mk1.5 的快取輸入為每百萬美元 $0.0375,恰好是其標準輸入費率的四分之一。Qwen 3.8 的折扣以百分比計算,但幅度更深,達 88%,因此其快取費率以絕對值而言是兩者中較便宜者,而未快取的費率則是 Mk1.5 的十倍以上。
• 每完成一項任務的成本——排名正是在這裡反轉。Artificial Analysis 將 Qwen 3.8 的每項 Intelligence Index 任務成本列為 $2.16,在同類 115 個模型中排名第 32,並在成本方面獲得四分之四的評級——儘管 token 昂貴,但每完成一項任務卻很便宜,因為該模型在數次指數測試中產生了 170M 個輸出 token,而相比之下,同場其他模型更加喋喋不休。Mk1.5 則沒有任何由任何人發布的對等數據。
• 上下文 — Mk1.5 為 36,864 個 token,相較於 Qwen 核心的原生 262K,在適當的服務配置下可擴展至一百萬。
• 推理控制 — Mk1.5 會公開 reasoning_effort 參數,可設為 high、medium、low、minimal 或 none,預設值為 high。Qwen 3.8 將思考功能強制開啟,因此每次呼叫你都得為思考權杖付費。
把那份清單讀兩遍,因為這兩個模型在成本上正好相反。以每 token 計,Mk1.5 便宜得多。以獨立基準測試中每項完成的任務計,Qwen 3.8 經測量屬便宜,而 Mk1.5 則未經測量。只有在假設兩者執行的是同一項工作時,這兩個說法才會互相矛盾,而它們並不是。

這裡的證據指向相反的方向
在這一批比較中,大多數情況是開放權重那一方帶著一堆廠商自行報告的數字,而封閉 API 那一方則有第三方頁面。這裡的情況正好相反,而這個反轉值得精確指出,因為它改變了哪些東西你可以驗證、哪些不能。
Qwen 3.8 有獨立量測。Artificial Analysis Intelligence Index 將 2.4T 核心模型列為 40 分,在撰寫本文時於同級 115 個模型中排名第 5,輸出速度為每秒 39.6 個 token——在 115 個中排名第 56,屬於中段班,任何人在規劃以它為核心的互動式迴圈之前都值得知道。指數修訂會在不同快照之間變動,解讀這些數字的誠實方式是把它們視為方向性指標,但重點仍然成立:阿里巴巴以外有人跑過這個模型並公布了數字。
Perceptron Mk1.5 並沒有這種東西。Mk1.5 或其前代機型都沒有 Artificial Analysis 的條目,也沒有競技場評分,因此現存的每一項能力數據,都是 Perceptron 針對自家模型所產出的。那組數據異常具體,這一點對它有利——在廠商自家測試中,egocentric hand_box 上是 0.9433,而 Gemini 3.1 Pro 為 0.4467;EgoSchema 為 80.40,同一競爭對手則是 81.20,在廣泛理解基準上小輸,同時宣稱在較難的 EgoSchema 子集上以 63.75 取得 12% 的領先;在 Molmo2-Track 上則是 0.647 的 centre-F1 與 0.628 的 point-HOTA——但具體和經獨立驗證是兩種不同的性質,而唯有第二種才能告訴你,你的影片素材上會發生什麼事。
關於閱讀 Perceptron 這張表,有兩點提醒,而這兩點適用於任何引用該表的情況。LiveVQA-W 在啟用工具時得出的 56.0 這個數字,來自四次取樣的多數投票,而用來與之對比的 Gemini 3.8 Flash 搭配 Google Search 接地的 53.2,並非多數投票;這種做法本身站得住腳,但相對於單次貪婪推論,它會讓分數顯得好看。再者,追蹤那一列列出 Qwen3-VL-8B 的 0.180 centre-F1,數字取自該模型的論文,卻和另一個檢查點家族所實測的數字並列在同一欄。把論文數字放進實測欄位,就不是同一基準的對等列,而這正是那種最常被引用、卻不帶出處的條目。
2.4T 核心不是你可以從我們這裡呼叫的東西——但它的架構可以。

這是比較中,誠實答案與該模型名氣所暗示內容不同的那部分。Qwen 3.8 這個名稱被廣泛用來指涉其開放核心,而開放核心是一種下載,不是端點:2.4TB 的 BF16 權重,採用阿里巴巴自訂的 Qwen3.8-Max 授權條款,於 2026 年 8 月發布。我們不提供它,而且今天在我們這一側也沒有任何供應商提供它——該目錄項目是以已公告、尚未可用的追蹤頁面形式存在,而不是一條實際可用的路由。
我們真正提供的是建構於同一套 2.4T 架構之上的旗艦 API。它已上線為 qwen/qwen3.8-max,每百萬個 token 收費 $2.00 與 $6.00,直接沿用阿里巴巴自有的價格,每個 token 都不加價,並搭載 100 萬 token 的多模態視窗——文字、圖像與影片輸入——以及與開放核心相同的混合注意力設計。如果你的推理那一半需要看見任何東西,這就是那條路線,而且也是供應商調價當天就會反映在我們這一側,而不是等到你下一個帳單週期的路線。與它並列,我們在自己的基礎設施上提供阿里巴巴的稠密兄弟模型 qwen/qwen3.8-27b,每百萬個收費 $0.33 與 $2.40,具備 262,144 個 token 的視窗以及文字、圖像與影片輸入,適用於 27B 推理模型就已足夠、而 2.4T 的 40 這個索引超出任務所需的情況。
無需第二份契約即可串接這兩個半部
實務上,這個配對之所以比基準論證更重要,原因在於具身堆疊本來就已經是兩個模型,而第三個模型的整合成本,才是會悄悄扼殺整個設計的關鍵。Mk1.5 不在我們的目錄中,所以要用它就得走供應商自家的 API——pip install "perceptron>=0.4.0",金鑰放在 PERCEPTRON_API_KEY,端點是 api.perceptron.inc。Qwen 那一半只差一組金鑰。
閘道器真正發揮價值之處,就在接縫上。當兩者都位於同一個相容 OpenAI 的端點之後時,把每個帶問題的畫面送往感知模型、把每份純文字計畫送往推理模型的路由規則,不過就是一行設定;而自動容錯移轉意味著任一方的供應商事故都會降級為備援路徑,而不是讓機器人停擺。一個 API 涵蓋 200 多個模型、並以 0% 加價轉嫁牌價,也是回答本文無法回答之問題最便宜的方式:你的物件追蹤任務到底需不需要 Mk1.5 的座標,或者一個視窗大得多、評分又獨立的通用視覺模型本來就夠了。在候選方案之間分流一部分真實流量,並在你自己的畫面上衡量,成本低於任何你能委外的基準研究。
具體來說,這該怎麼處理?
如果你正在為實體系統建構感知能力,Perceptron Mk1.5 是這組配對中唯一以座標作答的模型,而這是一項能力,而非一個分數——請在你自己的影片上測試手部框的宣稱,刻意設定 reasoning_effort,而不是接受偏高的預設值,並把 36,864-token 視窗當成硬性限制而非軟性限制來規劃。如果你正在其上建構推理層,Qwen 3.8 在 Mk1.5 未被衡量的地方有衡量數據,而它的每完成任務成本才是你該據以規劃的數字,而非 $2.00 的宣傳標題數字——但要注意,它的思考無法關閉,因此一項不需要思維鏈的任務,無論如何都還是在為思維鏈付費。
把事情做錯的團隊,正是那些試圖讓單一模型同時包辦兩者的團隊。一個 36,864-token 的感知專家無法承載運作歷程,而一個純文字、2.4T 的推理器也永遠看不到畫面。這種配對並不是兩個產品之間的妥協。它就是真正的分工,而唯一有用的問題是:你的每一次呼叫究竟屬於這條分工線的哪一側。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
