一個用於「PPLX 27B 在 Perplexity 的可攜式電腦中推出」的英雄標題卡,副標題為「本地優先代理 — 知識工作 85.4%,每個 token $0」,左側為帶有盾牌的桌上電腦線條圖示,右側為晶片線條圖示,右下角為 OrcaRouter 標誌。
Guides & Insights

PPLX 27B 於 Perplexity 的可攜式電腦中推出:一款超越 Open Harnesses 的本地代理

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Perplexity的PPLX 27B不是雲端模型,這就是全部的故事。2026年8月25日發布,與可攜式電腦(Portable Computer)——該公司與NVIDIA共同打造的本地優先代理——一同亮相,PPLX 27B是阿里巴巴開源權重Qwen 3.8 27B的後訓練版本,由Perplexity針對其自身的代理框架進行調校,並設計為完全在你擁有的硬體上運行。在Perplexity的53項任務本地知識工作基準(Local Knowledge Work Bench)中,運行PPLX 27B的框架得分為85.4%,領先於同一框架運行Qwen 3.8 27B(82.6%)以及兩個開源代理框架Pi(77.6%)和Hermes(74.0%)。這些是廠商在發布文章和配套研究論文〈A Local-First Agent for Private and Cost-Effective Knowledge Work〉中自行發布的數據,未經獨立複現——但這是首個公開證據,表明桌上型電腦上的27B模型能夠以雲端的一小部分成本承擔真正的知識工作。

實際發佈的內容

Portable Computer 是 Perplexity「Computer」代理平台的裝置端版本。早期的 Computer 產品在雲端執行其編排器,而 Portable Computer 則將整套技術堆疊打包成一個在使用者機器上執行的系統:代理程式框架、編排器、規劃器、工具路由器、排程器、持久化任務佇列、本地搜尋索引、推論引擎,以及 Google Drive、Gmail、Slack、GitHub 和 Outlook 的應用程式連接器。

有兩個特性讓它有別於自行架設的本地環境。第一,程式碼與工具的執行都發生在作業系統強制的沙盒內;若沙盒不可用,工具執行便會停用,而不是在缺乏保護下運行。第二,它在設計上以本地優先:每項任務都從裝置端開始;若某個步驟需要即時網路資料或前沿推理,協調器會先暫停並徵求許可,才將該單一步驟升級至 15 個以上的雲端模型之一。PII 分類器會先對外送上下文進行掃描,並確切顯示哪些資料會離開裝置。

這兩個27B模型

在推出時,你可以在兩個擁有270億參數的模型之間選擇。Qwen 3.8 27B 是阿里巴巴的 Apache-2.0 開放權重模型——一個密集、多模態的27B模型,原生上下文視窗為262K token,早在兩週前就已發佈,如今已是強大的自架設選項。PPLX 27B 是同一基礎模型經 Perplexity 後續訓練的版本:並非新架構,而是針對此框架特別調整的額外訓練,該公司聲稱在其自身的代理工作負載上,行為更精準且更有效率。NVIDIA 的 Nemotron 3.5 Lightning(30B)被列為即將推出,同時也支援自備模型與推論伺服器,因此此框架並非綁定於 Perplexity 的權重。

基準測試,以及它不是什麼

頭條數字來自53項任務的Local Knowledge Work Bench,這是一套涵蓋知識工作者實際會委派的各種工作——深度研究、財務分析、文件建立。Perplexity表示計畫將該基準開源,這最終將使比較可重複,而非僅憑信任。在此之前,這些結果由供應商執行。在該套件上,根據供應商說法:

• 搭載 PPLX 27B 的可攜式電腦 — 85.4%

• 搭載 Qwen 3.8 27B 的可攜式電腦 — 82.6%

• Pi(開源工具)— 77.6%

• Hermes(開源測試框架)— 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

還有兩項供應商回報的結果補全了整體情況。在網頁研究套件 BrowseComp 上,Computer 獲得 66.7%,Pi 為 50.2%,Hermes 為 43.9%,且所用牆鐘時間比 Pi 少 51%,Token 數少 70%。在文件萃取測試 ParseBench-100 上,Computer 得分 65.1%,Hermes 為 34.6%,Pi 為 13.9%。最大差距出現在那些獎勵 harness 自身基礎設施的任務上——搜尋、路由、工具使用——這正是經過後續訓練的模型加上專用管道堆疊發揮價值的地方。

經濟學的翻轉

更有意思的數字是價格。在地完成的工作,每個 token 的成本為零,也不消耗 Perplexity 額度——完全在地的任務,計數器就是零。只有升級(escalation)是唯一會花錢的地方,而且是每一步可選擇加入的。Perplexity 在 Terminal Bench 2.1 上公布了混合運算的數據:完全在地的得分是 59.6%,成本大約為零;加入一個前沿模型擔任顧問後,提升到 73.0%,每次 rollout 約 $0.415;僅用前沿模型則達到 82.4%,每次 rollout 約 $0.65。最後這個對比正是核心論點——在地推論讓常駐 agent 的成本曲線平坦化,而雲端升級變成了一種精準的花費,在能回本的地方才花。

以上這些全都不是免費的。硬體本身很重要。Portable Computer 率先在 NVIDIA DGX Spark 上推出 Linux 版本——這款桌上型超級電腦配備 128GB 統一記憶體(建議售價約 4,500 美元)——也可在配備至少 24GB VRAM 的 RTX GPU 之 Linux 個人電腦上執行(約為 RTX 3090 或更新機型),建議 32GB。Windows 支援預計於 9 月推出;macOS 尚未公佈。而軟體本身需要付費的 Perplexity 方案:Pro、Max、Enterprise Pro 或 Enterprise Max。這是一款訂閱加硬體的產品,目標對象是已經付費使用 Perplexity 的使用者,而非通用的 API。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

路由器的放置位置

PPLX 27B 不是 OrcaRouter 會路由的模型——它跑在你自有的硬體上,背後是 Perplexity 訂閱,我們不會假裝不是這樣。我們實際路由的是這次發布所帶來的對比組合。Qwen 3.8 27B,也就是 PPLX 27B 後續訓練所用的原始基礎權重,已上線於 OrcaRouter 自架版本;DeepSeek V4 FlashGemini 3.5 Flash LiteGPT-5.6 Luna 也一樣——全部只需一個 API 金鑰,以供應商列表價格供應,零加成轉傳,所以廠商宣布降價的當天,我們這邊也會同步生效。

這在當前情境下之所以重要,有其特定原因。Portable Computer 的賣點在於本地與雲端的成本對比,而這個對比在雲端那一半的可靠程度,取決於你拿來比較的價格是否誠實。在 OrcaRouter 上,那些價格就是供應商的實際牌價,因此本地或雲端的抉擇就變成一個你可以信賴的計算,而不是行銷式的比較。此外,如果你想以兩種方式為同一個代理建立原型——在一臺機器上使用本地執行框架,在一個端點背後使用雲端模型——自動容錯移轉能在本地模型力有未逮時讓雲端一方代為接手,既不需要第二份合約,也不需要第二條程式碼路徑。

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

看什麼

{{1}}未來一個月內要發生的三件事,將決定這款產品只是個小眾利基,還是某個全新類別的起點。{{/1}} {{2}}Perplexity 是否真的會把 Local Knowledge Work Bench 開源——若真如此,新聞標題上的那些數字就會從「宣稱」變成社群可以實際重現的成果。{{/2}} {{3}}Nemotron 3.5 Lightning 是否會如期推出,並在同一個評測框架上擊敗 PPLX 27B——「為了評測框架而後訓練」這套論點,再好也只等同於它底下那層基礎模型。{{/3}} {{4}}還有 Windows 支援能否在九月如期上線,讓這項產品跨出 DGX Spark 使用者的圈子。{{/4}} 如果這項基準測試是真的,而且評測框架的成效可以轉移,「在你自己的 GPU 上跑 agent」就不再只是業餘愛好者的實驗玩法,而會成為一個真正有實力的部署選項——屆時,所有拿來與它比較的雲端模型,都得證明自己值那個 per-token 的定價。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube