PPLX 27B 在 Perplexity 的可攜式電腦中發布——一個擊敗開放式評測框架的本地代理。重新生成的插圖。
Guides & Insights

PPLX 27B 於 Perplexity 的可攜式電腦中推出:一款超越 Open Harnesses 的本地代理

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Perplexity 的 PPLX 27B 不是雲端模型,而這就是全部重點。PPLX 27B 於 2026 年 8 月 25 日與 Portable Computer 一同發布——後者是該公司與 NVIDIA 共同打造的本地優先代理——它是 Alibaba 開放權重 Qwen 3.8 27B 的後訓練版本,由 Perplexity 為自家代理框架調校,並在推出後可完全在你擁有的硬體上執行。在 Perplexity 的 53 項任務 Local Knowledge Work Bench 上,執行 PPLX 27B 的框架得分 85.4%,領先同一框架在 Qwen 3.8 27B 上的 82.6%,以及兩款開源代理框架 Pi(77.6%)與 Hermes(74.0%)。這些是廠商自家數據,來自發布文章與隨附研究論文〈A Local-First Agent for Private and Cost-Effective Knowledge Work〉,並非經獨立重現——但這是首個公開證據,顯示桌上型電腦上的 27B 模型能以雲端價格的一小部分,勝任真正的知識工作。一週後,9 月 1 日,同一個後訓練模型出現在第二種部署中:Hybrid Compute,這是 Perplexity 的 Computer 代理的新 Mac 模式,會將單一任務拆分給雲端前沿模型與在 Apple silicon 上執行的 PPLX 27B——並以全新的裝置內 Privacy Gate 為後盾,在有任何資料離開機器之前掃描個人資料。在 Mac 發布消息兩天後,即 9 月 3 日,Perplexity 表示 Portable Computer 現在也已在 Linux 上推出,支援具備 24GB 以上 VRAM 的 NVIDIA RTX GPU。9 月 14 日,該公司表示它現在已在搭載 NVIDIA RTX GPU 的 Windows PC 上推出——根據該公司說法,這是本地優先主張歷來觸及範圍最廣的一次,也是讓在自己硬體上執行該代理成為最常見桌上型平台上真正部署選項的一步。這兩項說法均為廠商所述。

實際發佈的內容

Portable Computer 是 Perplexity 的「Computer」代理平台的裝置端版本。先前的 Computer 產品把協調器(orchestrator)跑在雲端,而 Portable Computer 則將整套技術堆疊打包成單一系統,直接在你的機器上運行:代理執行框架、協調器、規劃器、工具路由器、排程器、持久性任務佇列、本機搜尋索引、推論引擎,以及 Goog​le Drive、Gmail、Slack、GitHub 和 Outlook 的應用程式連接器。

有兩個特性讓它有別於DIY本地設定。首先,程式碼與工具執行都發生在作業系統強制執行的沙箱內;如果沙箱不可用,工具執行就會被停用,而不是在無保護的狀態下運行。其次,它在設計上就是本地優先:每項任務都從裝置端開始,如果某個步驟需要即時網頁資料或前沿推理,協調器會先停下來,在把該單一步驟升級到15+個雲端模型之一以前,請求你的許可。一個裝置端的PII分類器——也就是Perplexity後來產品化為Privacy Gate的技術——會先對外送的內容進行掃描,讓你看清楚究竟有哪些資料會離開這台機器。

這兩個27B模型

在推出時,你可以在兩個 270 億參數的模型之間選擇。Qwen 3.8 27B 是阿里巴巴的 Apache-2.0 開放權重模型——一個稠密、多模態的 27B,原生上下文視窗為 262K 個 token,早了兩週發布,且已是強大的自架選項。PPLX 27B 是 Perplexity 對同一個基礎模型進行後訓練後的版本:並非新架構,而是針對這個框架特別調校的額外訓練,該公司聲稱在其自家的代理工作負載上行為更精確、更有效率。NVIDIA 的 Nemotron 3.5 Lightning(30B)被列為即將推出,且支援自帶模型與推論伺服器,因此這個框架並非綁定於 Perplexity 的權重。

基準測試,以及它不是什麼

頭條數字來自53項任務的Local Knowledge Work Bench,這是一套涵蓋知識工作者實際會委派的各種工作——深度研究、財務分析、文件建立。Perplexity表示計畫將該基準開源,這最終將使比較可重複,而非僅憑信任。在此之前,這些結果由供應商執行。在該套件上,根據供應商說法:

• 搭載 PPLX 27B 的可攜式電腦 — 85.4%

• 搭載 Qwen 3.8 27B 的可攜式電腦 — 82.6%

• Pi(開源工具)— 77.6%

• Hermes(開源測試框架)— 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

還有兩項供應商回報的結果補全了整體情況。在網頁研究套件 BrowseComp 上,Computer 獲得 66.7%,Pi 為 50.2%,Hermes 為 43.9%,且所用牆鐘時間比 Pi 少 51%,Token 數少 70%。在文件萃取測試 ParseBench-100 上,Computer 得分 65.1%,Hermes 為 34.6%,Pi 為 13.9%。最大差距出現在那些獎勵 harness 自身基礎設施的任務上——搜尋、路由、工具使用——這正是經過後續訓練的模型加上專用管道堆疊發揮價值的地方。

經濟學的翻轉

更有意思的數字是價格。在地完成的工作,每個 token 的成本為零,也不消耗 Perplexity 額度——完全在地的任務,計數器就是零。只有升級(escalation)是唯一會花錢的地方,而且是每一步可選擇加入的。Perplexity 在 Terminal Bench 2.1 上公布了混合運算的數據:完全在地的得分是 59.6%,成本大約為零;加入一個前沿模型擔任顧問後,提升到 73.0%,每次 rollout 約 $0.415;僅用前沿模型則達到 82.4%,每次 rollout 約 $0.65。最後這個對比正是核心論點——在地推論讓常駐 agent 的成本曲線平坦化,而雲端升級變成了一種精準的花費,在能回本的地方才花。

這些選項沒有一項是免費就能起步的。主機本身才是關鍵。Portable Computer 於 8 月 25 日以 Linux 優先之姿登場,可運行於 NVIDIA DGX Spark 這款配備 128GB 統一記憶體的桌上型超級電腦(定價約 4,500 美元),或是搭載 RTX GPU、VRAM 至少 24GB 的 Linux PC 上——大約是 RTX 3090 或更新的型號——建議具備 32GB。9 月 3 日,Perplexity 表示 Portable Computer 現已可在 Linux 上搭配 VRAM 24GB 以上的 NVIDIA RTX GPU 使用——據該公司說法——而 NVIDIA 在同一週的 IFA 2026 發表會中新增了一鍵安裝程式與簡化的本機 AI 設定,明確瞄準 VRAM 24GB 以上的 RTX GPU,並將 Portable Computer 與 Hermes agent 和 OpenClaw 並列提及。Windows 支援如期報到:9 月 14 日,Perplexity 表示 Portable Computer 現已可在配備 NVIDIA RTX GPU 的 Windows PC 上使用——據該公司說法——並整合於 Perplexity Windows 應用程式中,其裝置端推論需要 VRAM 24GB 以上的 RTX GPU,與 Linux 的門檻一致,同時新增了兩項 Linux 途徑所沒有的功能:用於連接自有工具與應用程式整合的本機 MCP,以及可讓 Computer 在你不在時於你的 PC 上執行週期性工作的排程任務。macOS 則在 Linux 版推出後一週以不同形式登場——也就是接下來要介紹的 Hybrid Compute。而這套軟體本身需要付費的 Perplexity 方案:Pro、Max、Enterprise Pro 或 Enterprise Max。這是一款訂閱加硬體的產品,鎖定的是已經在付費使用 Perplexity 的人,而非通用的 API。

Mac 的轉變:混合運算與隱私守門員

9月1日,Perplexity Computer——Portable Computer 所建構的代理平台——在 Mac 桌面應用程式中獲得了 Hybrid Compute。這裡的分工方式與 Linux 版本相反:任務始於雲端,由前沿模型處理最艱難的推理、網路研究與長遠規劃,而協調器則將敏感的細部步驟交給在 Apple silicon 上執行的本機子代理。檔案、本機資料與裝置操作都留在 Mac 上,脈絡在交接過程中得以延續,且本機的 token 永遠不會傳到雲端。本機引擎正是本文所談的模型——PPLX 27B,也就是 Perplexity 後訓練的 Qwen 3.8 27B,在該公司的 Mac 資料中列為 PPLX Qwen 3.8 27B,並可透過應用程式中的一鍵下載安裝,無需 Ollama 或終端機設定,Perplexity 表示。其餘產品陣容的上市報導則各不相同:大多數媒體將 Goog​le 的 Gem​ma 4 E4B 與 Aliba​ba 的 Qwen3.6 35B-A3B 列為其他裝置端選項,另有一家則指出是 Perplexity 後訓練的 Qw​en 3.6 35B,而非 27B——這是媒體在首日報導中未能一致掌握的細節。

Perplexity目前主打的功能是Privacy Gate,這是一個在其Secure Intelligence Institute訓練的裝置端分類器。它會在傳輸任何內容之前,先讀取每項任務——包括提示、工具輸出、記憶、日誌——尋找個人可識別資訊:姓名、地址、帳戶號碼、憑證、支付卡號碼和政府身分證號碼。在請求離開Mac之前,偵測到的值會替換為替代值,並在答案返回時還原;當閘門標記到某些內容時,使用者會決定該步驟是在本地執行、被遮罩,還是對外分享——閘門只提出詢問,不會自行決定。Perplexity也表示已將該分類器開源,並釋出PII-TRACE,這是一個由13,148段橫跨13種語言的合成對話所構成的基準測試,用於評估PII偵測器。這些都是公司說法,未經獨立稽核。

Hybrid Compute 可在任何配備 Apple silicon 的 Mac 上執行,需 macOS 15 或更新版本,且統一記憶體最低 24GB——建議為 32GB;Perplexity 表示 8GB 與 16GB 機型已被排除在外。此功能透過桌面應用程式提供給 Pro、Max 與 Enterprise 訂閱者,企業帳戶須主動選擇啟用,管理員可設定組織層級的敏感度政策,並查看每台裝置對外傳送的內容記錄。本機工作不會消耗雲端額度,本機產生的 token 也不會被收費——只有雲端編排與委派步驟需要成本,且不需要 API 金鑰。其注意事項與 Linux 版本推出時相同:把關機制本身也是一個模型,因此有可能漏判;評測者很快指出,這項防護的好壞取決於使用者收到提示時所做的選擇。AppleInsider 尤其建議,在將敏感資料託付給此功能前,應先測試其表現。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

路由器的放置位置

PPLX 27B 並非 OrcaRouter 所路由的項目——它在你擁有的硬體上執行,並透過 Perplexity 訂閱提供,而我們不會假裝不是如此。我們真正路由的是這次發布所帶來的比較組合。Qwen 3.8 27B,正是 PPLX 27B 進行後訓練所依據的基礎權重,已在 OrcaRouter 自託管上線;DeepSeek V4 Flash、Gemini 3.5 Flash Lite 和 GPT-5.6 Luna 也是如此——全部透過單一 API 金鑰、以供應商定價提供,零加成直接轉遞,因此供應商降價在宣布當天就會在我們這邊生效。

這件事在這裡很重要,原因很具體。Portable Computer 的賣點在於本機與雲端的成本對比,而這個對比中屬於雲端的那一半,其誠實程度取決於你拿來比較的價格。在 OrcaRouter 上,那些是供應商實際的定價,這讓本機或雲端的抉擇成為一項你可以信任的計算,而不是行銷話術式的比較。而如果你想用兩種方式為同一個代理程式打造原型——一台機器跑本機測試框架,雲端模型則藏在單一端點之後——自動容錯移轉可在本機模型力有未逮時讓雲端代打,既不需要第二份合約,也不需要第二條程式碼路徑。Hybrid Compute 也重複同樣的交易條件——本機 Token 免費,只有雲端編排是唯一支出——因此無論本機那一半是跑在 DGX Spark、Linux RTX 工作站、Mac,還是——自 9 月 14 日起——搭載 RTX GPU 的 Windows PC 上,這套計算都一體適用。

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

看什麼

接下來一個月內有四件事,將決定這究竟是利基產品,還是一個品類的開端。Perplexity 是否真的會將 Local Knowledge Work Bench 開源——這會讓那些頭條數字從宣稱變成社群能重現的東西。Nemotron 3.5 Lightning 是否推出,並在同一個測試框架上擊敗 PPLX 27B——「為測試框架進行後訓練」這個論點,取決於其底下基礎模型的好壞。Privacy Gate 是否能在分類器已開源的情況下挺過對抗性審查——機率式 PII 偵測器唯有真的能讓姓名、帳號號碼與憑證不經網路傳送出去,才是混合式提案的關鍵。以及 Linux 推出時從未具備的觸及範圍,是否終於會透過九月的擴大行動到來——9 月 3 日確認的 RTX-24GB Linux 途徑、9 月 14 日在 Perplexity Windows 應用程式中確認的 Windows 支援,以及 Mac 上的 Hybrid Compute——把同樣的本機代理經濟模式帶到 Perplexity 迄今所推出最廣泛的消費級硬體上。如果這個基準測試是真的,而且該測試框架可移轉,那麼「在你自己的硬體上執行代理」就不再只是愛好者的模式,而會成為真正有實質威力的部署選項——而那些被拿來與之比較的雲端模型,將必須證明自己配得上每 token 的價格。