“PPLX 27B 在 Perplexity 的便携电脑中发布”的主标题卡片,副标题为“本地优先智能体 —— 知识工作表现达 85.4%,每个 token 0 美元”,左侧是带盾牌的台式电脑线性图标,右侧是芯片线性图标,右下角是 OrcaRouter 标志。
Guides & Insights

PPLX 27B 在 Perplexity 的便携式计算机中推出:一种胜过开放式测试框架的本地代理

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Perplexity的PPLX 27B不是云模型,这就是全部要点。该模型于2026年8月25日与Portable Computer——该公司与NVIDIA共同打造的本地优先智能体——一同发布。PPLX 27B是阿里巴巴开源权重Qwen 3.8 27B的后训练版本,由Perplexity针对其自有智能体框架进行调优,并交付为完全在你自有的硬件上运行。在Perplexity的53任务本地知识工作基准(Local Knowledge Work Bench)上,运行PPLX 27B的框架得分85.4%,领先于同一框架运行Qwen 3.8 27B的得分(82.6%),也高于两个开源智能体框架Pi(77.6%)和Hermes(74.0%)。这些数字来自厂商自己的发布文章和配套研究论文《A Local-First Agent for Private and Cost-Effective Knowledge Work》,并未经过独立复现——但它们是首个公开证据,表明桌面端27B模型能够以远低于云端的成本承担真实的知识工作。

实际发布的内容

Portable Computer 是 Perplexity 的“Computer”代理平台的设备端构建版本。早先的 Computer 产品在云端运行其编排器,而 Portable Computer 将整个技术栈打包为一个在您机器上运行的系统:包括代理框架、编排器、规划器、工具路由器、调度器、持久任务队列、本地搜索索引、推理引擎,以及用于 Google Drive、Gmail、Slack、GitHub 和 Outlook 的应用连接器。

两个特性让它有别于DIY本地部署。第一,代码和工具执行都发生在操作系统强制的沙箱中;如果沙箱不可用,工具执行会被禁用,而不会在无保护状态下运行。第二,它天生就是本地优先:每个任务都在设备端启动;如果某一步需要实时网络数据或前沿推理,编排器会停下来请求授权,之后才将这一步升级到15多个云模型之一。PII分类器会先对传出上下文进行检查,并向你确切展示哪些内容会离开设备。

这两个27B模型

{{1}}在发布时,你可以在两个 270 亿参数模型之间进行选择。{{/1}} {{2}}Qwen 3.8 27B 是阿里巴巴的 Apache-2.0 开放权重模型——一个稠密的、多模态的 27B 模型,原生窗口为 262K token,提前两周发布,且已经是一个强大的自托管选项。{{/2}} PPLX 27B 是同一基础模型由 Perplexity 进行后训练的结果:并非新架构,而是针对该测试框架专门调优的额外训练,该公司声称在其自身的智能体工作负载上表现更精准、更高效。NVIDIA 的 Nemotron 3.5 Lightning(30B)被列为即将推出,同时支持自带模型和推理服务器,因此该测试框架并不绑定 Perplexity 的权重。

基准测试,以及它不是什么

头条数字来自53项任务的“本地知识工作台”(Local Knowledge Work Bench),这是一套涵盖知识工作者实际会委托的工作的测试集——深度研究、财务分析、文档创作。Perplexity表示计划将该基准开源,这最终将使对比可重复,而非凭信心采信。在此之前,这些结果均由供应商自行运行。在该测试集上,据供应商称:

• 搭载 PPLX 27B 的便携式计算机 — 85.4%

• 便携式计算机,搭载 Qwen 3.8 27B — 82.6%

• Pi(开源测试工具)— 77.6%

• Hermes(开源测试框架)— 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

另外两个供应商报告的结果补充了整体情况。在 BrowseComp(网络研究套件)上,Computer 得分为 66.7%,而 Pi 为 50.2%,Hermes 为 43.9%,同时墙钟时间比 Pi 少 51%,词元比 Pi 少 70%。在 ParseBench-100(文档提取测试)上,它得到 65.1% 的分数,而 Hermes 为 34.6%,Pi 为 13.9%。最大的差距出现在那些奖励测试平台自身基础设施的任务上——搜索、路由、工具使用——这正是后训练模型加上专用基础设施堆栈证明其价值的地方。

经济翻转

更有意思的数字是价格。在本地完成的工作按token计费为零,也不消耗任何Perplexity积分——完全本地的任务,计数器始终停留在零。升级(Escalation)是唯一需要花钱的地方,而且它是按步骤自愿选择的。Perplexity在Terminal Bench 2.1上公布了这种混合模式的数学结果:完全本地运行的得分是59.6%,成本几乎为零;加入一个前沿模型作为顾问后,得分提升到73.0%,每次运行成本约为0.415美元;仅使用前沿模型则达到82.4%,每次运行成本约为0.65美元。这最后一组对比正是核心论点——本地推理让常驻智能体的成本曲线变得平缓,而云端的按需升级则变成一种能收回成本的精准支出。

这些都不是免费即可上手的。硬件本身至关重要。Portable Computer 将首先在 Linux 上推出,支持 NVIDIA DGX Spark——这款桌面超级计算机拥有 128GB 统一内存,建议零售价约 4,500 美元——或搭载至少 24GB 显存 RTX GPU 的 Linux PC(大致相当于 RTX 3090 或更新型号),建议配备 32GB 显存。Windows 支持计划于 9 月推出;macOS 尚未公布。而且该软件本身需要付费的 Perplexity 套餐:Pro、Max、Enterprise Pro 或 Enterprise Max。这是一款订阅加硬件的产品,面向的是已经在为 Perplexity 付费的用户,而非通用 API。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

路由器的安装位置

PPLX 27B 并不是 OrcaRouter 路由的内容——它运行在你自有的硬件上,依托 Perplexity 订阅,我们不会假装不是这样。我们实际路由的是这次发布所引发的对比组。Qwen 3.8 27B,即 PPLX 27B 后训练所依据的精确基础权重,已在 OrcaRouter 自托管上线;DeepSeek V4 FlashGemini 3.5 Flash LiteGPT-5.6 Luna 也同样如此——全部通过一个 API 密钥,按供应商目录价格直通,零加价,因此供应商宣布降价的同一天,我们这边也会同步生效。

这一点在这里之所以重要,有一个具体原因。Portable Computer 的卖点是本地与云端的成本对比,而这种对比中云端的那一半,其可信度取决于你所对比的价格。在 OrcaRouter 上,这些价格就是服务商的实际标价,从而让本地或云端的决策变成一种你可以信赖的计算,而非营销式对比。如果你想用两种方式对同一个代理进行原型验证——一台机器上的本地测试框架,与一个端点背后的云端模型——自动故障转移可以在本地模型力不能及时让云端顶上,无需第二份合同,也无需第二条代码路径。

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

看什么

未来一个月内,有三件事将决定这是一个小众产品,还是一个全新品类的开端。其一,Perplexity 是否真正开源 Local Knowledge Work Bench——这将把头条数字从声明变成社区可以复现的东西。其二,Nemotron 3.5 Lightning 是否如期落地,并在同一测试基准上击败 PPLX 27B——“针对基准进行后训练”这一论点,其可信度取决于底层基础模型。其三,九月的 Windows 支持能否将覆盖面扩大到 DGX Spark 用户之外。如果基准测试是真的,且该测试框架能够迁移,“在自己的 GPU 上运行智能体”将不再是一种爱好者玩法,而会成为一个真正有分量的部署选项——届时,与之对比的云端模型将不得不证明自己按 token 计价的价格物有所值。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube