
PPLX 27B 在 Perplexity 的便携式计算机中推出:一种胜过开放式测试框架的本地代理
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 87 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 446 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
Perplexity 的 PPLX 27B 并非云端模型,而这正是全部关键所在。PPLX 27B 于 2026 年 8 月 25 日与 Portable Computer 一同发布——后者是该公司与 NVIDIA 合作打造、秉持本地优先理念的智能体——它是阿里巴巴开放权重模型 Qwen 3.8 27B 的后训练版本,由 Perplexity 针对自家智能体框架进行调优,并交付为完全在你拥有的硬件上运行。在 Perplexity 的 53 项任务 Local Knowledge Work Bench 上,运行 PPLX 27B 的该框架得分为 85.4%,领先于同一框架在 Qwen 3.8 27B 上的表现(82.6%),也领先于两个开源智能体框架 Pi(77.6%)和 Hermes(74.0%)。这些数字来自厂商自己的发布博文和配套研究论文《面向私密且高性价比知识工作的本地优先智能体》,未经独立复现——但它们是首批公开证据,表明桌面上的 27B 模型能以云端价格的一小部分承担真正的知识工作。一周后,即 9 月 1 日,同一个后训练模型出现在第二种部署中:Hybrid Compute,这是 Perplexity 的 Computer 智能体新推出的 Mac 模式,它将单个任务拆分给云端前沿模型和在 Apple 芯片上运行的 PPLX 27B——其背后是新的设备端 Privacy Gate,会在任何内容离开本机之前扫描个人数据。Mac 发布两天后,即 9 月 3 日,Perplexity 表示 Portable Computer 现在也可在 Linux 上使用,面向显存 24GB 及以上的 NVIDIA RTX GPU。9 月 14 日,该公司表示它现在可在配备 NVIDIA RTX GPU 的 Windows PC 上使用——据该公司称,这是本地优先主张迄今覆盖范围最广的一次,也是让在自己硬件上运行该智能体成为最常见桌面平台上真正部署选项的一步。这两项说法均为厂商所述。
实际发布的内容
Portable Computer 是 Perplexity 的“Computer”智能体平台在设备端构建的版本。早期的 Computer 产品将编排器运行在云端,而 Portable Computer 则把整套技术栈打包成一个在你自己的机器上运行的系统:智能体运行框架、编排器、规划器、工具路由器、调度器、持久化任务队列、本地搜索索引、推理引擎,以及面向 Google Drive、Gmail、Slack、GitHub 和 Outlook 的应用连接器。
两个属性将它与DIY本地设置区分开来。首先,代码和工具执行发生在操作系统强制执行的沙箱内,如果沙箱不可用,工具执行将被禁用,而不是在无保护的情况下运行。其次,它在设计上就是本地优先:每个任务都从设备端开始,如果某个步骤需要实时网络数据或前沿推理,编排器会停下来,在将该单一步骤升级到15+个云模型之一之前征求许可。一个设备端的PII分类器——即Perplexity后来产品化为Privacy Gate的技术——会首先对出站上下文进行扫描,并精确地向你展示哪些内容会离开这台机器。
这两个27B模型
发布时,你可以在两个 270 亿参数的模型之间选择。Qwen 3.8 27B 是 Alibaba 的 Apache-2.0 开放权重模型——一个稠密、多模态的 27B 模型,具有 262K token 的原生窗口,早两周发布,并且已经是强大的自托管选项。PPLX 27B 是由 Perplexity 对同一基础模型进行后训练得到的:并非新架构,而是专门针对此运行框架调优的额外训练,该公司声称其在自己的智能体工作负载上表现更精确、更高效。NVIDIA 的 Nemotron 3.5 Lightning (30B) 被列为即将推出,并且自带模型和推理服务器均受支持,因此该运行框架并不绑定 Perplexity 的权重。
基准测试,以及它不是什么
头条数字来自53项任务的“本地知识工作台”(Local Knowledge Work Bench),这是一套涵盖知识工作者实际会委托的工作的测试集——深度研究、财务分析、文档创作。Perplexity表示计划将该基准开源,这最终将使对比可重复,而非凭信心采信。在此之前,这些结果均由供应商自行运行。在该测试集上,据供应商称:
• 搭载 PPLX 27B 的便携式计算机 — 85.4%
• 便携式计算机,搭载 Qwen 3.8 27B — 82.6%
• Pi(开源测试工具)— 77.6%
• Hermes(开源测试框架)— 74.0%

另外两个供应商报告的结果补充了整体情况。在 BrowseComp(网络研究套件)上,Computer 得分为 66.7%,而 Pi 为 50.2%,Hermes 为 43.9%,同时墙钟时间比 Pi 少 51%,词元比 Pi 少 70%。在 ParseBench-100(文档提取测试)上,它得到 65.1% 的分数,而 Hermes 为 34.6%,Pi 为 13.9%。最大的差距出现在那些奖励测试平台自身基础设施的任务上——搜索、路由、工具使用——这正是后训练模型加上专用基础设施堆栈证明其价值的地方。
经济翻转
更有意思的数字是价格。在本地完成的工作按token计费为零,也不消耗任何Perplexity积分——完全本地的任务,计数器始终停留在零。升级(Escalation)是唯一需要花钱的地方,而且它是按步骤自愿选择的。Perplexity在Terminal Bench 2.1上公布了这种混合模式的数学结果:完全本地运行的得分是59.6%,成本几乎为零;加入一个前沿模型作为顾问后,得分提升到73.0%,每次运行成本约为0.415美元;仅使用前沿模型则达到82.4%,每次运行成本约为0.65美元。这最后一组对比正是核心论点——本地推理让常驻智能体的成本曲线变得平缓,而云端的按需升级则变成一种能收回成本的精准支出。
而这一切都不是免费就能开始的。硬件本身很关键。Portable Computer 于 8 月 25 日率先登陆 Linux,运行在 NVIDIA DGX Spark 上——这台桌面超级计算机拥有 128GB 统一内存(标价约 4,500 美元)——或者运行在配备至少 24GB VRAM 的 RTX GPU 的 Linux PC 上——大致相当于 RTX 3090 或更新型号——并建议配备 32GB。9 月 3 日,Perplexity 表示,据该公司称,Portable Computer 现已在配备 24GB 或以上 VRAM 的 NVIDIA RTX GPU 的 Linux 上可用;同一周 NVIDIA 在 IFA 2026 的推进中新增了一键安装程序和简化的本地 AI 设置,明确面向 VRAM 达到 24GB 或以上的 RTX GPU,并将 Portable Computer 与 Hermes agent 和 OpenClaw 一同提及。Windows 支持如期而至:9 月 14 日,Perplexity 表示,据该公司称,Portable Computer 现已在配备 NVIDIA RTX GPU 的 Windows PC 上通过 Perplexity Windows 应用提供,端侧推理需要 VRAM 为 24GB 或更高的 RTX GPU,与 Linux 的门槛一致,并新增了两项 Linux 途径所没有的功能:用于连接自有工具和应用集成的本地 MCP,以及让你不在时 Computer 能在你的 PC 上运行周期性工作的计划任务。macOS 则以另一种形式在 Linux 发布一周后到来——Hybrid Compute,接下来会介绍。而该软件本身需要付费的 Perplexity 套餐:Pro、Max、Enterprise Pro 或 Enterprise Max。这是一款订阅加硬件的产品,面向已经在为 Perplexity 付费的人,而不是通用 API。
Mac的转向:混合计算与隐私门槛
9月1日,Perplexity Computer——Portable Computer 所基于的智能体平台——在 Mac 桌面应用中获得了 Hybrid Compute。在这里,分工方式与 Linux 版本相反:任务从云端开始,由前沿模型处理最困难的推理、网络研究和长周期规划,而编排器将敏感的子步骤交给运行在 Apple silicon 上的本地子智能体。文件、本地数据和设备操作都留在 Mac 上,上下文在交接后得以保留,本地 token 绝不会传到云端。本地引擎正是本文要讨论的模型——PPLX 27B,即 Perplexity 后期训练的 Qwen 3.8 27B,据 Perplexity 称,该模型在公司 Mac 资料中列为 PPLX Qwen 3.8 27B,并可通过应用中的一键下载安装,无需 Ollama 或终端设置。关于其余产品阵容,发布报道有所不同:大多数媒体将 Google 的 Gemma 4 E4B 和阿里巴巴的 Qwen3.6 35B-A3B 列为其他设备端选项,而有一家则提到 Perplexity 后期训练的 Qwen 3.6 35B,而非 27B——这一细节在发布首日并未得到媒体的一致确认。
Perplexity 主打的特色是 Privacy Gate(隐私门),这是一个由其 Secure Intelligence Institute(安全智能研究所)训练的端侧分类器。在传输任何数据之前,它会读取每项任务——提示词、工具输出、内存、日志——寻找个人可识别信息:姓名、地址、账号、凭据、支付卡号和政府身份证件。检测到的值会在请求离开 Mac 之前被替换为替身,并在答案返回时恢复;当门禁标记出某些内容时,用户决定该步骤是在本地运行、被屏蔽还是被共享——门禁只询问,不决定。Perplexity 还表示,它已开源该分类器,并发布了 PII-TRACE,这是一个基于 13 种语言、13,148 段合成对话构建的基准测试集,用于评估 PII 检测器。这些是公司声明,未经独立审计。
Hybrid Compute 可在任何搭载 Apple silicon 的 Mac 上运行,需 macOS 15 或更高版本,且统一内存最低 24GB——推荐 32GB,Perplexity 表示 8GB 和 16GB 内存的机器不在支持范围内。该功能通过桌面应用向 Pro、Max 和 Enterprise 订阅用户提供,企业账户需主动选择启用,管理员可设置组织范围的敏感度策略,并查看每台设备向外发送内容的记录。本地工作不消耗云积分,本地生成的令牌也不收费——只有云端编排和委派步骤需要付费,且无需 API 密钥。注意事项与 Linux 版本发布时一致:门控本身就是一个模型,因此可能出现漏报,评测者也迅速指出,该保护的有效性取决于用户在收到提示时做出的选择。尤其是 AppleInsider 建议,在将敏感数据托付给该功能之前先进行测试。

路由器的安装位置
PPLX 27B 并不是 OrcaRouter 所路由的对象——它运行在你自己拥有的硬件上,依托 Perplexity 订阅,我们不会假装不是这样。我们真正路由的,是这次发布所引出的那组对比模型。Qwen 3.8 27B——正是 PPLX 27B 进行后训练所基于的那份原始基础权重——已在 OrcaRouter 自托管环境上线;DeepSeek V4 Flash、Gemini 3.5 Flash Lite 和 GPT-5.6 Luna 同样如此——全都通过一个 API 密钥、按提供商标价提供,零加价透传,因此厂商一旦宣布降价,我们这边当天即同步生效。
这一点在这里有一个具体的理由。Portable Computer 的卖点是本地与云端的成本对比,而这一对比中云端那一半是否诚实,取决于你拿来比较的价格。在 OrcaRouter 上,那些价格就是提供商的实际标价,这让本地还是云端的决策变成一项你可以信赖的计算,而不是一场营销式的比较。如果你想用两种方式为同一个智能体做原型验证——本地运行框架放在一台机器上,云端模型放在一个端点后面——自动故障转移能让云端在本地模型力所不及时顶上来,无需第二份合同,也无需第二条代码路径。Hybrid Compute 重复的是同一笔交易——本地 token 免费,云端编排是唯一支出——所以无论本地那一半运行在 DGX Spark、Linux RTX 工作站、Mac,还是——自 9 月 14 日起——一台配备 RTX GPU 的 Windows PC 上,这项计算都成立。

看什么
未来一个月内的四件事将决定这是一个小众产品,还是一个品类的开端。Perplexity 是否会真正开源 Local Knowledge Work Bench——这会把那些头条数字从宣称变成社区能够复现的东西。Nemotron 3.5 Lightning 是否会落地,并在同一套测试框架上击败 PPLX 27B——“为测试框架进行后训练”的论点,成色取决于其底层的基础模型。Privacy Gate 在分类器已经开源之后,能否经受住对抗性审查——只有在它确实能让姓名、账号和凭据不被传出去时,概率性 PII 检测器才会成为混合方案的关键。以及 Linux 发布时从未拥有的触达范围,最终是否会通过 9 月的扩展而到来——9 月 3 日确认的 RTX-24GB Linux 路线、9 月 14 日在 Perplexity Windows 应用中确认的 Windows 支持,以及 Mac 上的 Hybrid Compute——把同样的本地智能体经济性,带到 Perplexity 迄今已推出的最广泛的消费级硬件上。如果基准测试是真实的,并且测试框架可以迁移,“在你自己的硬件上运行智能体”就不再是一种爱好者模式,而会成为一个真正有分量的部署选项——而与之比较的云端模型,将不得不证明自己配得上按 token 计费的价格。
