
Claude Haiku 5.5 与 PPLX 27B:每个 Token $0.00 并不等同于免费
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
PPLX 27B 每个 token 的成本为零。它在本地运行,在你拥有的硬件上运行,而一旦买下硬件,下一个 token 的边际成本确实就是零。Claude Haiku 5.5 每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.50 美元——这个数字小到值得把减法认认真真做一遍,而不是直接接受那个显而易见的结论。一台能很好地运行 PPLX 27B 的机器,大约是 4,500 美元的 DGX Spark,或者一台配有 24GB 或以上 RTX 显卡的台式机;而 4,500 美元的 Claude Haiku 5.5 输出 token,大约是九十亿个。所以这场对比真正要问的,不是哪个更便宜。而是你预计会烧掉多少 token,以及这个答案是否会因为那些 token 就摆在你桌上而改变。
Claude Haiku 5.5 是该厂商的小型模型,于 2026 年 10 月 7 日发布。PPLX 27B 由 Perplexity 于 2026 年 8 月 25 日与 Portable Computer 一同发布,后者基于 NVIDIA 构建;PPLX 27B 是开放权重模型 Qwen 3.8 27B 的后训练版本,针对 Perplexity 自家的运行框架进行了调优。两者都不能直接替代对方,且都不在 OrcaRouter 的产品目录中。
这两种模型,以及为什么其中一种就放在你的办公桌上
Claude Haiku 5.5 — ID claude-haiku-5-5,支持文本和图像输入、文本输出,100 万 token 上下文,最大输出 128,000 token,在 Batch API 上还提供 30 万 token 的测试版路径,训练数据截止到 2026 年 6 月,并承诺在 2027 年 10 月 7 日之前不会将其退役。Effort 档位从 Low 到 Max,默认为 Medium;自适应思考默认开启;缓存读取每百万 token 收费 0.01 美元,Batch 费率减半。它是一款托管产品:你发送 token,你获得 token,永远看不到 GPU。
PPLX 27B——一款 270 亿参数的稠密模型,衍生自 Qwen 3.8 27B,并针对 Perplexity 自家的智能体运行框架进行了后训练。它可在 DGX Spark 上的 Portable Computer 内运行,也可在配备 24GB 及以上 NVIDIA RTX 显卡的 Linux 机器上运行,且不会离开该机器。2026 年 9 月 1 日新增的混合模式会将它与会话云端模型配对,在设备端隐私网关之后处理更繁重的工作;面向 RTX 的 Linux 支持于 9 月 3 日推出;面向 24GB 及以上 RTX 显卡的 Windows 支持于 9 月 14 日推出,同时带来本地 MCP 和计划任务。后训练权重为专有资产,需订阅 Perplexity Pro 或 Max 方可使用。

• 尺寸,每行一个
• 每 token 边际成本 — Claude Haiku 5.5 输入每百万 $0.10,输出每百万 $0.50,提示最多 100K token;超过后为 $0.50 和 $2.50;PPLX 27B 则免费,前提是硬件已付费。
• 启动成本 — 除了 Claude Haiku 5.5 的 API 密钥外,无需其他费用;DGX Spark 大约 4,500 美元,或者一台配备 24GB 或更大显存的 NVIDIA RTX 显卡的台式机,用于 PPLX 27B。
• 上下文窗口——Claude Haiku 5.5 为 1,000,000 个词元,而 Qwen 3.8 27B 继承的约为 262,144 个。
• 最大输出 — Claude Haiku 5.5 为 128,000 个 token,在 Batch 上带有 300,000 token 的 beta 标头;PPLX 27B 未公布。
• 数据流向何处 — Anthropic 的云端还是你自己的机器,由混合模式的 Privacy Gate 决定哪些数据会离开它。
• 独立评分 — Claude Haiku 5.5 在 Artificial Analysis Intelligence Index 上得分为 43,Max 配置为 43.40,在 182 个中排名第二;PPLX 27B 未公布任何数据,Artificial Analysis 并未追踪该模型。
• 输出速度——Claude Haiku 5.5 为每秒 243.4 个 token;PPLX 27B 则取决于你的 GPU,且在没有公布数据的情况下无法直接比较。
• 输入模态——文本和图像对照文本,继承自多模态基座。
• 权重——两种情况都是专有的,但原因不同:一个是未发布权重,另一个是需要订阅才能获取的受限后训练。
硬件即价格,而价格即诚实的检验
“免费”这个词用在本地推理上并不恰当,厂商对此心知肚明,所以他们引用的数字始终是边际成本。正确的比较方式是盈亏平衡:一台 4,500 美元的机器,按 Claude Haiku 5.5 每百万输出 token 0.50 美元计算,要产出 90 亿输出 token 才能回本。一个每月生成 1 亿输出 token 的团队大约需要七年半才能达到这个点,到那时 GPU 已经过时。一个每月生成 50 亿输出 token 的团队不到两个月就能达到。
两个答案都正确,而且它们对不同公司而言都是正确的。这正是为什么这种比较无法在规格表上解决的原因,也正是为什么上面的分析忽略了所有让本地推理在实践中变得昂贵的东西:电费、机架空间、负责驱动更新的人,以及一个事实——放在桌上的机器是单点故障,除非你买了两台。把这些算进去,盈亏平衡点还会进一步后移。
这笔钱买到的本地推理根本不是成本优势。它买到的是提示词永不离开建筑的保证,对法律、医疗或国防相关团队而言,这比任何按token计费的价格都更有价值,Anthropic提供的任何折扣都无法替代这一点。反过来,Claude Haiku 5.5的100万token上下文和128,000 token输出上限,是你在24GB显卡上花多少钱都买不到的,一台4500美元的机器也改变不了这个事实。
85.4% 究竟衡量的是什么
Perplexity 为 PPLX 27B 公布的数字是,在其自家的 53 项任务 Local Knowledge Work Bench 上达到 85.4%,相比之下,同一评测框架运行在未经调优的 Qwen 3.8 27B 基座模型上为 82.6%,Pi 为 77.6%,Hermes 为 74.0%。关于这一点,有三件事值得直说,因为发布报道普遍没有提到它们。
这是由厂商报告的,尚未经独立复现。它是在厂商自有测试框架上所做的比较,而对于一个在该框架上完成后期训练的模型来说,这已是最公平的测试——相较基座模型取得的提升,有一部分其实是"更贴合该测试"所带来的提升。而且它专门衡量的是本地知识工作:检索、摘要、文档处理,正是 Portable Computer 所面向的那类任务。它不是通用能力评分,也不应被当作通用能力评分来解读。
基础模型则是另一回事。Qwen 3.8 27B 是稠密模型,采用 Apache-2.0 许可,多模态,于 2026 年 8 月 14 日发布,原生上下文窗口为 262,144 个 token,Artificial Analysis 将其推理配置评为 Intelligence Index 44——比 Claude Haiku 5.5 的 43.40 高出一分,而价格并不相同。PPLX 27B 就是该模型加上 Perplexity 的后训练,所以诚实的解读是:底层权重处于 Claude Haiku 5.5 的能力区间内,而调优把它们推向了某一家厂商的工作负载。你买的究竟是这两者中的哪一个,正是这 85.4% 被设计来不予回答的问题。
Claude Haiku 5.5 在哪些方面无需基准测试便能胜出
首先是长上下文:1M tokens 对 262K,以及 128,000 tokens 的最大输出对上一个未公布的数字。其次是图像输入,Qwen 3.8 系列具备它,但 Perplexity 的框架并未宣传这一点。第三是 effort 控制,而这是被低估的一项——Low 设置的存在,正是为了让你在不需要它们的调用上停止为推理 tokens 付费,这是一个本地模型无法提供的成本杠杆,因为根本没有账单可降。
还有可用性,第四点。Claude Haiku 5.5 是 API 上的一个模型字符串,而独立的数字是存在的:综合智能指数 43,Max 努力档位下 43.40,在 182 个模型中排名第二,每个指数任务 $0.21,输出速率 243.4 tokens 每秒,首 token 约 0.3 秒。当你判断一个工作负载是否已准备好迁移时,一个并非由你自己计算得出的公开分数,比你自己算出的更快的数字更有价值。

PPLX 27B 无需基准测试也能胜出的地方
隐私是第一位的,也是最重要的:token 从不离开本机,这是任何托管模型都无法企及的。规模化下的成本是第二点,而当每月输出 token 超过几十亿之后,这一点就真实存在了。离线运行是第三点——一台在地下室、没有网络连接的笔记本电脑仍能作答,而 Claude Haiku 5.5 做不到。9 月 1 日新增的混合模式是这款产品中最有趣的设计:让本地模型处理常规工作,云端模型则在设备端闸门之后负责棘手请求,这正是同时获得隐私与能力的途径,而且无论团队从哪家供应商购买,这都是最值得效仿的架构。
PPLX 27B 所不提供的,是一个可移植的答案。它绑定在 Portable Computer 上,获取权重需要订阅,而且这些权重是别人模型的衍生物——因此你实际持有的许可证是 Perplexity 的,而不是 Apache-2.0。如果你的目标是获得一个可以 fork 并发布的模型,那么基础版 Qwen 3.8 27B 才是采用宽松许可证的那个,但它与本文所讨论的模型并不是同一个。

用一个键运行其中任意一个,以及它在哪里停止
PPLX 27B 完全不通过 API 提供:它运行在你自己硬件上的 Portable Computer 中,而混合模式会在 Privacy Gate 的另一侧连接到 Perplexity 选择的云模型。Claude Haiku 5.5 可通过 Anthropic 自己的 API 使用,并从那里,在 Anthropic 模型被转售的任何地方也可使用。两者都不在 OrcaRouter 的目录中,我们也不会暗示并非如此——我们从这两个系列路由的是 anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5 和 anthropic/claude-fable-5.1,另外还有 PPLX 27B 进行后训练所基于的 Qwen 3.8 27B 基础模型,它位于目录中 qwen/qwen3.8-27b,并自托管在我们自己的基础设施上。
最后一点很实际。如果你关注 PPLX 27B,是因为它底层的 Qwen 3.8 27B 权重,而不是本地执行,那么你可以通过一个 API 获取 200 多个模型,一个密钥、一张账单,按供应商标价 0% 加价透传,并在底层进行供应商故障转移。如果你真正需要的是提示词不离开本机,那答案不是任何网关,而是 Portable Computer。
这个决定,不假装数字能一锤定音
如果你的提示词无法离开你的基础设施,那么 PPLX 27B 就是这两者中唯一对你存在的选择,而那 4,500 美元也不是成本对比——它是你无法通过谈判摆脱的约束的代价。如果你每月消耗超过几十亿输出 token,本地路线在一个季度内就能回本,之后还会持续带来收益。
如果这两种情况都不成立,那么 Claude Haiku 5.5 在几乎任何用量下都是更值得买的选择:没有硬件,没有运维,100 万 token 的窗口,128,000 token 的输出上限,支持图像输入,有一个可按需调低成本的投入力度调节旋钮,一项已发布的独立评分为 43,以及每百万 token 0.10 美元和 0.50 美元的价格,这使得它与工作站相比的盈亏平衡点大约在 90 亿 token 之后。每 token $0.00 这个数字是真的。只是它并不是整个减法。
如果你关注 PPLX 27B 的原因,是它底层所用的 Qwen 3.8 27B 权重,而不是本地执行,一个密钥、一张账单,那么你可以通过一个覆盖 200 多个模型的 API 直接使用这个基础模型:服务商标价按 0% 加价率原样透传,并在底层实现跨服务商的自动故障转移。
