一張生成的主視覺卡片,標題為「Claude Haiku 5.5 vs PPLX 27B」,副標為「每 token $0.00 並非免費」,標籤寫著:無硬體對比約 $4,500、1M 對比 262K 上下文,以及雲端對比裝置端。
Guides & Insights

Claude Haiku 5.5 對比 PPLX 27B:每 Token $0.00 不等於免費

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

PPLX 27B 每個 token 不花一毛錢。它在你擁有的硬體上本機執行,而一旦硬體買了,下一個 token 的邊際成本確實就是零。Claude Haiku 5.5 每百萬輸入 token 收費 0.10 美元,每百萬輸出收費 0.50 美元——這個數字小到值得好好把減法算清楚,而不是直接接受那個顯而易見的結論。一台能好好執行 PPLX 27B 的機器,大約是 4,500 美元的 DGX Spark,或是一台配備 24GB 以上 RTX 顯卡的桌機,而 4,500 美元的 Claude Haiku 5.5 輸出 token 大約是九十億個。所以這場對決真正要問的問題,並不是哪個比較便宜。而是你預期會燒掉多少 token,以及答案會不會因為這些 token 就擺在你桌上而改變。

Claude Haiku 5.5 是該廠商的小型模型,於 2026 年 10 月 7 日發布。PPLX 27B 由 Perplexity 於 2026 年 8 月 25 日與 Portable Computer 一同發表,並與 NVIDIA 合作打造;它是開放權重 Qwen 3.8 27B 的後訓練版本,針對 Perplexity 自家的測試框架調校。兩者無法彼此直接替換,且都不在 OrcaRouter 的型錄上。

這兩種模型,以及為什麼其中一種就在你的桌上

Claude Haiku 5.5 — ID claude-haiku-5-5,輸入文字與圖像,輸出文字,上下文長度 100 萬個詞元(token),最大輸出 128,000 個詞元,在 Batch API 上另有 300,000 個詞元的 Beta 路徑,訓練資料截止於 2026 年 6 月,並承諾在 2027 年 10 月 7 日之前不會將其退役。Effort 從 Low 到 Max,預設為 Medium,自適應思考預設為開啟,快取讀取每百萬個詞元收費 $0.01,Batch 則可享半價。這是一款託管產品:你送出詞元,取回詞元,永遠看不到 GPU。

PPLX 27B — 一個擁有 270 億參數的稠密模型,衍生自 Qwen 3.8 27B,並針對 Perplexity 自家的代理框架做後訓練。它可在 DGX Spark 上的 Portable Computer 內執行,或在配備 24GB 以上 NVIDIA RTX 顯卡的 Linux 機器上執行,而且不會離開該機器。2026 年 9 月 1 日新增的混合模式,會讓它與雲端模型搭配,在裝置端的隱私閘門(Privacy Gate)後方處理較繁重的工作;Linux 的 RTX 支援於 9 月 3 日推出;Windows 對 24GB 以上 RTX 顯卡的支援於 9 月 14 日推出,同時也帶來了本機 MCP 與排程工作。後訓練的權重為專有,且需具備 Perplexity Pro 或 Max 訂閱才能使用。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs PPLX 27B — the scoreboard'. Claude Haiku 5.5 reads marginal price $0.10 / $0.50 per million tokens, no upfront hardware, 1M-token context, 128K max output, AA Index 43, vendor-cloud data path; PPLX 27B reads marginal price $0.00 per token, about $4,500 upfront hardware, about 262K tokens of context, max output not published, no published independent score, on-device-only data path. A footer notes the Claude figures are per Artificial Analysis and the PPLX 27B figures are vendor-reported.

• 尺寸,每行一項

• 每個 token 的邊際成本——Claude Haiku 5.5 每百萬輸入 token 為 $0.10,每百萬輸出 token 為 $0.50,適用於提示在 10 萬 token 以內的情況;超過之後則為 $0.50 和 $2.50;PPLX 27B 則為零,只要硬體成本付清之後。

• 入門成本 — 除了 Claude Haiku 5.5 的 API 金鑰之外,別無其他花費;若要用 PPLX 27B,大約需要 $4,500 購買 DGX Spark,或是一台配備 24GB 以上 NVIDIA RTX 顯示卡的桌上型電腦。

• 上下文視窗 — Claude Haiku 5.5 為 1,000,000 個 token,對比從 Qwen 3.8 27B 承襲而來的約 262,144 個。

• 最大輸出 — Claude Haiku 5.5 為 128,000 個 token,在 Batch 上搭配 300,000-token 的 Beta 標頭;PPLX 27B 未公布。

• 資料會流向何處 — Anthropic 的雲端對上你自己的機器,並由混合模式的 Privacy Gate 決定哪些資料會離開本機。

• 獨立評分 — Claude Haiku 5.5 在 Artificial Analysis Intelligence Index 獲得 43,Max 配置下為 43.40,在 182 個中排名第二;PPLX 27B 則未公布任何資料,因為 Artificial Analysis 並未追蹤該模型。

• 輸出速度 — Claude Haiku 5.5 為每秒 243.4 個 token;PPLX 27B 取決於你的 GPU,且在沒有公布數據的情況下無從比較。

• 輸入模態——文字與圖像對比文字,繼承自多模態基礎。

• 權重——兩者皆為專有,但原因不同:前者未釋出權重,後者則是需訂閱才能取得的受限後訓練版本。

硬體就是價格,而價格就是誠實的考驗。

「免費」是用來描述本地推論的錯誤詞彙,而廠商心裡有數,所以他們引用的數字永遠是邊際成本。正確的比較應該是損益兩平:一台 4,500 美元的機器,以 Claude Haiku 5.5 每百萬輸出 token 0.50 美元的價格計算,要達到九十億個輸出 token,硬體才會回本。一個每月產生一億個輸出 token 的團隊,大約七年半才能達到這個損益兩平點,而到那時 GPU 早已過時。一個每月產生五十億個的團隊,不到兩個月就能達到。

兩個答案都是正確的,只是它們各自適用於不同的公司。這正是為什麼這個比較無法單憑規格表來斷定,也是為什麼上述的計算忽略了在實務上讓本地推論變得昂貴的所有因素:電力、機架空間、負責驅動程式更新的人,以及桌上型機器是單點故障(除非你買了兩台)這個事實。把這些納入考量,損益平衡點就會進一步推遲。

以那筆錢進行本地推論所換到的,根本不是成本。它換到的是一種保證:提示詞永遠不會離開自家內部;對法務、醫療或國防相關團隊來說,這比任何每 token 費率都更有價值,而 Anthropic 提供的任何折扣都無法取而代之。反過來說,Claude Haiku 5.5 的 100 萬 token 上下文與 128,000 token 輸出上限,是你在 24GB 顯示卡上無論花多少錢都買不到的東西,而一台 4,500 美元的機器也改變不了這一點。

85.4% 實際上衡量的是什麼

Perplexity 公佈的 PPLX 27B 數字,是在其自家 53 項任務的 Local Knowledge Work Bench 上達到 85.4%,而同一套測試框架在未經調校的 Qwen 3.8 27B 基礎模型上跑出 82.6%,Pi 為 77.6%,Hermes 為 74.0%。關於這點,有三件事值得直說,因為上市報導普遍沒有提到它們。

這是廠商自行回報的結果,尚未經過獨立重現。這是在廠商自家測試框架上進行的比較,而對於在該框架上做過後訓練的模型來說,這是最公平不過的測試——相較於基礎模型的增益,有一部分來自對這項測試的擬合。而且它專門衡量本地知識工作:檢索、摘要、文件處理,這些正是 Portable Computer 所為之打造的任務。它不是一般能力分數,也不應被解讀為一般能力分數。

基礎模型則是另一回事。Qwen 3.8 27B 是稠密模型,採 Apache-2.0 授權,為多模態模型,於 2026 年 8 月 14 日發布,原生上下文視窗達 262,144 個 token,而 Artificial Analysis 將其推理組態評為 Intelligence Index 44——比 Claude Haiku 5.5 的 43.40 高出一分,但價格不同。PPLX 27B 就是該模型再加上 Perplexity 的後訓練,因此誠實的解讀是:底層權重落在 Claude Haiku 5.5 的能力區間內,而微調則把它們推向單一廠商的工作負載。你買到的究竟是這兩者中的哪一個,正是那 85.4% 刻意不回答的問題。

Claude Haiku 5.5 無需基準測試也能勝出的地方

首先是長上下文:1M token 對比約 262K,以及 128,000 token 的最大輸出對比一個未公開的數字。其次是圖像輸入,Qwen 3.8 系列具備這項能力,但 Perplexity 的測試框架並未宣傳。第三是投入程度控制,而這是最被低估的一項——Low 設定的存在,正是為了讓你在不需要推理的呼叫上停止支付推理 token,這是一項本地模型無法提供的成本槓桿,因為根本沒有帳單可以降低。

還有可用性,第四點。Claude Haiku 5.5 是 API 上的一個模型字串,而獨立數據確實存在:Intelligence Index 整體為 43,在 Max effort 下為 43.40,在 182 個中排名第二,每項 index 任務 $0.21,輸出速度為每秒 243.4 個 token,首個 token 約需 0.3 秒。當你在判斷某個工作負載是否已準備好轉移時,一個不是你親自計算出來的已發布評分,比你自己算出的更快數字更有價值。

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

PPLX 27B 無需基準測試也能勝出的地方

隱私是首要且最重要的一點:token 永遠不會離開這台機器,這是任何託管式模型都做不到的。大量使用下的成本是第二點,而且一旦每月輸出超過數十億個 token,這筆帳就真實存在。離線運作是第三點——一台放在地下室、毫無連線的筆電照樣能給出答案,而 Claude Haiku 5.5 辦不到。至於 9 月 1 日新增的混合模式,則是這項產品中最有意思的設計:由本地模型處理例行事務,並在裝置端閘門之後以雲端模型應付棘手狀況,正是同時兼得隱私與能力的方式,而無論團隊向哪家廠商採購,這都是他們最該效法的架構。

PPLX 27B 並未提供的,是一個可攜的解答。它綁定在 Portable Computer 上,必須訂閱才能取得權重,而這些權重是他人模型的衍生物——因此你實際持有的授權是 Perplexity 的,而非 Apache-2.0。如果目標是一個你可以 fork 並發布的模型,基礎版 Qwen 3.8 27B 才具有寬鬆授權,但那是與本文所談模型不同的模型。

A capture of the OrcaRouter model page for qwen/qwen3.8-27b showing the Qwen3.8-27B listing with its Vision, Tools, JSON and Reasoning badges, its per-million pricing and the description noting it is released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

從單一按鍵執行其中任一個,以及這會在哪裡停止

PPLX 27B 完全不透過 API 提供:它直接在 Portable Computer 內、你的自有硬體上執行,而混合模式則會穿過隱私閘門,連到另一側由 Perplexity 選擇的雲端模型。Claude Haiku 5.5 可透過 Anthropic 自家的 API 取得,並從那裡延伸到任何轉售 Anthropic 模型的地方。兩者都不在 OrcaRouter 的目錄中,我們也不會暗示它們有——我們從這兩個系列所路由的是 anthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5 與 anthropic/claude-fable-5.1,另外還有 PPLX 27B 進行後訓練所依據的 Qwen 3.8 27B 基礎模型,它在目錄中列為 qwen/qwen3.8-27b,並在我們自家的基礎設施上自行託管。

最後那一點才是實際的。如果你當初關注 PPLX 27B 的原因,是它底層的 Qwen 3.8 27B 權重,而不是本機執行,那麼你可以透過一個涵蓋 200 多個模型的 API 取得基礎模型,一組金鑰、一份帳單,供應商定價以 0% 加成原價傳遞,底層還能在各供應商之間自動容錯轉移。如果你真正需要的是提示詞永遠不離開這台機器,那麼任何閘道都不是答案,Portable Computer 才是。

這項決定,不假裝數字能為它定案

如果你的提示詞無法離開你的基礎設施,PPLX 27B 就是這兩者中唯一對你而言存在的選擇,而這 4,500 美元並不是成本比較——它是你無法透過協商擺脫的限制所帶來的代價。如果你每月燒掉超過數十億個輸出 token,本地路線會在一季內回本,之後還會持續帶來回報。

如果這兩者皆非事實,Claude Haiku 5.5 幾乎在任何用量下都是更划算的選擇:無需硬體、無需維運、1M token 視窗、128,000 token 輸出上限、圖片輸入、可依需求調降成本的 effort 調節鈕、已公布的獨立評分 43,以及每百萬 token $0.10 與 $0.50 的價格,這使得相對於工作站的損益兩平點大約落在九十億 token 之後。每 token $0.00 這個數字是真的。只是它不是全部的減法。

如果你查看 PPLX 27B 的原因,是它底下的 Qwen 3.8 27B 權重,而不是本機執行,那麼你可以透過一個涵蓋 200 多個模型的 API 取得這個基礎模型,一組金鑰與一份帳單,供應商定價以 0% 加成原樣傳遞,且底層會在各供應商之間自動容錯移轉。