「Claude Haiku 5.5 vs PPLX 27B」というタイトルの生成されたヒーローカードで、キッカーは「トークンあたり$0.00は無料ではない」、チップは「ハードウェア不要 対 約$4,500」「1M 対 262Kコンテキスト」「クラウド 対 オンデバイス」。
Guides & Insights

Claude Haiku 5.5 vs PPLX 27B:トークンあたり$0.00は無料と同じではない

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

PPLX 27B はトークンあたりのコストがゼロです。ローカルで、自分が所有するハードウェア上で動作し、いったんハードウェアを購入してしまえば、次のトークンの限界費用は本当にゼロです。Claude Haiku 5.5 は入力トークン100万あたり $0.10、出力トークン100万あたり $0.50 かかります。これは、明白な結論をそのまま受け入れるのではなく、きちんと引き算をする価値があるほど小さな数字です。PPLX 27B を快適に動かせるマシンは、およそ $4,500 の DGX Spark か、24GB 以上の RTX カードを搭載したデスクトップであり、$4,500 分の Claude Haiku 5.5 の出力トークンは約90億トークンになります。したがって、この対決が本当に問いかけているのは、どちらが安いかではありません。どれだけのトークンを消費する見込みがあるのか、そしてトークンが自分の机の上にあるという理由でその答えが変わるのかどうかです。

Claude Haiku 5.5はベンダーの小型モデルで、2026年10月7日にリリースされた。PPLX 27Bは、2026年8月25日にPerplexityがPortable Computerとともに発表したもので、NVIDIAと共同で構築されており、オープンウェイトのQwen 3.8 27BをPerplexity独自のハーネス向けにポストトレーニングしたバージョンである。どちらも他方の代替としてそのまま使えるものではなく、どちらもOrcaRouterのカタログには掲載されていない。

2つのモデル、そしてそのうちの1つがあなたの机の上に居着く理由

Claude Haiku 5.5 — ID claude-haiku-5-5、テキストと画像を入力してテキストを出力、100万トークンのコンテキスト、最大出力128,000トークン(Batch APIでは300,000トークンのベータ経路あり)、学習カットオフは2026年6月で、2027年10月7日より前に廃止しないことを約束しています。EffortはLowからMaxまで設定でき、デフォルトはMedium、適応的思考はデフォルトで有効、キャッシュ読み取りは100万トークンあたり$0.01で、Batchでは料金が半額になります。これはホスト型製品です。トークンを送ればトークンが返ってきて、GPUを目にすることはありません。

PPLX 27B — Qwen 3.8 27B を基にし、Perplexity 独自のエージェントハーネス向けにポストトレーニングされた、270億パラメータの稠密モデル。DGX Spark 上、または 24GB 以上の NVIDIA RTX カードを搭載した Linux マシン上の Portable Computer 内で動作し、そのマシンから外には出ない。2026年9月1日に追加されたハイブリッドモードでは、オンデバイスの Privacy Gate の背後で、より重い処理のためにクラウドモデルとペアリングする。RTX の Linux サポートは9月3日に提供開始され、24GB 以上の RTX カードの Windows サポートは、ローカル MCP とスケジュールされたタスクとともに9月14日に提供開始された。ポストトレーニング済みの重みはプロプライエタリで、Perplexity Pro または Max のサブスクリプションの背後にある。

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs PPLX 27B — the scoreboard'. Claude Haiku 5.5 reads marginal price $0.10 / $0.50 per million tokens, no upfront hardware, 1M-token context, 128K max output, AA Index 43, vendor-cloud data path; PPLX 27B reads marginal price $0.00 per token, about $4,500 upfront hardware, about 262K tokens of context, max output not published, no published independent score, on-device-only data path. A footer notes the Claude figures are per Artificial Analysis and the PPLX 27B figures are vendor-reported.

• 寸法はそれぞれ1行ずつ

• トークンあたりの限界費用 — Claude Haiku 5.5 は入力100万トークンあたり$0.10、出力はプロンプト100Kトークンまで100万トークンあたり$0.50、それを超えると$0.50と$2.50。PPLX 27Bは、ハードウェア代を支払ってしまえばゼロ。

• 開始コスト — Claude Haiku 5.5 の API キー以外は何も不要。PPLX 27B なら、DGX Spark に約 $4,500、または 24GB 以上の NVIDIA RTX カードを搭載したデスクトップ。

• コンテキストウィンドウ — Claude Haiku 5.5では1,000,000トークン、Qwen 3.8 27Bから継承した約262,144トークンに対して。

• 最大出力 — Claude Haiku 5.5 では 128,000 トークン、Batch では 300,000 トークンのベータヘッダー付き、PPLX 27B では非公開。

• データの行き先 — Anthropicのクラウドか、自分のマシンか。ハイブリッドモードのPrivacy Gateが、何がそこから外に出るかを判断します。

• 独立したスコア — Claude Haiku 5.5 の Artificial Analysis Intelligence Index は 43、Max 構成では 43.40 で、182 件中 2 位。PPLX 27B については何も公表されておらず、Artificial Analysis はこれを追跡していない。

• 出力速度 — Claude Haiku 5.5 では毎秒 243.4 トークン、PPLX 27B ではお使いの GPU に依存し、公表された数値がないため比較できません。

• 入力モダリティ — テキスト、および画像対テキスト。マルチモーダルなベースモデルから継承。

• 重み — どちらの場合もプロプライエタリだが、理由は異なる。重みが一切公開されていないのに対し、入手にはサブスクリプションが必要な制限付きポストトレイン版である。

ハードウェアが価格であり、価格が誠実さの試練なのだ

「無料」はローカル推論にふさわしい言葉ではなく、ベンダーもそれを分かっている。だからこそ、常に引用される数字は限界費用なのだ。正しい比較は損益分岐点である。4,500ドルのマシンは、Claude Haiku 5.5の出力トークン100万あたり0.50ドルという単価では、ハードウェアが元を取るまでに90億出力トークンに相当する。月に1億出力トークンを生成するチームがその点に達するのは約7年半後で、その頃にはGPUは時代遅れになっている。月に50億を生成するチームなら、2か月未満で到達する。

どちらの答えも正しく、それぞれ別の企業にとって正しい。まさにそれが、この比較をスペックシート上で決着できない理由であり、上の計算が、ローカル推論を実運用で高コストにするあらゆる要素を無視している理由でもある。電気代、ラックスペース、ドライバー更新の担当者、そして2台買わない限りデスク上の1台は単一障害点であるという事実。これらを加えれば、損益分岐点はさらに先へ遠のく。

その金額でローカル推論が手に入れるものは、コストではまったくない。プロンプトが建物の外に出ないという保証であり、法務・医療・防衛関連のチームにとっては、どんなトークン単価よりも価値があり、Anthropic が提供するどんな割引もその代わりにはならない。逆に、Claude Haiku 5.5 の100万トークンのコンテキストと128,000トークンの出力上限は、24GB のカードではいくら出しても買えないものであり、4,500ドルのマシンでもそれは変わらない。

85.4%が実際に測定しているもの

PerplexityがPPLX 27Bについて公表した数値は、同社自身の53タスクのLocal Knowledge Work Benchで85.4%であり、同じハーネスを未調整のQwen 3.8 27Bベースで実行した場合は82.6%、Piは77.6%、Hermesは74.0%だった。このことについては、はっきり言っておくべきことが3つある。というのも、ローンチ時の報道は概してそれらを伝えていなかったからだ。

これはベンダーによる報告であり、独立に再現されたものではない。ベンダー自身のハーネス上での比較であり、そのハーネスで事後学習されたモデルにとっては可能な限り公平なテストである — ベースモデルに対する向上は、部分的にはテストへの適合における向上である。また、これは特にローカルなナレッジワークを測定している。検索、要約、文書処理、つまり Portable Computer がそのために作られているタスクである。これは汎用的な能力スコアではなく、そのように読むべきではない。

ベースモデルは別の話だ。Qwen 3.8 27B は dense で、Apache-2.0 ライセンスで、マルチモーダルであり、2026年8月14日にリリースされ、262,144トークンのネイティブコンテキストウィンドウを持つ。Artificial Analysis はその推論構成を Intelligence Index 44 と評価している — Claude Haiku 5.5 の 43.40 を1ポイント上回るが、価格は異なる。PPLX 27B はそのモデルに Perplexity のポストトレーニングを加えたものだ。したがって正直に読めば、基盤となる重みは Claude Haiku 5.5 の能力帯にあり、チューニングによってあるベンダーのワークロードに寄せられたということになる。この2つのうちどちらを買っているのかという問いは、85.4% が答えないように設計されている問いだ。

ベンチマークを必要とせずにClaude Haiku 5.5が勝利する場面

まず長いコンテキスト。約262Kに対して100万トークン、そして未公開の数値に対して最大出力128,000トークン。第二に画像入力。これはQwen 3.8系が備えているが、Perplexityのハーネスは公表していない。第三にエフォート制御。これが過小評価されているもので、Low設定は、必要としない呼び出しで推論トークンに支払うのをやめられるようにするために存在する。これは、下げるべき請求書が存在しないため、ローカルモデルには提供できないコストレバーだ。

そして可用性、4番目。Claude Haiku 5.5 は API 上のモデル文字列であり、独立した数値も存在します。Intelligence Index は総合 43、Max effort では 43.40 で、182 中 2 位、インデックスタスクあたり $0.21、毎秒 243.4 出力トークン、最初のトークンまで約 0.3 秒です。ワークロードを移行する準備ができているかどうかを判断するとき、自分で計算していない公表されたスコアは、自分で出したより速い数値よりも価値があります。

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

ベンチマークを必要とせずにPPLX 27Bが勝利する場面

プライバシーが第一で最も重要だ。トークンがマシンから出ることは決してなく、これはどのホスト型モデルにも真似できない。大量利用時のコストが第二で、月に数十億の出力トークンを超えると現実のものになる。オフライン動作が第三だ — 接続のない地下室のノートPCでも応答し、Claude Haiku 5.5は応答しない。そして9月1日に追加されたハイブリッドモードは、この製品で最も興味深い設計だ。定常作業をローカルモデルが行い、難しい判断はオンデバイスのゲートの背後にあるクラウドモデルが担うというのは、プライバシーと能力の両方を得るまさにその方法であり、どのベンダーから購入するかに関係なく、ほとんどのチームが模倣すべきアーキテクチャだ。

PPLX 27B が提供していないのは、持ち運び可能な答えです。それは Portable Computer に縛られ、重みを入手するにはサブスクリプションが必要で、その重みは他社のモデルの派生版です。したがって、実際にあなたが得るライセンスは Apache-2.0 ではなく Perplexity のものです。フォークして配布できるモデルが目的なら、寛容なライセンスを持つのはベースの Qwen 3.8 27B ですが、それはこの記事が扱っているモデルとは別物です。

A capture of the OrcaRouter model page for qwen/qwen3.8-27b showing the Qwen3.8-27B listing with its Vision, Tools, JSON and Reasoning badges, its per-million pricing and the description noting it is released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

どちらか一方を 1 つのキーから実行すること、そしてそれがどこで止まるか

PPLX 27BはAPI経由では一切提供されません。これはお客様自身のハードウェア上のPortable Computer内で動作し、ハイブリッドモードでは、プライバシーゲートの向こう側にあるPerplexityが選んだクラウドモデルに接続します。Claude Haiku 5.5はAnthropic自身のAPIを通じて利用でき、そこから、Anthropicのモデルが再販されているあらゆる場所で利用できます。どちらもOrcaRouterのカタログには掲載されておらず、そうであるかのような示唆もいたしません — この2つのファミリーから当社がルーティングするのはanthropic/claude-haiku-4.5、anthropic/claude-sonnet-5.5、anthropic/claude-opus-5.5、anthropic/claude-fable-5.1であり、それとは別に、PPLX 27Bのポストトレーニング元であるQwen 3.8 27Bベースもあります。これはカタログにqwen/qwen3.8-27bとして掲載されており、当社自身のインフラストラクチャ上でセルフホストされています。

最後の点は実用的な話だ。PPLX 27B を検討していた理由が、ローカル実行ではなく、その下にある Qwen 3.8 27B の重みだったのなら、200以上のモデルを扱う1つの API を通じてベースモデルを利用できる。1つのキーと1つの請求で、プロバイダーの定価を0%のマークアップでそのまま適用し、その下のプロバイダー間で自動フェイルオーバーする。本当に必要なのがプロンプトがマシンから一切出ないことなら、ゲートウェイは答えではなく、Portable Computer が答えだ。

数字がそれを決着させると装うことなく下された決定

プロンプトを自社インフラの外に出せないのであれば、この2つのうちあなたにとって存在するのは PPLX 27B だけであり、4,500ドルはコスト比較ではない――交渉で取り除けない制約の代価なのです。月に数十億を超える出力トークンを消費しているなら、ローカルという選択肢は四半期以内に元が取れ、その後もずっと利益を生み続けます。

どちらも当てはまらないなら、Claude Haiku 5.5 はほぼどのような量でもより良い買い物だ:ハードウェア不要、運用不要、1Mトークンのウィンドウ、128,000トークンの出力上限、画像入力、オンデマンドでコストを下げるエフォートダイヤル、公表された独立スコア43、そして100万トークンあたり$0.10と$0.50という価格は、ワークステーションに対する損益分岐点を約90億トークン先に設定する。$0.00/トークンという数字は真実だ。ただ、それは引き算のすべてではない。

PPLX 27B に目を向けた理由が、ローカル実行ではなくその土台にある Qwen 3.8 27B の重みだったなら、200 以上のモデルを扱える単一の API を通じてそのベースモデルを利用できます。キーは 1 つ、請求も 1 つ。プロバイダーの定価が 0% の上乗せでそのまま適用され、その下でプロバイダー間の自動フェイルオーバーも行われます。