
Claude Haiku 5.5 vs. PPLX 27B: 0,00 $ pro Token ist nicht dasselbe wie kostenlos
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
PPLX 27B kostet nichts pro Token. Es läuft lokal, auf Hardware, die Ihnen gehört, und sobald die Hardware gekauft ist, sind die Grenzkosten des nächsten Tokens tatsächlich null. Claude Haiku 5.5 kostet 0,10 US-Dollar pro Million Input-Tokens und 0,50 US-Dollar pro Million Output-Tokens — eine Zahl, die klein genug ist, dass es sich lohnt, die Subtraktion richtig durchzuführen, statt die naheliegende Schlussfolgerung zu akzeptieren. Eine Maschine, die PPLX 27B gut ausführen kann, ist ein DGX Spark für rund 4.500 US-Dollar oder ein Desktop mit einer RTX-Karte mit 24 GB oder mehr, und 4.500 US-Dollar in Output-Tokens von Claude Haiku 5.5 sind etwa neun Milliarden davon. Die Frage, die dieser Vergleich wirklich stellt, ist also nicht, welche der beiden günstiger ist. Sie lautet: Wie viele Tokens werden Sie voraussichtlich verbrauchen, und ändert sich die Antwort darauf, weil die Tokens auf Ihrem Schreibtisch stehen?
Claude Haiku 5.5 ist das kleine Modell des Anbieters und wurde am 7. Oktober 2026 veröffentlicht. PPLX 27B wurde von Perplexity am 25. August 2026 zusammen mit Portable Computer angekündigt, mit NVIDIA entwickelt, und es ist eine nachtrainierte Version des Open-Weight-Modells Qwen 3.8 27B, die auf Perplexitys eigene Harness abgestimmt ist. Keines ist ein Drop-in-Ersatz für das andere, und keines ist im Katalog von OrcaRouter.
Die beiden Modelle – und warum eines davon auf Ihrem Schreibtisch lebt
Claude Haiku 5.5 — ID claude-haiku-5-5, Text und Bild als Eingabe, Text als Ausgabe, 1-Mio.-Token-Kontext, maximale Ausgabe von 128.000 Token mit einem Beta-Pfad von 300.000 Token über die Batch API, Trainings-Cutoff Juni 2026 und die Zusage, das Modell nicht vor dem 7. Oktober 2027 abzuschalten. Effort reicht von Low bis Max, Standard ist Medium, adaptives Denken ist standardmäßig aktiviert, Cache-Lesevorgänge kosten 0,01 $ pro Million Token und bei Batch halbiert sich der Satz. Es ist ein gehostetes Produkt: Sie senden Token, Sie erhalten Token, Sie sehen nie eine GPU.
PPLX 27B — ein dichtes Modell mit 27 Milliarden Parametern, abgeleitet von Qwen 3.8 27B und nachtrainiert für Perplexitys eigenen Agent-Harness. Es läuft in Portable Computer auf einem DGX Spark oder auf einer Linux-Maschine mit einer NVIDIA RTX-Karte mit 24 GB oder mehr und verlässt diese Maschine nicht. Ein am 1. September 2026 hinzugefügter Hybridmodus kombiniert es mit einem Cloud-Modell für schwerere Arbeit hinter einem geräteseitigen Privacy Gate; Linux-Unterstützung für RTX kam am 3. September; Windows-Unterstützung für RTX-Karten mit 24 GB und mehr kam am 14. September, zusammen mit lokalem MCP und geplanten Aufgaben. Die nachtrainierten Gewichte sind proprietär und nur mit einem Perplexity Pro- oder Max-Abo verfügbar.

• Die Abmessungen, jeweils eine Zeile
• Grenzkosten pro Token – Claude Haiku 5.5: 0,10 $ pro Million Input und 0,50 $ Output bis zu 100K Token Prompt, danach 0,50 $ und 2,50 $; PPLX 27B: nichts, sobald die Hardware bezahlt ist.
• Einstiegskosten — nichts außer einem API-Schlüssel für Claude Haiku 5.5; etwa 4.500 $ für einen DGX Spark oder einen Desktop mit einer NVIDIA-RTX-Karte mit 24 GB oder mehr für PPLX 27B.
• Kontextfenster — 1.000.000 Token für Claude Haiku 5.5 gegenüber etwa 262.144, übernommen von Qwen 3.8 27B.
• Maximale Ausgabe — 128.000 Tokens für Claude Haiku 5.5, mit einem 300.000-Token-Beta-Header bei Batch; für PPLX 27B nicht veröffentlicht.
• Wohin die Daten gehen — Anthropics Cloud gegenüber deinem eigenen Rechner, wobei das Privacy Gate des Hybridmodus entscheidet, was ihn verlässt.
• Unabhängige Bewertung — Artificial Analysis Intelligence Index 43 für Claude Haiku 5.5, Max-Konfiguration 43.40, Zweiter von 182; für PPLX 27B, das Artificial Analysis nicht erfasst, wurde nichts veröffentlicht.
• Ausgabegeschwindigkeit — 243,4 Token pro Sekunde für Claude Haiku 5.5; bei PPLX 27B abhängig von deiner GPU und ohne veröffentlichten Wert nicht vergleichbar.
• Eingabemodalitäten — Text und Bilder gegen Text, übernommen von einer multimodalen Basis.
Gewichte — in beiden Fällen proprietär, aber aus unterschiedlichen Gründen: keine veröffentlichten Gewichte im Gegensatz zu einem eingeschränkten Post-Train, für dessen Erhalt ein Abonnement nötig ist.
Die Hardware ist der Preis, und der Preis ist der Ehrlichkeitstest.
„Kostenlos“ ist das falsche Wort für lokale Inferenz, und die Anbieter wissen das, weshalb die genannte Zahl immer Grenzkosten sind. Der richtige Vergleich ist eine Gewinnschwelle: Eine Maschine für 4.500 $ bei Claude Haiku 5.5 mit 0,50 $ pro Million Output-Tokens entspricht neun Milliarden Output-Tokens, bevor sich die Hardware bezahlt macht. Ein Team, das hundert Millionen Output-Tokens pro Monat erzeugt, erreicht diesen Punkt in etwa siebeneinhalb Jahren, und dann ist die GPU bereits veraltet. Ein Team, das fünf Milliarden pro Monat erzeugt, erreicht ihn in weniger als zwei Monaten.
Beide Antworten sind korrekt, und sie sind für unterschiedliche Unternehmen korrekt. Das ist genau der Grund, warum dieser Vergleich nicht auf einem Datenblatt entschieden werden kann, und es ist auch der Grund, warum die obige Rechnung alles außer Acht lässt, was lokale Inferenz in der Praxis teuer macht: den Strom, den Rack-Platz, die Person, die die Treiber-Updates verantwortet, und die Tatsache, dass ein Rechner auf einem Schreibtisch ein Single Point of Failure ist, sofern man nicht zwei gekauft hat. Rechnet man das hinzu, verschiebt sich der Break-even weiter nach hinten.
Was lokale Inferenz für dieses Geld liefert, ist überhaupt nicht der Kostenaspekt. Es ist die Garantie, dass ein Prompt das Gebäude nie verlässt, und die ist für ein juristisches, medizinisches oder verteidigungsnahes Team mehr wert als jeder Pro-Token-Tarif, und kein Rabatt, den Anthropic anbietet, ersetzt sie. Umgekehrt sind der 1M-Token-Kontext und die Ausgabeobergrenze von 128.000 Token bei Claude Haiku 5.5 Dinge, die man auf einer 24-GB-Karte zu keinem Preis kaufen kann, und eine Maschine für 4.500 $ ändert daran nichts.
Was die 85,4 % tatsächlich messen
Die von Perplexity veröffentlichte Zahl für PPLX 27B ist 85,4 % auf seinem eigenen Local Knowledge Work Bench mit 53 Aufgaben, gegenüber 82,6 % für denselben Harness, der auf der nicht feinabgestimmten Qwen 3.8 27B Basis läuft, 77,6 % für Pi und 74,0 % für Hermes. Drei Dinge daran verdienen es, klar gesagt zu werden, weil die Launch-Berichterstattung sie im Allgemeinen nicht erwähnte.
Es wurde vom Anbieter gemeldet und ist nicht unabhängig reproduziert worden. Es handelt sich um einen Vergleich auf dem eigenen Prüfstand des Anbieters, dem fairsten möglichen Test für ein Modell, das auf diesem Prüfstand nachtrainiert wurde — der Zugewinn gegenüber dem Basismodell ist teilweise ein Zugewinn bei der Anpassung an den Test. Und es misst speziell lokale Wissensarbeit: Retrieval, Zusammenfassung, Dokumentenverarbeitung, die Aufgaben, für die Portable Computer gebaut ist. Es ist kein allgemeiner Fähigkeitswert und sollte nicht als ein solcher gelesen werden.
Das Basismodell ist eine andere Sache. Qwen 3.8 27B ist dicht, Apache-2.0-lizenziert, multimodal und am 14. August 2026 mit einem nativen Kontextfenster von 262.144 Token veröffentlicht worden, und Artificial Analysis bewertet seine Reasoning-Konfiguration auf dem Intelligence Index mit 44 — einen Punkt über den 43,40 von Claude Haiku 5.5, zu einem anderen Preis. PPLX 27B ist dieses Modell plus das Post-Training von Perplexity, die ehrliche Lesart ist also, dass die zugrunde liegenden Gewichte im Fähigkeitsband von Claude Haiku 5.5 liegen und das Tuning sie in Richtung der Arbeitslast eines Anbieters verschoben hat. Welche dieser beiden Dinge man damit kauft, ist die Frage, die die 85,4 % nicht beantworten soll.
Wo Claude Haiku 5.5 gewinnt, ohne einen Benchmark zu benötigen
Langkontext, erstens: 1 M Token gegenüber etwa 262K und 128.000 Token maximale Ausgabe gegenüber einer nicht veröffentlichten Zahl. Bildeingabe, zweitens, die die Qwen-3.8-Reihe mitbringt, die Perplexitys Harness aber nicht bewirbt. Aufwandssteuerung, drittens, und sie ist die unterschätzte – die Low-Einstellung existiert speziell dafür, dass du aufhören kannst, für Reasoning-Token bei Aufrufen zu bezahlen, die sie nicht benötigen, was ein Kostenhebel ist, den kein lokales Modell bietet, weil es keine Rechnung zu senken gibt.
Und die Verfügbarkeit, viertens. Claude Haiku 5.5 ist ein Modell-String auf einer API, und die unabhängigen Zahlen liegen vor: Intelligence Index 43 insgesamt und 43,40 bei Max effort, an zweiter Stelle von 182, bei 0,21 $ pro Index-Aufgabe und 243,4 Ausgabe-Tokens pro Sekunde mit etwa 0,3 Sekunden bis zum ersten Token. Wenn man entscheidet, ob eine Workload bereit ist, verschoben zu werden, ist ein veröffentlichter Score, den man nicht selbst berechnet hat, mehr wert als eine schnellere Zahl, die man selbst ermittelt hat.

Wo PPLX 27B gewinnt, ohne einen Benchmark zu benötigen
Datenschutz steht an erster und wichtigster Stelle: Die Tokens verlassen niemals die Maschine, was kein gehostetes Modell bieten kann. Die Kosten bei hohem Volumen sind der zweite Punkt, und sie sind real, sobald man einige Milliarden Output-Tokens pro Monat überschreitet. Der Offline-Betrieb ist der dritte – ein Laptop in einem Keller ohne Verbindung antwortet trotzdem, und Claude Haiku 5.5 tut das nicht. Und der am 1. September hinzugefügte Hybridmodus ist das interessanteste Design im Produkt: Ein lokales Modell, das die Routinearbeit erledigt, mit einem Cloud-Modell hinter einem geräteseitigen Gate für die schwierigen Fälle – genau so bekommt man sowohl Datenschutz als auch Leistungsfähigkeit, und das ist die Architektur, die die meisten Teams kopieren sollten, unabhängig davon, bei welchem Anbieter sie sie kaufen.
Was PPLX 27B nicht bietet, ist eine portable Antwort. Es ist an Portable Computer gebunden, für den Erhalt der Gewichte ist ein Abonnement erforderlich, und die Gewichte sind ein Derivat des Modells von jemand anderem – die Lizenz, die Sie tatsächlich innehaben, ist also die von Perplexity, nicht Apache-2.0. Wenn das Ziel ein Modell ist, das Sie forken und ausliefern können, dann ist das Basis-Qwen 3.8 27B dasjenige mit der permissiven Lizenz, aber das ist ein anderes Modell als das, um das es in diesem Artikel geht.

Eines von beiden mit einer Taste auszuführen, und wo das endet
PPLX 27B kommt überhaupt nicht über eine API: Es läuft in Portable Computer auf Ihrer eigenen Hardware, und der Hybridmodus erreicht auf der anderen Seite des Privacy Gate ein Cloud-Modell nach Wahl von Perplexity. Claude Haiku 5.5 ist über Anthropics eigene API verfügbar und von dort aus überall, wo Anthropics Modelle weiterverkauft werden. Keines von beiden steht in OrcaRouters Katalog, und wir werden nichts anderes nahelegen — was wir aus diesen beiden Familien routen, ist anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 und anthropic/claude-fable-5.1, und separat die Qwen 3.8 27B-Basis, auf der PPLX 27B nachtrainiert wurde, die im Katalog unter qwen/qwen3.8-27b und auf unserer eigenen Infrastruktur selbst gehostet wird.
Der letzte Punkt ist der praktische. Wenn der Grund, warum Sie sich PPLX 27B angesehen haben, die darunterliegenden Qwen 3.8 27B-Gewichte waren und nicht die lokale Ausführung, können Sie das Basismodell über eine API für über 200 Modelle beziehen – ein Schlüssel und eine Rechnung, wobei die Listenpreise der Anbieter mit 0 % Aufschlag weitergegeben werden und darunter ein automatisches Failover zwischen Anbietern erfolgt. Wenn Sie tatsächlich brauchen, dass der Prompt den Rechner nie verlässt, ist kein Gateway die Antwort, sondern Portable Computer.
Die Entscheidung, ohne vorzugeben, dass die Zahlen sie klären
Wenn Ihre Prompts Ihre Infrastruktur nicht verlassen dürfen, ist PPLX 27B von diesen beiden die einzige, die für Sie existiert, und die 4.500 $ sind kein Kostenvergleich – sie sind der Preis einer Einschränkung, die Sie nicht wegverhandeln können. Wenn Sie mehr als ein paar Milliarden Output-Tokens pro Monat verbrauchen, amortisiert sich der lokale Weg innerhalb eines Quartals und zahlt sich danach immer weiter aus.
Wenn keines davon zutrifft, ist Claude Haiku 5.5 bei nahezu jedem Volumen die bessere Wahl: keine Hardware, keine Ops, ein Kontextfenster von 1 Mio. Token, eine Ausgabegrenze von 128.000 Token, Bildeingabe, ein Aufwandsregler, der die Kosten bei Bedarf senkt, ein veröffentlichter unabhängiger Score von 43 und ein Preis von 0,10 $ und 0,50 $ pro Million, der den Break-even gegenüber einer Workstation bei etwa neun Milliarden Token erreicht. Die Zahl von 0,00 $ pro Token stimmt. Sie ist nur nicht die ganze Subtraktion.
Wenn der Grund, aus dem Sie sich PPLX 27B angesehen haben, die darunterliegenden Qwen 3.8 27B-Gewichte waren und nicht die lokale Ausführung, können Sie das Basismodell über eine einzige API für über 200 Modelle beziehen, ein Schlüssel und eine Rechnung , wobei der Listenpreis des Anbieters mit 0 % Aufschlag weitergegeben wird und im Hintergrund automatisches Failover zwischen den Anbietern erfolgt.
