
Claude Haiku 5.5 vs PPLX 27B: $0,00 per token is niet hetzelfde als gratis
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
PPLX 27B kost niets per token. Het draait lokaal, op hardware die je bezit, en zodra de hardware is gekocht, zijn de marginale kosten van het volgende token echt nul. Claude Haiku 5.5 kost $ 0,10 per miljoen inputtokens en $ 0,50 per miljoen outputtokens — een getal dat klein genoeg is om de aftrekking goed uit te voeren in plaats van de voor de hand liggende conclusie te accepteren. Een machine die PPLX 27B goed kan draaien is een DGX Spark van ongeveer $ 4.500 of een desktop met een RTX-kaart van 24 GB of meer, en $ 4.500 aan Claude Haiku 5.5-outputtokens is ongeveer negen miljard daarvan. De vraag die deze confrontatie echt stelt, is dus niet welke goedkoper is. Het is hoeveel tokens je verwacht te verbranden, en of het antwoord daarop verandert omdat de tokens op je bureau staan.
Claude Haiku 5.5 is het kleine model van de leverancier, uitgebracht op 7 oktober 2026. PPLX 27B werd op 25 augustus 2026 aangekondigd door Perplexity, samen met Portable Computer, gebouwd met NVIDIA, en het is een post-getrainde versie van het open-weight Qwen 3.8 27B die is afgestemd op Perplexity's eigen harness. Geen van beide is een directe vervanging voor de andere, en geen van beide staat in de catalogus van OrcaRouter.
De twee modellen, en waarom een ervan op je bureau staat
Claude Haiku 5.5 — ID claude-haiku-5-, tekst en afbeelding in, tekst uit, 1M-tokencontext, maximale uitvoer van 128.000 tokens met een bètapad van 300.000 tokens op de Batch API, trainingsafsluitdatum juni 2026 en de toezegging om het niet vóór 7 oktober 2027 uit te faseren. Effort loopt van Low tot Max, met Medium als standaard, adaptief denken staat standaard aan, cache-leesbewerkingen kosten $0,01 per miljoen tokens en Batch halveert het tarief. Het is een gehost product: je stuurt tokens, je krijgt tokens, je ziet nooit een GPU.
PPLX 27B — een dense model met 27 miljard parameters, afgeleid van Qwen 3.8 27B en na-getraind voor Perplexity's eigen agent-harness. Het draait binnen Portable Computer op een DGX Spark of op een Linux-machine met een NVIDIA RTX-kaart van 24GB of meer, en het verlaat die machine niet. Een hybride modus die op 1 september 2026 is toegevoegd, koppelt het aan een cloudmodel voor zwaarder werk achter een on-device Privacy Gate; Linux-ondersteuning voor RTX kwam op 3 september; Windows-ondersteuning voor RTX-kaarten van 24GB en hoger kwam op 14 september, samen met lokale MCP en geplande taken. De na-getrainde gewichten zijn propriëtair en vallen achter een Perplexity Pro- of Max-abonnement.

• De afmetingen, één per regel
• Marginale kosten per token — Claude Haiku 5.5 $0,10 per miljoen in en $0,50 uit tot 100K tokens prompt, daarna $0,50 en $2,50; PPLX 27B niets, zodra de hardware is betaald.
• Kosten om te beginnen — niets meer dan een API-sleutel voor Claude Haiku 5.5; ongeveer $4.500 voor een DGX Spark, of een desktop met een NVIDIA RTX-kaart van 24GB of meer, voor PPLX 27B.
• Contextvenster — 1.000.000 tokens voor Claude Haiku 5.5 tegenover ongeveer 262.144 geërfd van Qwen 3.8 27B.
• Maximale output — 128.000 tokens voor Claude Haiku 5.5, met een bètaheader van 300.000 tokens voor Batch; niet gepubliceerd voor PPLX 27B.
• Waar de data naartoe gaat — Anthropic's cloud tegenover je eigen machine, waarbij de Privacy Gate van de hybride modus bepaalt wat die verlaat.
• Onafhankelijke score — Artificial Analysis Intelligence Index 43 voor Claude Haiku 5.5, Max-configuratie 43.40, tweede van 182; niets gepubliceerd voor PPLX 27B, dat Artificial Analysis niet volgt.
• Uitvoersnelheid — 243,4 tokens per seconde voor Claude Haiku 5.5; afhankelijk van je GPU voor PPLX 27B, en niet vergelijkbaar zonder een gepubliceerd cijfer.
• Inputmodaliteiten — tekst en afbeeldingen tegenover tekst, geërfd van een multimodale basis.
• Gewichten — in beide gevallen proprietary, maar om verschillende redenen: geen vrijgegeven gewichten versus een beperkte post-train die alleen met een abonnement te verkrijgen is.
De hardware is de prijs, en de prijs is de eerlijkheidstest
"Gratis" is het verkeerde woord voor lokale inferentie, en de leveranciers weten dat, daarom is het genoemde getal altijd de marginale kosten. De juiste vergelijking is een break-evenpunt: een machine van $4.500 tegen het tarief van $0,50 per miljoen outputtokens van Claude Haiku 5.5 komt neer op negen miljard outputtokens voordat de hardware zichzelf terugverdient. Een team dat per maand honderd miljoen outputtokens genereert, bereikt dat punt in ongeveer zeven en een half jaar; tegen die tijd is de GPU achterhaald. Een team dat per maand vijf miljard genereert, bereikt het in minder dan twee maanden.
Beide antwoorden zijn juist, en ze zijn juist voor verschillende bedrijven. Dat is precies de reden waarom deze vergelijking niet op een specificatieblad kan worden beslecht, en het is ook waarom de berekening hierboven alles negeert wat lokale inferentie in de praktijk duur maakt: de elektriciteit, de rackruimte, de persoon die de driver-updates beheert, en het feit dat een machine op een bureau een single point of failure is, tenzij je er twee hebt gekocht. Tel die erbij op en het break-evenpunt schuift verder op.
Wat lokale inferentie voor dat geld oplevert, is helemaal geen kwestie van kosten. Het is de garantie dat een prompt het gebouw nooit verlaat, wat voor een juridisch, medisch of defensiegerelateerd team meer waard is dan welk tarief per token dan ook, en geen enkele korting die Anthropic biedt, kan daarvoor in de plaats komen. Omgekeerd zijn de 1M-tokencontext van Claude Haiku 5.5 en het uitvoerplafond van 128.000 tokens dingen die je op een 24GB-kaart tegen geen enkele prijs kunt kopen, en een machine van $4.500 verandert dat niet.
Wat de 85,4% eigenlijk meet
Het door Perplexity gepubliceerde cijfer voor PPLX 27B is 85,4% op zijn eigen Local Knowledge Work Bench met 53 taken, tegenover 82,6% voor dezelfde testopstelling op de niet-afgestemde Qwen 3.8 27B-basis, 77,6% voor Pi en 74,0% voor Hermes. Drie dingen daaraan verdienen ronduit gezegd te worden, omdat de berichtgeving rond de lancering ze over het algemeen niet noemde.
Het is door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd. Het is een vergelijking op de eigen harness van de leverancier, wat de eerlijkst mogelijke test is voor een model dat op die harness is nagetraind — de winst ten opzichte van het basismodel is deels een winst in het passen op de test. En het meet specifiek lokaal kenniswerk: retrieval, samenvatten, documentverwerking, de taken waarvoor Portable Computer is gebouwd. Het is geen algemene capaciteitsscore en moet ook niet als zodanig worden gelezen.
Het basismodel is een ander verhaal. Qwen 3.8 27B is dense, heeft een Apache-2.0-licentie, is multimodaal en werd op 14 augustus 2026 uitgebracht met een native contextvenster van 262.144 tokens, en Artificial Analysis scoort de reasoningconfiguratie ervan op Intelligence Index 44 — een punt boven de 43,40 van Claude Haiku 5.5, tegen een andere prijs. PPLX 27B is dat model plus de post-training van Perplexity, dus de eerlijke lezing is dat de onderliggende gewichten in de capaciteitsband van Claude Haiku 5.5 zitten en dat de tuning ze richting de workload van één leverancier heeft bewogen. Welke van die twee dingen je koopt, is de vraag die de 85,4% ontworpen is om niet te beantwoorden.
Waar Claude Haiku 5.5 wint zonder een benchmark nodig te hebben
Lange context, ten eerste: 1M tokens tegen ongeveer 262K, en 128.000 tokens maximale uitvoer tegen een niet-gepubliceerd cijfer. Beeldinvoer, ten tweede, die de Qwen 3.8-lijn wel heeft maar die de harness van Perplexity niet adverteert. Effort control, ten derde, en dat is de meest onderschatte — de Low-instelling bestaat specifiek zodat je kunt stoppen met betalen voor reasoning-tokens bij aanroepen die ze niet nodig hebben, wat een kostenhefboom is die geen enkel lokaal model biedt, omdat er geen rekening te verlagen valt.
En beschikbaarheid, ten vierde. Claude Haiku 5.5 is een modelstring op een API, en de onafhankelijke cijfers bestaan: Intelligence Index 43 overall en 43,40 bij Max effort, tweede van 182, tegen $0,21 per indextaak en 243,4 outputtokens per seconde met ongeveer 0,3 seconde tot het eerste token. Wanneer je beslist of een workload klaar is om te verplaatsen, is een gepubliceerde score die je niet zelf hebt berekend meer waard dan een sneller getal dat je zelf hebt berekend.

Waar PPLX 27B wint zonder dat er een benchmark nodig is
Privacy staat voorop en is het belangrijkst: de tokens verlaten nooit de machine, wat geen enkel gehost model kan evenaren. Kosten bij grote volumes komen op de tweede plaats, en die zijn reëel zodra je boven een paar miljard outputtokens per maand uitkomt. Offline werken is het derde: een laptop in een kelder zonder verbinding antwoordt nog steeds, en Claude Haiku 5.5 doet dat niet. En de hybride modus die op 1 september is toegevoegd, is het interessantste ontwerp in het product: een lokaal model dat het routinewerk doet, met een cloudmodel achter een poort op het apparaat voor de moeilijke beslissingen, is precies hoe je zowel privacy als capaciteit krijgt, en het is de architectuur die de meeste teams zouden moeten kopiëren, ongeacht van welke leverancier ze die kopen.
Wat PPLX 27B niet biedt, is een overdraagbaar antwoord. Het is gebonden aan Portable Computer, je hebt een abonnement nodig om de gewichten te verkrijgen, en de gewichten zijn een afgeleide van het model van iemand anders — dus de licentie die je feitelijk hebt, is die van Perplexity, niet Apache-2.0. Als het doel een model is dat je kunt forken en uitbrengen, dan is het basis-Qwen 3.8 27B het model met de permissieve licentie, maar dat is een ander model dan het model waarover dit artikel gaat.

Een van beide vanaf één toets laten draaien, en waar dat stopt.
PPLX 27B komt helemaal niet via een API: het draait in Portable Computer op je eigen hardware, en de hybride modus bereikt een cloudmodel naar keuze van Perplexity aan de andere kant van de Privacy Gate. Claude Haiku 5.5 is beschikbaar via Anthropic' eigen API en van daaruit overal waar Anthropic' modellen worden doorverkocht. Geen van beide staat op de catalogus van OrcaRouter, en we zullen niet anders beweren — wat we uit deze twee families routeren is anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 en anthropic/claude-fable-5.1, en daarnaast de Qwen 3.8 27B-basis waarop PPLX 27B is post-getraind, die op de catalogus staat bij qwen/qwen3.8-27b en zelf gehost op onze eigen infrastructuur.
Dat laatste punt is het praktische punt. Als je naar PPLX 27B keek vanwege de Qwen 3.8 27B-gewichten eronder en niet vanwege de lokale uitvoering, kun je het basismodel via één API voor meer dan 200 modellen krijgen, met één sleutel en één factuur, waarbij de lijstprijs van de provider tegen 0% opslag wordt doorgegeven en automatische failover tussen providers eronder plaatsvindt. Als je echt nodig hebt dat de prompt de machine nooit verlaat, dan is geen gateway het antwoord en is Portable Computer dat wel.
De beslissing, zonder te doen alsof de cijfers deze beslechten
Als je prompts je infrastructuur niet kunnen verlaten, is PPLX 27B de enige van deze twee die voor jou bestaat, en de $4,500 is geen kostenvergelijking — het is de prijs van een beperking waar je niet omheen kunt onderhandelen. Als je meer dan een paar miljard outputtokens per maand verbruikt, verdient de lokale route zich binnen een kwartaal terug en blijft daarna opleveren.
Als geen van beide waar is, is Claude Haiku 5.5 bij vrijwel elk volume de betere koop: geen hardware, geen ops, een contextvenster van 1M tokens, een uitvoerplafond van 128.000 tokens, beeldinvoer, een effort-knop die de kosten op verzoek verlaagt, een gepubliceerde onafhankelijke score van 43, en een prijs van $0,10 en $0,50 per miljoen waardoor het break-evenpunt ten opzichte van een workstation op ongeveer negen miljard tokens ligt. Het cijfer van $0,00 per token klopt. Het is alleen niet de hele aftrekking.
Als de reden dat je naar PPLX 27B keek de Qwen 3.8 27B-gewichten eronder waren in plaats van de lokale uitvoering, kun je het basismodel via één API voor meer dan 200 modellen krijgen, één sleutel en één factuur , met de lijstprijs van de provider doorgegeven tegen 0% opslag en automatische failover tussen providers daaronder.
