
Claude Haiku 5.5 vs PPLX 27B: $0.00 per token är inte samma sak som gratis
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
PPLX 27B kostar ingenting per token. Den körs lokalt, på hårdvara du äger, och när hårdvaran väl är köpt är marginalkostnaden för nästa token verkligen noll. Claude Haiku 5.5 kostar $0.10 per miljon indatatokens och $0.50 per miljon utdatatokens – vilket är en siffra liten nog att det är värt att göra subtraktionen ordentligt i stället för att acceptera den uppenbara slutsatsen. En maskin som kan köra PPLX 27B bra är en DGX Spark för ungefär $4,500 eller en stationär dator med ett RTX-kort på 24 GB eller mer, och $4,500 av Claude Haiku 5.5:s utdatatokens är runt nio miljarder av dem. Så frågan den här jämförelsen egentligen ställer är inte vilken som är billigare. Det är hur många tokens du räknar med att bränna, och om svaret på det ändras av att tokens ligger på ditt skrivbord.
Claude Haiku 5.5 är leverantörens lilla modell, släppt den 7 oktober 2026. PPLX 27B aviserades av Perplexity den 25 augusti 2026 tillsammans med Portable Computer, byggd med NVIDIA, och den är en post-tränad version av Qwen 3.8 27B med öppna vikter, finjusterad för Perplexitys egen harness. Ingen av dem är en direkt ersättning för den andra, och ingen av dem finns i OrcaRouters katalog.
De två modellerna, och varför en av dem bor på ditt skrivbord
Claude Haiku 5.5 — ID claude-haiku-5-5, text och bild in, text ut, 1M-tokenkontext, maximal utdata på 128 000 tokens med en betaväg på 300 000 tokens via Batch-API:et, träningscutoff i juni 2026 och ett åtagande att inte pensionera den före den 7 oktober 2027. Effort går från Low till Max med Medium som standard, adaptivt tänkande är aktiverat som standard, cacheläsningar kostar $0,01 per miljon tokens och Batch halverar priset. Det är en hostad produkt: du skickar tokens, du får tokens, du ser aldrig en GPU.
PPLX 27B — en tät modell med 27 miljarder parametrar härledd från Qwen 3.8 27B och eftertränad för Perplexitys eget agentramverk. Den körs inuti Portable Computer på en DGX Spark eller på en Linux-maskin med ett NVIDIA RTX-kort på 24 GB eller mer, och den lämnar inte den maskinen. Ett hybridläge som lades till den 1 september 2026 parar ihop den med en molnmodell för tyngre arbete bakom en Privacy Gate på enheten; Linux-stöd för RTX kom den 3 september; Windows-stöd för RTX-kort på 24 GB och uppåt kom den 14 september, tillsammans med lokala MCP och schemalagda uppgifter. De eftertränade vikterna är proprietära och ligger bakom en Perplexity Pro- eller Max-prenumeration.

• Måtten, en rad vardera
• Marginalkostnad per token – Claude Haiku 5.5: 0,10 USD per miljon för indata och 0,50 USD för utdata upp till 100K tokens prompt, därefter 0,50 och 2,50 USD; PPLX 27B: ingenting, när hårdvaran väl är betald.
• Startkostnad – inget utöver en API-nyckel för Claude Haiku 5.5; cirka 4 500 USD för en DGX Spark, eller en stationär dator med ett NVIDIA RTX-kort på 24 GB eller mer, för PPLX 27B.
• Kontextfönster — 1 000 000 tokens för Claude Haiku 5.5 mot cirka 262 144 ärvda från Qwen 3.8 27B.
• Maximal utdata – 128 000 tokens för Claude Haiku 5.5, med en beta-header på 300 000 tokens i Batch; publiceras inte för PPLX 27B.
• Vart data tar vägen – Anthropics moln mot din egen dator, där hybridlägets Privacy Gate avgör vad som lämnar den.
• Oberoende poäng — Artificial Analysis Intelligence Index 43 för Claude Haiku 5.5, Max-konfiguration 43,40, tvåa av 182; inget har publicerats för PPLX 27B, som Artificial Analysis inte följer.
• Utdatashastighet — 243,4 tokens per sekund för Claude Haiku 5.5; för PPLX 27B är den beroende av din GPU och går inte att jämföra utan en publicerad siffra.
• Indatamodaliteter — text och bilder gentemot text, ärvda från en multimodal bas.
• Vikter – proprietära i båda fallen, men av olika skäl: inga vikter släpps kontra en begränsad efterträning som kräver en prenumeration för att få tillgång till.
Hårdvaran är priset, och priset är ärlighetstestet
”Gratis” är fel ord för lokal inferens och leverantörerna vet det, vilket är anledningen till att siffran som anges alltid är marginalkostnaden. Den korrekta jämförelsen är en break-even: en maskin för 4 500 dollar till Claude Haiku 5.5:s 0,50 dollar per miljon utdatatoken motsvarar nio miljarder utdatatoken innan hårdvaran har betalat sig själv. Ett team som genererar hundra miljoner utdatatoken i månaden når den punkten på ungefär sju och ett halvt år, vid det laget är GPU:n föråldrad. Ett team som genererar fem miljarder i månaden når den på mindre än två månader.
Båda svaren är korrekta, och de är korrekta för olika företag. Det är hela anledningen till att den här jämförelsen inte kan avgöras på ett specifikationsblad, och det är också därför aritmetiken ovan bortser från allt som gör lokal inferens dyrt i praktiken: elen, rackutrymmet, personen som ansvarar för drivrutinsuppdateringarna, och det faktum att en maskin på ett skrivbord är en enda felpunkt om man inte köpte två. Lägg till dem, och brytpunkten flyttas längre bort.
Det som lokal inferens ger för de pengarna handlar inte alls om kostnad. Det är garantin att en prompt aldrig lämnar byggnaden, vilket är värt mer än vilket per-token-pris som helst för ett juridiskt, medicinskt eller försvarsnära team, och ingen rabatt som Anthropic erbjuder kan ersätta den. Omvänt är Claude Haiku 5.5:s kontext på 1M tokens och utdatatak på 128 000 tokens saker du inte kan köpa till något pris på ett 24GB-kort, och en maskin för $4 500 ändrar inte på det.
Vad 85,4 % egentligen mäter
Perplexitys publicerade siffra för PPLX 27B är 85,4 % på Perplexitys egen Local Knowledge Work Bench med 53 uppgifter, mot 82,6 % för samma testrigg som körs på den icke finjusterade basen Qwen 3.8 27B, 77,6 % för Pi och 74,0 % för Hermes. Tre saker om detta förtjänar att sägas rakt ut, eftersom lanseringsbevakningen i allmänhet inte nämnde dem.
Det är rapporterat av leverantören och har inte oberoende reproducerats. Det är en jämförelse i leverantörens egen testmiljö, vilket är det mest rättvisa möjliga testet för en modell som eftertränats på den testmiljön – förbättringen jämfört med basmodellen är delvis en förbättring i att passa testet. Och det mäter lokalt kunskapsarbete specifikt: hämtning, sammanfattning, dokumenthantering, de uppgifter Portable Computer är byggd för. Det är inte en allmän kapacitetspoäng och bör inte läsas som en sådan.
Basmodellen är en annan sak. Qwen 3.8 27B är dense, licensierad under Apache-2.0, multimodal och släpptes den 14 augusti 2026 med ett inbyggt kontextfönster på 262 144 token, och Artificial Analysis poängsätter dess resonemangskonfiguration till Intelligence Index 44 – en poäng över Claude Haiku 5.5:s 43,40, till ett annat pris. PPLX 27B är den modellen plus Perplexitys efterträning, så den ärliga tolkningen är att de underliggande vikterna ligger inom Claude Haiku 5.5:s kapacitetsband och att finjusteringen flyttade dem mot en leverantörs arbetsbelastning. Vilken av dessa två saker du köper är den fråga som 85,4 % är utformat för att inte besvara.
Där Claude Haiku 5.5 vinner utan att behöva ett benchmark
Lång kontext, för det första: 1M tokens mot omkring 262K, och 128 000 tokens i maximal utdata mot en opublicerad siffra. Bildinmatning, för det andra, som Qwen 3.8-linjen har men som Perplexitys testram inte skyltar med. Ansträngningskontroll, för det tredje, och det är den underskattade — inställningen Låg finns specifikt för att du ska kunna sluta betala för resonemangstokens vid anrop som inte behöver dem, vilket är en kostnadsspak som ingen lokal modell erbjuder eftersom det inte finns någon räkning att sänka.
Och tillgänglighet, för det fjärde. Claude Haiku 5.5 är en modellsträng på ett API, och de oberoende siffrorna finns: Intelligence Index 43 totalt och 43,40 vid Max effort, tvåa av 182, till $0,21 per indexuppgift och 243,4 utdatatoken per sekund med omkring 0,3 sekunder till första token. När du avgör om en arbetsbelastning är redo att flyttas, är en publicerad poäng som du inte själv har beräknat värd mer än en snabbare siffra som du själv har beräknat.

Där PPLX 27B vinner utan att behöva ett benchmark
Integritet är det första och viktigaste: tokens lämnar aldrig maskinen, vilket ingen hostad modell kan matcha. Kostnaden vid stora volymer är den andra, och den är reell när man passerar några miljarder utdata-tokens i månaden. Offlinedrift är den tredje — en bärbar dator i en källare utan anslutning svarar fortfarande, och det gör inte Claude Haiku 5.5. Och hybridläget som lades till den 1 september är den mest intressanta designen i produkten: en lokal modell som gör rutinarbetet med en molnmodell bakom en grind på enheten för de svåra anropen är precis hur man får både integritet och kapacitet, och det är arkitekturen som de flesta team borde kopiera oavsett vilken leverantör de köper den från.
Det PPLX 27B inte erbjuder är ett portabelt svar. Det är knutet till Portable Computer, det kräver en prenumeration för att få tag på vikterna, och vikterna är en derivata av någon annans modell – så licensen du faktiskt innehar är Perplexitys, inte Apache-2.0. Om målet är en modell som du kan forka och distribuera, är basmodellen Qwen 3.8 27B den med den tillåtande licensen, men det är en annan modell än den som den här artikeln handlar om.

Att köra endera av dem från en och samma tangent, och var det tar stopp
PPLX 27B kommer inte via något API alls: det körs inuti Portable Computer på din egen hårdvara, och hybridläget når en molnmodell som Perplexity väljer på andra sidan av Privacy Gate. Claude Haiku 5.5 är tillgänglig via Anthropics eget API och därifrån, varhelst Anthropics modeller säljs vidare. Ingen av dem finns i OrcaRouters katalog, och vi kommer inte att antyda något annat — vad vi routar från dessa två familjer är anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 och anthropic/claude-fable-5.1, och separat basmodellen Qwen 3.8 27B som PPLX 27B är vidaretränad från, vilken finns i katalogen på qwen/qwen3.8-27b och som vi själva hostar på vår egen infrastruktur.
Den sista punkten är den praktiska. Om anledningen till att du tittade på PPLX 27B var Qwen 3.8 27B-vikterna under den snarare än den lokala körningen, kan du få basmodellen via ett API för över 200 modeller, en nyckel och en faktura, med leverantörens listpris vidarefört med 0 % påslag och automatisk failover mellan leverantörer under huven. Om det du faktiskt behöver är att prompten aldrig lämnar maskinen är ingen gateway svaret, och Portable Computer är det.
Beslutet, utan att låtsas att siffrorna avgör saken.
Om dina prompts inte kan lämna din infrastruktur är PPLX 27B den enda av dessa två som existerar för dig, och 4 500 dollar är inte en kostnadsjämförelse – det är priset för en begränsning som du inte kan förhandla bort. Om du gör av med mer än några miljarder output-tokens i månaden tjänar den lokala vägen in sig inom ett kvartal och fortsätter sedan att löna sig.
Om inget av detta stämmer är Claude Haiku 5.5 det bättre köpet vid nästan vilken volym som helst: ingen hårdvara, ingen drift, ett fönster på 1M tokens, ett utdatatak på 128 000 tokens, bildinmatning, en ansträngningsratt som sänker kostnaden vid behov, en publicerad oberoende poäng på 43 och ett pris på $0,10 och $0,50 per miljon som gör att brytpunkten mot en arbetsstation inträffar först vid omkring nio miljarder tokens. Siffran $0,00 per token är sann. Det är bara inte hela subtraktionen.
Om anledningen till att du tittade på PPLX 27B var Qwen 3.8 27B-vikterna under den snarare än den lokala körningen, kan du få basmodellen via ett enda API för över 200 modeller, en nyckel och en faktura, med leverantörens listpris vidarebefordrat med 0 % påslag och automatisk failover mellan leverantörer under huven.
