
Claude Haiku 5.5 vs PPLX 27B: $0,00 per token non è la stessa cosa di gratis
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
PPLX 27B non costa nulla per token. Viene eseguito localmente, su hardware di tua proprietà, e una volta acquistato l'hardware il costo marginale del token successivo è davvero zero. Claude Haiku 5.5 costa $0,10 per milione di token di input e $0,50 per milione di output — un numero abbastanza piccolo da rendere opportuno fare la sottrazione per bene invece di accettare la conclusione ovvia. Una macchina in grado di eseguire bene PPLX 27B è una DGX Spark da circa $4.500 o un desktop con una scheda RTX da 24GB o più, e $4.500 di token di output di Claude Haiku 5.5 equivalgono a circa nove miliardi di token. Quindi la domanda che questo confronto pone davvero non è quale sia più economico. È quanti token prevedi di consumare, e se la risposta cambia perché i token si trovano sulla tua scrivania.
Claude Ha 5.5 è il modello del fornitore stesso, rilasciato il 7 ottobre 2026. PPLX 27B è stato annunciato da Perplexity il 25 agosto 2026 insieme a Personal Computer, sviluppato con NVIDIA, ed è una versione post-addestrata del modello open-weight Qwen 3.8 27B, ottimizzata per l'harness di Perplexity. Nessuno dei due è un sostituto diretto dell'altro, e nessuno dei due è presente nel catalogo di OrcaRouter.
I due modelli, e perché uno di essi vive sulla tua scrivania
Claude Haiku 5.5 — ID claude-haiku-5-5, testo e immagini in ingresso, testo in uscita, contesto da 1M token, output massimo di 128.000 token con un percorso beta da 300.000 token sull'API Batch, cutoff di addestramento a giugno 2026 e l'impegno a non ritirarlo prima del 7 ottobre 2027. Effort va da Low a Max con Medium come impostazione predefinita, il pensiero adattivo è attivo per impostazione predefinita, le letture dalla cache costano 0,01 $ per milione di token e Batch dimezza la tariffa. È un prodotto ospitato: invii token, ricevi token, non vedi mai una GPU.
PPLX 27B — un modello denso da 27 miliardi di parametri derivato da Qwen 3.8 27B e sottoposto a post-training per l'agent harness proprietario di Perplexity. Viene eseguito all'interno di Portable Computer su una DGX Spark oppure su una macchina Linux con una scheda NVIDIA RTX da 24 GB o superiore, e non lascia mai quella macchina. Una modalità ibrida aggiunta il 1° settembre 2026 lo abbina a un modello cloud per i carichi di lavoro più pesanti, dietro un Privacy Gate sul dispositivo; il supporto Linux per RTX è arrivato il 3 settembre; il supporto Windows per le schede RTX da 24 GB in su è arrivato il 14 settembre, insieme a MCP locale e attività pianificate. I pesi post-addestrati sono proprietari e richiedono un abbonamento Perplexity Pro o Max.

• Le dimensioni, una riga ciascuna
• Costo marginale per token — Claude Haiku 5.5: 0,10 $ per milione in input e 0,50 $ in output fino a 100K token di prompt, poi 0,50 $ e 2,50 $; PPLX 27B nulla, una volta pagato l'hardware.
• Costo per iniziare — nulla oltre a una chiave API per Claude Haiku 5.5; circa 4.500 $ per un DGX Spark, oppure un desktop con una scheda NVIDIA RTX da 24 GB o più, per PPLX 27B.
• Finestra di contesto — 1.000.000 di token per Claude Haiku 5.5 rispetto a circa 262.144 ereditati da Qwen 3.8 27B.
• Output massimo — 128.000 token per Claude Haiku 5.5, con un header beta da 300.000 token su Batch; non pubblicato per PPLX 27B.
• Dove vanno i dati — il cloud di Anthropic contrapposto alla tua macchina, con il Privacy Gate della modalità ibrida che decide cosa lascia quest'ultima.
• Punteggio indipendente — Artificial Analysis Intelligence Index 43 per Claude Haiku 5.5, configurazione Max 43.40, secondo su 182; nulla di pubblicato per PPLX 27B, che Artificial Analysis non monitora.
• Velocità di output — 243,4 token al secondo per Claude Haiku 5.5; dipende dalla tua GPU per PPLX 27B, e non è confrontabile senza un valore pubblicato.
• Modalità di input — testo e immagini rispetto a testo, ereditate da una base multimodale.
• Pesi — proprietari in entrambi i casi, ma per ragioni diverse: nessun peso rilasciato rispetto a un post-train limitato che richiede un abbonamento per essere ottenuto.
L'hardware è il prezzo, e il prezzo è il test di onestà.
"Gratuito" è la parola sbagliata per l'inferenza locale e i fornitori lo sanno, ed è per questo che il numero citato è sempre il costo marginale. Il confronto corretto è un punto di pareggio: una macchina da 4.500 $ a 0,50 $ per milione di token di output di Claude Haiku 5.5 equivale a nove miliardi di token di output prima che l'hardware si ripaghi da solo. Un team che genera cento milioni di token di output al mese raggiunge quel punto in circa sette anni e mezzo, tempo in cui la GPU è ormai obsoleta. Un team che ne genera cinque miliardi al mese lo raggiunge in meno di due mesi.
Entrambe le risposte sono corrette, e sono corrette per aziende diverse. È proprio per questo che questo confronto non può essere risolto su una scheda tecnica, ed è anche il motivo per cui l’aritmetica di sopra ignora tutto ciò che rende l’inferenza locale costosa nella pratica: l’elettricità, lo spazio nel rack, la persona che si occupa degli aggiornamenti dei driver, e il fatto che una macchina su una scrivania rappresenta un singolo punto di guasto a meno che non ne abbiate comprate due. Aggiungi queste voci e il punto di pareggio si sposta ancora più avanti.
Ciò che l'inferenza locale ti dà per quei soldi non è affatto il costo. È la garanzia che un prompt non lasci mai l'edificio, cosa che per un team legale, medico o che gravita attorno alla difesa vale più di qualsiasi tariffa per token, e nessuno sconto offerto da Anthropic può sostituirla. Al contrario, il contesto da 1 milione di token e il tetto di output di 128.000 token di Claude Haiku 5.5 sono cose che non puoi comprare a nessun prezzo su una scheda da 24GB, e una macchina da 4.500 $ non cambia la situazione.
Cosa misura effettivamente l'85,4%
Il numero pubblicato da Perplexity per PPLX 27B è 85,4% sul suo Local Knowledge Work Bench a 53 attività, contro 82,6% per lo stesso harness eseguito sul modello base Qwen 3.8 27B non ottimizzato, 77,6% per Pi e 74,0% per Hermes. Tre cose al riguardo meritano di essere dette chiaramente, perché la copertura del lancio generalmente non le ha dette.
È stato riportato dal fornitore e non è stato riprodotto in modo indipendente. È un confronto sull'harness dello stesso fornitore, che è il test più equo possibile per un modello post-addestrato su quell'harness — il guadagno rispetto al modello base è in parte un guadagno nell'adattamento al test. E misura specificamente il lavoro di conoscenza locale: recupero, sintesi, gestione dei documenti, i compiti per cui è progettato Portable Computer. Non è un punteggio di capacità generale e non dovrebbe essere interpretato come tale.
Il modello base è un'altra questione. Qwen 3.8 27B è denso, con licenza Apache-2.0, multimodale e rilasciato il 14 agosto 2026 con una finestra di contesto nativa di 262.144 token, e Artificial Analysis assegna alla sua configurazione di ragionamento un Intelligence Index di 44 — un punto sopra il 43,40 di Claude Haiku 5.5, a un prezzo diverso. PPLX 27B è quel modello più il post-training di Perplexity, quindi la lettura onesta è che i pesi sottostanti si collocano nella fascia di capacità di Claude Haiku 5.5 e il tuning li ha spostati verso il carico di lavoro di un singolo fornitore. Quale delle due cose tu stia comprando è la domanda a cui l'85,4% è progettato per non rispondere.
Dove Claude Haiku 5.5 vince senza bisogno di un benchmark
Contesto lungo, primo: 1M di token contro circa 262K, e 128.000 token di output massimo contro una cifra non pubblicata. Input di immagini, secondo, che la linea Qwen 3.8 supporta ma che l'harness di Perplexity non pubblicizza. Controllo dell'effort, terzo, ed è quello sottovalutato — l'impostazione Low esiste appositamente per smettere di pagare token di ragionamento su chiamate che non ne hanno bisogno, una leva di costo che nessun modello locale offre perché non c'è alcuna bolletta da abbassare.
E la disponibilità, quarta. Claude Haiku 5.5 è una stringa di modello su un'API, e i numeri indipendenti esistono: Intelligence Index 43 complessivo e 43,40 a Max effort, secondo su 182, a 0,21 $ per attività di indice e 243,4 token di output al secondo, con circa 0,3 secondi al primo token. Quando decidi se un carico di lavoro è pronto a essere spostato, un punteggio pubblicato che non hai calcolato tu vale più di un numero più veloce che hai calcolato tu.

Dove PPLX 27B vince senza bisogno di un benchmark
La privacy è la prima e più importante: i token non lasciano mai la macchina, cosa che nessun modello ospitato può eguagliare. Il costo su larga scala è la seconda, ed è reale oltre qualche miliardo di token di output al mese. Il funzionamento offline è la terza — un laptop in un seminterrato senza connessione risponde comunque, e Claude Haiku 5.5 no. E la modalità ibrida aggiunta il 1° settembre è il design più interessante del prodotto: un modello locale che svolge il lavoro di routine con un modello cloud dietro un gate on-device per le decisioni difficili è esattamente il modo in cui si ottengono sia privacy che capacità, ed è l'architettura che la maggior parte dei team dovrebbe copiare, indipendentemente dal fornitore da cui la acquista.
Ciò che PPLX 27B non offre è una risposta portabile. È legato a Portable Computer, richiede un abbonamento per ottenere i pesi, e i pesi sono un derivato del modello di qualcun altro — quindi la licenza che si detiene effettivamente è quella di Perplexity, non Apache-2.0. Se l'obiettivo è un modello che si può forkare e distribuire, il Qwen 3.8 27B di base è quello con la licenza permissiva, ma è un modello diverso da quello di cui tratta questo articolo.

Eseguire l'uno o l'altro da un unico tasto, e dove questo si ferma
PPLX 27B non passa affatto attraverso un'API: viene eseguito all'interno di Portable Computer sul tuo hardware, e la modalità ibrida raggiunge un modello cloud scelto da Perplexity dall'altra parte del Privacy Gate. Claude Haiku 5.5 è disponibile tramite l'API di Anthropic e, da lì, ovunque i modelli di Anthropic vengano rivenduti. Nessuno dei due è nel catalogo di OrcaRouter, e non suggeriremo il contrario — ciò che instradiamo da queste due famiglie è anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1, e separatamente la base Qwen 3.8 27B da cui PPLX 27B è post-addestrato, che è presente nel catalogo su qwen/qwen3.8-27b e self-hosted sulla nostra infrastruttura.
Quest'ultimo punto è quello pratico. Se il motivo per cui stavi valutando PPLX 27B erano i pesi di Qwen 3 27B sottostanti, puoi ottenere il modello base tramite un'unica API per 200 al mese, una sola chiave e un pass-through del provider a markup 0%, con failover automatico tra i provider sottostanti. Se ciò di cui hai davvero bisogno è che il prompt non lasci mai la tua macchina, nessun gateway è la risposta, e Portable Computer lo è.
La decisione, senza fingere che i numeri la risolvano
Se i tuoi prompt non possono lasciare la tua infrastruttura, PPLX 27B è l'unico di questi due che esiste per te, e i $4,500 non sono un confronto di costi — è il prezzo di un vincolo che non puoi negoziare via. Se consumi più di qualche miliardo di token di output al mese, la via locale si ripaga entro un trimestre e poi continua a ripagarsi.
Se nessuna delle due è vera, Claude Haiku 5.5 è l'acquisto migliore a quasi qualsiasi volume: niente hardware, niente operazioni, una finestra da 1M token, un tetto di output di 128.000 token, input di immagini, un selettore dell'impegno che abbassa i costi su richiesta, un punteggio indipendente pubblicato di 43 e un prezzo di $0,10 e $0,50 per milione che porta il punto di pareggio rispetto a una workstation a circa nove miliardi di token di distanza. La cifra di $0,00 per token è vera. Semplicemente non è l'intera sottrazione.
Se il motivo per cui stavi considerando PPLX 27B erano i pesi di Qwen 3.8 27B che ne stanno alla base, piuttosto che l'esecuzione locale, puoi ottenere il modello base tramite un'unica API per oltre 200 modelli, una sola chiave e una sola fattura , con il prezzo di listino del provider passato a markup 0% e failover automatico tra i provider sottostanti.
