Una hero card per il titolo 'PPLX 27B viene lanciato sul Portable Computer di Perplexity' con il sottotitolo 'Un agente local-first — 85,4% sul lavoro di conoscenza, $0 per token', un'icona lineare di computer desktop con scudo a sinistra e un'icona lineare di chip a destra, e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

PPLX 27B debutta nel computer portatile di Perplexity: un agente locale che supera i banchi di prova aperti.

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il PPLX 27B di Perplexity non è un modello cloud, e questa è tutta la storia. Annunciato il 25 agosto 2026, insieme a Portable Computer — l'agente local-first dell'azienda, costruito con NVIDIA — PPLX 27B è una versione post-addestrata del Qwen 3.8 27B open-weight di Alibaba, ottimizzata da Perplexity per il proprio harness per agenti e distribuita per girare interamente su hardware di tua proprietà. Nel Local Knowledge Work Bench di Perplexity, composto da 53 attività, l'harness che esegue PPLX 27B ha ottenuto un punteggio dell'85,4%, superando lo stesso harness su Qwen 3.8 27B (82,6%) e due harness per agenti open-source, Pi (77,6%) e Hermes (74,0%). Questi sono i numeri del fornitore, tratti dal post di lancio e dall'articolo di ricerca complementare "A Local-First Agent for Private and Cost-Effective Knowledge Work", non riprodotti in modo indipendente — ma sono la prima prova pubblica che un modello da 27B su un desktop può svolgere un vero lavoro di conoscenza a una frazione del costo del cloud.

Cosa è stato effettivamente spedito

Portable Computer è la versione on-device della piattaforma agente "Computer" di Perplexity. Mentre il precedente prodotto Computer eseguiva il suo orchestratore nel cloud, Portable Computer racchiude l'intero stack in un unico sistema che gira sulla tua macchina: l'harness dell'agente, l'orchestratore, il pianificatore, il router degli strumenti, lo scheduler, una coda di attività durevole, un indice di ricerca locale, il motore di inferenza e i connettori per Google Drive, Gmail, Slack, GitHub e Outlook.

Due proprietà lo separano da una configurazione locale fai-da-te. Primo, l'esecuzione di codice e strumenti avviene all'interno di una sandbox imposta dal sistema operativo, e se la sandbox non è disponibile, l'esecuzione degli strumenti viene disabilitata anziché essere eseguita senza protezione. Secondo, è local-first per progettazione: ogni attività inizia sul dispositivo, e se un passaggio richiede dati web in tempo reale o ragionamento di frontiera, l'orchestratore si ferma e chiede il permesso prima di inoltrare quel singolo passaggio a uno dei 15+ modelli cloud. Un classificatore PII esamina il contesto in uscita e ti mostra esattamente cosa lascerebbe la macchina.

I due modelli 27B

{{1}}Al lancio puoi scegliere tra due modelli da 27 miliardi di parametri.{{/1}} {{2}}Qwen 3.8 27B è il modello open-weight Apache-2.0 di Alibaba — un 27B denso e multimodale con finestra nativa di 262K token, rilasciato due settimane prima e già una solida opzione self-host.{{/2}} {{3}}PPLX 27B è la stessa base post-addestrata da Perplexity: non una nuova architettura, ma un addestramento aggiuntivo ottimizzato specificamente per questo harness, con l'azienda che dichiara un comportamento più preciso ed efficiente sui propri carichi di lavoro degli agenti.{{/3}} {{4}}Il Nemotron 3.5 Lightning (30B) di NVIDIA è indicato come in arrivo, e sono supportati sia il modello bring-your-own sia il server di inferenza, quindi l'harness non è vincolato ai pesi di Perplexity.{{/4}}

Il benchmark, e cosa non è

Il dato principale proviene dal Local Knowledge Work Bench con 53 attività, una suite che copre il tipo di lavoro che un knowledge worker delegherebbe davvero — ricerca approfondita, analisi finanziaria, creazione di documenti. Perplexity afferma di avere in programma di rendere open-source il benchmark, che alla fine renderà il confronto ripetibile anziché basato sulla fiducia. Fino ad allora, questi risultati sono gestiti dal venditore. Su quella suite, secondo il venditore:

• Computer portatile con PPLX 27B — 85.4%

• Computer portatile con Qwen 3.8 27B — 82.6%

• Pi (harness open-source) — 77,6%

• Hermes (strumento open-source) — 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

Altri due risultati segnalati dai vendor completano il quadro. Su BrowseComp, la suite di ricerca web, Computer ha ottenuto il 66,7% contro il 50,2% di Pi e il 43,9% di Hermes, utilizzando inoltre il 51% in meno di tempo reale e il 70% in meno di token rispetto a Pi. Su ParseBench-100, un test di estrazione di documenti, ha ottenuto il 65,1% contro il 34,6% di Hermes e il 13,9% di Pi. I divari più ampi si registrano nei compiti che premiano l'infrastruttura stessa del sistema – ricerca, instradamento, uso di strumenti – ovvero dove un modello post-addestrato e uno stack di integrazione costruito su misura danno il meglio di sé.

Il capovolgimento dell'economia

Il numero più interessante è il prezzo. Il lavoro completato localmente ha un costo per token pari a zero e non consuma crediti Perplexity: il contatore resta a zero per un'attività interamente locale. L'escalation è l'unica cosa che costa denaro, ed è opzionale per ogni passaggio. Perplexity ha pubblicato la matematica ibrida su Terminal Bench 2.1: il solo locale ha ottenuto il 59,6% a costo praticamente zero; aggiungere un modello di frontiera come consulente lo ha portato al 73,0% a circa 0,415 $ per rollout; il solo modello di frontiera ha raggiunto l'82,4% a circa 0,65 $ per rollout. L'ultimo contrasto è la tesi: l'inferenza locale appiattisce la curva dei costi per gli agenti sempre attivi, e l'escalation al cloud diventa una spesa chirurgica che si ripaga da sola.

Nessuna di queste è gratuita all'inizio. La macchina conta. Portable Computer debutta su Linux, su NVIDIA DGX Spark, il supercomputer desktop con 128GB di memoria unificata (prezzo di listino intorno ai 4.500 dollari), oppure su PC Linux con GPU RTX con almeno 24GB di VRAM — all'incirca una RTX 3090 o più recente — con 32GB consigliati. Il supporto per Windows è previsto per settembre; macOS non è stato annunciato. E il software stesso richiede un piano Perplexity a pagamento: Pro, Max, Enterprise Pro o Enterprise Max. Questo è un prodotto che combina abbonamento e hardware, pensato per chi già paga Perplexity, non un'API generica.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

Dove si inserisce il router

PPLX 27B non è qualcosa che OrcaRouter instrada: gira su hardware di tua proprietà, dietro un abbonamento Perplexity, e non fingeremo il contrario. Ciò che instradiamo è il set di confronto che questo lancio invita. Qwen 3.8 27B, gli stessi pesi base su cui PPLX 27B fa il post-training, è disponibile su OrcaRouter self-hosted; così come DeepSeek V4 Flash, Gemini 3.5 Flash Lite e GPT-5.6 Luna — tutti dietro un'unica chiave API al prezzo di listino del fornitore, passati senza alcun ricarico, quindi un taglio del prezzo del fornitore è attivo dalla nostra parte il giorno stesso in cui viene annunciato.

Questo conta qui per una ragione specifica. La proposta di Portable Computer è il contrasto di costi tra locale e cloud, e la metà cloud di quel contrasto è onesta tanto quanto i prezzi con cui la confronti. Su OrcaRouter questi sono i prezzi di listino effettivi del fornitore, il che trasforma la decisione tra locale e cloud in un calcolo di cui ti puoi fidare, piuttosto che in un confronto di marketing. E se vuoi prototipare lo stesso agente in entrambi i modi — harness locale su una macchina, modelli cloud dietro un unico endpoint — il failover automatico consente al lato cloud di subentrare quando il modello locale è in difficoltà, senza un secondo contratto o un secondo percorso di codice.

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

Cosa guardare

Tre cose nel prossimo mese decideranno se questo è un prodotto di nicchia o l'inizio di una categoria. Se Perplexity rilascerà davvero in open source il Local Knowledge Work Bench, il che trasformerebbe le cifre dei titoli da dichiarazioni in qualcosa che la community può riprodurre. Se Nemotron 3.5 Lightning arriverà e batterà PPLX 27B sullo stesso harness — la tesi del "post-training per l'harness" vale solo quanto il modello base che c'è sotto. E se il supporto Windows a settembre amplierà la portata oltre i possessori di DGX Spark. Se il benchmark è reale e l'harness si trasferisce, "esegui l'agente sulla tua GPU" smette di essere un pattern da hobbisti e diventa un'opzione di deployment con vero mordente — e i modelli cloud con cui verrà messo a confronto dovranno guadagnarsi i loro prezzi per token.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube