PPLX 27B startet in Perplexitys tragbarem Computer — ein lokaler Agent, der die offenen Harnesses schlägt. Regenerierte Illustration.
Guides & Insights

PPLX 27B startet in Perplexitys tragbarem Computer: Ein lokaler Agent, der die Open Harnesses schlägt.

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

PPLX 27B von Perplexity ist kein Cloud-Modell, und das ist die ganze Geschichte. Am 25. August 2026 angekündigt, zusammen mit Portable Computer – dem Local-First-Agenten des Unternehmens, entwickelt mit NVIDIA –, ist PPLX 27B eine nachtrainierte Version von Alibabas Open-Weight-Modell Qwen 3.8 27B, von Perplexity für sein eigenes Agent-Harness optimiert und dafür ausgeliefert, vollständig auf Hardware zu laufen, die Ihnen gehört. Auf dem 53 Aufgaben umfassenden Local Knowledge Work Bench von Perplexity erreichte das Harness mit PPLX 27B 85,4 %, vor demselben Harness auf Qwen 3.8 27B (82,6 %) und vor zwei Open-Source-Agent-Harnesses, Pi (77,6 %) und Hermes (74,0 %). Das sind die eigenen Zahlen des Anbieters aus dem Startbeitrag und der begleitenden Forschungsarbeit „A Local-First Agent for Private and Cost-Effective Knowledge Work“, nicht unabhängig reproduziert – doch sie sind der erste öffentliche Beleg dafür, dass ein 27B-Modell auf einem Desktop echte Wissensarbeit zu einem Bruchteil des Cloud-Preises leisten kann. Eine Woche später, am 1. September, tauchte dasselbe nachtrainierte Modell in einem zweiten Einsatz auf: Hybrid Compute, der neue Mac-Modus des Computer-Agenten von Perplexity, der eine einzelne Aufgabe zwischen Cloud-Frontier-Modellen und PPLX 27B auf Apple Silicon aufteilt – hinter einem neuen On-Device-Privacy-Gate, das nach personenbezogenen Daten sucht, bevor irgendetwas den Rechner verlässt. Zwei Tage nach der Mac-Ankündigung, am 3. September, erklärte Perplexity, dass Portable Computer jetzt auch unter Linux für NVIDIA-RTX-GPUs mit 24 GB VRAM oder mehr verfügbar ist. Am 14. September erklärte das Unternehmen, dass es jetzt auf Windows-PCs mit NVIDIA-RTX-GPUs verfügbar ist – laut Unternehmen die größte Reichweite, die der Local-First-Ansatz bisher hatte, und der Schritt, der das Ausführen des Agenten auf eigener Hardware zu einer echten Deployment-Option auf der gängigsten Desktop-Plattform macht. Beide Angaben stammen vom Hersteller.

Was tatsächlich ausgeliefert wurde

Portable Computer ist die On-Device-Version von Perplexitys „Computer"-Agentenplattform. Während das frühere Computer-Produkt seinen Orchestrator in der Cloud ausführte, packt Portable Computer den gesamten Stack in ein einziges System, das auf Ihrem Rechner läuft: das Agenten-Harness, den Orchestrator, den Planer, den Tool-Router, den Scheduler, eine dauerhafte Aufgabenwarteschlange, einen lokalen Suchindex, die Inferenz-Engine und die App-Konnektoren für Goog​le Drive, Gmail, Slack, GitHub und Outlook.

Zwei Eigenschaften unterscheiden es von einem selbstgebauten lokalen Setup. Erstens finden Code- und Tool-Ausführung in einer vom Betriebssystem erzwungenen Sandbox statt, und wenn die Sandbox nicht verfügbar ist, wird die Tool-Ausführung deaktiviert, anstatt ungeschützt zu laufen. Zweitens ist es von Natur aus Local-First: Jede Aufgabe startet auf dem Gerät, und wenn ein Schritt Live-Webdaten oder fortschrittliche Argumentation benötigt, stoppt der Orchestrator und bittet um Erlaubnis, bevor er diesen einzelnen Schritt an eines von über 15 Cloud-Modellen eskaliert. Ein On-Device-PII-Klassifikator — die Technologie, die Perplexity inzwischen als Privacy Gate auf den Markt gebracht hat — läuft zuerst über den ausgehenden Kontext und zeigt Ihnen genau, was die Maschine verlassen würde.

Die beiden 27B-Modelle

Zum Start wählen Sie zwischen zwei Modellen mit 27 Milliarden Parametern. Qwen 3.8 27B ist Alibabas Apache-2.0-Open-Weight-Modell – ein dichtes, multimodales 27B-Modell mit einem nativen Kontextfenster von 262K Token, zwei Wochen früher veröffentlicht und bereits eine starke Self-Hosting-Option. PPLX 27B ist dieselbe Basis, nachtrainiert von Perplexity: keine neue Architektur, sondern zusätzliches Training, das speziell auf dieses Harness abgestimmt wurde, wobei das Unternehmen präziseres und effizienteres Verhalten bei seinen eigenen Agent-Workloads beansprucht. NVIDIAs Nemotron 3.5 Lightning (30B) wird als „demnächst verfügbar“ gelistet, und sowohl Bring-your-own-Modell als auch eigener Inferenzserver werden unterstützt, sodass das Harness nicht an Perplexitys Gewichte gebunden ist.

Der Benchmark und was er nicht ist

Die Schlagzeilenzahl stammt von der 53 Aufgaben umfassenden Local Knowledge Work Bench, einer Suite, die die Art von Arbeit abdeckt, die ein Wissensarbeiter tatsächlich delegieren würde – tiefgehende Recherche, Finanzanalyse, Dokumentenerstellung. Perplexity gibt an, dass es plant, den Benchmark als Open Source zu veröffentlichen, was den Vergleich letztendlich wiederholbar machen wird, anstatt dass man ihm blind vertrauen muss. Bis dahin stammen diese Ergebnisse vom Anbieter. Auf dieser Suite, so der Anbieter:

• Portable Computer mit PPLX 27B — 85.4%

• Tragbarer Computer mit Qwen 3.8 27B — 82,6%

• Pi (Open-Source-Testumgebung) — 77,6%

• Hermes (Open-Source-Harness) — 74,0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

Zwei weitere vom Anbieter gemeldete Ergebnisse runden das Bild ab. Bei BrowseComp, der Web-Recherche-Suite, erzielte Computer 66,7 % gegenüber 50,2 % für Pi und 43,9 % für Hermes, während es 51 % weniger verstrichene Zeit und 70 % weniger Token als Pi benötigte. Bei ParseBench-100, einem Dokumentextraktionstest, erzielte es 65,1 % gegenüber 34,6 % für Hermes und 13,9 % für Pi. Die größten Unterschiede zeigen sich bei den Aufgaben, die die eigene Infrastruktur eines Harness belohnen – Suche, Routing, Tool-Nutzung – genau dort, wo ein nachtrainiertes Modell plus ein zweckgebauter Plumbing-Stack seinen Wert beweist.

Der wirtschaftliche Umschwung

Die interessantere Zahl ist der Preis. Lokal ausgeführte Arbeit verursacht keine Kosten pro Token und verbraucht keine Perplexity-Credits – bei einer vollständig lokalen Aufgabe bleibt der Zähler bei null. Nur die Eskalation kostet Geld, und sie ist pro Schritt ein Opt-in. Perplexity hat die Hybrid-Rechnung auf Terminal Bench 2.1 veröffentlicht: vollständig lokal wurden 59,6 % zu nahezu null Kosten erzielt; das Hinzufügen eines Frontier-Modells als Berater steigerte sie auf 73,0 % bei etwa 0,415 $ pro Durchlauf; das Frontier-Modell allein erreichte 82,4 % bei etwa 0,65 $ pro Durchlauf. Dieser letzte Kontrast ist die These – lokale Inferenz flacht die Kostenkurve für ständig aktive Agenten ab, und Cloud-Eskalation wird zu einer chirurgischen Ausgabe, die sich dort selbst amortisiert.

Nichts davon ist zum Einstieg kostenlos. Die Box ist entscheidend. Portable Computer startete am 25. August zuerst für Linux auf dem NVIDIA DGX Spark, dem Desktop-Supercomputer mit 128 GB Unified Memory (Listenpreis rund 4.500 US-Dollar), oder auf Linux-PCs mit RTX-GPUs mit mindestens 24 GB VRAM – grob eine RTX 3090 oder neuer –, wobei 32 GB empfohlen werden. Am 3. September sagte Perplexity, Portable Computer sei jetzt unter Linux für NVIDIA-RTX-GPUs mit 24 GB VRAM oder mehr verfügbar – laut dem Unternehmen –, und NVIDIAs IFA-2026-Rollout in derselben Woche fügte Ein-Klick-Installer und eine vereinfachte lokale KI-Einrichtung hinzu, die genau auf RTX-GPUs mit 24 GB VRAM oder mehr abzielten, und nannte Portable Computer zusammen mit dem Hermes-Agenten und OpenClaw. Die Windows-Unterstützung kam wie geplant: Am 14. September sagte Perplexity, Portable Computer sei jetzt auf Windows-PCs mit NVIDIA-RTX-GPUs verfügbar – laut dem Unternehmen – in der Perplexity-Windows-App, wobei die Inferenz auf dem Gerät eine RTX-GPU mit 24 GB VRAM oder mehr erfordert, was dem Linux-Maßstab entspricht, und mit zwei Ergänzungen, die es unter Linux nicht gibt: lokales MCP zum Anbinden eigener Tools und App-Integrationen sowie geplante Aufgaben, mit denen Computer wiederkehrende Arbeit auf Ihrem PC erledigen kann, während Sie weg sind. macOS kam eine Woche nach dem Linux-Start in einer anderen Form – Hybrid Compute, dazu später mehr. Und die Software selbst erfordert einen kostenpflichtigen Perplexity-Tarif: Pro, Max, Enterprise Pro oder Enterprise Max. Dies ist ein Produkt aus Abonnement plus Hardware, das sich an Leute richtet, die bereits für Perplexity bezahlen, und keine allgemeine API.

Die Mac-Wende: Hybrid Compute und das Privacy Gate

Am 1. September erhielt Perplexity Computer – die Agentenplattform, auf der Portable Computer aufbaut – Hybrid Compute in der Mac-Desktop-App. Hier verläuft die Aufteilung umgekehrt zum Linux-Build: Eine Aufgabe beginnt in der Cloud, wo Frontier-Modelle das schwierigste Reasoning, die Web-Recherche und die langfristige Planung übernehmen, und der Orchestrator übergibt sensible Teilschritte an einen lokalen Subagenten, der auf Apple Silicon läuft. Dateien, lokale Daten und Geräteaktionen bleiben auf dem Mac, der Kontext übersteht die Übergabe, und keiner der lokalen Tokens erreicht jemals die Cloud. Die lokale Engine ist das Modell, um das es in diesem Artikel geht – PPLX 27B, Perplexitys nachtrainiertes Qwen 3.8 27B, das in den Mac-Materialien des Unternehmens als PPLX Qwen 3.8 27B aufgeführt wird und laut Perplexity mit einem Ein-Klick-Download in der App installiert wird, ganz ohne Ollama- oder Terminal-Einrichtung. Die Berichterstattung zum Launch unterscheidet sich beim Rest der Produktpalette: Die meisten Medien nennen zusätzlich Googles Gemma 4 E4B und Alibabas Qwen3.6 35B-A3B als weitere On-Device-Optionen, und eine Quelle nennt statt des 27B ein von Perplexity nachtrainiertes Qwen 3.6 35B – ein Detail, auf das sich die Presse am ersten Tag nicht einheitlich festlegte.

Die Funktion, mit der Perplexity führend ist, ist das Privacy Gate, ein On-Device-Klassifikator, der mit seinem Secure Intelligence Institute trainiert wurde. Es liest jede Aufgabe — Prompt, Tool-Ausgabe, Speicher, Protokolle — bevor irgendetwas übertragen wird, und sucht nach personenbezogenen Daten: Namen, Adressen, Kontonummern, Anmeldedaten, Zahlungskartennummern und Ausweisen von Regierungsbehörden. Erkannte Werte werden durch Platzhalter ersetzt, bevor die Anfrage den Mac verlässt, und wiederhergestellt, wenn die Antwort zurückkommt; wenn das Gate etwas markiert, entscheidet der Nutzer, ob dieser Schritt lokal ausgeführt, maskiert oder geteilt wird — das Gate fragt, es entscheidet nicht. Perplexity gibt außerdem an, den Klassifikator als Open Source veröffentlicht und PII-TRACE freigegeben zu haben, einen Benchmark, der aus 13.148 synthetischen Gesprächen in 13 Sprachen zur Bewertung von PII-Erkennern erstellt wurde. Das sind Behauptungen des Unternehmens, nicht unabhängig geprüft.

Hybrid Compute läuft auf jedem Mac mit Apple Silicon und macOS 15 oder neuer sowie mindestens 24 GB Unified Memory — empfohlen werden 32 GB —, und Perplexity zufolge scheiden 8-GB- und 16-GB-Maschinen aus. Die Funktion steht Pro-, Max- und Enterprise-Abonnenten über die Desktop-App zur Verfügung; Enterprise-Konten müssen sich aktiv anmelden, und Administratoren können eine unternehmensweite Sensibilitätsrichtlinie festlegen und einsehen, welche Daten jedes Gerät verlassen. Lokale Arbeit verbraucht kein Cloud-Guthaben, und lokal generierte Tokens werden nicht berechnet — nur die Cloud-Orchestrierung und die Delegierungsschritte kosten etwas; ein API-Schlüssel ist nicht erforderlich. Die Einschränkungen entsprechen denen beim Linux-Start: Das Gate ist selbst ein Modell, sodass falsch-negative Ergebnisse möglich sind, und die Tester merkten schnell an, dass der Schutz nur so gut ist wie die Entscheidungen, die ein Nutzer bei der entsprechenden Aufforderung trifft. Insbesondere AppleInsider riet dazu, die Funktion zu testen, bevor man ihr vertrauliche Daten anvertraut.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

Wo der Router hineinpasst

PPLX 27B ist nichts, das OrcaRouter routet – es läuft auf Hardware, die Ihnen gehört, hinter einem Perplexity-Abonnement, und wir werden nicht so tun, als wäre es anders. Was wir routen, ist das Vergleichsset, zu dem dieser Launch einlädt. Qwen 3.8 27B, die exakten Basisgewichte, von denen PPLX 27B post-trainiert, ist auf OrcaRouter als selbst gehostete Version live; ebenso DeepSeek V4 Flash, Gemini 3.5 Flash Lite und GPT-5.6 Luna – alle hinter einem API-Schlüssel zum Listenpreis des Anbieters, ohne Aufschlag durchgereicht, sodass eine Preissenkung eines Anbieters bei uns am selben Tag live ist, an dem sie angekündigt wird.

Das ist hier aus einem ganz bestimmten Grund wichtig. Der Pitch von Portable Computer ist der Kostenkontrast lokal gegen Cloud, und die Cloud-Hälfte dieses Kontrasts ist nur so ehrlich wie die Preise, mit denen Sie vergleichen. Bei OrcaRouter sind das die tatsächlichen Listenpreise des Anbieters, was die Entscheidung lokal oder Cloud zu einer Berechnung macht, auf die Sie sich verlassen können, statt zu einem Marketingvergleich. Und wenn Sie denselben Agenten auf beide Weisen prototypen möchten — lokales Harness auf einer Maschine, Cloud-Modelle hinter einem einzigen Endpoint —, lässt automatisches Failover die Cloud-Seite einspringen, wenn das lokale Modell überfordert ist, ohne einen zweiten Vertrag oder einen zweiten Codepfad. Hybrid Compute wiederholt denselben Deal — lokale Tokens kostenlos, Cloud-Orchestrierung die einzige Ausgabe —, sodass die Berechnung gilt, egal ob die lokale Hälfte auf einem DGX Spark, einer Linux-RTX-Workstation, einem Mac oder — seit dem 14. September — einem Windows-PC mit RTX-GPU läuft.

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

Was zu sehen

Vier Dinge im kommenden Monat entscheiden darüber, ob dies ein Nischenprodukt oder der Beginn einer Kategorie ist. Ob Perplexity die Local Knowledge Work Bench tatsächlich als Open Source veröffentlicht, was die Schlagzeilen-Zahlen von Behauptungen in etwas verwandeln würde, das die Community reproduzieren kann. Ob Nemotron 3.5 Lightning erscheint und PPLX 27B auf demselben Harness schlägt — die These „Post-Train für das Harness“ ist nur so gut wie das Basismodell darunter. Ob das Privacy Gate adversarialer Prüfung standhält, jetzt da der Klassifikator als Open Source verfügbar ist — ein probabilistischer PII-Detektor ist nur dann der Dreh- und Angelpunkt des Hybrid-Pitchs, wenn er tatsächlich Namen, Kontonummern und Anmeldedaten aus der Leitung heraushält. Und ob die Reichweite, die der Linux-Start nie hatte, endlich durch die September-Erweiterung erreicht wird — die RTX-24GB-Linux-Route am 3. September bestätigt, Windows-Unterstützung am 14. September in der Perplexity Windows-App bestätigt und Hybrid Compute auf dem Mac — was dieselbe Local-Agent-Ökonomie auf die breiteste Consumer-Hardware bringt, die Perplexity bisher ausgeliefert hat. Wenn der Benchmark echt ist und das Harness überträgt, hört „den Agenten auf der eigenen Hardware ausführen“ auf, ein Hobbyisten-Muster zu sein, und wird zu einer Deployment-Option mit echten Zähnen — und die Cloud-Modelle, mit denen es verglichen wird, werden ihre Preise pro Token verdienen müssen.