PPLX 27B est lancé dans l'ordinateur portable de Perplexity — un agent local qui bat les Open Harnesses. Illustration régénérée.
Guides & Insights

PPLX 27B débarque dans l'ordinateur portable de Perplexity : un agent local qui bat les Open Harnesses.

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le PPLX 27B de Perplexity n'est pas un modèle cloud, et c'est là toute l'histoire. Annoncé le 25 août 2026, aux côtés de Portable Computer — l'agent local-first de l'entreprise, conçu avec NVIDIA —, PPLX 27B est une version post-entraînée du Qwen 3.8 27B à poids ouverts d'Alibaba, ajustée par Perplexity pour son propre harnais d'agent et livrée pour fonctionner entièrement sur du matériel que vous possédez. Sur le Local Knowledge Work Bench de Perplexity à 53 tâches, le harnais exécutant PPLX 27B a obtenu 85,4 %, devant le même harnais sur Qwen 3.8 27B (82,6 %) et deux harnais d'agent open source, Pi (77,6 %) et Hermes (74,0 %). Ce sont les chiffres du fournisseur lui-même, issus de l'article de lancement et de l'article de recherche complémentaire, « Un agent local-first pour un travail de connaissance privé et économique », non reproduits indépendamment — mais ils constituent la première preuve publique qu'un modèle 27B sur un ordinateur de bureau peut assurer un véritable travail de connaissance pour une fraction du prix du cloud. Une semaine plus tard, le 1er septembre, le même modèle post-entraîné est réapparu dans un second déploiement : Hybrid Compute, le nouveau mode Mac de l'agent Computer de Perplexity, qui répartit une seule tâche entre des modèles cloud de frontière et PPLX 27B exécuté sur Apple silicon — derrière une nouvelle Privacy Gate sur l'appareil qui recherche les données personnelles avant que quoi que ce soit ne quitte la machine. Deux jours après l'annonce Mac, le 3 septembre, Perplexity a déclaré que Portable Computer est désormais aussi disponible sous Linux pour les GPU NVIDIA RTX avec 24 Go de VRAM ou plus. Le 14 septembre, l'entreprise a déclaré qu'il est désormais disponible sur les PC Windows avec GPU NVIDIA RTX — la portée la plus large qu'ait eue l'argumentaire local-first, selon l'entreprise, et l'étape qui fait de l'exécution de l'agent sur votre propre matériel une véritable option de déploiement sur la plateforme de bureau la plus courante. Ces deux affirmations émanent du fournisseur.

Ce qui a réellement été livré

Portable Computer est la version locale de la plateforme d'agents « Computer » de Perplexity. Là où le produit Computer précédent exécutait son orchestrateur dans le cloud, Portable Computer intègre toute la pile dans un seul système qui s'exécute sur votre machine : le harnais d'agent, l'orchestrateur, le planificateur, le routeur d'outils, l'ordonnanceur, une file de tâches durable, un index de recherche local, le moteur d'inférence et les connecteurs d'application pour Goog​le Drive, Gmail, Slack, GitHub et Outlook.

Deux propriétés le distinguent d’une configuration locale DIY. Premièrement, l’exécution du code et des outils se fait dans un bac à sable imposé par le système d’exploitation, et si ce bac à sable n’est pas disponible, l’exécution des outils est désactivée plutôt que d’être lancée sans protection. Deuxièmement, il est conçu pour être local-first : chaque tâche démarre sur l’appareil, et si une étape nécessite des données web en direct ou un raisonnement de pointe, l’orchestrateur s’arrête et demande la permission avant de faire remonter cette seule étape vers l’un des plus de 15 modèles cloud. Un classificateur de PII sur l’appareil — la technologie que Perplexity a depuis transformée en produit sous le nom de Privacy Gate — examine d’abord le contexte sortant et vous montre exactement ce qui quitterait la machine.

Les deux modèles 27B

Au lancement, vous choisissez entre deux modèles de 27 milliards de paramètres. Qwen 3.8 27B est le modèle open-weight Apache-2.0 d'Alibaba — un modèle dense et multimodal de 27B avec une fenêtre native de 262K tokens, sorti deux semaines plus tôt et déjà une solide option d'auto-hébergement. PPLX 27B est cette même base post-entraînée par Perplexity : non pas une nouvelle architecture, mais un entraînement supplémentaire ajusté spécifiquement pour ce harnais, l'entreprise affirmant un comportement plus précis et plus efficace sur ses propres charges de travail d'agents. Nemotron 3.5 Lightning (30B) de NVIDIA est listé comme bientôt disponible, et l'apport de votre propre modèle et de votre propre serveur d'inférence sont tous deux pris en charge, donc le harnais n'est pas lié aux poids de Perplexity.

Le benchmark, et ce qu'il n'est pas

Le chiffre principal provient du Local Knowledge Work Bench, une suite de 53 tâches couvrant le type de travail qu’un travailleur du savoir déléguerait réellement — recherche approfondie, analyse financière, création de documents. Perplexity indique qu’elle prévoit d’ouvrir le code source du benchmark, ce qui rendra à terme la comparaison reproductible plutôt que fondée sur la confiance. En attendant, ces résultats sont gérés par le fournisseur. Sur cette suite, selon le fournisseur :

• Ordinateur portable avec PPLX 27B — 85,4 %

• Ordinateur portable avec Qwen 3.8 27B — 82.6%

• Pi (harnais open-source) — 77.6%

• Hermes (harnais open-source) — 74,0 %

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

Deux autres résultats rapportés par les fournisseurs complètent le tableau. Sur BrowseComp, la suite de recherche web, Computer a obtenu 66,7 % contre 50,2 % pour Pi et 43,9 % pour Hermes, tout en utilisant 51 % de temps réel en moins et 70 % de jetons en moins que Pi. Sur ParseBench-100, un test d'extraction de documents, il a obtenu 65,1 % contre 34,6 % pour Hermes et 13,9 % pour Pi. Les écarts les plus importants se situent sur les tâches qui récompensent l'infrastructure propre d'un harnais — recherche, routage, utilisation d'outils — c'est là qu'un modèle post-entraîné associé à une pile d'infrastructure dédiée trouve tout son intérêt.

Le basculement économique

Le chiffre le plus intéressant est le prix. Un travail effectué localement ne coûte rien par jeton et ne consomme aucun crédit Perplexity — le compteur reste à zéro pour une tâche entièrement locale. L'escalade est la seule chose qui coûte de l'argent, et elle est facultative à chaque étape. Perplexity a publié les calculs hybrides sur Terminal Bench 2.1 : le tout local a obtenu 59,6 % à coût quasi nul ; l'ajout d'un modèle de pointe comme conseiller l'a porté à 73,0 % pour environ 0,415 $ par exécution ; le modèle de pointe seul a atteint 82,4 % pour environ 0,65 $ par exécution. Ce dernier contraste résume la thèse — l'inférence locale aplatit la courbe des coûts pour les agents toujours actifs, et l'escalade vers le cloud devient une dépense chirurgicale qui s'autofinance.

Rien de tout cela n'est gratuit pour commencer. La machine compte. Portable Computer a été lancé d'abord sous Linux le 25 août sur le NVIDIA DGX Spark, le superordinateur de bureau doté de 128 Go de mémoire unifiée (prix catalogue autour de 4 500 $), ou sur des PC Linux équipés de GPU RTX d'au moins 24 Go de VRAM — en gros une RTX 3090 ou plus récente — avec 32 Go recommandés. Le 3 septembre, Perplexity a déclaré que Portable Computer est désormais disponible sous Linux pour les GPU NVIDIA RTX dotés de 24 Go de VRAM ou plus — selon l'entreprise — et le déploiement d'IFA 2026 de NVIDIA, la même semaine, a ajouté des installateurs en un clic et une configuration simplifiée de l'IA locale, visant précisément les GPU RTX avec 24 Go de VRAM ou plus, en citant Portable Computer aux côtés de l'agent Hermes et d'OpenClaw. La prise en charge de Windows est arrivée comme prévu : le 14 septembre, Perplexity a déclaré que Portable Computer est désormais disponible sur les PC Windows équipés de GPU NVIDIA RTX — selon l'entreprise — dans l'application Windows de Perplexity, l'inférence sur l'appareil nécessitant un GPU RTX avec 24 Go de VRAM ou plus, ce qui correspond au seuil exigé sous Linux, et avec deux ajouts que l'option Linux n'offre pas : MCP local pour connecter vos propres outils et intégrations d'applications, et des tâches planifiées qui permettent à Computer d'exécuter du travail récurrent sur votre PC pendant votre absence. macOS est arrivé sous une forme différente une semaine après le lancement Linux — Hybrid Compute, dont il sera question ensuite. Et le logiciel lui-même nécessite un forfait Perplexity payant : Pro, Max, Enterprise Pro ou Enterprise Max. Il s'agit d'un produit associant abonnement et matériel, destiné aux personnes qui paient déjà Perplexity, et non d'une API générale.

Le tournant du Mac : Hybrid Compute et la barrière de confidentialité

Le 1er septembre, Perplexity Computer — la plateforme d'agents à partir de laquelle Portable Computer est construit — s'est doté de Hybrid Compute dans l'application de bureau Mac. Ici, la répartition fonctionne à l'inverse de la version Linux : une tâche démarre dans le cloud, où des modèles de pointe prennent en charge le raisonnement le plus difficile, la recherche web et la planification à long horizon, et où l'orchestrateur confie les sous-étapes sensibles à un sous-agent local exécuté sur Apple silicon. Les fichiers, les données locales et les actions sur l'appareil restent sur le Mac, le contexte survit au passage de relais, et aucun des jetons locaux n'atteint jamais le cloud. Le moteur local est le modèle dont traite cet article — PPLX 27B, le Qwen 3.8 27B post-entraîné de Perplexity, répertorié dans les documents Mac de l'entreprise sous le nom de PPLX Qwen 3.8 27B et installé par un téléchargement en un clic dans l'application, sans installation d'Ollama ni configuration via le terminal, selon Perplexity. La couverture du lancement diffère pour le reste de la gamme : la plupart des médias ajoutent le Gemma 4 E4B de Google et le Qwen3.6 35B-A3B d'Alibaba comme autres options sur l'appareil, et un seul nomme un Qwen 3.6 35B post-entraîné par Perplexity au lieu du 27B — un détail que la presse n'a pas relevé de manière cohérente dès le premier jour.

La fonctionnalité mise en avant par Perplexity est le Privacy Gate, un classificateur embarqué entraîné avec son Secure Intelligence Institute. Il lit chaque tâche — le prompt, la sortie d’outil, la mémoire, les journaux — avant que quoi que ce soit ne soit transmis, à la recherche d’informations personnelles identifiables : noms, adresses, numéros de compte, identifiants, numéros de carte de paiement et numéros d’identification gouvernementaux. Les valeurs détectées sont remplacées par des substituts avant que la requête ne quitte le Mac, puis restaurées lorsque la réponse revient. Lorsque le Privacy Gate signale quelque chose, l’utilisateur décide si cette étape s’exécute localement, est masquée ou est partagée — le Privacy Gate demande, il ne décide pas. Perplexity affirme également avoir publié le classificateur en open source et avoir lancé PII-TRACE, un benchmark construit à partir de 13 148 conversations synthétiques dans 13 langues pour évaluer les détecteurs de PII. Ce sont des affirmations de l’entreprise, non vérifiées par un audit indépendant.

Hybrid Compute fonctionne sur tout Mac avec puce Apple silicon sous macOS 15 ou version ultérieure, avec un minimum de 24 Go de mémoire unifiée — 32 Go recommandés, et Perplexity indique que les machines de 8 Go et 16 Go sont exclues. La fonction est disponible pour les abonnés Pro, Max et Enterprise via l’application de bureau, les comptes Enterprise devant l’activer, et les administrateurs pouvant définir une politique de sensibilité à l’échelle de l’organisation et consulter un journal de ce qui quitte chaque appareil. Le travail local n’utilise pas de crédits cloud et les jetons générés localement ne sont pas facturés — seules les étapes d’orchestration et de délégation cloud ont un coût, et aucune clé API n’est nécessaire. Les limites correspondent à celles du lancement sous Linux : la passerelle est elle-même un modèle, donc des faux négatifs sont possibles, et les testeurs ont vite souligné que la protection ne vaut que par les choix effectués par l’utilisateur lorsqu’il est invité à décider. AppleInsider, en particulier, recommande de tester la fonction avant de lui confier des données sensibles.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

Où se place le routeur

PPLX 27B n'est pas un modèle qu'OrcaRouter achemine — il tourne sur du matériel qui vous appartient, derrière un abonnement Perplexity, et nous ne prétendrons pas le contraire. Ce que nous acheminons, en revanche, c'est l'ensemble de comparaison que ce lancement invite. Qwen 3.8 27B, les poids de base exacts à partir desquels PPLX 27B effectue son post-entraînement, est disponible sur OrcaRouter en auto-hébergement ; tout comme DeepSeek V4 Flash, Gemini 3.5 Flash Lite et GPT-5.6 Luna — tous derrière une seule clé API au prix catalogue du fournisseur, répercuté sans marge, de sorte qu'une baisse de prix d'un fournisseur est effective de notre côté le jour même de son annonce.

Cela compte ici pour une raison bien précise. L'argument de vente de Portable Computer, c'est le contraste de coûts entre local et cloud, et la moitié cloud de ce contraste n'est honnête que si les prix auxquels vous la comparez le sont. Sur OrcaRouter, il s'agit des tarifs catalogue réels du fournisseur, ce qui transforme la décision local ou cloud en un calcul fiable plutôt qu'en une comparaison marketing. Et si vous voulez prototyper le même agent des deux façons — harnais local sur une machine, modèles cloud derrière un seul point de terminaison — le basculement automatique permet au côté cloud de prendre le relais lorsque le modèle local atteint ses limites, sans second contrat ni second chemin de code. Hybrid Compute reprend le même marché — jetons locaux gratuits, orchestration cloud comme seule dépense — donc le calcul s'applique que la moitié locale tourne sur un DGX Spark, une station de travail Linux RTX, un Mac, ou — depuis le 14 septembre — un PC Windows avec un GPU RTX.

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

Que regarder

Quatre choses au cours du mois prochain décideront si cela est un produit de niche ou le début d'une catégorie. Si Perplexity ouvre réellement le code source du Local Knowledge Work Bench, ce qui transformerait les chiffres phares de simples affirmations en quelque chose que la communauté peut reproduire. Si Nemotron 3.5 Lightning arrive et surpasse PPLX 27B sur le même harnais — la thèse du « post-entraînement pour le harnais » ne vaut que ce que vaut le modèle de base sous-jacent. Si le Privacy Gate survit à un examen contradictoire maintenant que le classificateur est open source — un détecteur probabiliste de données personnelles (PII) n'est la clé de voûte de l'argumentaire hybride que s'il garde réellement les noms, les numéros de compte et les identifiants hors des transmissions. Et si la portée que le lancement Linux n'a jamais eue arrive enfin grâce à l'élargissement de septembre — la voie Linux RTX-24GB confirmée le 3 septembre, le support Windows confirmé le 14 septembre dans l'application Windows de Perplexity, et Hybrid Compute sur Mac — plaçant la même économie d'agent local sur le matériel grand public le plus large que Perplexity ait jamais livré. Si le benchmark est réel et que le harnais est transférable, « exécutez l'agent sur votre propre matériel » cesse d'être un schéma d'amateur pour devenir une option de déploiement avec de vrais atouts — et les modèles cloud auxquels il est comparé devront justifier leurs prix par token.