Une carte hero générée intitulée « Claude Haiku 5.5 vs PPLX 27B » avec comme accroche « 0,00 $ PAR TOKEN, CE N'EST PAS GRATUIT » et des puces indiquant aucun matériel contre environ 4 500 $, un contexte de 1 M contre 262 K, et le cloud contre sur l'appareil.
Guides & Insights

Claude Haiku 5.5 vs PPLX 27B : 0,00 $ par token n'est pas synonyme de gratuit

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

PPLX 27B ne coûte rien par token. Il tourne localement, sur du matériel que vous possédez, et une fois le matériel acheté, le coût marginal du token suivant est vraiment nul. Claude Haiku 5.5 coûte 0,10 $ par million de tokens d'entrée et 0,50 $ par million de tokens de sortie — un chiffre suffisamment petit pour qu'il vaille la peine de faire correctement la soustraction plutôt que d'accepter la conclusion évidente. Une machine capable de faire tourner PPLX 27B correctement est un DGX Spark à environ 4 500 $ ou un ordinateur de bureau avec une carte RTX de 24 Go ou plus, et 4 500 $ de tokens de sortie Claude Haiku 5.5 représentent environ neuf milliards de tokens. Donc la question que cette confrontation pose vraiment n'est pas de savoir lequel est le moins cher. C'est combien de tokens vous comptez brûler, et si la réponse à cette question change parce que les tokens se trouvent sur votre bureau.

Claude Haiku 5.5 est le petit modèle du fournisseur, sorti le 7 octobre 2026. PPLX 27B a été annoncé par Perplexity le 25 août 2026 en même temps que Portable Computer, conçu avec NVIDIA, et il s'agit d'une version post-entraînée du modèle à poids ouverts Qwen 3.8 27B, optimisée pour le harnais propre à Perplexity. Ni l'un ni l'autre n'est un substitut direct à l'autre, et aucun des deux ne figure au catalogue d'OrcaRouter.

Les deux modèles, et pourquoi l’un d’eux vit sur votre bureau

Claude Haiku 5.5 — ID claude-haiku-5-5, texte et image en entrée, texte en sortie, contexte de 1 M de tokens, sortie maximale de 128 000 tokens avec une voie bêta de 300 000 tokens sur l'API Batch, date de coupure des connaissances à juin 2026 et engagement de ne pas le retirer avant le 7 octobre 2027. Le paramètre d'effort va de Low à Max, avec Medium par défaut, la réflexion adaptative est activée par défaut, les lectures de cache coûtent 0,01 $ par million de tokens et Batch divise le tarif par deux. C'est un produit hébergé : vous envoyez des tokens, vous recevez des tokens, vous ne voyez jamais de GPU.

PPLX 27B — un modèle dense de 27 milliards de paramètres dérivé de Qwen 3.8 27B et post-entraîné pour le propre harnais d'agents de Perplexity. Il s'exécute au sein de Portable Computer sur un DGX Spark ou sur une machine Linux équipée d'une carte NVIDIA RTX de 24 Go ou plus, et il ne quitte pas cette machine. Un mode hybride ajouté le 1er septembre 2026 l'associe à un modèle cloud pour les tâches plus lourdes, derrière un Privacy Gate exécuté sur l'appareil ; la prise en charge de Linux pour les cartes RTX est arrivée le 3 septembre ; la prise en charge de Windows pour les cartes RTX de 24 Go et plus est arrivée le 14 septembre, en même temps que le MCP local et les tâches planifiées. Les poids post-entraînés sont propriétaires et nécessitent un abonnement Perplexity Pro ou Max.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs PPLX 27B — the scoreboard'. Claude Haiku 5.5 reads marginal price $0.10 / $0.50 per million tokens, no upfront hardware, 1M-token context, 128K max output, AA Index 43, vendor-cloud data path; PPLX 27B reads marginal price $0.00 per token, about $4,500 upfront hardware, about 262K tokens of context, max output not published, no published independent score, on-device-only data path. A footer notes the Claude figures are per Artificial Analysis and the PPLX 27B figures are vendor-reported.

• Les dimensions, une par ligne

• Coût marginal par token — Claude Haiku 5.5 : 0,10 $ par million en entrée et 0,50 $ en sortie jusqu’à 100 K tokens de prompt, puis 0,50 $ et 2,50 $ ; PPLX 27B : rien, une fois le matériel payé.

• Coût de démarrage — rien de plus qu’une clé API pour Claude Haiku 5.5 ; environ 4 500 $ pour un DGX Spark, ou un ordinateur de bureau doté d’une carte NVIDIA RTX de 24 Go ou plus, pour PPLX 27B.

• Fenêtre de contexte — 1 000 000 de tokens pour Claude Haiku 5.5 contre environ 262 144 hérités de Qwen 3.8 27B.

• Sortie maximale — 128 000 tokens pour Claude Haiku 5.5, avec un en-tête bêta de 300 000 tokens sur Batch ; non publié pour PPLX 27B.

• Où vont les données — le cloud d’Anthropic face à votre machine, avec le Privacy Gate du mode hybride qui décide ce qui la quitte.

• Score indépendant — Indice d’intelligence Artificial Analysis : 43 pour Claude Haiku 5.5, configuration Max : 43,40, deuxième sur 182 ; rien de publié pour PPLX 27B, qu’Artificial Analysis ne suit pas.

• Vitesse de sortie — 243,4 jetons par seconde pour Claude Haiku 5.5 ; dépend de votre GPU pour PPLX 27B, et non comparable sans chiffre publié.

• Modalités d’entrée — texte et images par rapport au texte, héritées d’une base multimodale.

• Poids — propriétaires dans les deux cas, mais pour des raisons différentes : aucun poids publié, par opposition à un post-entraînement restreint dont l’obtention nécessite un abonnement.

Le hardware, c'est le prix, et le prix, c'est le test de l'honnêteté

« Gratuit » n'est pas le mot juste pour l'inférence locale, et les fournisseurs le savent bien ; c'est pourquoi le chiffre cité est toujours le coût marginal. La bonne comparaison est celle du seuil de rentabilité : une machine à 4 500 $, face aux 0,50 $ par million de tokens de sortie de Claude Haiku 5.5, équivaut à neuf milliards de tokens de sortie avant que le matériel ne soit amorti. Une équipe qui génère cent millions de tokens de sortie par mois atteint ce point en sept ans et demi environ, délai au terme duquel le GPU est obsolète. Une équipe qui en génère cinq milliards par mois l'atteint en moins de deux mois.

Les deux réponses sont correctes, et elles le sont pour des entreprises différentes. C’est exactement pour cela que cette comparaison ne peut pas être tranchée sur une fiche technique, et c’est aussi pourquoi le calcul ci-dessus ignore tout ce qui rend l’inférence locale coûteuse en pratique : l’électricité, l’espace en rack, la personne responsable des mises à jour de pilotes, et le fait qu’une machine posée sur un bureau constitue un point de défaillance unique, à moins d’en avoir acheté deux. Ajoutez ces éléments, et le seuil de rentabilité recule encore.

Ce que l’inférence locale apporte pour ce prix n’est pas du tout une question de coût. C’est la garantie qu’un prompt ne quitte jamais les locaux, ce qui vaut plus que n’importe quel tarif par token pour une équipe juridique, médicale ou proche du secteur de la défense, et aucune remise proposée par Anthropic ne peut le remplacer. À l’inverse, le contexte de 1 M de tokens et le plafond de sortie de 128 000 tokens de Claude Haiku 5.5 sont des choses qu’on ne peut acheter à aucun prix sur une carte de 24 Go, et une machine à 4 500 $ n’y change rien.

Ce que les 85,4 % mesurent réellement

Le chiffre publié par Perplexity pour PPLX 27B est de 85,4 % sur son propre Local Knowledge Work Bench à 53 tâches, contre 82,6 % pour le même harnais exécuté sur la base Qwen 3.8 27B non affinée, 77,6 % pour Pi et 74,0 % pour Hermes. Trois choses à ce sujet méritent d’être dites sans détour, car la couverture du lancement ne les a généralement pas énoncées.

Il est rapporté par le fournisseur et n'a pas été reproduit de manière indépendante. Il s'agit d'une comparaison réalisée sur le propre harnais d'évaluation du fournisseur, ce qui constitue le test le plus équitable possible pour un modèle post-entraîné sur ce harnais — le gain par rapport au modèle de base est en partie un gain d'ajustement au test. Et il mesure spécifiquement le travail de connaissance local : la recherche d'information, le résumé, le traitement de documents, les tâches pour lesquelles Portable Computer est conçu. Il ne s'agit pas d'un score de capacité générale et il ne doit pas être interprété comme tel.

Le modèle de base est une autre affaire. Qwen 3.8 27B est dense, sous licence Apache-2.0, multimodal et publié le 14 août 2026 avec une fenêtre de contexte native de 262 144 jetons, et Artificial Analysis évalue sa configuration de raisonnement à 44 sur l’Intelligence Index — soit un point au-dessus du 43,40 de Claude Haiku 5.5, à un prix différent. PPLX 27B est ce modèle plus le post-entraînement de Perplexity, donc l’interprétation honnête est que les poids sous-jacents se situent dans la même bande de capacités que Claude Haiku 5.5 et que le réglage les a orientés vers la charge de travail d’un fournisseur. Laquelle de ces deux choses vous achetez est la question à laquelle les 85,4 % sont conçus pour ne pas répondre.

Là où Claude Haiku 5.5 l’emporte sans avoir besoin d’un benchmark

Le contexte long, d'abord : 1 M de tokens contre environ 262 K, et 128 000 tokens de sortie maximale contre un chiffre non publié. L'entrée d'images, deuxièmement, que la lignée Qwen 3.8 prend en charge mais que le harnais de Perplexity ne met pas en avant. Le contrôle de l'effort, troisièmement, et c'est le plus sous-estimé — le réglage Low existe précisément pour que vous puissiez arrêter de payer des tokens de raisonnement sur les appels qui n'en ont pas besoin, un levier de coût qu'aucun modèle local n'offre parce qu'il n'y a pas de facture à réduire.

Et la disponibilité, quatrième. Claude Haiku 5.5 est une chaîne de modèle sur une API, et les chiffres indépendants existent : Intelligence Index 43 au global et 43,40 à effort maximal, deuxième sur 182, à 0,21 $ par tâche d’indice et 243,4 tokens de sortie par seconde, avec environ 0,3 seconde jusqu’au premier token. Lorsque vous décidez si une charge de travail est prête à être déplacée, un score publié que vous n’avez pas calculé vous-même vaut plus qu’un chiffre plus rapide que vous avez calculé vous-même.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Là où PPLX 27B l'emporte sans avoir besoin d'un benchmark

La confidentialité est le premier et le plus important des critères : les tokens ne quittent jamais la machine, ce qu'aucun modèle hébergé ne peut égaler. Le coût à grande échelle vient en deuxième, et il est bien réel au-delà de quelques milliards de tokens de sortie par mois. Le fonctionnement hors ligne arrive en troisième — un ordinateur portable dans un sous-sol sans connexion répond quand même, contrairement à Claude Haiku 5.5. Et le mode hybride ajouté le 1er septembre est le design le plus intéressant du produit : un modèle local qui effectue le travail de routine, avec un modèle cloud derrière une barrière embarquée pour les appels difficiles, c'est précisément ainsi que l'on obtient à la fois confidentialité et capacité, et c'est l'architecture que la plupart des équipes devraient copier, quel que soit le fournisseur auprès duquel elles l'achètent.

Ce que PPLX 27B n’offre pas, c’est une réponse portable. Il est lié à Portable Computer, il exige un abonnement pour obtenir les poids, et les poids sont un dérivé du modèle de quelqu’un d’autre — la licence que vous détenez réellement est donc celle de Perplexity, et non Apache-2.0. Si l’objectif est un modèle que vous pouvez forker et distribuer, le Qwen 3.8 27B de base est celui qui bénéficie de la licence permissive, mais c’est un modèle différent de celui dont traite cet article.

A capture of the OrcaRouter model page for qwen/qwen3.8-27b showing the Qwen3.8-27B listing with its Vision, Tools, JSON and Reasoning badges, its per-million pricing and the description noting it is released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Lancer l’un ou l’autre à partir d’une seule touche, et où cela s’arrête

PPLX 27B ne passe pas du tout par une API : il s'exécute dans Portable Computer sur votre propre matériel, et le mode hybride atteint un modèle cloud choisi par Perplexity de l'autre côté du Privacy Gate. Claude Haiku 5.5 est disponible via l'API propre à Anthropic et, de là, partout où les modèles d'Anthropic sont revendus. Ni l'un ni l'autre ne figure au catalogue d'OrcaRouter, et nous ne laisserons pas entendre le contraire — ce que nous routons depuis ces deux familles, c'est anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 et anthropic/claude-fable-5.1, et séparément la base Qwen 3.8 27B à partir de laquelle PPLX 27B est post-entraîné, qui figure au catalogue sous qwen/qwen3.8-27b et est auto-hébergée sur notre propre infrastructure.

Ce dernier point est le plus concret. Si la raison pour laquelle vous examiniez PPLX 27B était les poids Qwen 3.8 27B qui le sous-tendent plutôt que l’exécution locale, vous pouvez obtenir le modèle de base via une API unique pour plus de 200 modèles, une seule clé et une seule facture, avec le prix catalogue des fournisseurs répercuté à 0 % de marge et un basculement automatique entre fournisseurs en arrière-plan. Si ce dont vous avez réellement besoin, c’est que le prompt ne quitte jamais la machine, alors aucune passerelle n’est la solution, et Portable Computer l’est.

La décision, sans prétendre que les chiffres la tranchent

Si vos prompts ne peuvent pas quitter votre infrastructure, PPLX 27B est le seul de ces deux qui existe pour vous, et les 4 500 $ ne sont pas une comparaison de coûts — c’est le prix d’une contrainte dont vous ne pouvez pas vous affranchir. Si vous consommez plus de quelques milliards de tokens de sortie par mois, la voie locale s’amortit en un trimestre, puis continue de rapporter.

Si aucune de ces deux conditions n'est vraie, Claude Haiku 5.5 est le meilleur achat à presque n'importe quel volume : pas de matériel, pas d'exploitation, une fenêtre de 1 M de tokens, un plafond de sortie de 128 000 tokens, une entrée d'images, un curseur d'effort qui réduit le coût à la demande, un score indépendant publié de 43, et un prix de 0,10 $ et 0,50 $ par million qui fait que le seuil de rentabilité par rapport à une station de travail se situe à environ neuf milliards de tokens. Le chiffre de 0,00 $ par token est vrai. Ce n'est simplement pas toute la soustraction.

Si la raison pour laquelle vous examiniez PPLX 27B était les poids Qwen 3.8 27B qui le sous-tendent plutôt que l’exécution locale, vous pouvez obtenir le modèle de base via une seule API pour plus de 200 modèles, une seule clé et une seule facture, avec le prix catalogue des fournisseurs répercuté à 0 % de marge et un basculement automatique entre fournisseurs sous-jacents.