Un titre généré intitulé « Pareto 26.10 Preview vs Pareto » avec le sous-titre « Même chaîne de modèle, deux versions différentes », au-dessus de trois cartes indiquant « Contexte : 1M vs 262K », « Prix : 0,80 $ / 3,20 $ vs 2,50 $ / 7,50 $ » et « Stabilité : preview vs stable », avec un pied de page indiquant « Les deux versions sont servies par Unbiased sous la chaîne de modèle pareto ; chiffres selon la fiche publique. »
Guides & Insights

Pareto 26.10 Preview et Pareto : même chaîne de modèle, deux modèles différents

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Unbiased a livré Pareto 26.10 Preview le 1er octobre 2026 et a laissé la version précédente, Pareto, listée à côté. Les deux ne sont pas des variantes d'une même famille entre lesquelles on choisit à l'aide d'un indicateur. Ce sont deux versions derrière une seule marque, et la chaîne de modèle du fournisseur lui-même — pareto — correspond désormais à la plus récente, explicitement instable. La question de la comparaison n'est donc pas vraiment « laquelle est la meilleure ». C'est : laquelle votre requête atteint-elle réellement, et qu'advient-il de la réponse quand cela change sous vos pieds ?

Le seul endroit où les deux sont décrits du même souffle est la fiche technique publique du modèle. La fiche de modèle, la page de tarification et la FAQ d'Unbiased décrivent un seul produit empilé et ne mentionnent jamais la séparation. Cette asymétrie — un diff public détaillé d'un côté, le silence de l'autre — est le point de départ honnête d'une comparaison directe, car elle vous indique d'où vient chaque chiffre ci-dessous.

Six dimensions, les deux côtés

Tout ce qui distingue les versions tient dans ces six lignes. À gauche, Pareto 26.10 Preview ; à droite, la version Pareto du 17 septembre, celle que le texte du catalogue de la préversion qualifie de choix stable.

• Fenêtre de contexte — 1 048 576 tokens vs 262 144 tokens. Quatre fois plus de place, sur le papier, sans palier inférieur proposé pour l’un ou l’autre.
• Sortie maximale — 131 072 tokens vs 131 072 tokens. Inchangé. La fenêtre plus grande n’a pas donné lieu à une réponse plus longue.
• Prix d’entrée, selon le routage — 0,80 $ par million vs 2,50 $ par million. L’aperçu représente environ un tiers du prix sur cette fiche.
• Prix de sortie, selon le routage — 3,20 $ par million vs 7,50 $ par million. Moins de la moitié.
• Entrée mise en cache, selon le routage — 0,03 $ par million vs 0,25 $ par million. Les trajectoires d’agent les plus longues en bénéficient le plus.
• Fiche de benchmarks publiée — quatre scores, explicitement « préliminaire » et « susceptible de changer avant la publication finale » vs aucun tableau de benchmarks publié du tout.

Deux de ces lignes sont celles qui déterminent le travail réel. La fenêtre de contexte est l'information principale que le fournisseur ne mentionnera pas sur son propre site — elle se trouve sur l'annonce, pas sur la fiche du modèle — et le prix des entrées mises en cache est celui qui modifie la facture d'un agent plutôt que son plafond. Tout le reste est soit un delta marketing, soit, dans le cas du score de sortie, un aveu : publier les chiffres d'un aperçu avec une étiquette « préliminaire » est plus honnête que l'alternative, et c'est aussi un avertissement.

A generated two-column scoreboard titled "Pareto 26.10 Preview vs Pareto - the scoreboard". The left column, "Pareto 26.10 Preview", reads "Context: 1,048,576 tokens", "Max output: 131,072 tokens", "Input price: $0.80 / 1M", "Output price: $3.20 / 1M", "Cached input: $0.03 / 1M" and "Scores: four, preliminary". The right column, "Pareto", reads "Context: 262,144 tokens", "Max output: 131,072 tokens", "Input price: $2.50 / 1M", "Output price: $7.50 / 1M", "Cached input: $0.25 / 1M" and "Scores: none published". A footer reads "Both columns per the public listing; the vendor's own site lists $2.50 / $7.50 for both releases."

Le prix que vous voyez dépend de l'endroit où vous regardez

Mettez les deux grilles tarifaires côte à côte et elles ne concordent pas, ce qui est la partie de cette comparaison que personne n’a expliquée.

La propre plateforme d'Unbiased, le jour où 26.10 Preview est devenu la version courante, affiche encore 2,50 $ par million de jetons d'entrée, 0,25 $ pour les jetons mis en cache et 7,50 $ en sortie. Ce sont les chiffres de septembre, inchangés, aussi bien sur la page de tarification que sur la fiche du modèle. La série inférieure — 0,80 $, 0,03 $, 3,20 $ — figure sur la liste du catalogue routé pour la même préversion. Ainsi, un client qui appelle pareto directement via l'API du fournisseur paie l'ancienne grille tarifaire pour le nouveau modèle, tandis que la liste routée en annonce environ un tiers. Les deux sont actifs. Le fournisseur n'a publié aucune date de fin promotionnelle ni aucune déclaration permettant de concilier les deux.

C'est une question de canal, et sur une préversion, c'est aussi une question de calendrier : quel que soit le chiffre sur lequel vous modélisez vos coûts, l'autre n'est qu'à une note de version près de devenir le bon. Un routeur qui répercute le prix catalogue d'un fournisseur à 0 % de marge supprime exactement cette friction — un changement de tarif d'un fournisseur est effectif le jour même, et non à la prochaine revue de contrat — et c'est la seule chose structurelle qui vaut la peine d'être empruntée à OrcaRouter ici. Nous ne proposons aujourd'hui aucune des deux versions d'Unbiased, donc la réponse directe à « où est-ce que je l'appelle » est l'API d'Unbiased elle-même, sur l'un ou l'autre des deux ensembles de prix que porte l'offre par laquelle vous achetez. La raison de le dire tout haut, c'est que la différence est d'un facteur trois, et une préversion n'est pas l'endroit pour découvrir que vous avez tarifé le mauvais.

Ce que l'aperçu vous apporte, et ce qu'il vous coûte

La description catalogue de la préversion fixe elle-même les conditions : elle « peut changer sans préavis », et toute personne qui a besoin d’un comportement prévisible est renvoyée à la version de septembre. Ce n’est pas une clause de style — c’est la définition du produit. Comparez cela à la forme pratique d’une longue session d’agent, et l’arbitrage devient concret.

Un agent qui fait durer une conversation accumule du contexte, et c'est dans les conversations longues que la mise en cache des prompts est réellement rentable. Un modèle modifié derrière un point de terminaison inchangé est la façon classique de la perdre : le cache est indexé sur le modèle qui a produit les tokens, de sorte qu'un changement de version silencieux en cours de trajectoire peut invalider ce que vous aviez mis en cache et refacturer un travail que vous pensiez déjà payé. La documentation d'Unbiased défend ce point dans l'autre sens — elle présente son blend comme stable pour le cache, là où un routeur de commutation ne l'est pas — c'est donc un risque que le fournisseur comprend bien et qu'il accepte simplement en échange de la livraison d'une preview. Cela vaut la peine de le signaler, car la défaillance est invisible dans un tableau de bord : vos tokens sont toujours facturés, vos réponses continuent d'arriver, et le nombre est simplement plus élevé que la semaine dernière.

L'avantage de la preview est réel, et son revers l'est tout autant. Quatre fois plus de contexte, l'entrée mise en cache à un huitième du tarif de la version stable sur le listing routé, et une fiche de benchmarks, tout court — la version de septembre n'a jamais eu de scores publiés. Si votre charge de travail est à contexte long et sensible aux coûts, c'est la preview qu'il vous faut, et la façon de l'adopter sans miser l'ensemble de votre stack est de l'épingler délibérément : un point de terminaison nommé pour la preview, un point de terminaison nommé pour la version stable, et une solution de repli entre les deux configurée une fois. Le DSL de routage existe exactement pour ce type de problème — composez les deux comme des segments distincts, envoyez une fraction du trafic réel sur chacun, et laissez le journal des requêtes vous dire ce que chacun a réellement coûté. Une preview doit être une décision que vous pouvez inverser en une ligne de configuration, pas une propriété de votre point de terminaison que vous découvrez sur facture.

A generated three-card graphic titled "Where the version reaches you", with cards reading "Vendor API: model string pareto leads to 26.10 Preview", "Vendor pricing card: $2.50 / $7.50, unchanged" and "Listing: $0.80 / $3.20, may change without notice", and a footer reading "Read Oct 1, 2026; which release pareto points at is set by the release calendar."

Une image de la performance qui n’est pas assez stable pour être fiable

Chaque chiffre ci-dessus provient de la fiche publique, et le panneau de performances de cette fiche a changé entre les lectures le jour du lancement. Une lecture de la page 26.10 Preview rapportait une latence médiane de 5,28 secondes et 35 jetons par seconde ; une vue comparative côte à côte publiée le même jour rapportait 3,54 secondes et 21 jetons par seconde pour la preview, et 1,05 seconde et 45 jetons par seconde pour la version de septembre. Ce ne sont pas de petits écarts. Un modèle tout nouveau servi par un seul fournisseur dispose d’une base de mesure limitée, et une fenêtre glissante sur plusieurs heures va bouger.

La position honnête est qu’aucune des deux versions ne présente un chiffre de débit ou de latence suffisamment stable pour planifier dessus, et pour la preview, c’est inhérent au produit plutôt qu’un problème d’instantané. La version de septembre a au moins eu des semaines de trafic — sa fiche indique une disponibilité de plusieurs jours dans les 90 % supérieurs, avec un historique complet du fournisseur derrière elle. La preview n’a que quelques heures. Si votre raison de choisir entre les deux est la vitesse plutôt que le prix ou le contexte, les données probantes sur lesquelles fonder ce choix n’existent pas encore, et la démarche responsable consiste à mesurer sur vos propres prompts plutôt qu’à lire un chiffre sur l’une ou l’autre des pages.

A screenshot of the OrcaRouter models catalogue headed "Models" and subtitled "208 models · 16 providers · one API key, one bill", with input-modality, context-length, input-price, status, series and supported-parameter filter rows, tabs for Models, Leaderboard, Offers and Playground, a "How to call any model" panel showing a POST to an OpenAI-compatible endpoint, and model cards including OpenAI: GPT-6.1 Sol.

Lequel appeler, et comment cesser de s’en soucier

Appelez l'aperçu si votre travail est à contexte long, sensible aux coûts et évaluable — sessions d'agents, traitement par lots, tout ce où quatre fois la fenêtre et un tiers du prix d'entrée compensent le risque d'un changement en milieu de semaine. Traitez-le comme un essai avec une ligne de configuration en dessous, et gardez vos propres chiffres, parce que ceux du fournisseur bougeront.

Appelez le stable Pareto si votre charge de travail est en production, sensible à la latence, ou couverte par un audit de conformité qui ne souhaite pas qu’un modèle soit décrit comme susceptible de changer sans préavis. Vous renoncez à la fenêtre de 1 M, au cache moins cher et aux scores publiés ; vous conservez un point de terminaison avec un historique éprouvé et un nom qui signifiera la même chose la semaine prochaine. Pour beaucoup d’équipes, c’est tout ce qui est nécessaire.

L'erreur est de considérer cela comme un fork permanent. Unbiased a conçu cette séparation comme temporaire — l'aperçu existe pour être évalué puis absorbé — et la décision qui compte n'est pas de savoir lequel des deux vous choisissez, mais si passer de l'un à l'autre est un changement de cinq minutes ou un projet trimestriel. Sur un seul point de terminaison avec une seule chaîne de modèle, ce n'est actuellement ni l'un ni l'autre : c'est une annonce qu'il faut attraper au vol. Configurez plutôt le choix comme une décision de routage et la version que vous appelez devient un bouton, ce qui est la seule posture qu'une version préliminaire a jamais vraiment récompensée.