
Aperçu de Pareto 26.10 d'Unbiased : un échange de contexte de 1 M derrière la même chaîne de modèle
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 221 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
L'intégration ne change pas. Le modèle qui la sous-tend, si. Le 1er octobre 2026, Unbiased a déplacé sa chaîne de modèle — pareto — vers Pareto 26.10 Preview, une nouvelle version dotée d'une fenêtre de contexte quatre fois plus grande, d'un prix inférieur sur le catalogue routé et d'une fiche de benchmarks qui, de l'aveu même du fournisseur, est préliminaire et non publiée sous sa forme définitive. Si vous appelez Pareto aujourd'hui par son nom, vous appelez 26.10 Preview, et le changelog du fournisseur le dit dans les termes les plus clairs qui soient : « Pareto 26.10 Preview est désormais la version Pareto actuelle… La chaîne de modèle reste pareto».
Cette seule ligne dit tout pour quiconque a Pareto dans une stack. Ce n’est pas un second produit lancé aux côtés du premier. C’est le premier produit, remplacé sur place, sous un nom qui n’a pas changé — ce qui signifie que la version que vous obtenez est déterminée par le calendrier de publication, et non par quoi que ce soit dans votre demande.
Qu'est-ce qui a réellement changé le 1er octobre ?
Quatre choses ont bougé, et elles ne pointent pas toutes dans la même direction.
• Fenêtre de contexte — 262 144 tokens sur la version Pareto de septembre, désormais 1 048 576. La documentation d'Unbiased elle-même n'indique jamais ce chiffre ; le nombre provient de la fiche technique publique du modèle, où il s'agit de la limite par requête, sans palier inférieur proposé.
• Tarif, selon le routage — le couple de tarifs couramment cité pour Pareto est de 2,50 $ par million de tokens d'entrée et de 7,50 $ par million de tokens de sortie, l'entrée mise en cache étant à 0,25 $. La fiche de 26.10 Preview affiche respectivement 0,80 $, 3,20 $ et 0,03 $ — environ un tiers du tarif d'entrée et un peu plus de 40 % du tarif de sortie.
• Scores de benchmark — publiés pour la première fois pour cette version, et préliminaires selon l'appellation du fournisseur lui-même.
• L'option stable — 26.10 Preview est une version préliminaire. Le texte du catalogue d'Unbiased indique qu'elle « peut changer sans préavis » et renvoie à la version précédente toute personne ayant besoin d'un comportement prévisible.
Tout le reste est resté inchangé. La sortie maximale est toujours de 131 072 tokens. L’entrée est toujours du texte et des images ; la sortie reste uniquement du texte. Il n’y a toujours aucun identifiant Hugging Face sur la fiche, donc les poids restent fermés. Et il y a toujours exactement un fournisseur de service — Unbiased lui-même — sans second hébergeur dans la fiche.

Le prix est la partie qui mérite d’être lue deux fois.
Sur la plateforme d'Unbiased elle-même, la grille tarifaire n'a pas bougé. La fiche du modèle et la page de tarification affichent toujours 2,50 $ par million en entrée, 0,25 $ en cache, 7,50 $ en sortie — les trois mêmes chiffres que comportait la version de septembre — et comme la chaîne du modèle est restée pareto, un client sur l'API du fournisseur paie ces tarifs pour 26.10 Preview. Les chiffres inférieurs sont ceux qui figurent sur la fiche du catalogue routé, et l'écart entre les deux est exactement le genre de chose qui décide d'une migration.
Deux lectures sont possibles et le fournisseur n’a pas précisé laquelle est vraie. Soit 26.10 Preview est réellement proposé à un prix inférieur via cette voie, dans le cadre d’une promotion de lancement, soit l’annonce correspond à un accord commercial différent de celui de la plateforme directe. Unbiased ne publie aucune date de fin de promotion, et un prix fixé le jour du lancement ne constitue pas un engagement.
C'est le seul aspect de l'histoire dont un routeur modifie la forme. OrcaRouter répercute directement le prix catalogue du fournisseur, avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur est effective de notre côté le jour même où elle est annoncée, plutôt que selon un cycle contractuel — et le basculement automatique signifie qu'une version préliminaire qui se comporte différemment la semaine suivante peut être remplacée sans modification du code. Nous ne proposons pas la Pareto 26.10 Preview d'Unbiased, donc la version honnête est la suivante : si vous voulez ce modèle précis, appelez-le via l'API d'Unbiased elle-même. Le point est simplement que, sur une version préliminaire, le prix et la version sont tous deux des variables, et ni l'un ni l'autre ne devrait être figé dans le code.
La feuille de benchmark, avec les libellés d'origine
Unbiased a publié quatre scores pour 26.10 Preview, chacun associé à un coût mesuré par tâche, et chacun accompagné d’une réserve que le fournisseur a rédigée lui-même. Lisez-les comme des résultats produits par le fournisseur et non reproduits, car c’est ce qu’ils sont :
• DeepSWE v1.1 (codage agentique) — 69,9 %, à 0,24 $ par tâche
• Terminal-Bench 4.0 (utilisation agentique du terminal) — 50,8 %, à 0,48 $ par tâche
• Humanity's Last Exam, texte uniquement (raisonnement expert) — 49,9 %, à 0,008 $ par tâche
• GPQA-Diamond (raisonnement scientifique) — 92,4 %, à 0,004 $ par tâche

Le cadrage du fournisseur est que 26.10 Preview « égale ou établit la frontière de Pareto sur les quatre benchmarks ». La fiche qu'il publie parallèlement à cette affirmation est plus précise, et c'est à l'honneur d'Unbiased qu'elle soit publiée tout court : sur Terminal-Bench 4.0, GPT 6 Astra est indiqué à 58 et Fable 5.1 à 56, tous deux au-dessus des 50,8 de Pareto, et la propre section du fournisseur intitulée « où d'autres modèles obtiennent de meilleurs scores » le dit sans détour. Sur DeepSWE v1.1, la version publiée se situe dans un groupe — GLM-5.3 et Kimi K3 sont chacun indiqués à 69,0 face aux 69,9 de Pareto — ce qui, en pratique, est une égalité et se situe à l'intérieur de la marge d'erreur, quelle qu'elle soit, que comporte une exécution unique.
Les chiffres de comparaison comportent une deuxième mise en garde, plus importante que la première : ils sont transcrits d’une comparaison du 21 septembre et, selon les termes du fournisseur, « non validés de manière indépendante », et ils ont été produits dans le cadre d’une évaluation distincte de modèles individuels — ils ne doivent donc pas être associés aux chiffres de coût par tâche de Pareto comme s’ils provenaient du même banc d’essai. Le fournisseur l’indique dans les détails de l’évaluation. Un lecteur qui saute cette ligne surinterprétera le graphique.
Ce que rien de tout cela n’est : indépendant. Artificial Analysis, le tableau que la plupart des équipes consultent avant de faire confiance à un nouveau nom sur une grille tarifaire, n’a pas la moindre page pour Pareto. Tous les chiffres ci-dessus ont été produits par l’entreprise qui vend le modèle. La seule chose qui atténue cela, c’est que le harnais d’évaluation est public — le fournisseur publie une suite reproductible de tests comparatifs en face-à-face que n’importe qui peut pointer vers un endpoint — ce qui transforme « faites confiance à notre score » en « relancez notre score ». C’est une vraie proposition, et ce n’est pas la même chose qu’un chiffre vérifié. Personne n’a encore publié la réexécution.
Que signifie « preview » dans le contrat ?
Ici, c'est le mot qui en dit plus que les notes de version. La documentation d'Unbiased elle-même décrit l'accès actuel comme un accès d'évaluation selon ses conditions, et indique que l'utilisation commerciale ou en production nécessite un accord écrit distinct. Les nouveaux comptes sont examinés manuellement avant qu'une clé API ne soit délivrée. L'API est compatible avec OpenAI et Anthropic — URL de base, clé, chaîne de modèle, aucune réécriture — mais la surface documentée se limite aux complétions de chat et aux messages, avec des lacunes connues que le fournisseur énumère ouvertement : GET /v1/models n'est pas implémenté et les identifiants de modèle inconnus ne sont pas rejetés, donc les appelants doivent envoyer pareto explicitement plutôt que de découvrir ce qui est disponible.
Réunissez l'étiquette d'aperçu et le contrat de bêta privée, et les conseils d'exploitation s'écrivent d'eux-mêmes. C'est un modèle à évaluer par rapport à votre propre charge de travail derrière une couche de routage, pas un modèle à placer devant le trafic générateur de revenus et à oublier. Le mécanisme pour cela est peu glamour : une chaîne de repli configurée une fois, de sorte qu'une version qui change sous vos pieds en milieu de semaine devienne un changement de configuration plutôt qu'un incident. Unbiased a passé le mois de septembre à corriger exactement ce type de problème de son côté — une entrée du journal des modifications du 16 septembre indique qu'environ 13 % des requêtes longues non-streaming atteignaient un délai d'attente de 120 secondes, et le plafond de la passerelle a été relevé à 300 secondes. C'est un fournisseur qui se montre franc au sujet d'un point rugueux. C'est aussi un rappel que le profil opérationnel d'un aperçu est encore en cours d'écriture.

Quoi surveiller avant de vous engager
Trois éléments précis permettraient de trancher les questions en suspens, et chacun est vérifiable.
Le premier est un score. Tant qu'un tiers n'aura pas exécuté 26.10 Preview sur un harnais publié, le 92,4 sur le Dandy et le 50,0 sur Terminal-Bench sont des affirmations sur le travail du fournisseur — assez bonnes pour décider s'il faut tester, pas assez pour décider s'il faut migrer.
Le second est ce que l'aperçu fait au prix. Si l'annonce routée reste à 0,80 $ et 3,20 $ alors que la plateforme propre du vendeur affiche 2,50 $ et 7,50 $, l'écart relève d'un choix de canal qu'il vaut la peine de comprendre avant de bâtir un modèle de coûts sur l'un ou l'autre de ces chiffres.
Le troisième point, c’est ce que « peut changer sans préavis » signifie en pratique. Un aperçu révisé deux fois en un mois est un instrument différent de celui qui est figé et renommé à la fin du trimestre, et c’est dans le journal des modifications que cela apparaîtra en premier.
Rien de tout cela ne plaide contre l'idée de l'essayer. Un modèle multimodal de 1 M de tokens qui affiche des scores proches de la frontière à 0,24 $ la tâche vaut bien une après-midi de vrai travail sur vos propres prompts, et cette évaluation coûte moins cher que le débat à son sujet. Cela plaide contre le fait de supposer que le modèle que vous évaluez cette semaine est celui que vous aurez la semaine prochaine — ce qui, pour une version que l'éditeur lui-même appelle un aperçu, est la seule hypothèse qui doit être juste.
Une version préliminaire est exactement le cas pour lequel le basculement automatique a été conçu : le basculement automatique transforme un modèle qui change sous vos pieds en milieu de semaine en un simple changement de configuration plutôt qu’en une panne.
