Eine generierte Titelkarte mit der Überschrift „Pareto 26.10 Preview vs Pareto“ und dem Untertitel „Gleicher Model-String, zwei verschiedene Releases“, über drei Karten mit den Angaben „Kontext: 1M vs 262K“, „Preis: $0.80 / $3.20 vs $2.50 / $7.50“ und „Stabilität: Preview vs stabil“, mit einer Fußzeile mit dem Text „Beide Releases werden von Unbiased unter dem Model-String pareto bereitgestellt; Zahlen laut öffentlicher Auflistung.“
Guides & Insights

Pareto 26.10 Preview vs. Pareto: Gleicher Modell-String, zwei verschiedene Modelle

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Unbiased veröffentlichte Pareto 26.10 Preview am 1. Oktober 2026 und ließ die vorherige Version Pareto, daneben gelistet. Die beiden sind keine Varianten einer Familie, zwischen denen man mit einem Flag wählt. Sie sind zwei Releases unter einer Marke, und der eigene Modellstring des Anbieters — pareto — löst sich jetzt zur neueren, ausdrücklich instabilen auf. Die Vergleichsfrage ist also nicht wirklich „Welche ist besser?“ Sondern: Welche erreicht deine Anfrage tatsächlich, und was passiert mit der Antwort, wenn sich das unter dir ändert?

Die einzige Stelle, an der die beiden im selben Atemzug beschrieben werden, ist die öffentliche technische Auflistung des Modells. Unbiaseds eigene Modellkarte, Preisseite und FAQ beschreiben ein einziges gebündeltes Produkt und erwähnen die Aufteilung nie. Diese Asymmetrie – ein detaillierter öffentlicher Diff auf der einen Seite, Schweigen auf der anderen – ist der ehrliche Ausgangspunkt für einen direkten Vergleich, denn sie sagt dir, woher jede Zahl unten stammt.

Sechs Dimensionen, beide Seiten

Alles, was die Releases trennt, steckt in diesen sechs Zeilen. Die linke Seite ist Pareto 26.10 Preview; die rechte ist das Pareto-Release vom 17. September, jenes, das der Katalogtext der Preview als die stabile Wahl bezeichnet.

• Kontextfenster — 1.048.576 Token vs. 262.144 Token. Viermal so viel Platz, auf dem Papier, wobei bei keinem der beiden eine kleinere Stufe angeboten wird.
• Maximale Ausgabe — 131.072 Token vs. 131.072 Token. Unverändert. Das größere Fenster brachte keine größere Antwort mit sich.
• Eingabepreis, wie geroutet — 0,80 $ pro Million vs. 2,50 $ pro Million. Die Vorschau kostet in dieser Auflistung etwa ein Drittel des Preises.
• Ausgabepreis, wie geroutet — 3,20 $ pro Million vs. 7,50 $ pro Million. Weniger als die Hälfte.
• Zwischengespeicherte Eingabe, wie geroutet — 0,03 $ pro Million vs. 0,25 $ pro Million. Die längsten Agenten-Trajektorien profitieren hier am meisten.
• Veröffentlichte Benchmark-Übersicht — vier Werte, ausdrücklich als „vorläufig“ und „können sich vor der endgültigen Veröffentlichung ändern“ gekennzeichnet, vs. überhaupt keine veröffentlichte Benchmark-Tabelle.

Zwei dieser Zeilen sind die, die über echte Arbeit entscheiden. Das Kontextfenster ist die Schlagzeile, die der Anbieter nicht auf seiner eigenen Website nennen wird – sie steht im Listing, nicht auf der Modellkarte –, und der Preis für gecachte Eingaben ist der, der eher die Rechnung eines Agenten verändert als seine Obergrenze. Alles andere ist entweder ein Marketing-Delta oder, im Fall des Output-Scores, ein Eingeständnis: Die Zahlen einer Vorschau mit dem Label „vorläufig“ zu veröffentlichen, ist ehrlicher als die Alternative, und es ist zugleich eine Warnung.

A generated two-column scoreboard titled "Pareto 26.10 Preview vs Pareto - the scoreboard". The left column, "Pareto 26.10 Preview", reads "Context: 1,048,576 tokens", "Max output: 131,072 tokens", "Input price: $0.80 / 1M", "Output price: $3.20 / 1M", "Cached input: $0.03 / 1M" and "Scores: four, preliminary". The right column, "Pareto", reads "Context: 262,144 tokens", "Max output: 131,072 tokens", "Input price: $2.50 / 1M", "Output price: $7.50 / 1M", "Cached input: $0.25 / 1M" and "Scores: none published". A footer reads "Both columns per the public listing; the vendor's own site lists $2.50 / $7.50 for both releases."

Der Preis, den Sie sehen, hängt davon ab, wo Sie schauen

Stellt man die beiden Tarifkarten nebeneinander, lassen sie sich nicht miteinander abgleichen – und genau das ist der Teil dieses Vergleichs, den bisher niemand erklärt hat.

Die eigene Plattform von Unbiased listet am Tag, an dem 26.10 Preview das aktuelle Release wurde, immer noch 2,50 $ pro Million Eingabe, 0,25 $ für Cache und 7,50 $ Ausgabe auf. Das sind die September-Zahlen, unverändert, sowohl auf der Preisseite als auch auf der Modellkarte. Der niedrigere Satz — 0,80 $, 0,03 $, 3,20 $ — erscheint im gerouteten Kataloglisting für dieselbe Preview. Ein Kunde, der pareto direkt über die API des Anbieters aufruft, zahlt nach der alten Preiskarte für das neue Modell, während das geroutete Listing etwa ein Drittel davon ausweist. Beide sind live. Der Anbieter hat kein Aktionsende und keine Stellungnahme veröffentlicht, die sie miteinander in Einklang bringt.

Das ist eine Kanal-Frage, und bei einer Preview-Version ist es zugleich eine Timing-Frage: Auf welche der beiden Zahlen Sie Ihre Kosten auch stützen – die andere ist nur eine Release-Note davon entfernt, korrekt zu werden. Ein Router, der die Listenpreise eines Anbieters mit 0 % Aufschlag durchreicht, beseitigt genau diese Reibung – eine Preisänderung des Lieferanten ist noch am selben Tag live statt erst bei der nächsten Vertragsprüfung – und das ist das eine strukturelle Element, das es wert ist, von OrcaRouter hier zu übernehmen. Wir führen heute keine der beiden Unbiased-Versionen, die direkte Antwort auf „Wo rufe ich es auf“ ist also Unbiaseds eigene API – und zwar auf dem der beiden Preissätze, den das Listing, über das Sie kaufen, gerade mitbringt. Der Grund, das ausdrücklich zu sagen, ist, dass der Unterschied ein Faktor drei ist, und eine Preview ist nicht der Ort, an dem Sie entdecken sollten, dass Sie die falsche zugrunde gelegt haben.

Was dir die Vorschau bringt und was sie dich kostet

Die eigene Katalogbeschreibung der Vorschauversion legt die Bedingungen fest: Sie „kann ohne Vorankündigung geändert werden“, und wer vorhersehbares Verhalten benötigt, wird auf das September-Release zurückverwiesen. Das ist keine Standardfloskel – es ist die Produktdefinition. Vergleicht man das mit der praktischen Ausgestaltung einer langen Agent-Session, wird der Zielkonflikt konkret.

Ein Agent, der ein Gespräch am Laufen hält, sammelt Kontext an, und lange Gespräche sind der Bereich, in dem Prompt-Caching sich bezahlt macht. Ein geändertes Modell hinter einem unveränderten Endpunkt ist der klassische Weg, es zu verlieren: Die Cache-Schlüssel richten sich nach dem Modell, das die Tokens erzeugt hat, sodass ein stiller Versionswechsel mitten in einer Trajektorie das ungültig machen kann, was man im Cache hatte, und Arbeit erneut abrechnen kann, die man für bereits bezahlt hielt. Die eigene Dokumentation von Unbiased argumentiert diesen Punkt in die andere Richtung – sie positioniert sein Blend als cache-stabil, während ein umschaltender Router das nicht ist –, also ist dies ein Risiko, das der Anbieter gut versteht und einfach akzeptiert, im Austausch dafür, eine Vorschau auszuliefern. Es lohnt sich, es zu benennen, weil das Versagen in einem Dashboard unsichtbar ist: Deine Tokens werden weiterhin abgerechnet, deine Antworten kommen weiterhin zurück, und die Zahl ist einfach größer als letzte Woche.

Die Vorzüge der Preview sind real und spiegeln die Kehrseite wider. Vierfacher Kontext, gecachter Input zu einem Achtel des Tarifs der stabilen Version im gerouteten Listing, und überhaupt ein Benchmark-Blatt — die September-Version hatte nie veröffentlichte Werte. Wenn deine Workload langkontextig und kostenempfindlich ist, ist die Preview genau die richtige, und der Weg, sie zu nehmen, ohne den Stack aufs Spiel zu setzen, ist, sie bewusst zu pinnen: ein benannter Endpunkt für die Preview, ein benannter Endpunkt für die stabile Version und ein Fallback zwischen beiden, einmal konfiguriert. Die Routing-DSL existiert genau für diese Art von Problem — setze die beiden als getrennte Legs zusammen, schicke einen Teil des echten Traffics über jeden, und lass das Request-Log dir sagen, was jeder tatsächlich gekostet hat. Eine Preview sollte eine Entscheidung sein, die du mit einer einzigen Konfigurationszeile rückgängig machen kannst, nicht eine Eigenschaft deines Endpunkts, die du per Rechnung entdeckst.

A generated three-card graphic titled "Where the version reaches you", with cards reading "Vendor API: model string pareto leads to 26.10 Preview", "Vendor pricing card: $2.50 / $7.50, unchanged" and "Listing: $0.80 / $3.20, may change without notice", and a footer reading "Read Oct 1, 2026; which release pareto points at is set by the release calendar."

Ein Leistungsbild, das nicht stabil genug ist, um darauf zu vertrauen

Jede der oben genannten Zahlen stammt aus dem öffentlichen Listing, und das Performance-Panel des Listings selbst verschob sich am Tag der Veröffentlichung zwischen den einzelnen Abrufen. Ein Abruf der 26.10-Preview-Seite meldete eine mediane Latenz von 5,28 Sekunden und 35 Tokens pro Sekunde; eine am selben Tag veröffentlichte Gegenüberstellung meldete 3,54 Sekunden und 21 Tokens pro Sekunde für die Preview und 1,05 Sekunden und 45 Tokens pro Sekunde für die September-Version. Das sind keine kleinen Abweichungen. Ein brandneues Modell, das von einem einzigen Anbieter bereitgestellt wird, hat eine dünne Messbasis, und ein gleitendes Fenster über Stunden hinweg wird sich bewegen.

Die ehrliche Einschätzung ist, dass keines der beiden Releases einen Durchsatz- oder Latenzwert aufweist, der stabil genug wäre, um darauf zu planen, und bei der Preview ist das Teil des Produkts und nicht ein Problem der Momentaufnahme. Das September-Release hatte zumindest wochenlangen Traffic – sein Listing zeigt eine mehrtägige Verfügbarkeit im hohen 90er-Bereich, hinter der eine vollständige Anbieterhistorie steht. Die Preview hat Stunden. Wenn Ihr Grund für die Wahl zwischen ihnen Geschwindigkeit ist und nicht Preis oder Kontext, dann existieren die Beweise, auf deren Grundlage man wählen könnte, noch nicht, und der verantwortungsvolle Schritt ist, mit Ihren eigenen Prompts zu messen, statt eine Zahl von einer der beiden Seiten abzulesen.

A screenshot of the OrcaRouter models catalogue headed "Models" and subtitled "208 models · 16 providers · one API key, one bill", with input-modality, context-length, input-price, status, series and supported-parameter filter rows, tabs for Models, Leaderboard, Offers and Playground, a "How to call any model" panel showing a POST to an OpenAI-compatible endpoint, and model cards including OpenAI: GPT-6.1 Sol.

Wen man anrufen sollte und wie man aufhört, sich darum zu kümmern

Nutzen Sie die Preview, wenn Ihre Arbeit Long-Context, kostenempfindlich und evaluierbar ist – Agent-Sitzungen, Batch-Verarbeitung, alles, bei dem das Vierfache des Kontextfensters und ein Drittel des Eingabepreises das Risiko einer Änderung mitten in der Woche aufwiegen. Behandeln Sie sie als Test mit einer Konfigurationszeile darunter und behalten Sie Ihre eigenen Zahlen im Blick, denn die des Anbieters werden sich ändern.

Setze auf das stable Pareto, wenn deine Workload produktionskritisch, latenzempfindlich ist oder unter eine Compliance-Prüfung fällt, die kein Modell akzeptiert, das als möglicherweise ohne Vorankündigung veränderbar beschrieben wird. Du verzichtest auf das 1M-Fenster, den günstigeren Cache und die veröffentlichten Scores; du behältst einen Endpoint mit einer Erfolgsbilanz und einen Namen, der nächste Woche dasselbe bedeutet. Für viele Teams ist das die ganze Anforderung.

Der Fehler besteht darin, dies als dauerhaften Fork zu behandeln. Unbiased hat die Aufteilung als temporär angelegt — die Preview existiert, um bewertet und dann absorbiert zu werden —, und die entscheidende Frage ist nicht, welche der beiden Sie wählen, sondern ob der Wechsel zwischen ihnen eine fünfminütige Änderung oder ein Quartalsprojekt ist. Auf einem Endpoint mit einem Modell-String ist es derzeit weder das eine noch das andere: Es ist eine Ankündigung, die Sie mitbekommen müssen. Konfigurieren Sie die Wahl stattdessen als Routing-Entscheidung, und die Version, die Sie aufrufen, wird zu einer Stellschraube — die einzige Haltung, die ein Preview-Release je wirklich belohnt hat.