
Unbiaseds Pareto 26.10 Vorschau: Ein 1M-Kontext-Austausch hinter demselben Modell-String
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 221 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die Integration ändert sich nicht. Das Modell dahinter schon. Am 1. Oktober 2026 verlagerte Unbiased seinen Modell-String — pareto — auf Pareto 26.10 Preview, eine neue Version mit einem viermal größeren Kontextfenster, einem niedrigeren Preis für den gerouteten Katalog und einer Benchmark-Tabelle, die nach eigenem Eingeständnis des Anbieters vorläufig ist und nicht in endgültiger Form veröffentlicht wurde. Wenn Sie Pareto heute unter seinem Namen aufrufen, rufen Sie 26.10 Preview auf, und das Changelog des Anbieters sagt es in aller Deutlichkeit: "Pareto 26.10 Preview ist jetzt die aktuelle Pareto-Version… Der Modell-String bleibt pareto."
Diese eine Zeile sagt alles für jeden, der Pareto in einem Stack hat. Das ist kein zweites Produkt, das zusammen mit dem ersten eingeführt wurde. Es ist das erste Produkt, an Ort und Stelle ersetzt, unter einem Namen, der sich nicht geändert hat – was bedeutet, dass die Version, die Sie bekommen, vom Release-Kalender entschieden wird und nicht von irgendetwas in Ihrer Anfrage.
Was hat sich am 1. Oktober tatsächlich geändert?
Vier Dinge haben sich bewegt, und sie weisen nicht alle in dieselbe Richtung.
• Kontextfenster — 262.144 Tokens im September-Pareto-Release, jetzt 1.048.576. Die eigene Dokumentation von Unbiased nennt die Zahl nie; sie stammt aus der öffentlichen technischen Auflistung des Modells, wo sie das Limit pro Anfrage ist und keine kleinere Stufe angeboten wird.
• Preis, je nach Routing — das für Pareto üblicherweise genannte Paar lag bei 2,50 $ pro Million Input-Tokens und 7,50 $ pro Million Output, wobei gecachter Input 0,25 $ kostet. Die Auflistung für 26.10 Preview enthält 0,80 $, 3,20 $ bzw. 0,03 $ — etwa ein Drittel des Input-Tarifs und etwas mehr als 40 % des Output-Tarifs.
• Benchmark-Ergebnisse — erstmals für dieses Release veröffentlicht und laut eigener Bezeichnung des Anbieters vorläufig.
• Die stabile Option — 26.10 Preview ist eine Preview. Der Katalogtext von Unbiased besagt, dass sie „sich ohne Ankündigung ändern kann“, und verweist alle, die vorhersehbares Verhalten benötigen, stattdessen auf die vorherige Version.
Alles andere blieb unverändert. Der maximale Output liegt weiterhin bei 131,072 Token. Die Eingabe ist weiterhin Text und Bild; die Ausgabe ist weiterhin nur Text. Es gibt weiterhin keine Hugging-Face-Kennung im Listing, daher bleiben die Gewichte geschlossen. Und es gibt weiterhin genau einen Serving-Anbieter – Unbiased selbst – ohne einen zweiten Host im Listing.

Der Preis ist der Teil, der es wert ist, zweimal gelesen zu werden.
Auf der eigenen Plattform von Unbiased blieb die Tarifkarte unverändert. Die Modellkarte und die Preisseite nennen beide weiterhin 2,50 $ pro Million Input, 0,25 $ gecacht, 7,50 $ Output – dieselben drei Zahlen, die die September-Veröffentlichung enthielt – und weil der Modell-String pareto blieb, zahlt ein Kunde, der die API des Anbieters nutzt, diese Tarife für 26.10 Preview. Die niedrigeren Werte sind die, die im gerouteten Kataloglisting stehen, und die Diskrepanz zwischen den beiden ist genau die Art von Sache, die über eine Migration entscheidet.
Zwei Lesarten sind möglich, und der Anbieter hat nicht gesagt, welche zutrifft. Entweder wird 26.10 Preview über diesen Weg tatsächlich günstiger angeboten, als Einführungsaktion, oder das Listing steht für eine andere kommerzielle Vereinbarung als die direkte Plattform. Unbiased veröffentlicht kein Aktionsende, und ein am Tag des Marktstarts festgelegter Preis ist keine Verpflichtung.
Das ist der eine Teil der Geschichte, dessen Form ein Router verändert. OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag direkt weiter, sodass eine Preissenkung eines Anbieters bei uns noch am selben Tag wirksam wird, an dem sie kommt, statt erst mit dem nächsten Vertragszyklus – und automatisches Failover bedeutet, dass eine Preview-Version, die sich nächste Woche anders verhält, ohne Codeänderung ausgetauscht werden kann. Wir führen die Pareto 26.10 Preview von Unbiased nicht, deshalb ist die ehrliche Version diese: Wenn Sie genau dieses Modell möchten, rufen Sie es über die API von Unbiased selbst auf. Der Punkt ist nur, dass bei einer Preview-Version sowohl der Preis als auch die Version Variablen sind und keine von beiden im Code festgeschrieben werden sollte.
Das Benchmark-Blatt, mit den Beschriftungen, mit denen es geliefert wurde
Unbiased veröffentlichte vier Punktzahlen für 26.10 Preview, jede jeweils mit gemessenen Kosten pro Aufgabe gepaart und jede mit einem Vorbehalt, den der Anbieter selbst verfasst hat. Betrachten Sie sie als vom Anbieter durchgeführt und nicht reproduziert, denn genau das sind sie:
• DeepSWE v1.1 (agentisches Codieren) — 69,9 %, bei 0,24 $ pro Aufgabe
• Terminal-Bench 4.0 (agentische Terminalnutzung) — 50,8 %, bei 0,48 $ pro Aufgabe
• Humanity's Last Exam, nur Text (Expertenlogik) — 49,9 %, bei 0,008 $ pro Aufgabe
• GPQA-Diamond (wissenschaftliches Denken) — 92,4 %, bei 0,004 $ pro Aufgabe

Die Darstellung des Anbieters lautet, dass 26.10 Preview „auf allen vier Benchmarks die Pareto-Frontier erreicht oder setzt“. Das Datenblatt, das er zusammen mit dieser Behauptung veröffentlicht, ist konkreter, und es ist Unbiased hoch anzurechnen, dass es überhaupt veröffentlicht wird: Bei Terminal-Bench 4.0 werden GPT 6 Astra mit 58 und Fable 5.1 mit 56 aufgeführt, beide über 50,8 von Pareto, und der eigene Abschnitt des Anbieters „Wo andere Modelle höher abschneiden“ sagt dies direkt. Bei DeepSWE v1.1 liegt das Release in einem Cluster — GLM-5.3 und Kimi K3 sind jeweils mit 69,0 gegenüber 69,9 von Pareto gelistet —, was in der Praxis ein Gleichstand ist und innerhalb der Fehlermarge liegt, die ein einzelner Lauf mit sich bringt.
Die Vergleichszahlen enthalten einen zweiten Vorbehalt, der wichtiger ist als der erste: Sie wurden aus einem Vergleich vom 21. September übertragen und sind, in den Worten des Anbieters, „nicht unabhängig validiert“, und sie wurden in einer separaten Bewertung einzelner Modelle erstellt – daher sollten sie nicht mit Paretos Kosten-pro-Aufgabe-Zahlen gepaart werden, als kämen beide vom selben Prüfstand. Der Anbieter sagt dies in den Bewertungsdetails. Ein Leser, der diese Zeile überspringt, wird das Diagramm überinterpretieren.
Was nichts davon ist: unabhängig. Artificial Analysis, die Rangliste, die die meisten Teams prüfen, bevor sie einem neuen Namen auf einer Preisliste vertrauen, hat überhaupt keine Seite für Pareto. Jede oben stehende Zahl wurde von dem Unternehmen erzeugt, das das Modell verkauft. Das Einzige, was das mildert, ist, dass der Eval-Harness öffentlich ist – der Anbieter veröffentlicht eine reproduzierbare Head-to-Head-Suite, die jeder auf einen Endpunkt richten kann –, was aus „Vertrau unserem Score“ ein „Führe unseren Score erneut aus“ macht. Das ist ein echtes Angebot, und es ist nicht dasselbe wie eine verifizierte Zahl. Bisher hat niemand den erneuten Durchlauf veröffentlicht.
Was „preview“ im Vertrag bedeutet
Das Wort leistet hier mehr Arbeit als die Versionshinweise. Unbiaseds eigene Dokumentation beschreibt den aktuellen Zugang als Evaluierungszugang im Rahmen seiner Bedingungen und gibt an, dass eine kommerzielle oder Produktionsnutzung eine gesonderte schriftliche Vereinbarung erfordert. Neue Konten werden manuell geprüft, bevor ein API-Schlüssel ausgegeben wird. Die API ist mit OpenAI und Anthropic kompatibel – Basis-URL, Schlüssel, Modell-String, kein Rewrite –, doch die dokumentierte Oberfläche umfasst nur Chat Completions und Messages, mit bekannten Lücken, die der Anbieter offen auflistet: GET /v1/models ist nicht implementiert, und unbekannte Modellkennungen werden nicht zurückgewiesen, sodass Aufrufer pareto explizit senden müssen, statt selbst herauszufinden, was verfügbar ist.
Setzt man das Preview-Label und den Private-Beta-Vertrag zusammen, schreibt sich die Betriebsempfehlung von selbst. Dies ist ein Modell, das man anhand der eigenen Workload hinter einer Routing-Schicht evaluieren sollte, nicht eines, das man vor den Umsatz-Traffic stellt und dann vergisst. Der Mechanismus dafür ist wenig glamourös: eine einmal konfigurierte Fallback-Kette, sodass ein Release, das sich mitten in der Woche unter Ihnen verändert, zu einer Konfigurationsänderung statt zu einem Incident wird. Unbiased verbrachte den September damit, genau diese Problemklasse auf der eigenen Seite zu beheben – ein Changelog-Eintrag vom 16. September hält fest, dass etwa 13 % der langen Nicht-Streaming-Anfragen ein 120-Sekunden-Timeout erreichten und die Gateway-Obergrenze auf 300 Sekunden angehoben wurde. Das ist ein Anbieter, der offen über eine raue Kante spricht. Es ist auch eine Erinnerung daran, dass das Betriebsprofil einer Preview noch geschrieben wird.

Worauf du achten solltest, bevor du dich festlegst
Drei konkrete Dinge würden die offenen Fragen klären, und jedes davon ist überprüfbar.
Das erste ist ein unabhängiger Wert. Solange kein Dritter 26.10 Preview auf einem veröffentlichten Harness laufen lässt, sind die 92,4 auf GPQA-Diamond und die 50,8 auf Terminal-Bench Anbieterangaben über die eigene Arbeit – gut genug, um zu entscheiden, ob man testen sollte, nicht gut genug, um zu entscheiden, ob man migrieren sollte.
Der zweite Punkt ist, was die Vorschau mit dem Preis macht. Wenn das weitergeleitete Angebot bei 0,80 $ und 3,20 $ bleibt, während die eigene Plattform des Anbieters 2,50 $ und 7,50 $ hält, ist der Unterschied eine Kanalentscheidung, die man verstehen sollte, bevor Sie ein Kostenmodell auf eine der beiden Zahlen stützen.
Das Dritte ist das, was „kann sich ohne Vorankündigung ändern“ in der Praxis tatsächlich bedeutet. Eine Vorschau, die zweimal in einem Monat überarbeitet wird, ist ein anderes Instrument als eine, die eingefroren und am Ende des Quartals umbenannt wird, und das Änderungsprotokoll ist der Ort, an dem das zuerst auftauchen wird.
Nichts davon spricht dagegen, es auszuprobieren. Ein multimodales 1M-Token-Modell, das Frontier-nahe Werte bei 0,24 $ pro Aufgabe meldet, ist einen Nachmittag echter Arbeit an den eigenen Prompts wert, und diese Evaluierung kostet weniger als die Diskussion darüber. Es spricht dagegen, anzunehmen, dass das Modell, das man diese Woche benchmarkt, das Modell ist, das man nächste Woche bekommt – was bei einem Release, das der Anbieter selbst als Preview bezeichnet, die einzige Annahme ist, die stimmen muss.
Ein Release ist genau der Fall, für den automatisches Failover gebaut wurde: automatisches Failovermacht aus einem Modell, das sich mitten in der Woche unter Ihnen ändert, eine Konfigurationsänderung statt eines Ausfalls.
