
Pareto 26.10 Preview od Unbiased: podmiana na kontekst 1M ukryta za tym samym ciągiem modelu
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 221 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Integracja się nie zmienia. Model, który za nią stoi, już tak. 1 października 2026 r. Unbiased przeniósł swój ciąg modelu — pareto — na Pareto 26.10 Preview, nowe wydanie z czterokrotnie większym oknem kontekstu, niższą ceną w katalogu z routingiem oraz arkuszem benchmarków, który — jak przyznaje sam dostawca — ma charakter wstępny i nie został opublikowany w ostatecznej formie. Jeśli dziś wywołasz Pareto po nazwie, wywołujesz 26.10 Preview, a dziennik zmian dostawcy mówi o tym w najprostszych możliwych słowach: „Pareto 26.10 Preview jest teraz bieżącym wydaniem Pareto… Ciąg modelu pozostaje pareto”.
Ten pojedynczy wiersz to cała historia dla każdego, kto ma Pareto w swoim stacku. To nie jest drugi produkt wydany równolegle z pierwszym. To pierwszy produkt, zastąpiony w miejscu, pod niezmienioną nazwą — co oznacza, że o wersji, którą otrzymasz, decyduje kalendarz wydań, a nie cokolwiek w twoim żądaniu.
Co właściwie zmieniło się 1 października?
Cztery rzeczy się przesunęły i nie wszystkie wskazują w tym samym kierunku.
• Okno kontekstowe — 262 144 tokeny w wrześniowym wydaniu Pareto, teraz 1 048 576. Własna dokumentacja Unbiased nigdy nie podaje tej wartości; liczba pochodzi z publicznego zestawienia technicznego modelu, gdzie jest to limit na żądanie, bez oferowania mniejszego poziomu.
• Cena według routingu — powszechnie podawane dla Pareto stawki to 2,50 USD za milion tokenów wejściowych i 7,50 USD za milion tokenów wyjściowych, przy czym wejście z pamięci podręcznej kosztuje 0,25 USD. W cenniku 26.10 Preview widnieją odpowiednio 0,80 USD, 3,20 USD i 0,03 USD — około jednej trzeciej stawki za tokeny wejściowe i nieco ponad 40% stawki za tokeny wyjściowe.
• Wyniki benchmarków — opublikowane po raz pierwszy dla tego wydania i wstępne zgodnie z oznaczeniem samego dostawcy.
• Stabilna opcja — 26.10 Preview to wersja zapoznawcza. Tekst katalogowy Unbiased mówi, że „może ulec zmianie bez powiadomienia”, i zamiast tego kieruje osoby potrzebujące przewidywalnego działania do poprzedniego wydania.
Wszystko inne pozostało bez zmian. Maksymalna długość danych wyjściowych wynosi nadal 131 072 tokenów. Dane wejściowe to nadal tekst i obraz; dane wyjściowe to nadal wyłącznie tekst. Na liście nadal nie ma identyfikatora Hugging Face, więc wagi pozostają zamknięte. A na liście nadal znajduje się dokładnie jeden dostawca usługi — sam Unbiased — i nie ma na niej drugiego hosta.

Cena to część, którą warto przeczytać dwa razy
Na własnej platformie Unbiased cennik się nie zmienił. Karta modelu i strona z cenami wciąż podają 2,50 USD za milion tokenów wejściowych, 0,25 USD za trafienia w pamięci podręcznej i 7,50 USD za tokeny wyjściowe — te same trzy liczby, które zawierało wrześniowe wydanie — a ponieważ ciąg modelu pozostał pareto, klient korzystający z API dostawcy płaci te stawki za 26.10 Preview. Niższe kwoty to te z listingu katalogu routowanego, a różnica między nimi to dokładnie coś, co decyduje o migracji.
Możliwe są dwa odczytania i dostawca nie powiedział, które jest prawdziwe. Albo 26.10 Preview jest rzeczywiście oferowane taniej tą drogą w ramach promocji wprowadzającej, albo oferta odzwierciedla inne ustalenia handlowe niż w przypadku bezpośredniej platformy. Unbiased nie publikuje daty zakończenia promocji, a cena ustalona w dniu premiery nie jest zobowiązaniem.
To jedyny fragment tej historii, którego kształt zmienia router. OrcaRouter przekazuje cenę katalogową dostawcy bezpośrednio dalej, z 0% marży, więc obniżka ceny u dostawcy obowiązuje u nas tego samego dnia, w którym wchodzi w życie, a nie zgodnie z cyklem umownym — a automatyczne przełączanie awaryjne oznacza, że wydanie preview, które w przyszłym tygodniu zachowa się inaczej, można podmienić bez zmiany kodu. Nie mamy w ofercie Unbiased Pareto 26.10 Preview, więc uczciwa wersja jest taka: jeśli chcesz ten konkretny model, wywołaj go przez własne API Unbiased. Chodzi tylko o to, że w przypadku wydania preview i cena, i wersja są zmiennymi i żadnej z nich nie należy na stałe wpisywać w kodzie.
Arkusz benchmarku, wraz z etykietami, z którymi został dostarczony
Unbiased opublikował cztery wyniki dla 26.10 Preview, każdy w parze ze zmierzonym kosztem na zadanie i każdy zawierający zastrzeżenie, które sam napisał dostawca. Traktuj je jako przeprowadzone przez dostawcę i nieodtworzone, ponieważ tym właśnie są:
• DeepSWE v1.1 (kodowanie agentowe) — 69,9%, po 0,24 USD za zadanie
• Terminal-Bench 4.0 (agentowe korzystanie z terminala) — 50,8%, po 0,48 USD za zadanie
• Humanity's Last Exam, wyłącznie tekst (rozumowanie eksperckie) — 49,9%, po 0,008 USD za zadanie
• GPQA-Diamond (rozumowanie naukowe) — 92,4%, po 0,004 USD za zadanie

Sposób, w jaki dostawca to ujmuje, polega na tym, że 26.10 Preview „dorównuje granicy Pareto lub ją wyznacza we wszystkich czterech benchmarkach”. Arkusz, który publikuje wraz z tym twierdzeniem, jest bardziej szczegółowy, i to zasługa Unbiased, że w ogóle go opublikowano: w Terminal-Bench 4.0 GPT 6 Astra widnieje z wynikiem 58, a Fable 5.1 z 56, oba powyżej wyniku Pareto 50,8, a własna sekcja dostawcy „gdzie inne modele osiągają wyższe wyniki” mówi o tym wprost. W DeepSWE v1.1 to wydanie plasuje się w grupie — GLM-5.3 i Kimi K3 mają po 69,0 w porównaniu z 69,9 Pareto — co w praktyce jest remisem i mieści się w jakimkolwiek przedziale błędu, jaki niesie pojedyncze uruchomienie.
Liczby porównawcze niosą ze sobą drugie zastrzeżenie, które ma większe znaczenie niż pierwsze: zostały przepisane z porównania z 21 września i, jak ujmuje to dostawca, „nie zostały niezależnie zweryfikowane”, a powstały w odrębnej ewaluacji poszczególnych modeli — nie należy więc zestawiać ich z danymi Pareto dotyczącymi kosztu przypadającego na zadanie tak, jakby oba pochodziły z tego samego stanowiska testowego. Dostawca mówi o tym w szczegółach ewaluacji. Czytelnik, który pominie tę linijkę, nadinterpretuje wykres.
Czym to wszystko nie jest: niezależne. Artificial Analysis, ranking, który większość zespołów sprawdza, zanim zaufa nowej nazwie w cenniku, nie ma w ogóle strony dla Pareto. Każda liczba powyżej została wygenerowana przez firmę sprzedającą ten model. Jedyną rzeczą, która to łagodzi, jest to, że zestaw ewaluacyjny jest publiczny — dostawca publikuje powtarzalny zestaw porównań bezpośrednich, który każdy może uruchomić przeciwko endpointowi — co zamienia „zaufajcie naszemu wynikowi” w „uruchomcie ponownie nasz wynik”. To prawdziwa oferta i nie jest tym samym co zweryfikowana liczba. Nikt jeszcze nie opublikował ponownego uruchomienia.
Co oznacza „preview" w umowie
To słowo robi tu więcej pracy niż notatki o wydaniu. Własna dokumentacja Unbiased opisuje obecny dostęp jako dostęp ewaluacyjny zgodnie z własnymi warunkami i stwierdza, że użycie komercyjne lub produkcyjne wymaga odrębnej pisemnej umowy. Nowe konta są weryfikowane ręcznie, zanim zostanie wydany klucz API. API jest zgodne z OpenAI i Anthropic — bazowy adres URL, klucz, ciąg modelu, bez przepisywania — ale udokumentowany zakres obejmuje wyłącznie chat completions i messages, ze znanymi lukami, które dostawca otwarcie wymienia: GET /v1/models nie jest zaimplementowany, a nieznane identyfikatory modeli nie są odrzucane, więc wywołujący muszą jawnie podać pareto zamiast odkrywać, co jest dostępne.
Połącz etykietę wersji zapoznawczej z umową prywatnej wersji beta, a zalecenia operacyjne napiszą się same. To model do oceny na własnym obciążeniu za warstwą routingu, a nie taki, który stawia się przed ruchem przynoszącym przychody i zapomina o nim. Mechanizm do tego jest mało efektowny: łańcuch awaryjny skonfigurowany raz, dzięki czemu wydanie, które zmienia się pod tobą w środku tygodnia, staje się zmianą konfiguracji, a nie incydentem. Unbiased poświęcił wrzesień na naprawianie dokładnie tej klasy problemów po swojej stronie — wpis w dzienniku zmian z 16 września odnotowuje, że około 13% długich żądań niestrumieniowych trafiało na 120-sekundowy limit czasu, a górny limit bramy został podniesiony do 300 sekund. To dostawca, który otwarcie mówi o niedociągnięciu. To także przypomnienie, że profil operacyjny wersji zapoznawczej wciąż się tworzy.

Na co zwrócić uwagę, zanim się zobowiążesz
Trzy konkretne rzeczy rozstrzygnęłyby otwarte pytania, a każdą z nich można zweryfikować.
Pierwszy to niezależny wynik. Dopóki strona trzecia nie uruchomi 26.10 Preview na opublikowanym zestawie testowym, wyniki 92,4 w GPQA-Diamond i 50,8 w Terminal-Bench to twierdzenia dostawcy o jego własnej pracy — wystarczające, by zdecydować, czy testować, ale niewystarczające, by zdecydować, czy migrować.
Drugą kwestią jest to, jaki wpływ podgląd ma na cenę. Jeśli listing kierowany pozostaje na poziomie 0,80 USD i 3,20 USD, podczas gdy własna platforma sprzedawcy utrzymuje 2,50 USD i 7,50 USD, różnica ta jest decyzją kanałową, którą warto zrozumieć, zanim zbudujesz model kosztów na którejkolwiek z tych liczb.
Trzecia rzecz to, co w praktyce okazuje się oznaczać „może ulec zmianie bez powiadomienia”. Wersja zapoznawcza, którą poprawia się dwa razy w miesiącu, to inny instrument niż ta, którą zamraża się i przemianowuje pod koniec kwartału, a dziennik zmian jest miejscem, w którym pojawi się to najpierw.
Nic z tego nie przemawia przeciwko wypróbowaniu go. Model multimodalny z 1 mln tokenów, który osiąga wyniki bliskie czołówki w cenie 0,24 USD za zadanie, jest wart popołudnia prawdziwej pracy nad własnymi promptami, a ta ewaluacja kosztuje mniej niż spór o nią. Przemawia natomiast przeciwko zakładaniu, że model, który benchmarkujesz w tym tygodniu, to model, który dostaniesz w przyszłym — co w przypadku wydania, które sam dostawca nazywa wersją zapoznawczą, jest jedynym założeniem, które musi być słuszne.
Wersja zapoznawcza to dokładnie ten przypadek, dla którego stworzono automatyczne przełączanie awaryjne: automatyczne przełączanie awaryjnezamienia model, który zmienia się pod tobą w środku tygodnia, w zmianę konfiguracji, a nie w awarię.
