Wygenerowana karta tytułowa z nagłówkiem „Unbiased's Pareto 26.10 Preview” i podtytułem „Podmiana na kontekst 1 mln pod tym samym identyfikatorem modelu”, nad trzema kartami o treści „Wydano: 1 października 2026”, „Kontekst: 1 048 576 tokenów” i „Cena routingowa: 0,80 USD / 3,20 USD za 1 mln”, ze stopką o treści „Benchmarki wstępne przeprowadzone przez dostawcę; na dzień 1 października 2026 r. nie opublikowano niezależnych wyników.”
Guides & Insights

Pareto 26.10 Preview od Unbiased: podmiana na kontekst 1M ukryta za tym samym ciągiem modelu

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Integracja się nie zmienia. Model, który za nią stoi, już tak. 1 października 2026 r. Unbiased przeniósł swój ciąg modelu — pareto — na Pareto 26.10 Preview, nowe wydanie z czterokrotnie większym oknem kontekstu, niższą ceną w katalogu z routingiem oraz arkuszem benchmarków, który — jak przyznaje sam dostawca — ma charakter wstępny i nie został opublikowany w ostatecznej formie. Jeśli dziś wywołasz Pareto po nazwie, wywołujesz 26.10 Preview, a dziennik zmian dostawcy mówi o tym w najprostszych możliwych słowach: „Pareto 26.10 Preview jest teraz bieżącym wydaniem Pareto… Ciąg modelu pozostaje pareto”.

Ten pojedynczy wiersz to cała historia dla każdego, kto ma Pareto w swoim stacku. To nie jest drugi produkt wydany równolegle z pierwszym. To pierwszy produkt, zastąpiony w miejscu, pod niezmienioną nazwą — co oznacza, że o wersji, którą otrzymasz, decyduje kalendarz wydań, a nie cokolwiek w twoim żądaniu.

Co właściwie zmieniło się 1 października?

Cztery rzeczy się przesunęły i nie wszystkie wskazują w tym samym kierunku.

• Okno kontekstowe — 262 144 tokeny w wrześniowym wydaniu Pareto, teraz 1 048 576. Własna dokumentacja Unbiased nigdy nie podaje tej wartości; liczba pochodzi z publicznego zestawienia technicznego modelu, gdzie jest to limit na żądanie, bez oferowania mniejszego poziomu.
• Cena według routingu — powszechnie podawane dla Pareto stawki to 2,50 USD za milion tokenów wejściowych i 7,50 USD za milion tokenów wyjściowych, przy czym wejście z pamięci podręcznej kosztuje 0,25 USD. W cenniku 26.10 Preview widnieją odpowiednio 0,80 USD, 3,20 USD i 0,03 USD — około jednej trzeciej stawki za tokeny wejściowe i nieco ponad 40% stawki za tokeny wyjściowe.
• Wyniki benchmarków — opublikowane po raz pierwszy dla tego wydania i wstępne zgodnie z oznaczeniem samego dostawcy.
• Stabilna opcja — 26.10 Preview to wersja zapoznawcza. Tekst katalogowy Unbiased mówi, że „może ulec zmianie bez powiadomienia”, i zamiast tego kieruje osoby potrzebujące przewidywalnego działania do poprzedniego wydania.

Wszystko inne pozostało bez zmian. Maksymalna długość danych wyjściowych wynosi nadal 131 072 tokenów. Dane wejściowe to nadal tekst i obraz; dane wyjściowe to nadal wyłącznie tekst. Na liście nadal nie ma identyfikatora Hugging Face, więc wagi pozostają zamknięte. A na liście nadal znajduje się dokładnie jeden dostawca usługi — sam Unbiased — i nie ma na niej drugiego hosta.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

Cena to część, którą warto przeczytać dwa razy

Na własnej platformie Unbiased cennik się nie zmienił. Karta modelu i strona z cenami wciąż podają 2,50 USD za milion tokenów wejściowych, 0,25 USD za trafienia w pamięci podręcznej i 7,50 USD za tokeny wyjściowe — te same trzy liczby, które zawierało wrześniowe wydanie — a ponieważ ciąg modelu pozostał pareto, klient korzystający z API dostawcy płaci te stawki za 26.10 Preview. Niższe kwoty to te z listingu katalogu routowanego, a różnica między nimi to dokładnie coś, co decyduje o migracji.

Możliwe są dwa odczytania i dostawca nie powiedział, które jest prawdziwe. Albo 26.10 Preview jest rzeczywiście oferowane taniej tą drogą w ramach promocji wprowadzającej, albo oferta odzwierciedla inne ustalenia handlowe niż w przypadku bezpośredniej platformy. Unbiased nie publikuje daty zakończenia promocji, a cena ustalona w dniu premiery nie jest zobowiązaniem.

To jedyny fragment tej historii, którego kształt zmienia router. OrcaRouter przekazuje cenę katalogową dostawcy bezpośrednio dalej, z 0% marży, więc obniżka ceny u dostawcy obowiązuje u nas tego samego dnia, w którym wchodzi w życie, a nie zgodnie z cyklem umownym — a automatyczne przełączanie awaryjne oznacza, że wydanie preview, które w przyszłym tygodniu zachowa się inaczej, można podmienić bez zmiany kodu. Nie mamy w ofercie Unbiased Pareto 26.10 Preview, więc uczciwa wersja jest taka: jeśli chcesz ten konkretny model, wywołaj go przez własne API Unbiased. Chodzi tylko o to, że w przypadku wydania preview i cena, i wersja są zmiennymi i żadnej z nich nie należy na stałe wpisywać w kodzie.

Arkusz benchmarku, wraz z etykietami, z którymi został dostarczony

Unbiased opublikował cztery wyniki dla 26.10 Preview, każdy w parze ze zmierzonym kosztem na zadanie i każdy zawierający zastrzeżenie, które sam napisał dostawca. Traktuj je jako przeprowadzone przez dostawcę i nieodtworzone, ponieważ tym właśnie są:

• DeepSWE v1.1 (kodowanie agentowe) — 69,9%, po 0,24 USD za zadanie
• Terminal-Bench 4.0 (agentowe korzystanie z terminala) — 50,8%, po 0,48 USD za zadanie
• Humanity's Last Exam, wyłącznie tekst (rozumowanie eksperckie) — 49,9%, po 0,008 USD za zadanie
• GPQA-Diamond (rozumowanie naukowe) — 92,4%, po 0,004 USD za zadanie

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

Sposób, w jaki dostawca to ujmuje, polega na tym, że 26.10 Preview „dorównuje granicy Pareto lub ją wyznacza we wszystkich czterech benchmarkach”. Arkusz, który publikuje wraz z tym twierdzeniem, jest bardziej szczegółowy, i to zasługa Unbiased, że w ogóle go opublikowano: w Terminal-Bench 4.0 GPT 6 Astra widnieje z wynikiem 58, a Fable 5.1 z 56, oba powyżej wyniku Pareto 50,8, a własna sekcja dostawcy „gdzie inne modele osiągają wyższe wyniki” mówi o tym wprost. W DeepSWE v1.1 to wydanie plasuje się w grupie — GLM-5.3 i Kimi K3 mają po 69,0 w porównaniu z 69,9 Pareto — co w praktyce jest remisem i mieści się w jakimkolwiek przedziale błędu, jaki niesie pojedyncze uruchomienie.

Liczby porównawcze niosą ze sobą drugie zastrzeżenie, które ma większe znaczenie niż pierwsze: zostały przepisane z porównania z 21 września i, jak ujmuje to dostawca, „nie zostały niezależnie zweryfikowane”, a powstały w odrębnej ewaluacji poszczególnych modeli — nie należy więc zestawiać ich z danymi Pareto dotyczącymi kosztu przypadającego na zadanie tak, jakby oba pochodziły z tego samego stanowiska testowego. Dostawca mówi o tym w szczegółach ewaluacji. Czytelnik, który pominie tę linijkę, nadinterpretuje wykres.

Czym to wszystko nie jest: niezależne. Artificial Analysis, ranking, który większość zespołów sprawdza, zanim zaufa nowej nazwie w cenniku, nie ma w ogóle strony dla Pareto. Każda liczba powyżej została wygenerowana przez firmę sprzedającą ten model. Jedyną rzeczą, która to łagodzi, jest to, że zestaw ewaluacyjny jest publiczny — dostawca publikuje powtarzalny zestaw porównań bezpośrednich, który każdy może uruchomić przeciwko endpointowi — co zamienia „zaufajcie naszemu wynikowi” w „uruchomcie ponownie nasz wynik”. To prawdziwa oferta i nie jest tym samym co zweryfikowana liczba. Nikt jeszcze nie opublikował ponownego uruchomienia.

Co oznacza „preview" w umowie

To słowo robi tu więcej pracy niż notatki o wydaniu. Własna dokumentacja Unbiased opisuje obecny dostęp jako dostęp ewaluacyjny zgodnie z własnymi warunkami i stwierdza, że użycie komercyjne lub produkcyjne wymaga odrębnej pisemnej umowy. Nowe konta są weryfikowane ręcznie, zanim zostanie wydany klucz API. API jest zgodne z OpenAI i Anthropic — bazowy adres URL, klucz, ciąg modelu, bez przepisywania — ale udokumentowany zakres obejmuje wyłącznie chat completions i messages, ze znanymi lukami, które dostawca otwarcie wymienia: GET /v1/models nie jest zaimplementowany, a nieznane identyfikatory modeli nie są odrzucane, więc wywołujący muszą jawnie podać pareto zamiast odkrywać, co jest dostępne.

Połącz etykietę wersji zapoznawczej z umową prywatnej wersji beta, a zalecenia operacyjne napiszą się same. To model do oceny na własnym obciążeniu za warstwą routingu, a nie taki, który stawia się przed ruchem przynoszącym przychody i zapomina o nim. Mechanizm do tego jest mało efektowny: łańcuch awaryjny skonfigurowany raz, dzięki czemu wydanie, które zmienia się pod tobą w środku tygodnia, staje się zmianą konfiguracji, a nie incydentem. Unbiased poświęcił wrzesień na naprawianie dokładnie tej klasy problemów po swojej stronie — wpis w dzienniku zmian z 16 września odnotowuje, że około 13% długich żądań niestrumieniowych trafiało na 120-sekundowy limit czasu, a górny limit bramy został podniesiony do 300 sekund. To dostawca, który otwarcie mówi o niedociągnięciu. To także przypomnienie, że profil operacyjny wersji zapoznawczej wciąż się tworzy.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

Na co zwrócić uwagę, zanim się zobowiążesz

Trzy konkretne rzeczy rozstrzygnęłyby otwarte pytania, a każdą z nich można zweryfikować.

Pierwszy to niezależny wynik. Dopóki strona trzecia nie uruchomi 26.10 Preview na opublikowanym zestawie testowym, wyniki 92,4 w GPQA-Diamond i 50,8 w Terminal-Bench to twierdzenia dostawcy o jego własnej pracy — wystarczające, by zdecydować, czy testować, ale niewystarczające, by zdecydować, czy migrować.

Drugą kwestią jest to, jaki wpływ podgląd ma na cenę. Jeśli listing kierowany pozostaje na poziomie 0,80 USD i 3,20 USD, podczas gdy własna platforma sprzedawcy utrzymuje 2,50 USD i 7,50 USD, różnica ta jest decyzją kanałową, którą warto zrozumieć, zanim zbudujesz model kosztów na którejkolwiek z tych liczb.

Trzecia rzecz to, co w praktyce okazuje się oznaczać „może ulec zmianie bez powiadomienia”. Wersja zapoznawcza, którą poprawia się dwa razy w miesiącu, to inny instrument niż ta, którą zamraża się i przemianowuje pod koniec kwartału, a dziennik zmian jest miejscem, w którym pojawi się to najpierw.

Nic z tego nie przemawia przeciwko wypróbowaniu go. Model multimodalny z 1 mln tokenów, który osiąga wyniki bliskie czołówki w cenie 0,24 USD za zadanie, jest wart popołudnia prawdziwej pracy nad własnymi promptami, a ta ewaluacja kosztuje mniej niż spór o nią. Przemawia natomiast przeciwko zakładaniu, że model, który benchmarkujesz w tym tygodniu, to model, który dostaniesz w przyszłym — co w przypadku wydania, które sam dostawca nazywa wersją zapoznawczą, jest jedynym założeniem, które musi być słuszne.

Wersja zapoznawcza to dokładnie ten przypadek, dla którego stworzono automatyczne przełączanie awaryjne: automatyczne przełączanie awaryjnezamienia model, który zmienia się pod tobą w środku tygodnia, w zmianę konfiguracji, a nie w awarię.