Wygenerowana karta tytułowa z nagłówkiem „Ultrafast vs Sol”, podtytułem „Ten sam checkpoint, dwa cenniki, trzy obciążenia” i trzema chipami o treści „Agent interaktywny: przenieś”, „Nocne przeszukiwanie: pozostań” i „Sumaryzator wsadowy: pozostań”, nad stopką o treści „Ceny to stawki listowe OpenAI za 1 mln tokenów, krótki kontekst, październik 2026”.
Engineering & Research

GPT-6.1 Ultrafast kontra GPT-6.1 Sol: Trzy zadania, po jednym werdykcie dla każdego

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Zapytaj, czy GPT-6.1 Ultrafast jest wart sześciokrotności ceny GPT-6.1 Sol a uczciwa odpowiedź brzmi, że dwa z trzech twoich obciążeń powinny pozostać dokładnie tam, gdzie są. Interaktywny agent kodujący powinien się przenieść. Nocny przegląd ewaluacyjny nie powinien, podobnie jak sumaryzator wsadowy, a powód nie polega na tym, że ten poziom jest zbyt drogi — tylko na tym, że nigdy nie kupowali tego, co on sprzedaje. GPT-6.1 Sol został wydany 29 września 2026, a Ultrafast pojawił się jako tryb oparty na nim 8 października 2026: ten sam punkt kontrolny, to samo okno kontekstowe o rozmiarze 1 050 000 tokenów, ten sam limit wyjściowy 128 000 tokenów, ta sama data odcięcia wiedzy 30 kwietnia 2026, te same odpowiedzi, przy $12.00 za milion tokenów wejściowych i $60.00 za milion wyjściowych w porównaniu do $2.00 i $10.00. Poziom szybkości to zakup czasu zegarowego, a czas zegarowy jest wart pieniędzy tylko dla zadania, na które ktoś czeka.

To przeformułowanie to cały artykuł. Reszta to arytmetyka, która mówi ci, które z twoich zajęć jest tym, na które trzeba czekać, oraz dwa koszty, które pojawiają się wraz z mnożnikiem — niezależnie od tego, czy je przewidziałeś, czy nie.

Co tak naprawdę się różni: jedno pole żądania i jeden rachunek

Nie ma żadnego punktu kontrolnego Ultrafast, żadnego osobnego limitu kontekstu, żadnej alternatywnej daty odcięcia wiedzy ani niczego do przypięcia. Wysyłasz ten sam identyfikator modelu z ustawionym polem poziomu usługi, a OpenAI inaczej planuje obsługę żądania; wyślij go bez tego pola, a znajdziesz się na poziomie Standard. Wszystko, względem czego programista pisze kod, jest identyczne, a warto podejść do tej listy mechanicznie, ponieważ długość tej listy jest argumentem.

• Identyfikator modelu — ten sam identyfikator po obu stronach, jeden domyślny snapshot, nic z datą do przypięcia.

• Kontekst — okno o rozmiarze 1 050 000 tokenów, maksymalny rozmiar wejścia 922 000 tokenów i maksymalny rozmiar wyjścia 128 000 tokenów w obu przypadkach.

• Drabina rozumowania — low, medium (domyślnie), high, xhigh i max w obu, przy czym none i minimal nie są obsługiwane w żadnym z nich.

• Powierzchnia narzędzi — wyszukiwanie w sieci, wyszukiwanie plików, generowanie obrazów, interpreter kodu, hostowany shell, stosowanie poprawek, umiejętności, użytkowanie komputera, MCP i wyszukiwanie narzędzi, przez Responses API, w obu przypadkach.

Cena — $2.00 za wejście / $0.10 z pamięci podręcznej / $2.50 za zapis do pamięci podręcznej / $10.00 za wyjście za milion tokenów w Standard, w porównaniu z $12.00 / $0.60 / $15.00 / $60.00 w Ultrafast.

• Powyżej 272 000 tokenów wejściowych — całe żądanie jest ponownie wyceniane według 2x stawek za dane wejściowe i pamięć podręczną oraz 1,5x za dane wyjściowe w obu przypadkach, co daje Ultrafast long-context na poziomie 24,00 USD / 1,20 USD / 30,00 USD / 90,00 USD.

• Szybkość — Standard to z definicji poziom odniesienia; Ultrafast to najwyższy szczebel, a jedyny publikowany przez OpenAI mnożnik dla konkretnego modelu należy do GPT-6 Astra, nie do tego modelu.

Ta ostatnia linia to zastrzeżenie, które leży u podstaw wszystkiego innego, i ma własną sekcję niżej. Najpierw zadania.

Zadanie pierwsze: agent. To ten, który działa.

Pętla agenta, która wykonuje czterdzieści wywołań narzędzi z rzędu, to nabywca, dla którego powstał ten poziom, ponieważ czas generowania każdej tury warunkuje następną turę, a użytkownik patrzy. Weź sesję, która wysyła 30 000 tokenów wejściowych i otrzymuje 1500 tokenów wyjściowych na turę przez 40 tur — łącznie 1 200 000 tokenów wejściowych i 60 000 tokenów wyjściowych, a każde żądanie jest znacznie poniżej progu 272 000 tokenów, po przekroczeniu którego zmienia się cena.

• Standard — 1,2 miliona tokenów wejściowych po 2,00 USD to 2,40 USD; 60 000 tokenów wyjściowych po 10,00 USD to 0,60 USD. Trzy dolary za uruchomienie.

• Ultrafast — 1,2 miliona tokenów wejściowych po 12,00 USD to 14,40 USD; 60 000 tokenów wyjściowych po 60,00 USD to 3,60 USD. Osiemnaście dolarów za to uruchomienie.

• Delta — 15,00 USD, aby usunąć większość opóźnienia generowania z zadania, którego wynik jest poza tym identyczny.

Czy $15.00 to tanio, to pytanie o minuty, a nie o tokeny. Jeśli sesja zajmuje dwadzieścia minut na Standard i cztery minuty na Ultrafast, kupiłeś szesnaście minut za piętnaście dolarów — około $0.94 za minutę — a porównanie, które ma znaczenie, dotyczy tego, ile kosztowało cię tych szesnaście minut. Deweloper według stawki z pełnym obciążeniem jest wart więcej niż dolara na minutę, więc w przypadku z człowiekiem w pętli odpowiedź nie jest nawet bliska. Agent czekający w kolejce do przeglądu przez człowieka jest wart zero na minutę, a tam te same szesnaście minut to darmowe szesnaście minut, a ten poziom to strata.

To jest test, który należy zastosować, i nie ma on nic wspólnego z modelem. Na czyim zegarze opiera się czas generowania i ile ten zegar jest wart? Jeśli odpowiedź brzmi: „człowieka, i to dużo”, Ultrafast jest najtańszą pozycją na twojej fakturze. Jeśli odpowiedź brzmi: „schedulera, i nic”, jest najdroższą.

A generated cost card headed 'One run, four configurations', listing Batch at half of Standard for $1.50, standard GPT-6.1 Sol at $3.00, GPT-6.1 Ultrafast at $18.00 and Ultrafast above 272,000 input tokens at $24.00 input and $90.00 output per 1M, with a note that all four describe the same 40-turn agent of 1,200,000 input and 60,000 output tokens and a footer reading that prices are OpenAI list rates and the arithmetic is ours.

Zadanie drugie: nocny przegląd oceniający. To jest nie

Przebieg ewaluacji przepuszcza przez model kilka tysięcy promptów, zapisuje wyniki do magazynu obiektowego, a rano człowiek czyta tabelę. Jego budżet opóźnienia to nie minuty; to noc. Nic w potoku nie czeka na model poza następnym żądaniem w kolejce.

Ultrafast nie usuwa kosztu czasu rzeczywistego przebiegu, ponieważ koszt czasu rzeczywistego przebiegu jest decyzją planistyczną, którą podjąłeś, a nie problemem z opóźnieniem, który masz. To, co robi, to szóstokrotne zwiększenie rachunku i przeniesienie zadania na budżet z własnymi limitami szybkości na organizację — co jest realnym ryzykiem w nienadzorowanym przetwarzaniu wsadowym, ponieważ pułap limitu szybkości to dokładnie ten tryb awarii, na który trafia duży przebieg, a strona planu nie podaje tej liczby.

A na tej samej karcie stawek jest ścieżka, która jest wyceniona dla tego zadania i wyceniona w przeciwnym kierunku. Batch i Flex są wyceniane na połowę Standard, a przetwarzanie wsadowe API jest zaprojektowane dokładnie dla tego profilu: duże ilości, brak interaktywnego terminu, wyniki zwracane asynchronicznie. Według powyższych liczb, ten sam łączny koszt tokenów dla 40 tur wynosi 1,50 USD w Batch w porównaniu do 18,00 USD w Ultrafast. To 12-krotna różnica dla zadania, które nie potrafi dostrzec różnicy.

Błędem, którego należy unikać, jest traktowanie Ultrafast jako uniwersalnego ulepszenia. To szczyt drabiny — Batch i Flex za połowę, Standard za jeden, Fast za dwa, Ultrafast za sześć — a drabina nie jest menu lepszych wersji. Wybór złego szczebla kosztuje więcej niż wybór złego modelu.

Zadanie trzecie: sumaryzator wsadowy. Również nie, z innego powodu.

Załóżmy, że obciążenie to nocne przejście przez magazyn dokumentów: długie dane wejściowe, krótkie dane wyjściowe, brak człowieka w pętli i SLA mierzone w godzinach. To tutaj mieszanka tokenów obraca się przeciwko Ultrafast, a nie na jego korzyść.

Próg 272 000 tokenów jest tego powodem. Na obu poziomach pojedyncze żądanie, które go przekroczy, powoduje ponowną wycenę całego żądania — każdego tokenu wejściowego, każdego odczytu z pamięci podręcznej, każdego tokenu wyjściowego — według dwukrotności stawek za wejście i pamięć podręczną oraz 1,5-krotności stawki za wyjście. Ultrafast w trybie długiego kontekstu kosztuje zatem 24,00 USD za milion tokenów wejściowych i 90,00 USD za milion tokenów wyjściowych, a ponowna wycena jest wyzwalana przez żądanie, a nie przez część, która przekracza próg. Sumaryzator dokumentów, który od czasu do czasu wysyła żądanie z 300 000 tokenów wejściowych, płaci stawkę za długi kontekst za wszystkie 300 000 z nich.

Zachowanie pamięci podręcznej to potęguje. Odczyty z pamięci podręcznej to najtańsze tokeny w tym modelu i najskuteczniejsza dźwignia kosztowa, a skalują się wraz z poziomem usługi, zamiast go pochłaniać — 0,10 USD za milion buforowanych tokenów wejściowych w Standard i 0,60 USD w Ultrafast, oba na poziomie 5% stawki za niebuforowane tokeny wejściowe. Nie istnieje mieszanka tokenów buforowanych i świeżych, która złagodziłaby tę krotność, więc mocno zoptymalizowany potok korzystający z pamięci podręcznej nie otrzymuje zniżki od szybkiej ścieżki. Po prostu płaci sześciokrotność mniejszej liczby.

Połącz oba te elementy, a sumaryzator okaże się przypadkiem, w którym premia za Ultrafast jest największa w ujęciu absolutnym, a korzyść z niego najmniejsza. Jeśli dokumenty są naprawdę długie, a termin jest naprawdę liczony w godzinach, właściwą konfiguracją jest Batch albo standardowy Standard, a właściwym zastosowaniem Ultrafast jest pętla w trakcie rozwoju, w której iterujesz nad promptem, a człowiek czeka na każdą wersję.

Dwa koszty, które pojawiają się wraz z mnożnikiem

Sześciokrotna stawka to widoczna część ceny. Dwie niewidoczne części mają większe znaczenie w produkcji.

Pierwszy to budżet limitu szybkości. Ultrafast działa na własnych limitach, oddzielnych od budżetów Standard i Fast, a O​penAI ustala je dla każdej organizacji, zamiast publikować je na stronie poziomu; zalecenie jest takie, aby przed zwiększeniem ruchu sprawdzić limity swojej organizacji i skontaktować się z zespołem opiekującym się kontem, jeśli trzeba je podnieść. Przełączenie obciążenia na Ultrafast robi więc dwie rzeczy naraz: zwielokrotnia rachunek i przenosi obciążenie na pułap, którego możesz nie być w stanie odczytać. W przypadku agenta działającego bez nadzoru to pułap wiąże jako pierwszy.

Drugą kwestią jest kształt oszczędności. Ultrafast skraca czas między tokenami, a nie czas do pierwszego tokena ani fazę namysłu. Żądanie, które większość swojego czasu zegarowego spędza na myśleniu, zanim cokolwiek wyemituje, można przełączyć na Ultrafast i nadal będzie sprawiać wrażenie wolnego, ponieważ ten poziom przyspiesza tę część żądania, która nigdy nie była wąskim gardłem. To ten tryb awarii prowadzi do raportów „zapłaciliśmy sześciokrotnie, a prędkość jest taka sama”: mierzy się aplikację, której opóźnienie znajduje się tam, gdzie ten poziom nie sięga. Zanim podejmiesz decyzję, zmierz, gdzie faktycznie uciekają sekundy — czas do pierwszego tokena w zestawieniu z czasem między tokenami — ponieważ ten poziom odpowiada tylko za jedno z nich.

Dlaczego „szybciej” nie jest jeszcze liczbą, z której można rozliczyć O​penAI

Ultrafast jest sprzedawany z hasłem „nawet 8x”, a pomiar stojący za tym sformułowaniem dotyczy innego modelu. Opublikowane zdanie dotyczy GPT-6 Astra Ultrafast generującego tokeny nawet 8 razy szybciej niż GPT-6 Astra w trybie Standard w Codex. Nie ma opublikowanego odpowiednika tego mnożnika dla GPT-6.1 Sol, a żaden niezależny podmiot nie opublikował również liczby tokenów na sekundę dla wariantu Sol. Dokumentacja tego poziomu opisuje go jako skracający czas między generowanymi tokenami wyjściowymi i wskazuje na tabelę stawek.

Rozsądnym założeniem wstępnym jest, że ten mnożnik się utrzymuje — oba modele korzystają z tego samego stosu obsługi, a mechanizm tego poziomu jest taki sam — ale „do” odgrywa w tym zdaniu niebagatelną rolę, a sufit deklarowany przez dostawcę, zmierzony na modelu pokrewnym u innego klienta, to nie jest liczba, którą zobaczy Twoje obciążenie. To samo dotyczy starszego szczebla: Ultrafast na GPT-5.6 Sol ogłoszono w sierpniu 2026 r., podając „do 14 razy szybciej niż Standard processing” w ograniczonym podglądzie, a dokumentacja nadal mówi o dostępie w wersji zapoznawczej, przy czym tabela stawek Ultrafast zawiera dokładnie dwa wiersze.

To, z czego możesz rozliczyć OpenAI, to cena, ponieważ cena jest publikowana i dotyczy każdego tokenu. Co oznacza, że decyzja, której dotyczy ta strona, jest decyzją o Twoim własnym budżecie opóźnień, a nie o deklarowanej przez dostawcę szybkości.

A generated decision card headed 'Which lane for which job' with three columns: 'Interactive agent' carrying the rows 'A person is waiting' and 'Ultrafast: yes', 'Overnight eval sweep' carrying 'Nobody is waiting' and 'Batch: half of Standard', and 'Long-document batch pass' carrying '272,000-token repricing line' and 'Standard: yes', footnoted to OpenAI's published per-million rates and tier documentation, October 2026.

Testowanie tego bez zatwierdzania i przełączanie z powrotem

Ten poziom jest dostępny dla wszystkich użytkowników API, więc najtańszym sposobem odpowiedzi na pytanie o czas rzeczywisty jest dwukrotne uruchomienie tego samego zestawu promptów — z włączonym i wyłączonym polem — i porównanie liczby tokenów oraz czasów. W tym teście należy zwrócić uwagę na dwie rzeczy: czy Twoje żądania przekraczają granicę 272 000 tokenów i czy czas do pierwszego tokenu dominuje nad czasem między tokenami. Każda z tych rzeczy może sprawić, że próba będzie wyglądać na wynik zerowy, mimo że poziom działa dokładnie tak, jak reklamowano.

Przełączenie z powrotem to pole w żądaniu, a nie migracja, a standardowa ścieżka jest realizowana po własnej cenie katalogowej dostawcy przez OrcaRouter jako openai/gpt-6.1-sol — 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych, 0% marży, z ceną dostawcy przekazywaną wprost, więc zmiana cennika przez dostawcę jest u nas widoczna tego samego dnia. Sam Ultrafast nie jest czymś, co sprzedajemy; to flaga poziomu usługi rozliczana na Twoim własnym koncie O​penAI, a powiedzenie tego wprost jest bardziej użyteczne niż sugerowanie czegoś przeciwnego. To, co daje jeden klucz, to standardowa ścieżka plus reszta katalogu za jednym endpointem zgodnym z O​penAI, a do tego automatyczne przełączanie awaryjne między dostawcami, co warto mieć, jeśli zamierzasz postawić drogi poziom przed produkcyjnym agentem i chcesz, aby standardowa ścieżka była decyzją routingową, a nie zmianą w kodzie.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128,000 maximum output tokens, text and image input with text output, input price $2.00 and output price $10.00 per 1M tokens, with the page's code sample and EN language toggle visible in the header.

Jedna praktyczna uwaga o szybkiej ścieżce, która nie dotyczy tańszej: WebSockets. OpenAI zaleca trwałe połączenie WebSocket dla Ultrafast — to właściwy kształt dla agenta wykonującego wiele kolejnych wywołań i niewłaściwy dla skryptu wsadowego z jednym żądaniem na proces. Jeśli Twój klient należy do drugiego typu, transport zalecany przez sam ten poziom to kolejny powód, dla którego zadanie nocne powinno trafić gdzie indziej.

Kiedy zmienia się werdykt

Trzy zmiany przeniosłyby zadania z listy „stay”. Opublikowany limit szybkości Ultrafast dla GPT-6.1 Sol usunąłby ryzyko pułapu w przypadku wsadowym. Opublikowany lub niezależnie odtworzony pomiar szybkości dla poziomu Sol pozwoliłby uwzględnić w budżecie oszczędność czasu rzeczywistego, zamiast zakładać ją z góry. A szczebel rabatowy na szybkiej ścieżce — odpowiednik Batch w wariancie Ultrafast, w którym poziom jest wciąż szybki, ale nie kosztuje sześciokrotności ceny — zmieniłby ekonomikę każdego zadania w środku drabiny.

Żadne z nich nie istnieje dzisiaj. To, co istnieje, to poziom, który jest dokładnie tym, czym mówi, że jest: ten sam GPT-6.1 Sol, inaczej zaplanowany, sześciokrotnie wyższa cena w każdym wierszu. Przenieś interaktywnego agenta, zostaw pozostałe dwa w spokoju i zmierz, gdzie faktycznie trafiają twoje sekundy, zanim ustalisz, który jest twój.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie