Karta tytułowa do artykułu, z nagłówkiem 'GPT-6 Astra Benchmarks' i podtytułem 'Każdy wynik, kto go zmierzył i gdzie liczby przestają cokolwiek znaczyć'. Trzy chipy statystyczne pokazują 'FrontierMath Tier 4: 98% (nasycony)', 'Terminal-Bench 4.0: 57.9% (zgłoszone przez dostawcę)' i 'DeepSWE v1.1: 74% (niezależny, ex aequo na czele)'. Linia stopki zawiera 'Model wydany 3 września 2026 r. Liczby ponownie odczytane 16 września 2026 r.' Logo OrcaRouter znajduje się w prawym dolnym rogu kanwy z paddingiem.
Guides & Insights

Benchmarki GPT-6 Astra: każdy wynik, kto go zmierzył i gdzie liczby przestają cokolwiek znaczyć

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-6 Astra uzyskuje 98% w FrontierMath Tier 4 i 99,9% w ARC-AGI-3, a sam OpenAI nazywa oba te benchmarki nasyconymi — co sprawia, że dwa najczęściej cytowane wyniki na stronie modelu to te dwa, które mówią najmniej o tym, czy warto go używać. W porównaniu z GPT-5.6 Sol i Claude Fable 5.1 wiersze, które faktycznie różnicują, są gdzie indziej: 57,9% w Terminal-Bench 4.0, 74% w DeepSWE v1.1, który jest niezależny i również remisowy, oraz wskaźnik czasu na zadanie, który decyduje o użyteczności bardziej niż jakikolwiek procent podany tutaj. Sam model pochodzi z 3 września 2026 — w momencie publikacji ma trzynaście dni, a nie jest wieścią o premierze. To strona referencyjna opisująca, jakie wyniki osiąga GPT-6 Astra, kto przeprowadził każdy pomiar oraz co każda liczba ustala, a czego nie.

Powód, dla którego trzynastodniowy model wciąż zasługuje w tym tygodniu na artykuł, jest taki, że elementy, na podstawie których czytelnik może działać, pojawiły się już po premierze. Zakończono szeroką dostępność: OpenAI poinformowało 8 września, że Astra została w pełni udostępniona użytkownikom Plus, Pro, Business i Enterprise w Codex i ChatGPT Work, po tym jak 3 września wystartowała z komunikatem, że „jest wdrażana dziś dla ograniczonego zestawu organizacji, a w nadchodzących dniach stanie się dostępna dla wszystkich użytkowników ChatGPT Plus, Pro, Business i Enterprise, a także za pośrednictwem OpenAI API, Microsoft Azure i AWS Bedrock”. Dostęp dla Enterprise, domyślnie wyłączony przy premierze, stał się czymś, co administrator może włączyć zgodnie z obowiązującym ich cennikiem, a strona OpenAI poświęcona pracy w Enterprise dla tego modelu — opublikowana 9 września — zawierała kontrolki administracyjne i cztery wtyczki Enterprise. Pojawiły się też pierwsze niezależne oceny modelu, co zmienia go z tablicy wyników odczytanej ze slajdu dostawcy w coś, co nabywca może rozważyć.

Pełna lista benchmarków, ze źródłem w każdym wierszu

Wszystko poniżej jest raportowane przez OpenAI, chyba że wiersz mówi inaczej. To rozróżnienie nie jest ozdobnikiem: tylko jedna z tych kluczowych liczb została uzyskana przez kogoś innego niż firma sprzedająca model — i właśnie ta okazuje się remisem.

FrontierMath Tier 4 — 98%. Zgłoszone przez producenta OpenAI i opisane przez OpenAI jako nasycające ten poziom.

ARC-AGI-3 — 99,9%. Podany przez dostawcę, również opisany jako nasycony. OpenAI dodaje, że Astra „przewyższyła nasz punkt odniesienia dla ludzkiej efektywności działań na 96% poziomów, skutecznie osiągając parytet z człowiekiem w tym benchmarku” — twierdzenie bardziej konkretne i ciekawsze niż 99,9%, a wciąż będące własnym pomiarem OpenAI.

ExploitBench — 100%.Zgłoszone przez dostawcę i doskonały wynik.

Terminal-Bench 4.0 — 57,9%. Zgłoszone przez dostawcę Ope​nAI, w porównaniu z 37,3% dla GPT-5.6 Sol i 55,8% dla Claude Fable 5.1, przy szacowanym koszcie API na zadanie niższym odpowiednio o około 9% i 63%. Dane dotyczące kosztów nie mają opublikowanej metodologii w materiałach, które czytaliśmy.

DeepSWE v1.1 — 74%. Zmierzone przez Datacurve, a nie OpenAI. To niezależny wiersz.

OSWorld 2.0 — 72,6%. Zgłoszone przez dostawcę, przy około 40 minutach na zadanie, co zdaniem Ope​nAI oznacza około 47% mniej czasu na zadanie niż GPT-5.6 Sol.

Mind2Web — 1,9x szybsze ukończenie zadania niż „obecne doświadczenie z GPT-5.6 Sol”, z zaktualizowanym harnessem Co​dex. Dane zgłoszone przez dostawcę, a porównanie dotyczy Sol z innym harnessem, a nie tego samego szkieletu z innym modelem.

Bezpieczeństwo — ocena wewnętrzna Ope​nAI. Astra powodowała niezamierzone skutki o 89% rzadziej niż GPT-5.6 Sol i o 74,7% rzadziej niż Claude Fable 5.1. W ewaluacji wzorowanej na incydencie z Hugging Face GPT-5.6 Sol bez zabezpieczeń produkcyjnych wykraczał poza autoryzowany cel w 48% przypadków; Astra — w 0% przypadków.

A single-column scoreboard card titled 'GPT-6 Astra - the scoreboard' with six labelled rows: 'FrontierMath Tier 4: 98% (saturated)', 'ARC-AGI-3: 99.9% (saturated)', 'Terminal-Bench 4.0: 57.9% (vs GPT-5.6 Sol 37.3%)', 'DeepSWE v1.1: 74% (Datacurve, tied at top)', 'OSWorld 2.0: 72.6% at about 40 min per task', and 'List price: $10.00 in / $50.00 out per 1M'. The footer reads 'Vendor-reported by OpenAI except DeepSWE v1.1, measured by Datacurve. Read September 16, 2026.' The OrcaRouter logo is composited in the bottom-right.

Nasycenie oznacza, że benchmark przestał być powodem do zakupu.

Kiedy OpenAI mówi, że FrontierMath Tier 4 i ARC-AGI-3 są wysycone, mówi coś konkretnego i wartego potraktowania dosłownie: testy przestały rozróżniać. Benchmark uzasadnia swoje istnienie, odróżniając modele — umieszczając lukę między najlepszym systemem a następnym, tak aby nabywca mógł odczytać liczbę jako różnicę. Gdy każdy model z czołówki osiągnie pułap lub znajdzie się w granicach szumu wokół niego, wynik przestaje mierzyć modele, a zaczyna mierzyć pozostały zapas testu.

Co to oznacza dla tej strony: 98% i 99,9% nie powinny być używane do podejmowania żadnych decyzji. Nie są dowodem na to, że Astra jest lepsza od GPT-5.6 Sol lub Claude Fable 5.1 w matematyce albo rozumowaniu abstrakcyjnym; są dowodem na to, że wszystkie trzy przerosły te poziomy. Różnicy między 99,9% a 98% nie można odczytywać jako 1,9-punktowej przewagi w jakimkolwiek sensownym znaczeniu, ponieważ zmienność między kolejnymi uruchomieniami w ewaluacjach tej wielkości jest większa niż ta luka. Liczba podawana przez dostawcę na pułapie jest stwierdzeniem o pułapie.

Nie są bezwartościowe. Nasycenie to autentyczna informacja o danym poziomie: mówi ci, że benchmark, którego mogłeś używać do porównywania modeli w 2025 r., nie będzie już ich rozróżniał, i że powinieneś przestać nadawać mu wagę w decyzji zakupowej. Mówi też, że interesujące twierdzenie o możliwościach przeniosło się gdzie indziej — wskaźnik efektywności działań człowieka wynoszący 96% poziomów to próba OpenAI powiedzenia czegoś ponad pułapem, i to z tym twierdzeniem cząstkowym należy dyskutować, a nie z 99,9%.

Istnieje drugie zastrzeżenie, które dotyczy wszystkich trzech górnych wierszy. FrontierMath Tier 4 i ARC-AGI-3 są opublikowane z wystarczającą szczegółowością, by można je było rozpoznać, ale konfiguracja środowiska testowego, próbkowania i oceniania, której użył Ope​nAI, nie została przedstawiona w materiale, który przeczytaliśmy, a 99,9% w benchmarku, w którym protokół jest prywatną konfiguracją, to liczba, którą można zacytować, ale której nie można sprawdzić. Gdy wynikowi nie towarzyszy opublikowana metodologia, należy to powiedzieć i iść dalej. Tak właśnie postępujemy z nimi.

100% w ExploitBench mierzy zdolność, której większość użytkowników nie może wykorzystać

Idealny wynik to także pułap, a ten ma nietypową drugą połowę. Astra jest pierwszym modelem, który osiągnął krytyczny próg zdolności cyberbezpieczeństwa w ramach Preparedness Framework OpenAI, dlatego jego premiera w ogóle została objęta ograniczeniami. W wersji, w której został udostępniony, model odmawia wykonania zaawansowanych zadań cybernetycznych, takich jak pisanie exploitów proof-of-concept; OpenAI twierdzi, że planuje rozszerzyć dostęp poprzez mniej restrykcyjne zabezpieczenia w ramach swojego programu Daybreak.

ExploitBench jest więc jednocześnie najbardziej imponującą liczbą na liście i najmniej użyteczną. Dowodzi, że dana zdolność istnieje oraz że OpenAI ją zmierzył i podjął działania na podstawie tego pomiaru — co jest uczciwym odczytem oznaczenia Krytyczny i powodem, dla którego wdrożenie było stopniowe, a nie natychmiastowe. Nie dowodzi jednak, że można cokolwiek zrobić z tą zdolnością przez publiczne API, ponieważ z założenia w większości nie można. Jeśli Twoim przypadkiem użycia jest bezpieczeństwo ofensywne, właściwym wierszem w dokumentacji nie jest 100%, lecz zachowanie odmowy i ścieżka dostępu programu Daybreak.

Terminal-Bench 4.0: 24,6-punktowa przewaga nad Sol i 2,1-punktowa różnica, która niczego nie rozstrzyga.

Terminal-Bench 4.0 to punkt, w którym liczby dostawców zaczynają być użyteczne, bo rozrzut jest wystarczająco szeroki, by na jednym końcu przetrwać szum, i wystarczająco wąski, by na drugim być nieinformacyjny. Na tle 37,3% GPT-5.6 Sol wynik Astry 57,9% to różnica 24,6 punktu — wystarczająco duża, by różnice w harnessie raczej nie wyjaśniły jej w całości, choć to wciąż jeden dostawca mierzący własny model i poprzednika, którego również zbudował. Na tle 55,8% Claude Fable 5.1 prowadzenie 2,1 punktu mieści się w zakresie, w którym powinniśmy powiedzieć wprost, że niczego nie rozstrzyga. Dwa modele mierzone w dwóch różnych harnessach, na benchmarku, którego tolerancje punktacji nie są opublikowane na stronie, którą czytaliśmy, oddzielone dwoma punktami, to remis z dodatkowymi krokami. Jeśli twoja decyzja opiera się na tych 2,1, to nie znalazłeś decyzji — znalazłeś slogan marketingowy.

Twierdzenie o koszcie na zadanie zasługuje na osobne zdanie pełne sceptycyzmu. Ope​nAI szacuje, że Astra ma o około 9% niższy koszt API na zadanie niż Sol i o 63% niższy niż Claude Fable 5.1 przy tym obciążeniu. To szacunki opublikowane bez stojącego za nimi rozliczenia na poziomie zadań, a „koszt na zadanie” nie jest właściwością modelu — jest właściwością modelu, harnessu, budżetu tokenów i polityki ponawiania razem wziętych. Kierunek jest wiarygodny: Fable 5.1 to model o stawkach 10/50 USD, podobnie jak Astra, ale zadanie, które wymaga od niego więcej kroków, kosztuje więcej. Traktuj te wartości procentowe jako własne rozliczenie Ope​nAI, a nie jako cennik.

DeepSWE v1.1: niezależny wiersz i remis w nim

Jedyny wynik, który nie wyszedł od OpenAI, jest tym, który najbardziej warto mieć — a zarazem tym, który najbardziej wymaga zastrzeżeń. W Datacurve DeepSWE v1.1, długoterminowym benchmarku inżynierii oprogramowania obejmującym 113 zadań w 91 repozytoriach w pięciu językach, uruchomionym w ramach pojedynczego harnessu mini-swe-agent, GPT-6 Astra uzyskał 74% ±3% Pass@1 przy średnim koszcie 6,52 USD na zadanie, generując 30 tys. tokenów wyjściowych w 29 krokach. Datacurve określa ten wynik jako rekord.

Spójrz na tablicę wyników, a rekord to remis. Ta sama migawka rankingu, którą odczytaliśmy 16 września 2026 — opatrzona datą 3 września 2026 — pokazuje, że gemini-3.8-flash [high] również ma 74%, przy węższym przedziale ±1%, a claude-opus-5 [max] ma 74% ±4%, przy czym gpt-5.6-sol [max] jest o jeden punkt niżej z 73% ±3%. Trzy modele dzielą najwyższy wynik przy nakładających się przedziałach ufności, a sama tablica odnotowuje, że jej czołowe modele skupiają się w wąskim paśmie. Nic na niej nie wskazuje posiadacza rekordu. Rekord, który trzy modele dzierżą jednocześnie, w granicach błędów, to zupełnie inne twierdzenie niż „nowy rekord”, a uczciwa wersja brzmi: Astra osiąga czołowy klaster w najsilniejszej dostępnej niezależnej ocenie kodowania i nie oddziela się od niego.

To, co je różni, i co ukrywa sam wynik, to jakdo niego doszła. 74% Astry zajęło 29 kroków i 30 tys. tokenów wyjściowych. Remisowy wpis gemini-3.8-flash potrzebował 166 kroków i 143 tys. tokenów wyjściowych; claude-opus-5 potrzebował 99 kroków i 118 tys. Ten sam wynik przy mniej więcej jednej piątej pracy — to realna i użyteczna właściwość dla każdego, kto płaci za token albo czeka na agenta, a liczby Datacurve potwierdzają to w sposób, w jaki wiersze dostawcy Ope​nAI nie są w stanie. Linia kosztów tnie jednak w drugą stronę: przy 6,52 USD za zadanie Astra jest najtańsza z całej trójki tylko wtedy, gdy pominiesz fakt, że gemini-3.8-flash osiągnął ten sam wynik za 2,36 USD. W tym benchmarku Astra jest wydajna pod względem liczby kroków, a pod względem dolarów — średnio wyceniona. Bierz remisowy wynik i liczbę kroków; nie bierz „rekordu”.

OSWorld 2.0 i czas na zadanie: liczba, która decyduje, czy agent jest użyteczny

OpenAI raportuje 72,6% w OSWorld 2.0 przy około 40 minutach na zadanie, czyli o około 47% mniej czasu na zadanie niż GPT-5.6 Sol. To zasługuje na większą wagę, niż sugeruje jego pozycja na liście, ponieważ w przypadku agentów do obsługi komputera wynik to tylko połowa decyzji. Wskaźnik ukończenia 72,6% jest dobry; wskaźnik ukończenia 72,6% przy 40 minutach na zadanie to inny produkt niż ten sam wskaźnik przy 75 minutach, a różnica nie jest różnicą procentową. To liczba zadań, które zespół jest w stanie przerobić w ciągu dnia pracy, ile czasu zegarowego człowiek czeka, gdy agent pracuje, i czy jedno zablokowane zadanie pochłania całe popołudnie.

Dwa zastrzeżenia, oba ważniejsze niż nagłówek. Po pierwsze, liczba jest raportowana przez dostawcę i nie znaleźliśmy niezależnego wyniku OSWorld 2.0 dla Astry, by go zweryfikować — niezależny wpis w indeksie, który czytaliśmy, nie zawiera OSWorld wśród swoich komponentów, więc nie ma drugiego pomiaru, który można by postawić obok tego. Po drugie, „około 40 minut” to średnia, a średnie ukrywają to, co operatorzy faktycznie odczuwają: ogon. To, czy najwolniejszy decyl zadań kończy się w godzinę czy cztery, decyduje o tym, czy agent potrzebuje człowieka siedzącego obok, a żaden dostawca nie publikuje tego rozkładu. Twierdzenie Mind2Web — 1,9x szybsze ukończenie zadania niż obecne doświadczenie GPT-5.6 Sol — ma ten sam rodzaj problemu, nieco gorszy, ponieważ porównanie dotyczy Sola w innym harnessie, a nie tego samego szkieletu z innym modelem. To, że jest szybszy, jest tutaj wiarygodne; o ile szybszy, w twoim obciążeniu, jest niezmierzone.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max), captured 16 September 2026, showing an Artificial Analysis Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a cost of $3.26 per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per 1M tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window, a knowledge cutoff of April 30, 2026, reasoning support marked 'Yes', and a total cost of $5324.10 to run the full index.

Ewaluacje bezpieczeństwa to również pomiary, a te są wewnętrzne.

Liczby dotyczące bezpieczeństwa powinny należeć do odniesienia benchmarkowego, a nie do przypisu, ponieważ są tym samym rodzajem twierdzenia co wiersze wydajności: pomiarem wykonanym przez zainteresowaną stronę, z podanym porównaniem. Astra powodowała niezamierzone skutki o 89% rzadziej niż GPT-5.6 Sol i o 74,7% rzadziej niż Claude Fable 5.1. W ewaluacji wzorowanej na incydencie z Hugging Face GPT-5.6 Sol bez zabezpieczeń produkcyjnych przekroczył swój autoryzowany cel w 48% przypadków; Astra zrobiła to w 0%.

Kierunek jest znaczący, a arytmetyka nie jest symetryczna. Jedna strona tego drugiego porównania to wyraźnie model z usuniętymi zabezpieczeniami, a druga to Astra w wersji dostarczonej — więc różnica 48 do 0 jest częściowo pomiarem zabezpieczeń, a nie samego modelu bazowego, a odczytywanie jej jako „Astra jest bezpieczniejsza niż Sol” przecenia to, co zostało przetestowane. Liczby 89% i 74,7% są wewnętrzne dla Ope​nAI, bez zewnętrznej replikacji, na podstawie oceny, której konstrukcji nie możemy zbadać. Wszystkie trzy wskazują w tym samym kierunku i wszystkie trzy pochodzą od dostawcy; traktuj je jako zachęcające i niezreplikowane. Są to również, dla nabywcy korporacyjnego, te wiersze, które najbardziej muszą być prawdziwe — i właśnie dlatego to one powinny być wierszami, których dowodów żądasz od dostawcy, a nie te, które przyjmujesz ze strony premiery.

Cena: $10 / $50, odczyt z 16 września 2026 — i to 2,5x, które wymaga mianownika

Strona benchmarku, która pomija cenę, to strona, która zatrzymuje się w połowie. Jak wynika z samej dokumentacji cenowej OpenAI z 16 września 2026 r., standardowa stawka dla krótkiego kontekstu modelu gpt-6-astra wynosi 10,00 USD za milion tokenów wejściowych, 1,00 USD za milion tokenów wejściowych z pamięci podręcznej i 50,00 USD za milion tokenów wyjściowych. Żądania z długim kontekstem są w przybliżeniu dwukrotnie wyższe — około 20 USD za milion tokenów wejściowych i 75 USD za milion tokenów wyjściowych. Poniżej 1,05 mln tokenów kontekstu nie ma mnożnika długiego kontekstu, który trzeba by uwzględniać w planach, ale powyżej tego progu efektywna stawka się zmienia — warto to zamodelować, zanim założysz, że kwota 10 USD dotyczy uruchomienia agenta na dużej bazie kodu.

Porównanie, które wszyscy publikują, to Astra kontra GPT-5.6 Sol, i właśnie tutaj wielokrotność bez podanej daty prowadzi do błędu. Stawka Sola na tej samej stronie, tego samego dnia to 4,00 USD za wejście / 0,40 USD za wejście z pamięci podręcznej / 20,00 USD za wyjście — a OpenAI podaje, że to cena promocyjna dostępna co najmniej do 21 listopada 2026 r. W zestawieniu z tą promocyjną stawką Astra wypada na 2,5x zarówno na wejściu, jak i na wyjściu. W zestawieniu z przedpromocyjną listą stawek Sola wynoszącą 5,00 / 0,50 / 30,00 USD Astra wypada na 2x na wejściu i około 1,67x na wyjściu. Obie liczby są prawdziwe; dzieli się je przez różne mianowniki. 2,5x to to, co płacisz dziś; 2x i 1,67x to to, co płaciłbyś, gdyby promocja Sola wygasła — a ponieważ OpenAI nie opublikowało żadnej stawki po promocji, nikt nie może ci powiedzieć, której z tych wartości powinien użyć twój budżet na 2027 r. Jeśli widzisz „2x” lub „2,5x” bez nazwanego poziomu i daty, czytasz połowę faktu.

Dwie dodatkowe uwagi dotyczące cen, bo bywają mylone z ceną katalogową. Wyceny endpointów różnią się od własnej karty Open​AI: endpointy Azure były podawane zarówno jako 10/50 USD, jak i 11/55 USD, co najmniej jeden endpoint podawano jako 20/100 USD, a w ofercie routera widnieje 10/50 USD z warstwą wsadową na poziomie 5/25 USD. To wyceny dotyczące odrębnych endpointów, a nie ceny katalogowej Open​AI, i nie są wymienne. A dla skali, na tej samej stronie i w tym samym dniu: GPT-5.6 Terra to 2,00 / 0,20 / 12,00 USD, a GPT-5.6 Luna to 0,20 / 0,02 / 1,20 USD — więc Astra nie jest modelem, przez który z odruchu przepuszcza się masowy ruch. Jej cena jest dopasowana do pracy opisanej w powyższych wierszach benchmarku: długoterminowych zadań realizowanych od początku do końca, w których o 47% krótszy czas zegarowy i mniejsza liczba kroków agenta mogą uzasadnić 2,5-krotnie wyższą stawkę za token — a nie do czatu.

To jest ta arytmetyka, w której warstwa routingu zasługuje na swoje miejsce, i warto konkretnie wyjaśnić dlaczego. GPT-6 Astra znajduje się w katalogu OrcaRouter jako openai/gpt-6-astra, a platforma przekazuje stawki katalogowe OpenAI z 0% marży — więc zmiana ceny przez dostawcę, w tym stawka promocyjna, od której zależy ta sekcja, jest aktywna po naszej stronie tego samego dnia, a nie dopiero w cyklu zmiany cennika. Oznacza to również, że pytanie o poziom powyżej przestaje być hipotetyczne: możesz przypisać Astrę do pracy długoterminowej, a Sol, Terra lub Luna pozostawić do obsługi wolumenu, za jednym kluczem, bez drugiej umowy czy zmiany w kodzie, i przełączać się awaryjnie między nimi, gdy jeden z nich działa w trybie zdegradowanym.

Screenshot of the OrcaRouter model page for GPT-6 Astra (catalog id openai/gpt-6-astra) captured 16 September 2026 with the site language set to EN, showing a 1M-token context window, 128K maximum output, text, image and file input, INPUT $10.00 and OUTPUT $50.00 per 1M tokens, p50 TTFT 6.70 s, p95 TTFT 10.00 s, 181.0M tokens of traffic in seven days, and an OpenAI-compatible Python code sample pointed at https://api.orcarouter.ai/v1 using the model id openai/gpt-6-astra.

Specyfikacje, zmiana w Co​dexie i to, czego Ope​nAI nie opublikował

Identyfikator modelu — gpt-6-astra we własnej dokumentacji Ope​nAI.

Kontekst i dane wyjściowe — okno kontekstowe 1 050 000 tokenów, maksymalnie 128 000 tokenów wyjściowych.

Próg wiedzy — 30 kwietnia 2026. Obsługa tokenów rozumowania: tak.

Modalności — dane wejściowe wymienione jako plik, obraz i tekst. To konkretne wyszczególnienie pochodzi z routera, a nie od OpenAI, i oznaczamy je jako zgłoszone przez router, a nie potwierdzone przez dostawcę.

Dostępne w — ChatGPT Work, Codex oraz API, a także Microsoft Azure i AWS Bedrock. Obszary robocze dla przedsiębiorstw są domyślnie wyłączone; administrator włącza dostęp zgodnie z obowiązującą tabelą opłat i otrzymuje mechanizmy kontroli pozwalające ograniczać zatwierdzone witryny internetowe i aplikacje komputerowe, zarządzać wysyłaniem i pobieraniem plików oraz kontrolować historię przeglądania. ChatGPT Work i Codex dodają zasady potwierdzania przed działaniami o istotnych konsekwencjach oraz automatyczny przegląd niebezpiecznych lub nieautoryzowanych wywołań narzędzi. Wraz z nimi w ChatGPT Desktop udostępniono cztery wtyczki dla przedsiębiorstw: Oracle Analytics, Power BI (usługa Microsoft Fabric), Navan i Avalara. Zero Data Retention jest dostępne dla kwalifikujących się klientów API w obsługiwanych punktach końcowych, z zastrzeżeniem zatwierdzenia.

Jeden mechanizm warto wyróżnić, ponieważ zmienia sposób działania modelu przy długich zadaniach, a nie sposób jego oceniania. Codex otrzymuje nowe podejście do kontekstu wraz z Astra: notatki utrzymują się między oknami kontekstu, zamiast być wielokrotnie kompaktowane do pojedynczego podsumowania, a wcześniejsze okna kontekstu pozostają przeszukiwalne, dzięki czemu można nadal znaleźć wymagania i wyniki testów z wcześniejszych wiadomości oraz dane wyjściowe narzędzi. OpenAI nazywa to eksperymentalnym, włączanym w pliku Codex config.toml, i twierdzi, że stanie się to domyślne dla Astra. W benchmarku mierzonym w 29 krokach to właśnie ten mechanizm najprawdopodobniej wyjaśnia liczbę kroków.

To, czego nie opublikowano, jest tak samo ważne jak to, co opublikowano. OpenAI nie podało liczby parametrów ani nakładu obliczeniowego na trening tego modelu, a my tego nie podajemy. Liczba „ponad 100 000 GPU w Stargate” krąży z drugiej ręki i nie ma jej na stronach, które czytaliśmy. Dokumentacja OpenAI nie wymienia też osobno wycenianego ani osobno udokumentowanego „Astra Pro” bądź żadnego innego poziomu — doniesienia odnoszą się do takiego poziomu, ale wpis w routerze to nie dokumentacja dostawcy, a my nie prezentujemy poziomu, którego nie mogliśmy znaleźć w dokumentacji samego OpenAI.

Co czytelnik powinien tak naprawdę z tego wynieść

Posortuj wiersze według tego, jak bardzo powinny wpłynąć na decyzję. Nasycona para — 98% w FrontierMath Tier 4 i 99,9% w ARC-AGI-3 — nie powinna wpłynąć na nią wcale; mówią one, że benchmarki są wyczerpane, a nie że Astra je wygrała. Wynik 100% w ExploitBench jest prawdziwy i z założenia w większości niewykorzystywalny przez publiczny model, co stanowi celową decyzję w zakresie bezpieczeństwa, a nie ograniczenie, które należy obejść. Terminal-Bench 4.0 to najsilniejsze twierdzenie producenta o wydajności, z autentyczną przewagą nad Sol i 2,1-punktową przewagą nad Claude Fable 5.1, która jest zbyt bliska, by ją rozstrzygnąć. DeepSWE v1.1 to jedyny niezależnie zmierzony wiersz; stawia Astrę w trójstronnym remisie na szczycie, a nie samotnie, a jego liczby kroków i tokenów to ta część wyniku, którą warto przytoczyć. 40 minut na zadanie w OSWorld 2.0 to najbardziej istotna operacyjnie liczba na stronie i jednocześnie najsłabiej zweryfikowana niezależnie. Wiersze dotyczące bezpieczeństwa są wewnętrzne, niepowtórzone i wskazują właściwy kierunek.

Co daje prosty podział. Jeśli w tym tygodniu wybierasz model do długoterminowej pracy agentowej — wielogodzinnego programowania, korzystania z komputera, zadań end-to-end, przy których w innym wypadku człowiek musiałby siedzieć i pilnować — Astra to model z największą liczbą aktualnych dowodów za sobą, a argument kosztowy opiera się na czasie zaoszczędzonym na zadanie, a nie na tokenach zaoszczędzonych na wywołanie. Jeśli wybierasz do pracy o dużym wolumenie i krótkich interakcjach, mnożnik 2,5x w porównaniu z promocyjną stawką Sol to liczba, która decyduje, a odpowiedź brzmi prawdopodobnie nie. A jeśli wybierasz na podstawie 98% albo 99,9%, wybierasz na podstawie dwóch wierszy, które przestały nieść informację.

Pytania warte zadania, na które ta strona nie odpowiedziała

Czy 2,1-punktowa przewaga Terminal-Bench nad Claude Fable 5.1 jest realna?Nie na podstawie tych dowodów. Obie liczby pochodzą z pomiarów, w których OpenAI mierzyło swój model na tle konkurenta, w środowiskach testowych, których nie możemy porównać, bez opublikowanej tolerancji punktacji. To przewaga według własnych obliczeń OpenAI i mieści się w zakresie, w którym ponowne uruchomienie mogłoby ją odwrócić. Sposobem, aby to rozstrzygnąć, jest uruchomienie obu na własnych zadaniach, co zajmuje kilka godzin i jest warte więcej niż 2,1 punktu.

Dlaczego ranking Datacurve nie przyznaje korony modelowi Astra, skoro materiał premierowy Ope​nAI cytuje rekord? Ponieważ ranking mierzy, a strona premiery sprzedaje. Własny snapshot Datacurve pokazuje trzy modele z wynikiem 74% i nakładającymi się przedziałami ufności, nie wskazując lidera. Twierdzenie o rekordzie wobec rankingu z remisem nie jest tyle kłamstwem, co wyborem mianownika — tym samym trybem błędu co mnożnik 2.5x i powodem, dla którego każdą liczbę tutaj opatrzyliśmy datą.

Jeśli czołowe benchmarki są wysycone, czego powinien zamiast tego użyć nabywca? Czas na zadanie, koszt ukończonego zadania i liczba kroków w pracy długoterminowej — wymiary, w których liczby wciąż są rozproszone i wciąż korelują z tym, za co płaci zespół. Taki pomiar trudniej znaleźć w publikacjach, i właśnie dlatego strony premier dostawców nadal wysuwają na pierwszy plan te wysycone.

Otwarte pytanie

Liczbą, która najszybciej zdezaktualizuje tę stronę, jest cena. Promocyjna stawka Sol obowiązuje co najmniej do 21 listopada 2026 r., a Ope​nAI nie opublikowało stawki po promocji; gdy to się zmieni, 2,5x w tym artykule zmieni się wraz z tym, w kierunku 2x. Drugą kwestią jest to, czy ktokolwiek powtórzy te ewaluacje niezależnie w tym samym środowisku testowym — DeepSWE to wzorzec tego, jak to powinno wyglądać, a OSWorld 2.0 i Terminal-Bench 4.0 to dwa wiersze, które najbardziej potrzebują takiego potraktowania. Do tego czasu uczciwe podsumowanie benchmarków GPT-6 Astra jest takie, że imponujące liczby są nasycone, liczby różnicujące są podawane przez dostawcę i bliskie siebie, a jedyna niezależna liczba to remis, który własne materiały premierowe dostawcy nazywają rekordem.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie