OpenAI Astra-1
Guides & Insights

OpenAI Astra: Wszystko, co wiemy o modelu, który nie jest GPT-6

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

To, co możesz dziś pobrać, to nie jest model. To dziesięć plików kodu Lean. 1 sierpnia 2026 roku OpenAI opublikowało wpis badawczy o matematyce, a w nim ukryte było pierwsze potwierdzenie nazwy jego następnego systemu granicznego: Astra. Nie ma karty modelu, strony z cenami, punktu końcowego API ani daty. Obecny flagowy model, z którego faktycznie możesz skorzystać, to nadal GPT-5.6 Sol, w cenie 5 dolarów za milion tokenów wejściowych i 30 dolarów za milion tokenów wyjściowych, dokładnie tak jak od 9 lipca.

Jeśli szukałeś GPT-6, oto krótka wersja: OpenAI nigdy nie ogłosiło modelu o tej nazwie, a na dzień dzisiejszy nie zdecydowało, czy Astra zostanie wydana jako GPT-6, jako wydanie punktowe GPT-5, takie jak GPT-5.7, czy jako czwarty poziom obok Sol, Terra i Luna. Ta niejednoznaczność nazewnictwa nie jest nieśmiałością wobec prasy. To żywe wewnętrzne pytanie, opisane przez The Information 31 lipca i od tego czasu nierozstrzygnięte.

To, co nastąpi, oddziela trzy rzeczy, które większość relacji na temat tej historii miesza ze sobą: to, co samo OpenAI oświadczyło, to, co dodają wiarygodne doniesienia, oraz to, co krąży bez przypisanego źródła. Dowody to prawdziwe artefakty, które można skompilować. Liczba 10 bilionów parametrów to liczba, którą ktoś wpisał w internecie. Te rzeczy zasługują na zupełnie inną wagę.

Co OpenAI faktycznie powiedziało — i znacznie dłuższa lista rzeczy, których nie powiedziało

Ogłoszenie nie miało formy premiery produktu. Miało formę artykułu naukowego. Post OpenAI opisywał wyniki osiągnięte przez „wewnętrzną wersję Astry, naszego kolejnego głównego modelu”, w problemach, które – w tym ujęciu – nie doczekały się postępu w głównym wyniku od co najmniej dekady. Astrę scharakteryzowano jako system przeznaczony do długotrwałej pracy: wiele agentów koordynujących działania na różnych częściach jednego dużego problemu przez dłuższe okresy, a nie udzielających odpowiedzi w jednym przebiegu.

To niemal cały oficjalny opis techniczny. Na tym tle lista braków jest uderzająca:

Potwierdzone przez OpenAI — nazwa Astra; że jest to "następny główny model"; że wersja wewnętrzna wygenerowała dziesięć wyników; wieloagentowy zamysł projektowy o długim horyzoncie; 249-stronicowy manuskrypt; certyfikaty Lean 4 w publicznym repozytorium; szacunkowy koszt tokenów wyceniony według stawek GPT-5.6 Sol.

Nieujawnione przez OpenAIdata premiery; cena; okno kontekstowe; liczba parametrów; wszelkie wyniki benchmarków; karta modelu; czy trafia do ChatGPT, czy tylko do API; ile agentów działało, jak długo, na jakim sprzęcie; prompty; wskaźnik sukcesu; ostateczna nazwa produktu.

Wiarygodne doniesienia uzupełniają nieco obraz. The Information podało, że Sam Altman zaprezentował Astrę decydentom w Waszyngtonie pod koniec lipca — zgodnie z tym raportem, w briefingu uczestniczyli senatorowie Raphael Warnock, Bernie Moreno i Mark Warner, a także obecni byli sekretarz skarbu Scott Bessent i sekretarz handlu Howard Lutnick. Rodzina modeli jest podobno już w fazie testów, a sama nazwa „Astra" wciąż jest robocza.

Nikt poza OpenAI nie uruchamiał tego modelu na niczym. Każde krążące twierdzenie o jego możliwościach wywodzi się albo z dziesięciu opublikowanych dowodów, albo z pokazu, którego publiczność nie widziała.

Dziesięć dowodów: niezwykle sprawdzalne i wciąż nierozstrzygnięte

OpenAI Astra-2

W tym miejscu ogłoszenie jest rzeczywiście mocniejsze niż typowe opublikowanie benchmarku i warto dokładnie wyjaśnić dlaczego. OpenAI nie opublikowało wyniku i nie poprosiło, by uwierzono mu na słowo. Opublikowało artefakty podlegające weryfikacji maszynowej na licencji Apache 2.0 w repozytorium openai/ten-proofs — po jednym pliku Lean na wynik, przypięte do Lean 4.32.0 z zależnością mathlib, wraz z katalogiem ComparatorChallenges do niezależnego sprawdzania. Repozytorium zostało opublikowane jako jeden commit 1 sierpnia i od tego czasu zdobyło kilkaset gwiazdek i dziesiątki forków.

Dziesięć wyników, jak nazywa je repozytorium, obejmuje niezwykle szeroki zakres dziedzin:

Teoria grup — konstrukcja grupy niesoficznej, która daje negatywną odpowiedź na pytanie otwarte od 1999 roku. Soficzność to właściwość, którą spełnia prawie każda grupa rozważana przez matematyków; czy każda przeliczalna grupa dyskretna musi ją spełniać, pozostawało otwarte przez 27 lat.

Algebry operatorów — kontrprzykład dotyczący hipotezy sztywności Connesa, postawionej w 1980 roku przez laureata medalu Fieldsa, Alaina Connesa.

Geometria wysokowymiarowa — ulepszenie metody upakowania kul, uznawane za pierwsze tego rodzaju od 1978 roku — oraz ostra postać nierówności objętości Ehrharta.

Teoria kodowania — nowe ograniczenia dla kodów binarnych i sferycznych.

Złożoność — dolne ograniczenie dla obwodów arytmetycznych obliczających permanent oraz wykładniczy wynik o równoległym powtarzaniu dla gier splątanych.

Kryptografia oparta na kratachtwardość ze stałym czynnikiem wielomianowym dla problemu najbliższego wektora.

Kombinatoryka ekstremalna — skala wzrostu wielokolorowych liczb Ramseya dla trójkątów oraz kontrprzykłady w ekstremalnej teorii grafów, w tym prace nad kilkoma skatalogowanymi problemami Erdősa.

Reakcje matematyków były raczej zainteresowane niż lekceważące. Thomas Bloom, który prowadzi bazę problemów Erdősa, nazwał wyniki wielką wiadomością i ocenił je wyżej niż kontrprzykład dla hipotezy o odległości jednostkowej z maja. Noam Brown z OpenAI dodał pożyteczne otrzeźwienie z wewnątrz: „Niestety, żadnych problemów milenijnych (na razie)."

Co rozstrzyga certyfikat Leana, a co pozostawia otwarte

Dowód w Lean, który przechodzi sprawdzenie typów, jest poprawny z konstrukcji. Nie musisz ufać metodologii ewaluacji OpenAI, jego wyborowi baseline'ów ani jego interpretacji własnych wyników — możesz skompilować pliki. Dla branży, w której „uzyskaliśmy 94,1%" jest standardową jednostką dowodu, to znacząca poprawa w zakresie falsyfikowalności.

Jest to również węższe, niż sugerują nagłówki, na cztery konkretne sposoby. Lean sprawdza, czy dowód formalnego stwierdzenia jest poprawny. Nie sprawdza, czy formalne stwierdzenie jest twierdzeniem, które głosi tekst. Nie sprawdza, czy zakodowane definicje odpowiadają temu, co dziedzina rozumie przez te słowa. Nie sprawdza nieformalnych redukcji łączących formalne punkty końcowe z wynikiem z nagłówków. I nic nie mówi o nowości — czy wynik jest nowy, czy już znany pod inną nazwą.

Wszystkie cztery z tych kwestii to kwestie ludzkiego osądu i na dzień ogłoszenia żadna nie przeszła recenzji. Manuskrypt zawiera podziękowania dla specjalistów, z którymi się konsultowano; podziękowania nie są jednak poparciem każdego twierdzenia. Jedna opublikowana częściowa kompilacja repozytorium zbudowała 8 820 z 9 007 zadań, co jest tym, jak wygląda duża realna formalizacja w trakcie weryfikacji, a nie ukończony audyt. Uczciwy obecny status to dziesięć poważnych, formalnie zakodowanych twierdzeń badawczych — a nie dziesięć ustalonych pozycji w kanonie matematycznym.

Istnieje drugie, subtelniejsze ograniczenie: proces odkrywania nie może zostać odtworzony przez nikogo spoza OpenAI. Dowody są publiczne; system wyszukiwania, prompty, punkty kontrolne i środowisko wykonawcze — nie. Możesz zweryfikować cel. Nie możesz powtórzyć podróży.

Kwota 2000 dolarów i dlaczego można za nią kupić mniej, niż by się wydawało.

OpenAI Astra-3

Liczbą, która rozeszła się najszerzej, był koszt. OpenAI określiło wydatki na tokeny dla dziesięciu rozwiązań na mniej więcej 2000 dolarów, licząc według stawek GPT-5.6 Sol — około 200 dolarów za problem otwarty sprzed dekady, przy najczęstszej interpretacji tego sformułowania. Część publikacji odczytała to samo zdanie jako poniżej 2000 dolarów za problem, co daje różnicę dziesięciokrotną; komunikat OpenAI jest na tyle zwięzły, że obie interpretacje przetrwały w druku, a nie widzieliśmy, aby firma to doprecyzowała.

Przyjmij całkowity odczyt i przelicz to. Sol nalicza $5 za milion tokenów wejściowych i $30 za milion tokenów wyjściowych, przy czym tokeny rozumowania są rozliczane jako wyjściowe. Gdyby cały wydatek dotyczył wyjścia, $2,000 wystarcza na co najwyżej około 67 milionów tokenów wyjściowych — mniej więcej 6,7 miliona na problem. To dużo myślenia i nie jest to absurdalna ilość myślenia. To budżet, jaki dobrze finansowana grupa badawcza mogłaby już przeznaczyć na jedno trudne pytanie.

Trzy zastrzeżenia liczą się bardziej niż nagłówek:

To jest cena kontrfaktyczna, a nie cena. Astra jest nieopublikowana i nie ma ceny. Ta kwota 2000 dolarów opisuje, ile te tokeny by kosztowały według stawek innego modelu.

Liczy tylko zwycięstwa. Nie opublikowano wskaźnika sukcesu. Nie wiemy, ile problemów postawiono przed Astrą, których nie zdołała rozwiązać, ani ile kosztowały te próby. Opublikowany koszt przypadający na sukces bez wskaźnika sukcesu nie jest kosztem przypadającym na wynik, a różnica może być o rząd wielkości w którąkolwiek stronę.

Tokeny to najtańsza część. Ludzie definiowali problemy, przygotowywali manuskrypty i prowadzili formalizację. Ta praca nie jest wliczona w te 2000 dolarów.

Jedyną częścią, którą możesz dziś wycenić, jest punkt odniesienia. Ponieważ OrcaRouter przekazuje cenę listową dostawcy bezpośrednio z zerową marżą, GPT-5.6 Sol kosztuje na naszej API tyle samo $5/$30 co na API OpenAI — więc jeśli chcesz sprawdzić poprawność tych obliczeń względem własnego obciążenia, stawka podana w ogłoszeniu jest stawką, którą faktycznie zapłacisz. Czego nikt jeszcze nie potrafi wycenić, to sama Astra, a każdy dostawca, który twierdzi inaczej, zgaduje.

Data premiery jest ograniczona 30-dniowym zegarem, a nie wyciekiem.

OpenAI Astra-4

Większość doniesień na temat „kiedy pojawi się GPT-6" to arytmetyka pogłosek. Istnieje bardziej konkretne ograniczenie, które leży na widoku, a które ledwo zostało powiązane z tym pytaniem.

Rozporządzenie wykonawcze podpisane 2 czerwca 2026 r. zobowiązało agencje federalne do uruchomienia dobrowolnego procesu przeglądu, w ramach którego czołowi deweloperzy przekazują modele do przeglądu rządowego na maksymalnie 30 dni przed publicznym udostępnieniem. Ramowy program miał formalnie wejść w życie 1 sierpnia — tego samego dnia, w którym opublikowano wpis o Astrze. Jak wynika z doniesień, oczekuje się, że Astra będzie pierwszym modelem, który przejdzie ten proces.

„Dobrowolne” robi tu niezłą robotę. W praktyce administracja już wcześniej wpływała na terminy udostępniania, a ostatnie zachowanie OpenAI wygląda jak próba generalna: GPT-5.6 był udostępniony około dwudziestu zweryfikowanym organizacjom od 26 czerwca, zanim 9 lipca uzyskał powszechny dostęp — czyli stopniowe wdrożenie trwające około dwóch tygodni.

Zestaw ze sobą te dwa fakty, a otrzymasz przybliżoną dolną granicę, a nie prognozę. Jeśli Astra przejdzie 30-dniowy przegląd przedpremierowy i powtórzy schemat GPT-5.6, powszechna dostępność nastąpi mniej więcej sześć tygodni po zgłoszeniu. A data zgłoszenia jest właśnie tym, czego nie znamy. Dlatego pewne sierpniowe daty należy traktować z rezerwą: etap bramkujący to proces o opublikowanym czasie trwania, a zegar wyraźnie nie ruszył.

Rynki predykcyjne przesunęły się dokładnie w tym kierunku. Odczyt z 5 sierpnia 2026 r.: drabinka Polymarket „GPT-6 released by” wskazywała 1% na 7 sierpnia, 3% na 14 sierpnia, 13% na 21 sierpnia, 25% na 31 sierpnia, 68% na 30 września i 89% na 31 grudnia, przy wolumenie bliskim milionowi dolarów. Traktuj to jako zagregowany osąd tłumu, a nie źródło — ale zauważ, że tłum przesunął swój ciężar na Q4.

Pomaga również pamiętać o dotychczasowych osiągnięciach. Każde twierdzenie „GPT-6 ukaże się w przyszłym tygodniu” z ostatnich dwunastu miesięcy było błędne. Niezweryfikowany przeciek wskazywał 14 kwietnia 2026 jako dzień premiery; w rzeczywistości dziewięć dni później wydano GPT-5.5.

Plotki, ocenione

Posortowane według tego, ile faktycznie waży każdy z nich:

Nazwa nierozstrzygnięta (GPT-6 / GPT-5.7 / osobna klasa). Źródło: The Information. Najbardziej wiarygodne niepochodzące od OpenAI stwierdzenie w tej historii i to, które powinno zresetować oczekiwania — system ogłoszony w artykule matematycznym może wcale nie być reklamowany jako skok generacyjny.

Kryptonimy „Zinc” i „Magnesium” zauważone w Design Arena. Zauważenie przez społeczność, wpisy rzekomo zablokowane, niepotwierdzone przez OpenAI. Interpretacja: punktowe wydanie GPT-5.x może równie dobrze pojawić się przed Astrą, co nie spełni niczyich oczekiwań co do GPT-6, przejmując cykl informacyjny.

W skali mniej więcej 2× GPT-5.6 Sol; ceny zbliżone do zakresu GPT-5.6. Krążąca plotka. Osoba, która ją ujawniła, przyznała, że nie testowała modelu. Brzmi wiarygodnie, ale jest całkowicie niepoparte.

Okno kontekstu o 1,5 miliona tokenów. Pojawia się w zestawieniach przecieków bez podanego źródła. Warto zauważyć, że Sol już oferuje 1 050 000 tokenów, więc byłby to przyrost, a nie skok — co jest powodem, by podchodzić do tego podejrzliwie jako do „przecieku” w nagłówku.

Około 10 bilionów parametrów. Nie znaleźliśmy żadnego przypisania, które moglibyśmy wyśledzić. Najczęściej powtarzana i najmniej poparta liczba w całej historii.

Pamięć i personalizacja jako kierunek definiujący. Opiera się na publicznych wypowiedziach samego Altmana z wywiadu udzielonego w sierpniu 2025 roku — prawdziwych, ale sprzed roku i dotyczących ogólnie kierunku po GPT-5, a nie konkretnie Astry.

Co właściwie robić od teraz aż do czasu wydania

Złym posunięciem jest przeprojektowywanie architektury pod model, który nie ma karty. Właściwym posunięciem jest zauważenie, które z twoich problemów zmieniłby system wieloagentowy o długim horyzoncie działania, ponieważ to właśnie te części twojego stosu technologicznego są dziś niedostatecznie rozbudowane, niezależnie od tego, co wypuści OpenAI.

Trzy z nich warto budować pod GPT-5.6 Sol już teraz:

Pułapy kosztów na zadanie, a nie na wywołanie. Jeśli pojedyncze zadanie może działać godzinami i zużyć sześć lub siedem milionów tokenów wyjściowych, limity na wywołanie przestają cię chronić. Potrzebujesz budżetu, który jest dziedziczony przez całe zadanie, i twardego zatrzymania.

Tworzenie punktów kontrolnych i wznawialność. Jednorazowe wywołanie albo zwraca wynik, albo kończy się niepowodzeniem. Wielogodzinne uruchomienie agenta, które pada w 90. minucie, nie zapisawszy niczego trwałego, to kategoria kosztownej awarii, z którą większość baz kodu nigdy nie musiała sobie radzić.

Ocena godna zaufania w przypadku problemów bez referencyjnej odpowiedzi. Te dziesięć dowodów jest interesujących częściowo dlatego, że Lean dostarcza wyroczni. Niemal nic w produkcji tego nie robi. Jeśli nie potrafisz odróżnić dobrego sześciogodzinnego przebiegu od wiarygodnie wyglądającego złego, większa moc obliczeniowa ci nie pomoże.

W kwestii przełączania: Astra nie jest dostępna na OrcaRouter, ponieważ nie jest dostępna nigdzie. Co możemy powiedzieć, to że problem zmienności wersji jest w dużej mierze rozwiązany po naszej stronie. Jeden klucz obejmuje 200+ modeli, więc niezależnie od tego, czy to trafi na rynek jako GPT-6, GPT-5.7 czy czwarty poziom GPT-5.6, przyjęcie tego to zmiana ciągu modelu, a nie migracja — bez drugiej umowy, bez nowego SDK. A w przypadku konkretnie niezweryfikowanego modelu granicznego automatyczne przełączanie awaryjne to różnica między przetestowaniem go w rzeczywistym obciążeniu a postawieniem ścieżki produkcyjnej na system, którego nikt poza laboratorium nie poddał testom obciążeniowym. Kierujesz na niego fragment ruchu, trzymasz Sol w tle jako zabezpieczenie i się przekonujesz.

Pytania warte odpowiedzi

Czy Astra to to samo co GPT-6?

Niekoniecznie, i to jest najbardziej brzemienna w skutki niewiadoma w tej historii. OpenAI potwierdziło, że Astra będzie jego kolejnym dużym modelem, ale nie zdecydowało jeszcze o nazwie wydania; według doniesień na stole są GPT-6, GPT-5.7 oraz osobna klasa obok Sol, Terra i Luna. Jest całkiem możliwe, że model o nazwie GPT-6 nigdy się nie pojawi, a skok możliwości, na który czekali ludzie, nadejdzie pod nazwą, której nikt nie śledził.

Czy mogę dziś uzyskać dostęp do Astry w jakiejkolwiek formie?

Nie — nie w ChatGPT, nie przez API, nie przez żadnego routera ani resellera. Publicznie dostępne są jedynie artykuł, opisy rozumowania oraz repozytorium Lean. Jeśli jakaś usługa twierdzi, że oferuje dostęp do Astry, to albo odsprzedaje coś innego, albo kłamie. Jedyne naprawdę użyteczne, co możesz teraz zrobić z tym wydaniem, to samodzielnie skompilować dowody.

Czy Astra naprawdę rozwiązała problemy, których ludzcy matematycy nie potrafili rozwiązać?

Wygenerowało formalnie zweryfikowane dowody twierdzeń, które pozostawały otwarte przez co najmniej dekadę, co jest rzeczywistym i niezwykłym wynikiem — a weryfikacja stoi o poziom wyżej niż norma branżowa. Ale „sprawdzone w Lean” to nie „recenzowane”, a pytanie o to, czy każde formalne twierdzenie oddaje główny problem, jest dokładnie tą częścią, której Lean nie jest w stanie rozstrzygnąć. Specjaliści czytający manuskrypty wypowiadają się pozytywnie; żaden z nich nie przeszedł przez recenzję naukową. Należy się spodziewać, że ocena skrystalizuje się w ciągu miesięcy, w którąkolwiek stronę.

Czy kwota 2 000 dolarów oznacza, że badania na granicy wiedzy są teraz tanie?

To oznacza, że zwycięskie przebiegi tokenów były tanie, w cenach innego modelu, z wyłączeniem niepowodzeń i z wyłączeniem ludzi. Każde z tych trzech wykluczeń może być duże. Uczciwa interpretacja jest taka, że koszt krańcowy udanego zautomatyzowanego przeszukiwania dowodów spadł na tyle, że stał się interesujący, a nie że dziesięć otwartych problemów kosztuje teraz tyle, co laptop.

Co właściwie rozstrzygnęłoby tę sprawę

Trzy konkretne rzeczy, z których żadna nie jest plotką, i wszystkie można zweryfikować, gdy do nich dojdzie.

Karta modelu i strona z cennikiem. To moment, w którym Astra przestaje być artefaktem badawczym, a staje się czymś, na czym można planować — i moment, w którym kwestia nazewnictwa rozwiązuje się sama.

Niezależna przebudowa repozytorium Lean przez specjalistów, którzy weryfikują definicje i nieformalne redukcje, a nie tylko sprawdzanie typów. Katalog ComparatorChallenges sugeruje, że OpenAI tego oczekuje. Jeśli formalne stwierdzenia wytrzymają taką kontrolę, wyniki będą znacznie trudniejsze do podważenia; jeśli niezgodność ujawni się nawet w jednym z dziesięciu, każde twierdzenie w zestawie zostanie ponownie przeczytane.

Dowód, że federalny zegar przeglądu ruszył. W 30-dniowym oknie przedpremierowym to zgłoszenie jest najwcześniejszym wiarygodnym sygnałem daty premiery — znacznie bardziej pouczającym niż kolejny zrzut ekranu wyłączonego wpisu w rankingu areny.

Do tego czasu trafne jest tylko jedno wąskie stwierdzenie, którego warto się trzymać: następny flagowy model OpenAI ma nazwę, dziesięć weryfikowalnych maszynowo dowodów, demo w Waszyngtonie i nic poza tym. Ktokolwiek podaje ci datę — zgaduje; ktokolwiek podaje liczbę parametrów — zmyśla.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube