Karta tytułowa hero z napisem „722 manuskrypty matematyczne OpenAI” i podtytułem „Model, który za nimi stoi, nie ma nazwy, ceny ani API”, bursztynowa plakietka z napisem „MODEL NIEWYDANY - TYLKO WYNIKI” oraz trzy karty: „Co wydano: 722 manuskrypty, 372 rodziny”, „Czego nie wydano: brak karty modelu, brak identyfikatora, brak daty” i „Co mówi OpenAI: praca nad wydaniem modelu”.
Guides & Insights

722 rękopisy matematyczne OpenAI: Model za nimi nie ma nazwy, ceny ani API

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

6 października 2026 o 21:47 UTC repozytorium o nazwie openai/math pojawiło się na GitHubie bez opisu i z początkowym commitem. Czternaście minut później OpenAI opublikowało je na X i udostępniło towarzyszącą stronę „Dzielenie się postępem AI w matematyce”. Te dwie rzeczy razem opisują wydarzenie bez precedensu: 722 manuskrypty matematyczne, pogrupowane w 372 rodziny, wygenerowane przez wewnętrzny model frontierowy, któremu OpenAI nie nadało nazwy, nie ustaliło ceny i którego nie można wywołać z żadnego API. Modele, ponad którymi się znajduje, to te, do których można dziś faktycznie uzyskać dostęp — GPT-6 Astra po 10 / 50 USD za milion tokenów i GPT-6.1 Sol po 2 / 10 USD — i żaden z nich nie napisał tych prac. OpenAI twierdzi, że model, który tego dokonał, jest wciąż trenowany i że pracuje nad jego „odpowiedzialnym udostępnieniem”. To, co zostało dotychczas zweryfikowane, co nie zostało, oraz jedno pytanie, które czytelnik powinien z tego wyciągnąć.

Zacznijmy od tego, czym to wydanie nie jest. Nie jest to premiera modelu: nie ma karty modelu, identyfikatora, okna kontekstowego, tabeli wyników benchmarków ani daty. Nie jest to artykuł naukowy: nic tutaj nie zostało poddane recenzji, a OpenAI mówi wprost, że wyniki bez formalizacji w Lean „mogą mieć problemy”. I nie jest to przeciek — powód, dla którego ten tekst napisano w konwencji „co wiemy do tej pory”, nie polega na tym, że materiał jest tajny, lecz na tym, że sam podmiot, czyli model, nie został jeszcze wydany. Wszystko pozostałe poniżej można zweryfikować na podstawie repozytorium, własnego wpisu OpenAI oraz grupy doradczej, z którą — jak twierdzi OpenAI — się konsultowano.

Co właściwie wylądowało 6 października?

Repozytorium jest publiczne, objęte licencją Apache-2.0 i napisane w Lean. W jego README podano, że katalog „zawiera 722 rękopisy uporządkowane w 372 rodziny”, gdzie rodzina grupuje główny wynik wraz z towarzyszącymi argumentami, konsekwencjami lub alternatywnymi dowodami. Mapa rękopisów jest wystarczająco szczegółowa, by można ją było audytować: 372 rodziny, każda z głównym wynikiem, wymienione wraz z tworzącymi je artykułami oraz, jeśli są dostępne, linkiem do formalizacji w Lean.

Post OpenAI dodaje liczby dotyczące pochodzenia, które są jej własne i nie zostały niezależnie zweryfikowane:

• Postawione problemy — około 4000, spośród których wybrano udostępnione rodziny

• Obliczenia na wynik — średnio równowartość około trzech godzin myślenia ChatGPT Pro

• Podsumowania rozumowania — udostępniono 10, obejmujące rodziny, w tym wykładnik niewymierności π, symetryczne i ogólne hipotezy Mahlera, hipotezę bezpośredniej skończoności Kaplansky'ego w charakterystyce dwa, wzór Mézarda–Parisiego dla rozcieńczonych szkieł spinowych oraz trójwymiarowy relatywistyczny układ Vlasowa–Maxwella

• Polityka wersji — nowe wersje są publikowane w celu wprowadzania poprawek, a wcześniejsze wersje pozostają dostępne

Tematy obejmują cały zakres: teoria liczb, geometria algebraiczna i zespolona, kombinatoryka, informatyka teoretyczna, algebry operatorów, prawdopodobieństwo i fizyka matematyczna. Niektóre z tytułów w tej rodzinie są na pierwszy rzut oka bardzo śmiałymi twierdzeniami — kontrprzykład do hipotezy pokryciowej Rysera, mnożenie liczb całkowitych poniżej n log n, mnożenie macierzy z wykładnikiem co najwyżej 9/4, hipotezy Mahlera, kontrprzykłady do Baum–Connesa i Kadisona–Kaplansky'ego. To, czy dane twierdzenie jest prawdziwe, jest dokładnie tym pytaniem, którego to wydanie nie rozstrzyga za ciebie.

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

Model nie ma nazwy, nie został jeszcze wydany, a OpenAI twierdzi, że nadchodzi.

README nie pozostawia wątpliwości co do autora: „manuskrypty matematyczne i towarzyszące im artefakty dowodowe wytworzone przez wewnętrzny model OpenAI”, przy czym zdecydowaną większość uzyskano „przy użyciu nieudostępnionego wewnętrznego modelu OpenAI”. Brak nazwy, brak kryptonimu, brak rozmiaru. Nazwy krążące w innych publikacjach nie zostały potwierdzone przez OpenAI i nie zamierzamy żadnej podawać.

To, co można datować, to oś czasu wokół tego. 28 sierpnia 2026 r., zgodnie ze stroną OpenAI dotyczącą jej grupy doradczej ds. matematyki, firma „rozpoczęła trenowanie nowego wewnętrznego modelu”, który od tego czasu rozwiązał problem milenijny Naviera–Stokesa i, według własnego podliczenia OpenAI, ponad 100 od dawna otwartych problemów. Wynik dotyczący Naviera–Stokesa ogłoszono osobno 8 września 2026 r., przy czym OpenAI opisała stojący za nim model jako „znacznie bardziej zdolny niż GPT-6 Astra” i stwierdziła, że trening wciąż trwał. Dwa z manuskryptów w tegotygodniowym zbiorze łamią standardową procedurę, co warto odnotować, ponieważ oznacza to, że publikacja nie jest jednym jednolitym potokiem: prace nad obszarem wolnym od zer dla funkcji dzeta Riemanna i dowód hipotezy Hodge'a dla rozmaitości abelowych CM potraktowano inaczej, a OpenAI twierdzi, że tekst o dzeta został zredagowany przez człowieka pod kątem czytelności.

A potem zdanie, które ma znaczenie dla każdego, kto planuje na tej podstawie: OpenAI pisze, że „pracuje nad odpowiedzialnym udostępnieniem modelu, który dał te wyniki”. To deklaracja zamiaru, nie data. Dopóki model nie zostanie udostępniony, jedyne modele OpenAI, które programista może wywołać, to te już obecne w cenniku.

Co oznacza tutaj „weryfikacja” — i gdzie się kończy

To jest ta część, którą większość doniesień o premierze sprowadza do jednego zdania, i to ta część decyduje o tym, jaką wagę nadać pojedynczej pracy.

OpenAI jednoznacznie stwierdza, że „ta kolekcja obejmuje wyniki na różnych etapach weryfikacji”. Najsilniejszą formą dowodu w pakiecie jest formalizacja w Lean, która pozwala komputerowi sprawdzić dowód, a nie człowiekowi. Własny manifest formalizacji repozytorium — katalog artykułów z sformalizowanym głównym wynikiem — zawiera 162 pozycje, więc około jeden na pięć z 722 manuskryptów jest poparty dowodem możliwym do sprawdzenia maszynowo w publicznym drzewie. OpenAI mówi, że więcej zostanie dodanych „gdy je uzyskamy”.

Pozostała duża większość nie jest zweryfikowana w tym sensie, a OpenAI nie udaje, że jest inaczej w odniesieniu do całego zbioru: „Niektóre z niezformalizowanych wyników mogą mieć problemy. Dołożymy starań, aby szybko naprawić wszelkie takie problemy”. Dwa szczegóły strukturalne wzmacniają wrażenie, że jest to wydanie zarządzane, a nie otwarte — zgłoszenia (issues) są wyłączone w repozytorium, a pull requesty są ograniczone do współpracowników. Nie ma publicznej ścieżki, by zakwestionować dowód na miejscu.

Zatem rzetelna interpretacja jest węższa, niż sugeruje liczba z nagłówka:

• Sprawdzone maszynowo — 162 rękopisy ze sformalizowanym głównym wynikiem w publicznym drzewie Lean

• Niezweryfikowane maszynowo — reszta, którą sam OpenAI oznacza jako potencjalnie zawierającą błędy

• Odpowiedzialność ludzka — nie wskazano nikogo; samo OpenAI przedstawia to tak, że żadna osoba nie rozumie argumentów stojących za większością tego, co zostało wytworzone

• Niezależna ocena — żadnej nie opublikowano; wyboru tego, które wyniki były „istotne” na tyle, by je uwzględnić, dokonał OpenAI

Nic z tego nie oznacza, że ta praca jest błędna. Oznacza to, że na razie „OpenAI udostępniło 722 dowody” i „722 dowody zostały sprawdzone” to różne stwierdzenia, a dziś prawdziwe jest tylko pierwsze.

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

Grupa doradcza dołączyła warunek, który został zaprotokołowany.

W poście OpenAI napisano, że skonsultowano się z niezależną Grupą Doradczą ds. Matematyki i Sztucznej Inteligencji przy Institute for Advanced Study i oparto się na „ich radach i publicznych rekomendacjach”. Rekomendacje te opublikowano 29 września 2026 r., po tym jak grupa otrzymała ponad 600 odpowiedzi od społeczności matematycznej. Warto przeczytać je bezpośrednio, ponieważ grupa ta nie jest wyłącznie pieczątką zatwierdzającą.

Ten sam dokument zaczyna się stwierdzeniem, że grupa w ogóle nie popiera tej praktyki: „niektóre czołowe laboratoria AI testują zaawansowane problemy matematyczne na modelach własnościowych, które pozostają niedostępne dla szerszej społeczności naukowej... nie popieramy tej praktyki i prosimy ich, aby przestali”. Grupa opisuje się również jako działająca niezależnie, a jej członkowie pracują nieodpłatnie i nie mają władzy decyzyjnej nad OpenAI — opis relacji, który odbija się echem również we własnym wpisie OpenAI.

Zalecenia grupy i to wydanie są zgodne w kwestii procesu: wyczerpujący przegląd literatury z cytowaniami prac, które wprowadziły te idee, opracowania dowodów sporządzone w standardowym stylu, a nie surowe wyniki modelu, oraz wersjonowanie, które zachowuje wcześniejsze wydania. Różnica polega na części, którą grupa nazywa centralną — że laboratorium publikujące wyniki, których nikt nie rozumie, powinno finansować zrozumienie przez ludzi, które musi nastąpić, poprzez warsztaty, konferencje i programy, oraz że ta praca powinna pozostać prowadzona przez społeczność, a nie kierowana przez laboratorium. OpenAI zobowiązało się do finansowania „serii warsztatów, konferencji i specjalnych programów wokół zrozumienia głównych wyników wygenerowanych przez AI” i twierdzi, że szczegóły pojawią się później. To jest otwarta kwestia i to ta, z której należy ich rozliczyć.

Co możesz dziś wywołać i do czego tak naprawdę służy tutaj routing

Nie da się wysłać zapytania do modelu, który wygenerował te rękopisy, a żadna platforma zewnętrzna nie może przekierować takiego zapytania — każda oferta, która twierdzi inaczej, opisuje model, którego nie ma w niczyim katalogu. Modele OpenAI w środowisku produkcyjnym to działająca linia GPT-6, a ich liczby są podane w cenniku, a nie wywnioskowane:

• GPT-6 Astra — 10 / 50 USD za milion tokenów, 1 USD za odczyt z pamięci podręcznej; poziom długiego kontekstu powyżej 272 tys. tokenów promptu w cenie 20 / 75 USD; kontekst 1,05 mln tokenów, maks. 128 tys. tokenów wyjściowych

• GPT-6.1 Sol — $2 / $10 za milion tokenów, $0.10 za odczyt z pamięci podręcznej; ta sama taryfikacja długiego kontekstu przy $4 / $15; kontekst 1,05 mln tokenów, maksymalnie 128K tokenów wyjściowych

Oba znajdują się w katalogu OrcaRouter, co jest praktycznym punktem dla każdego, kto czyta tę publikację jako sygnał o możliwościach: modele, których wolno ci dziś używać, to także modele, wokół których twoje prompty są już ukształtowane, a różnica między nimi a modelem wewnętrznym jest dokładnie tą luką, którą OpenAI prosi matematyków o pomoc w zamknięciu.

Ta luka jest także powodem, by rachunek za eksperymenty trzymać oddzielnie od ścieżki produkcyjnej. Gdy OpenAI w końcu nada temu modelowi nazwę i cenę, pierwszy tydzień będzie powodzią niezweryfikowanych twierdzeń o wynikach benchmarków i mnóstwem panicznych prac nad ponowną integracją — argument za routingiem w przypadku platformy takiej jak nasza jest taki, że wypróbowanie nieudowodnionego modelu kosztuje wtedy jeden ciąg modelu, a nie migrację. GPT-6 Astra kosztuje 10 / 50 USD, a GPT-6.1 Sol 2 / 10 USD za milion tokenów, przekazywane po cenie katalogowej z 0% marży, więc zmiana ceny dostawcy obowiązuje tego samego dnia, w którym zostaje wprowadzona. Automatyczne przełączanie awaryjne oznacza, że nowy model może obsługiwać ułamek ruchu i zostać wycofany, nie pociągając za sobą ścieżki żądań, a DSL routingu pozwala złożyć kilka modeli w jedno wywołanie, jeśli chcesz drugiej opinii przy długim wyprowadzeniu, a nie pojedynczej odpowiedzi. Nic z tego nie dotyczy modelu, który nie został jeszcze wydany — ale to dokładnie ta infrastruktura, którą warto mieć na miejscu, zanim pojawi się następny.

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

Co obejrzeć dalej

Cztery rzeczy, w kolejności, w jakiej prawdopodobnie będą miały znaczenie. Liczba formalizacji, ponieważ jest to jedyna liczba w tym wydaniu, która może przejść od „OpenAI tak twierdzi” do „maszyna to sprawdziła”, i jest publiczna. Pierwsza naprawdę niezależna ocena nazwanego wyniku — matematyk spoza OpenAI pracujący publicznie nad konkretnym artykułem, a nie streszczenie zbioru. Hostowane przez społeczność repozytorium, co do którego OpenAI twierdzi, że wciąż je rozważa, co przeniosłoby artefakt z własnego konta OpenAI w ręce środowiska. Oraz udostępnienie samego modelu, do którego OpenAI się zobowiązało, ale nie wyznaczyło terminu.

Czy 722 rękopisy oznaczają, że AI rozwiązało te problemy?

W przypadku podzbioru, jeśli matematyka się zgadza: kolekcja twierdzi, że zawiera kontrprzykłady i dowody dotyczące dobrze znanych otwartych problemów, a za głównym wynikiem 162 z tych prac stoi formalizacja sprawdzalna maszynowo. W przypadku pozostałych twierdzenie jest takie, że model wygenerował manuskrypt dotyczący problemu, co jest słabszym stwierdzeniem niż zweryfikowane rozwiązanie, a samo OpenAI ostrzega, że niesformalizowane wyniki mogą zawierać błędy. Różnica między „wygenerowaniem dowodu” a „posiadaniem dowodu” to cała historia tego wydania.

Czy cokolwiek z tego jest dziś użyteczne w produkcie?

Nie. Rękopisy to PDF-y, źródła Lean i podsumowania rozumowania — artefakty badawcze, a nie usługa. Nie ma identyfikatora modelu, punktu końcowego, ceny ani formularza wniosku o dostęp. Praktycznie użyteczną częścią wydania dla programisty jest potwierdzenie, że OpenAI ma w treningu model znacząco wykraczający poza GPT-6 Astra, co jest sygnałem planistycznym na najbliższe dwanaście miesięcy, a nie czymś, co można wywołać w tym tygodniu.

Dlaczego OpenAI opublikowało wyniki zamiast modelu?

Ponieważ te dwie rzeczy mają odmienne profile ryzyka. Publikowanie manuskryptów jest odwracalne — OpenAI zachowuje wcześniejsze wersje i twierdzi, że naprawi problemy — natomiast wypuszczenie modelu już nie. OpenAI oświadcza, że pracuje nad odpowiedzialnym udostępnieniem go, a zalecenia grupy doradczej, z których — jak twierdzi firma — czerpała, są zbudowane dokładnie wokół tej sekwencji: przekazać wyniki w ręce przedstawicieli dziedziny wraz z cytowaniami i wersjonowaniem, a następnie finansować zrozumienie po stronie ludzi, które musi po tym nastąpić.

Wersja jednym zdaniem dla tych, którzy tylko rzucą okiem: naprawdę bezprecedensowy korpus matematyki wygenerowanej przez AI został upubliczniony 6 października — około jednej piątej sprawdzono maszynowo, żadna jego część nie przeszła recenzji naukowej, a całość jest powiązana z modelem, którego nie można użyć. Ciekawe pytanie nie dotyczy tego, czy model jest zdolny — odpowiadają na to trzy godziny obliczeń w trybie frontier thinking na wynik w przypadku 4000 problemów, a OpenAI twierdzi, że model jest znacząco bardziej zdolny niż GPT-6 Astra — lecz tego, czy weryfikacja i ludzkie zrozumienie nadążą, zanim następne wydanie uczyni ten model przestarzałym.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie