Karta tytułowa hero dla GPT-6.7 — niewydanego następnego flagowca OpenAI — zatytułowana 'GPT-6.7: pytanie o jądro', przedstawiająca płaską ikonę chipa GPU z pogrubionym znakiem zapytania nad nią, tarczę wskaźnika z czerwoną wskazówką przy etykiecie '2x', małe ikony liniowe prędkościomierza, klucza i dokumentu wycieku oraz dolny pasek z napisem 'GPT-6.7 · NIEWYDANY · CO WIEMY DO TEJ PORY', z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6.7 i pytanie o „Boba": Czy niewydany flagowiec OpenAI naprawdę będzie działać 2x wolniej?

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

15 sierpnia post na X z konta @Yuchenj_UW skondensował plotkę do jednego zdania: „Bob, król jąder GPU, odszedł z firmy? GPT-6.7 będzie działać 2x wolniej…”. Za tym znakiem zapytania stoją dwa twierdzenia — że najbardziej skryty inżynier firmy odszedł, i że jego odejście zmniejsza o połowę szybkość serwowania GPT-6.7, niewydanego flagowca firmy (przemianowanego na GPT-6-7 w październiku zeszłego roku). Żadne z tych twierdzeń nie zostało potwierdzone. Ale ten post pojawia się w momencie, gdy kolejny model firmy jest już kwestią kiedy, a nie czy: nazwa rodziny Astra pojawiła się 1 sierpnia, przegląd bezpieczeństwa wstrzymał go 7 sierpnia, a GPT-5.6 Sol — obecny flagowiec, działający na OrcaRouter — to jedyny konkretny punkt odniesienia dla tego, co następna generacja musi pobić. Oto, co faktycznie można dziś ustalić.

Jedno na wstępie: nikt poza OpenAI nie uruchamiał GPT-6.7. Każde twierdzenie o tym, jak szybko będzie serwować tokeny, jest ekstrapolacją — w tym liczba „2x wolniej". To, co poniżej, oddziela zweryfikowane fakty (zmianę nazwy, harmonogram wydania, odejścia potwierdzone w źródłach) od legendy (Bob, jądro i liczba). Cały materiał plotkowy jest odpowiednio oznaczony.

Kim jest "Bob" i dlaczego jeden inżynier stał się legendą

"Bob" to pseudonim, jakiego pracownicy OpenAI używają wobec inżyniera, którego nazwiska firma nigdy nie potwierdziła. Doniesienia prasowe z września 2025 roku — w tym QbitAI, The Paper i itbear, wszystkie powołujące się na byłych i obecnych pracowników OpenAI — opisują skrytego badacza, który w pojedynkę pisze jądra CUDA wykorzystywane do inferencji, czyli niskopoziomowy kod GPU przekształcający matematykę transformerów w tokeny. Jego jądro uwagi, nazywane wewnątrz OpenAI „jądrem Boba", jest podobno wykonywane biliony razy dziennie na setkach tysięcy procesorów graficznych, a precyzja musi temu dorównywać: błąd wymusiłby wycofanie punktów kontrolnych i cykl ponownego trenowania.

Legenda jest spójna we wszystkich relacjach. Byli pracownicy twierdzą, że Bob w ciągu kilku minut rozwiązał problem z wydajnością, z którym koledzy zmagali się przez tydzień. Wewnętrzny Slack OpenAI ma emoji "Bob magic". Szacunki branżowe przytoczone w tym samym artykule określają liczbę żyjących osób potrafiących pisać wysokowydajne jądra CUDA do trenowania na mniej niż sto — dlatego zależność od jednej osoby tego rodzaju jest traktowana jako realne ryzyko, a nie coś, co miło mieć.

Jeśli chodzi o tożsamość, OpenAI nigdy nie powiedziało, kim jest Bob. Wiodąca hipoteza, powtarzana w tych samych doniesieniach prasowych, wskazuje na Scotta Graya — absolwenta fizyki i informatyki, który dołączył do OpenAI w 2016 roku, był pierwszym autorem wpisu na blogu OpenAI z 2017 roku „Block-sparse GPU kernels", a później współautorem raportu technicznego GPT-4 i pracy o prawach skalowania, z dorobkiem 51 prac i ponad 80 000 cytowań. To dopasowanie jest poszlakowe, ale szeroko powtarzane; to wnioskowanie, a nie potwierdzenie.

Czy Bob rzeczywiście wyszedł?

Tweet jest pytaniem, a nie twierdzeniem. Jednak odejście, na które wskazuje, ma udokumentowany ślad. Opublikowane 15 sierpnia 2026 roku podsumowanie rotacji w kadrze kierowniczej wymienia Scotta Graya — opisanego jako «wieloletni inżynier systemów GPU», który dołączył w 2016 roku i pomagał zbudować infrastrukturę stojącą za transformerami rozrzedzonymi, prawami skalowania i GPT-3 — wśród co najmniej dwunastu wysokiej rangi pracowników, którzy opuścili OpenAI w 2026 roku. Ta sama lista wymienia dyrektorkę ds. przychodów Denise Dresser, byłego dyrektora operacyjnego Brada Lightcapa, dyrektorkę generalną ds. aplikacji Fidji Simo, szefa Sory Billa Peeblesa oraz szefów działów bezpieczeństwa, etyki, marketingu i sprzętu. To wtórny raport, a nie oficjalne potwierdzenie, i nie podaje daty odejścia Graya.

Szerszy kontekst sprawia, że plotka jest mniej zaskakująca. Doniesienia z tego samego tygodnia przedstawiają rotację jako przetasowanie przed IPO: współzałożyciel Greg Brockman przejmuje władzę operacyjną przed planowanym debiutem giełdowym, a CNBC poinformowało o odejściu CRO 13 sierpnia. A „Bob” od roku jest znanym celem rekrutacyjnym — doniesienia z września 2025 mówiły, że Mark Zuckerberg z Meta uczynił „kim jest Bob?” stałym punktem spotkań rekrutacyjnych. Wojna o talenty w tej konkretnej specjalizacji jest realna, co częściowo sprawia, że wyciek brzmi wiarygodnie.

Niemniej jednak łańcuch twierdzeń ma dwa niezweryfikowane ogniwa: że Scott Gray to Bob oraz że pozycja w zestawieniu to to samo odejście, o którym mowa w tweecie. Jest całkiem możliwe, że tweet powtarza plotkę, która powstała przed jakimkolwiek faktycznym odejściem. Ta sekcja to uczciwe podsumowanie: oficjalnie starszy inżynier GPU o nazwisku Scott Gray widnieje na liście odejść na rok 2026; nieoficjalnie ta osoba może być lub nie być tym Bobem, o którym mowa w tweecie.

Dlaczego „2x wolniej" miałoby znaczenie — i dlaczego prawdopodobnie nie jest to takie proste.

Jądra określają dwie liczby decydujące o ekonomii modelu: tokeny na sekundę i koszt tokena. Gdyby GPT-6.7 działał na jądrach serwujących o połowę mniej wydajnych niż hipotetyczna wersja „Bob-optimized”, ten sam sprzęt obsłużyłby o połowę mniej tokenów, a to samo żądanie trwałoby dwa razy dłużej — przy mniej więcej dwukrotnie wyższym koszcie krańcowym. Dla dewelopera kierującego ruch produkcyjny oznacza to 2x większe opóźnienie i 2x większy koszt na flagowym modelu, czyli dokładnie ten rodzaj liczby, który zmienia wybór modelu. Dlatego ta plotka ma w sobie moc.

Teraz powody, dla których nie należy mu ufać:

• „2x" nie ma podanej podstawy. To liczba w poście — eksperyment myślowy, a nie pomiar, a powiązany obraz też żadnego nie zawiera.

• Jądra to kod, a kod żyje dłużej niż jego autorzy. Stos serwujący, który Bob (lub ktokolwiek inny) napisał dla wcześniejszych modeli, nie znika, gdy osoba odchodzi; następny model dziedziczy większość z niego.

• Organizacja infrastruktury OpenAI jest duża, a legenda o tym, że „jedna osoba pisze wszystko”, jest niemal na pewno uproszczeniem. Ryzyko kluczowej osoby jest realne, ale rzadko zero-jedynkowe.

• Nawet prawdziwy spadek wydajności nie zmieniłby możliwości. Zmienia koszt i opóźnienie — bolesne, ale dostawca może częściowo to pochłonąć lub obejść cenowo, a OpenAI już wypuściło funkcję szybkości (Ultrafast, do 14 razy szybszą w obecnym flagowcu) skierowaną dokładnie na tego rodzaju presję kosztów serwowania.

Najmocniejsza wersja tego twierdzenia to statystyka poniżej stu. Jeśli osoba, która napisała jądra serwujące flagowego modelu, już nie pracuje, to jej zastępca nie jest zwykłym zatrudnieniem na etat — to wieloletni proces wdrażania. To realne ryzyko dla ekonomiki serwowania OpenAI. Jest to jednak ryzyko dotyczące zespołu, a nie zmierzony fakt o modelu, który jeszcze nie został wydany.

Co faktycznie wiemy o GPT-6.7?

Model, którego dotyczy plotka, ma dłuższą publiczną historię, niż sugeruje tweet, a większość z niej jest niedawna:

• 31 paź 2025 — Sam Altman ogłosił na X, że „GPT-6” zostanie przemianowane na „GPT-6-7”, powszechnie odczytywane jako ukłon w stronę slangu generacji Alpha „6-7”. Czy „GPT-6.7” i „GPT-6-7” są ściśle tym samym, nie jest oficjalne; tweet traktuje je jako zamienne, podobnie jak większość publikacji.

• Kwiecień 2026 — Doniesienia o zakończeniu pre-treningu GPT-6, z plotkami o premierze około 14 kwietnia. Ta data minęła bez premiery.

• Sierpień 2026 — Według przecieków premiera została przyspieszona na początek sierpnia, a OpenAI pomija GPT-5.7 do GPT-5.9. Niepotwierdzone.

• 1 sierpnia 2026 — OpenAI ogłosiło, że „Astra" będzie nazwą jego następnej rodziny modeli, za pośrednictwem raportu badawczego twierdzącego, że rozwiązano dziesięć otwartych problemów matematycznych. To, czy Astra ukaże się pod nazwą GPT-6, nie jest potwierdzone.

7 sierpnia 2026 — OpenAI wstrzymało rozwój Astry i opóźniło premierę po tym, jak wewnętrzny przegląd bezpieczeństwa wykazał „krytyczne” ryzyko cyberbezpieczeństwa — pierwszy model, który uruchomił ten poziom. Altman powiedział, że szerokie udostępnienie „potrzebuje trochę więcej czasu”.

• Rynki prognostyczne — Stan na połowę sierpnia: uczestnicy rynku szacują wydanie GPT-6 do 30 września na około 62%, a do 31 grudnia na około 90%.

{{1}}Plotkowane specyfikacje — kontekst wielkości około {{2}}2M tokenów{{/2}}, wydajność mniej więcej {{3}}40%{{/3}} lepsza niż obecna generacja, spersonalizowana pamięć i natywna architektura multimodalna pod kryptonimem {{4}}"Symphony."{{/4}} Wszystko niezweryfikowane.{{/1}}

Zatem model stojący za "2x slower" nie został wydany, nie ma potwierdzonej daty premiery i jest przedmiotem aktywnego przeglądu bezpieczeństwa. Przypisana mu liczba szybkości serwowania jest spekulacyjna podwójnie — raz ze względu na datę, raz ze względu na szybkość.

A timeline infographic titled 'GPT-6.7 — the trail so far' with five milestone cards: Oct 31 2025 (renamed GPT-6-7 by Altman), Apr 2026 (pre-training reported done), Aug 1 2026 (Astra family name announced), Aug 7 2026 (safety pause: critical cyber risk), Aug 15 2026 (Bob departure rumor circulates); footer reads 'Timeline per OpenAI announcements and press reports; model unreleased as of Aug 15 2026.' OrcaRouter logo in the bottom-right corner.

Jedyna tablica wyników, która jest dziś uczciwa.

Ponieważ GPT-6.7 jeszcze nie istnieje, tablica wyników może jedynie zestawić plotkę z tym, co faktycznie jest dostępne:

• GPT-6.7 (niewydany) — status: nie wydany; premiera: podobno jesień 2026; kontekst: ~2M tokenów (podobno); szybkość: „2x wolniej?” niezweryfikowane; cena: brak; routowalny: jeszcze nie.

GPT-5.6 Sol (live) — status: dostępny; kontekst: 1,05 mln tokenów, maks. 128K tokenów wyjściowych; prędkość: ~290 tok/s zaobserwowana w statystykach 7-dniowych OrcaRouter; cena: 5,00 $ za wejście / 30,00 $ za wyjście na milion tokenów na standardowym poziomie wejściowym; routowalny: tak, po cenie katalogowej dostawcy.

Interesująca różnica dotyczy kolumny ceny. Obecny flagowy model OpenAI kosztuje 5/30 dolarów za milion tokenów przez OrcaRouter, a stawka pass-through to cennik producenta bez żadnej marży — więc bez względu na to, jak OpenAI wyceni GPT-6.7, liczba po naszej stronie zmieni się tego samego dnia, w którym model zostanie wydany, bez renegocjacji. To jest użyteczna część tablicy wyników dla każdego, kto planuje prace w oparciu o następny model.

A two-column scoreboard titled 'GPT-6.7 vs GPT-5.6 Sol — the scoreboard'. Left column GPT-6.7 (unreleased): Status not shipped, Release rumored autumn 2026, Context ~2M (rumored), Speed 2x slower? (unverified), Price n/a, On OrcaRouter not yet. Right column GPT-5.6 Sol (live): Status shipping, Release live now, Context 1.05M tokens, Speed ~290 tok/s, Price $5.00/$30.00 per M, On OrcaRouter yes at list price. Footer: 'GPT-6.7 figures rumored/unaudited; GPT-5.6 Sol per OrcaRouter model page.' OrcaRouter logo in the bottom-right corner.

Jak postępować z takim przeciekiem

To znajomy schemat: niewydany model, spektakularna liczba, osoba podana z nazwiska. Każdy element jest prawdopodobny, a żaden niepotwierdzony. Właściwa reakcja nie polega ani na ignorowaniu plotki, ani na stawianiu na nią — lecz na takim ustrukturyzowaniu decyzji, by nie trzeba było wybierać.

To jest przypadek routingu. Gdy GPT-6.7 trafi na rynek, sposób na ocenę twierdzenia o 2-krotnie wolniejszym działaniu bez stawiania na szali ścieżki produkcyjnej polega na umieszczeniu go za tym samym endpointem, którego już używasz: jeden klucz API, automatyczne przełączanie na GPT-5.6 Sol w momencie, gdy nowy model osiąga gorsze wyniki, a prawdziwy ruch decyduje, czy plotka była prawdziwa. Twierdzenie staje się wtedy pomiarem zamiast tweeta. Jeśli cennik OpenAI zmieni się wraz z nową wersją, stawka pass-through zaktualizuje się tego samego dnia — OrcaRouter przekazuje cenniki dostawców bez narzutów, więc obniżka (lub podwyżka) cen od dostawcy jest tu widoczna natychmiast, bez renegocjacji.

Tymczasem obecny flagowiec to konkretna rzecz. GPT-5.6 Sol jest dziś dostępny na OrcaRouter w cenie 5/30 dolarów za milion tokenów, z kontekstem 1,05 mln tokenów i ~290 tok/s, jak pokazuje tablica wyników. Tryb Ultrafast ogłoszony 13 sierpnia — do 14 razy szybszy, około 750 tokenów na sekundę na infrastrukturze Cerebras — dotyczy tego modelu, a nie GPT-6.7, i przypomina, że OpenAI może atakować koszty serwowania za pomocą infrastruktury, a także jąder.

Screen capture of the OrcaRouter model page for GPT-5.6 Sol, showing the OpenAI flagship's pricing ($5.00 in / $30.00 out per million tokens), a 1.05M-token context window, 128K max output, Vision/Tools/JSON/Reasoning capability tags, and a p50 time-to-first-token of 1.87 seconds.

Co teraz oglądamy

• Czy odejście Boba zostanie potwierdzone. OpenAI nie komentuje, kim jest Bob; najbliższym udokumentowanym wydarzeniem jest nazwisko Scotta Graya na liście odejść na rok 2026. Jeśli OpenAI lub Gray to potwierdzi, pierwsze ogniwo łańcucha stanie się faktem.

• Czy liczba „2x wolniej” kiedykolwiek zyska podstawę. Jeśli GPT-6.7 ukaże się i pojawią się niezależne pomiary szybkości, liczba przestaje być plotką — albo zostanie potwierdzona, albo wycofana. Do tego czasu jest to tylko liczba w poście.

• Czy przerwa ze względów bezpieczeństwa Astry opóźni termin. Rynki predykcyjne już przesunęły GPT-6 poza sierpień; klasyfikacja jako „krytyczny” oraz testy rządowe, których chce OpenAI, to naturalne źródła dalszych opóźnień.

• Czy kernel bench ponownie sortuje. Jeśli zespół serwujący OpenAI skompensuje tę stratę — albo legenda wyolbrzymia udział jednej osoby — cała plotka jest bezprzedmiotowa, a pierwszą oznaką będzie wydajność serwowania następnego modelu względem jego poprzednika.

Szczera ocena: „2x wolniejszy” to przekonująca historia i na razie tylko tyle. Odejście guru kernela to realny punkt danych z prawdziwym udokumentowanym śladem; liczba dotycząca szybkości to liczba w tweecie. Dopóki GPT-6.7 nie zostanie wydany, uzasadnione stanowisko to planowanie pod oba wyniki — zakładaj, że pogłoska może być częściowo prawdziwa, i zbuduj routing tak, aby flagowiec wolniejszy niż oczekiwano nic Cię nie kosztował w testach. To jest cały sens routowania modelu, którego nie poznałeś.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube