
GPT-6.7 en de "Bob"-vraag: Zal OpenAI's niet-uitgebrachte vlaggenschip echt 2x langzamer draaien?
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
Op 15 augustus perste een X-post van het account @Yuchenj_UW een gerucht samen in één zin: "Bob, de koning van GPU-kernels, heeft het bedrijf verlaten? GPT-6.7 zal 2x langzamer draaien…." Twee beweringen rusten op dat vraagteken — dat de geheimzinnigste ingenieur van het bedrijf is vertrokken, en dat zijn vertrek de servesnelheid van GPT-6.7, het niet-uitgebrachte vlaggenschip van het bedrijf (in oktober vorig jaar hernoemd naar GPT-6-7), halveert. Geen van beide beweringen is bevestigd. Maar de post landt op een moment dat het volgende model van het bedrijf al een kwestie is van wanneer, niet of: de familienaam Astra deed op 1 augustus zijn intrede, een veiligheidsreview pauzeerde het op 7 augustus, en GPT-5.6 Sol — het huidige vlaggenschip, live op OrcaRouter — is het enige concrete referentiepunt voor wat de volgende generatie moet overtreffen. Dit is wat er vandaag de dag daadwerkelijk bekend is.
Eén ding vooraf: niemand buiten OpenAI heeft GPT-6.7 gedraaid. Elke bewering over hoe snel het tokens zal serveren is extrapolatie — inclusief het cijfer "2x langzamer". Wat volgt scheidt de geverifieerde feiten (de naamsverandering, de releaseplanning, de vertrekken die officieel zijn bevestigd) van de legende (Bob, de kernel en het getal). Al het geruchtmateriaal is als zodanig gelabeld.
Wie "Bob" is, en waarom een enkele ingenieur een legende werd.
"Bob" is de bijnaam die OpenAI-medewerkers gebruiken voor een ingenieur wiens naam het bedrijf nooit heeft bevestigd. Perspublicaties van september 2025 — waaronder QbitAI, The Paper en itbear, die zich allemaal baseren op voormalige en huidige OpenAI-medewerkers — beschrijven een geheimzinnige onderzoeker die in zijn eentje de CUDA-kernels schrijft die voor inferentie worden gebruikt: de low-level GPU-code die de wiskunde van transformers omzet in tokens. Zijn attention-kernel, binnen OpenAI de "Bob-kernel" genoemd, zou naar verluidt biljoenen keren per dag worden uitgevoerd op honderdduizenden GPU's, met de precisie die daarbij hoort: een bug zou een rollback van checkpoints en een hertrainingscyclus afdwingen.
De legende is consistent in alle verhalen. Voormalige medewerkers zeggen dat Bob in minuten een prestatieprobleem oploste waar collega's een week mee hadden geworsteld. De interne Slack van OpenAI heeft een 'Bob magic'-emoji. In dezelfde berichtgeving aangehaalde sectorschattingen stellen dat het aantal levende mensen dat high-performance training-CUDA-kernels kan schrijven onder de honderd ligt — daarom wordt een dergelijke afhankelijkheid van één persoon als werkelijk riskant beschouwd in plaats van als een leuk extraatje.
Wat identiteit betreft, heeft OpenAI nooit gezegd wie Bob is. De voornaamste hypothese, herhaald in dezelfde persverslaggeving, is Scott Gray — een afgestudeerde in natuurkunde en informatica die in 2016 bij OpenAI kwam, in 2017 eerste auteur was van OpenAI's blogbericht 'Block-sparse GPU kernels,' en later medeauteur van het GPT-4-technisch rapport en het paper over schaalwetten, met een bibliografie van 51 papers en meer dan 80.000 citaten. De overeenkomst is indirect maar wordt breed herhaald; het is een afleiding, geen bevestiging.
Is Bob echt vertrokken?
De tweet is een vraag, geen bewering. Maar het vertrek waar hij op wijst heeft een papieren spoor. Een overzicht van de personeelswisselingen in het leiderschap, gepubliceerd op 15 augustus 2026, vermeldt Scott Gray — omschreven als een 'jarenlange GPU-systeemingenieur' die in 2016 kwam en hielp bij het bouwen van de infrastructuur achter sparse transformers, schaalwetten en GPT-3 — onder ten minste twaalf seniormedewerkers die OpenAI in 2026 verlieten. Dezelfde lijst noemt chief revenue officer Denise Dresser, voormalig COO Brad Lightcap, applications-CEO Fidji Simo, Sora-hoofd Bill Peebles, en hoofden van veiligheid, ethiek, marketing en hardware. Dat is een secundair rapport, geen officiële bevestiging, en het geeft geen vertrekdatum voor Gray.
De bredere context maakt het gerucht minder verrassend. Berichtgeving rond dezelfde week kadert het verloop als een herschikking in aanloop naar de beursgang: medeoprichter Greg Brockman trekt de operationele zeggenschap naar zich toe voorafgaand aan een geplande beursnotering, en CNBC berichtte op 13 augustus over het vertrek van de CRO. En "Bob" is al een jaar een bekend wervingsdoelwit — berichten van september 2025 meldden dat Mark Zuckerberg van Meta "wie is Bob?" tot een vast agendapunt had gemaakt tijdens wervingsvergaderingen. De talentenoorlog rond deze specifieke vaardigheden is reëel, en dat verklaart mede waarom het lek plausibel overkomt.
Toch heeft de keten van beweringen twee onbevestigde schakels: dat Scott Gray Bob is, en dat de vermelding in het overzicht hetzelfde vertrek betreft als waar de tweet op doelt. Het is heel goed mogelijk dat de tweet een gerucht herhaalt dat dateert van vóór een daadwerkelijk vertrek. Dit deel is de eerlijke samenvatting: officieel verschijnt een senior GPU-ingenieur genaamd Scott Gray op een vertreklijst van 2026; officieus kan die persoon wel of niet de Bob zijn waar de tweet op doelt.
Waarom "2x langzamer" er wel toe doet — en waarom het waarschijnlijk niet zo eenvoudig is.
Kernels bepalen de twee grootheden die de economie van een model bepalen: tokens per seconde en kosten per token. Als GPT-6.7 op de markt zou komen met serving-kernels die half zo efficiënt zijn als de hypothetische 'Bob-geoptimaliseerde' versie, zou dezelfde hardware de helft van het aantal tokens bedienen en zou hetzelfde verzoek twee keer zo lang duren — tegen ruwweg twee keer de marginale kosten. Voor een ontwikkelaar die productieverkeer routeert, betekent dat een verdubbeling van latentie en een verdubbeling van kosten op het vlaggenschip, precies het soort cijfer dat een modelkeuze kan veranderen. Daarom is dit gerucht serieus te nemen.
Nu de redenen om het te wantrouwen:
De "2x" heeft geen vermelde basis. Het is een getal in een bericht — een gedachte-experiment, geen meting, en de gelinkte afbeelding bevat ook geen basis.
Kernels zijn code, en code overleeft auteurs. De serving stack die Bob (of wie dan ook) voor eerdere modellen schreef, verdwijnt niet wanneer iemand vertrekt; het volgende model erft het grootste deel ervan.
• De infrastructuurorganisatie van OpenAI is groot, en de mythe dat "één persoon alles schrijft" is vrijwel zeker een vereenvoudiging. Het sleutelpersoonrisico is reëel, maar zelden binair.
• Zelfs een echt efficiëntieverlies zou de capaciteiten niet veranderen. Het verandert de kosten en latentie — pijnlijk, maar een leverancier kan het gedeeltelijk absorberen of de prijs eromheen bepalen, en OpenAI heeft al een snelheidsfunctie uitgebracht (Ultrafast, tot 14x sneller op het huidige vlaggenschip) die precies is gericht op dit soort druk op de serveringskosten.
De sterkste versie van de bewering is de onder-honderd-statistiek. Als de persoon die de serving kernels van het vlaggenschip schreef er niet meer is, is de vervanging geen headcount-aanwerving — het is een meerjarige opbouw. Dat is een legitiem risico voor OpenAI's serving-economie. Maar het is een risico over het team, geen gemeten feit over een model dat nog niet is uitgebracht.
Wat we daadwerkelijk weten over GPT-6.7
Het model waar het gerucht over gaat heeft een langere publieke geschiedenis dan de tweet suggereert, en het meeste daarvan is recent:
• 31 okt 2025 — Sam Altman kondigde op X aan dat "GPT-6" zou worden hernoemd naar "GPT-6-7," algemeen gelezen als een knipoog naar de Gen-Alpha-slang "6-7." Of "GPT-6.7" en "GPT-6-7" strikt genomen hetzelfde zijn, is niet officieel; de tweet behandelt ze als onderling uitwisselbaar, en de meeste berichtgeving doet dat ook.
• April 2026 — Berichten dat de pre-training van GPT-6 was voltooid, met geruchten over een release rond 14 april. Die datum ging voorbij zonder een lancering.
• Augustus 2026 — Volgens geruchten werd de lancering vervroegd naar begin augustus, waarbij OpenAI GPT-5.7 tot en met GPT-5.9 oversloeg. Onbevestigd.
• 1 aug 2026 — OpenAI kondigde "Astra" aan als de naam van zijn volgende modelfamilie, via een onderzoeksrapport waarin werd geclaimd dat tien open wiskundeproblemen zijn opgelost. Of Astra onder de naam GPT-6 wordt uitgebracht, is niet bevestigd.
• 7 aug 2026 — OpenAI pauzeerde de ontwikkeling van Astra en stelde de uitrol uit nadat een interne veiligheidsreview een "kritiek" cybersecurityrisico aan het licht bracht — het eerste model dat dat niveau activeerde. Altman zei dat brede uitrol "nog iets langer duurt."
• Voorspellingsmarkten — Per half augustus schatten handelaren de kans op een GPT-6-release vóór 30 september op circa 62% en vóór 31 december op circa 90%.
• Vermeende specificaties — een context van ongeveer 2M tokens, ruwweg 40% betere prestaties dan de huidige generatie, gepersonaliseerd geheugen en native multimodale architectuur onder de codenaam "Symphony." Alles is onbevestigd.
Dus het model achter "2x langzamer" is nog niet uitgebracht, heeft geen bevestigde releasedatum en is onderwerp van een actieve veiligheidsbeoordeling. Een serving-snelheidscijfer dat eraan gekoppeld is, is dubbel speculatief — eenmaal voor de datum, eenmaal voor de snelheid.

Het enige scorebord dat vandaag eerlijk is.
Omdat GPT-6.7 nog niet bestaat, kan een scorebord het gerucht alleen maar afzetten tegen wat er daadwerkelijk live is:
• GPT-6.7 (niet uitgebracht) — status: niet uitgeleverd; release: volgens geruchten najaar 2026; context: ~2M tokens (naar verluidt); snelheid: "2x langzamer?" onbevestigd; prijs: n.v.t.; routeerbaar: nog niet.
GPT-5.6 Sol (live) — status: wordt uitgeleverd; context: 1,05M tokens, 128K maximale output; snelheid: ~290 tok/s waargenomen op de 7-daagse statistieken van OrcaRouter; prijs: $5,00 in / $30,00 uit per miljoen tokens op het standaard invoerniveau; routeerbaar: ja, tegen de lijstprijs van de provider.
Het interessante verschil is de prijskolom. Het huidige vlaggenschip van OpenAI kost $5/$30 per miljoen tokens via OrcaRouter, en de doorberekening is de eigen catalogusprijs van de leverancier zonder opslag — dus wat OpenAI ook voor GPT-6.7 vraagt, het getal aan onze kant beweegt dezelfde dag dat het uitkomt, zonder heronderhandeling. Dat is het nuttige deel van het scorebord voor iedereen die rond het volgende model plant.

Hoe behandel je zo'n lek?
Het patroon is bekend: een nog niet uitgebracht model, een opzienbarend getal, een met naam genoemd persoon. Elk onderdeel is aannemelijk en niets is geverifieerd. De juiste reactie is noch om het gerucht te negeren, noch om erop te wedden — het is om de beslissing zo te structureren dat je niet hoeft te kiezen.
Dat is het geval voor routing. Wanneer GPT-6.7 uitkomt, is de manier om een bewering dat het 2x langzamer is te evalueren zonder er een productiepad op te verwedden, door het achter hetzelfde eindpunt te plaatsen dat je al gebruikt: één API-sleutel, automatische failover naar GPT-5.6 Sol zodra het nieuwe model ondermaats presteert, en echt verkeer dat beslist of het gerucht waar was. De bewering wordt dan een meting in plaats van een tweet. Als de prijslijst van OpenAI verandert met de nieuwe release, wordt het doorberekende tarief dezelfde dag bijgewerkt — OrcaRouter geeft de prijslijsten van providers door zonder opslag, dus een prijsverlaging (of -verhoging) van een leverancier is hier onmiddellijk actief, zonder heronderhandeling.
Ondertussen is het huidige vlaggenschip het concrete feit. GPT-5.6 Sol is vandaag live op OrcaRouter tegen $5/$30 per miljoen tokens, met de 1,05M-token context en ~290 tok/s die het scorebord toont. De Ultrafast-modus die op 13 augustus werd aangekondigd — tot 14x sneller, ongeveer 750 tokens per seconde op Cerebras-infrastructuur — geldt voor dat model, niet voor GPT-6.7, en het is een herinnering dat OpenAI de serveringskosten kan aanpakken met infrastructuur én met kernels.

Wat we nu kijken
Of Bobs vertrek wordt bevestigd. OpenAI geeft geen commentaar op wie Bob is; het dichtstbijzijnde officiële feit is de naam van Scott Gray op de lijst van vertrekkenden in 2026. Als OpenAI of Gray dit bevestigt, wordt de eerste schakel van de keten een feit.
{{1}}Of het getal "2x langzamer" ooit een basis krijgt. Als GPT-6.7 uitkomt en er onafhankelijke snelheidsmetingen verschijnen, {{2}}houdt het cijfer op een gerucht te zijn — het wordt dan bevestigd of weerlegd. Tot die tijd is het een getal in een bericht.{{/2}}{{/1}}
Of Astra's veiligheidspauze de datum opschuift. Voorspellingsmarkten hebben GPT-6 al uit augustus verplaatst; de aanduiding "kritiek" en de overheidsproeven die OpenAI zegt te willen, zijn beide natuurlijke bronnen van verdere vertraging.
• Of de kernel-benchmark opnieuw sorteert. Als het serving-team van OpenAI het verlies opvangt — of de legende het aandeel van één persoon overdrijft — is het hele gerucht niet ter zake, en het eerste teken zal de serving-prestatie van het volgende model zijn ten opzichte van zijn voorganger.
De eerlijke lezing: "2x langzamer" is een overtuigend verhaal en tot nu toe alleen maar dat. Het vertrek van de kernel-wizard is een echt datapunt met een echt papieren spoor; het snelheidsgetal is een getal in een tweet. Totdat GPT-6.7 uitkomt, is de verdedigbare positie om op beide uitkomsten te plannen — neem aan dat het gerucht deels waar kan zijn, en bouw de routing zo dat een vlaggenschip dat langzamer is dan verwacht je niets kost om te testen. Dat is precies het hele punt van het routeren van een model dat je nog niet bent tegengekomen.
