
GPT-6.7 et la question « Bob » : le produit phare non publié d'OpenAI tournera-t-il vraiment 2x plus lentement ?
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Le 15 août, un post X du compte @Yuchenj_UW a résumé une rumeur en une phrase : « Bob, le roi des kernels GPU, a quitté l'entreprise ? GPT-6.7 tournera 2x plus lentement… ». Deux affirmations reposent sur ce point d'interrogation — que l'ingénieur le plus secret de l'entreprise est parti, et que son départ réduit de moitié la vitesse de service de GPT-6.7, le fleuron non encore publié de l'entreprise (renommé GPT-6-7 en octobre dernier). Aucune de ces affirmations n'est vérifiée. Mais ce post arrive à un moment où le prochain modèle de l'entreprise est déjà une question de quand, pas de si : le nom de la famille Astra a été dévoilé le 1er août, un examen de sécurité l'a suspendu le 7 août, et GPT-5.6 Sol — le fleuron actuel, en service sur OrcaRouter — est le seul point de référence concret que la prochaine génération doit surpasser. Voici ce que l'on peut réellement savoir à ce jour.
Une chose d'emblée : personne en dehors d'OpenAI n'a exécuté GPT-6.7. Toute affirmation sur sa vitesse de service des tokens est une extrapolation — y compris le chiffre « 2x plus lent ». Ce qui suit sépare les faits vérifiés (le renommage, le calendrier de sortie, les départs qui sont documentés) de la légende (Bob, le noyau et le nombre). Tout le matériel de rumeur est étiqueté comme tel.
Qui est « Bob », et pourquoi un seul ingénieur est devenu une légende
« Bob » est le surnom que les employés d'OpenAI donnent à un ingénieur dont l'entreprise n'a jamais confirmé le nom. Des articles de presse datant de septembre 2025 — notamment de QbitAI, The Paper et itbear, tous citant d'anciens et d'actuels employés d'OpenAI — décrivent un chercheur discret qui écrit à lui seul les kernels CUDA utilisés pour l'inférence, ce code GPU de bas niveau qui transforme les mathématiques des transformers en tokens. Son kernel d'attention, appelé « Bob kernel » en interne chez OpenAI, serait exécuté des milliers de milliards de fois par jour sur des centaines de milliers de GPU, avec une précision à la hauteur : un bug forcerait un retour en arrière des checkpoints et un cycle de réentraînement.
La légende est constante d'un témoignage à l'autre. D'anciens employés affirment que Bob a résolu en quelques minutes un problème de performance sur lequel des collègues avaient bataillé pendant une semaine. Le Slack interne d'OpenAI dispose d'un emoji « Bob magic ». Les estimations du secteur citées dans le même reportage évaluent à moins d'une centaine le nombre de personnes vivantes capables d'écrire des kernels CUDA d'entraînement haute performance — c'est pourquoi une dépendance de ce type envers une seule personne est considérée comme un risque réel plutôt qu'un simple plus.
Sur l'identité, OpenAI n'a jamais dit qui est Bob. L'hypothèse principale, reprise dans la même couverture de presse, est Scott Gray — un diplômé en physique et en informatique qui a rejoint OpenAI en 2016, a été l'auteur principal de l'article de blog d'OpenAI de 2017 « Block-sparse GPU kernels », puis a co-écrit le rapport technique de GPT-4 et l'article sur les lois d'échelle, avec 51 publications et plus de 80 000 citations. La correspondance est circonstancielle mais largement reprise ; c'est une inférence, pas une confirmation.
Est-ce que Bob est vraiment parti ?
Le tweet est une question, pas une affirmation. Mais le départ auquel il fait allusion a une trace écrite. Un récapitulatif des départs de dirigeants publié le 15 août 2026 place Scott Gray — décrit comme un « ingénieur systèmes GPU de longue date » qui a rejoint OpenAI en 2016 et a contribué à construire l'infrastructure derrière les transformers épars, les lois de mise à l'échelle et GPT-3 — parmi au moins douze cadres supérieurs ayant quitté OpenAI en 2026. La même liste nomme la directrice du chiffre d'affaires Denise Dresser, l'ancien directeur des opérations Brad Lightcap, le PDG des applications Fidji Simo, le directeur de Sora Bill Peebles, et les responsables de la sécurité, de l'éthique, du marketing et du matériel. Ce n'est qu'un compte rendu secondaire, pas une confirmation officielle, et il ne donne aucune date de départ pour Gray.
Le contexte plus large rend la rumeur moins surprenante. Les reportages de la même semaine présentent ce remaniement comme une réorganisation précédant l'introduction en Bourse : le cofondateur Greg Brockman concentre l'autorité opérationnelle entre ses mains avant une cotation publique prévue, et CNBC a rapporté le départ du CRO le 13 août. Et « Bob » est une cible de recrutement connue depuis un an — des reportages de septembre 2025 indiquaient que Mark Zuckerberg, de Meta, avait fait de « qui est Bob ? » un point permanent à l'ordre du jour des réunions de recrutement. La guerre des talents autour de cet ensemble de compétences spécifiques est bien réelle, ce qui explique en partie pourquoi la fuite semble plausible.
Néanmoins, la chaîne d’affirmations comporte deux maillons non vérifiés : que Scott Gray est bien Bob, et que la liste du décompte correspond au même départ que celui évoqué dans le tweet. Il est tout à fait possible que le tweet reprenne une rumeur antérieure à tout départ réel. Cette section est le résumé honnête : officiellement, un ingénieur GPU senior nommé Scott Gray apparaît sur une liste de départs de 2026 ; officieusement, cette personne est peut-être, ou peut-être pas, le « Bob » dont parle le tweet.
Pourquoi "2x plus lent" aurait de l'importance — et pourquoi ce n'est probablement pas si simple.
Les kernels déterminent les deux nombres qui décident de l'économie d'un modèle : les tokens par seconde et le coût par token. Si GPT-6.7 était livré avec des kernels de service deux fois moins efficaces que la version hypothétique « optimisée par Bob », le même matériel servirait la moitié des tokens et la même requête prendrait deux fois plus de temps — à un coût marginal environ deux fois plus élevé. Pour un développeur qui achemine du trafic de production, cela représente une pénalité de 2x en latence et de 2x en coût sur le modèle phare, le genre de chiffre qui change précisément un choix de modèle. C'est pourquoi cette rumeur a du mordant.
Maintenant, les raisons de s'en méfier :
• Le « 2x » n'a aucune base énoncée. C'est un chiffre dans une publication — une expérience de pensée, pas une mesure, et l'image liée n'en indique pas non plus.
Les kernels sont du code, et le code survit à ses auteurs. La pile de service que Bob (ou quiconque) a écrite pour les modèles précédents ne disparaît pas lorsqu'une personne s'en va ; le modèle suivant en hérite en grande partie.
L'organisation de l'infrastructure d'OpenAI est vaste, et la légende selon laquelle « une seule personne écrit tout » est presque certainement une simplification. Le risque de personne clé est réel, mais rarement binaire.
• Même une perte d'efficacité réelle ne changerait pas la capacité. Cela change le coût et la latence — c'est douloureux, mais un fournisseur peut en partie l'absorber ou ajuster ses prix en conséquence, et OpenAI a déjà lancé une fonctionnalité de vitesse (Ultrafast, jusqu'à 14 fois plus rapide sur le flagship actuel) visant précisément ce type de pression sur les coûts de service.
La version la plus forte de l'affirmation est la statistique de moins de cent. Si la personne qui a écrit les noyaux de service du produit phare n'est plus là, son remplacement n'est pas une simple embauche — c'est une montée en compétence sur plusieurs années. C'est un risque légitime pour l'économie de service d'OpenAI. Mais c'est un risque lié à l'équipe, pas un fait mesuré concernant un modèle qui n'a pas encore été déployé.
Ce que nous savons réellement de GPT-6.7
Le modèle dont parle la rumeur a un historique public plus long que ce que suggère le tweet, et la majeure partie en est récente :
• 31 oct. 2025 — Sam Altman a annoncé sur X que « GPT-6 » serait renommé « GPT-6-7 », largement interprété comme un clin d’œil à l’argot de la génération Alpha « 6-7 ». Que « GPT-6.7 » et « GPT-6-7 » soient strictement la même chose n’est pas officiel ; le tweet les traite comme interchangeables, tout comme la plupart des articles.
• Avril 2026 — Des rapports indiquaient que le pré-entraînement de GPT-6 était terminé, avec une sortie supposée autour du 14 avril. Cette date est passée sans lancement.
• Août 2026 — Des fuites affirmaient que le lancement avait été avancé à début août, OpenAI sautant les versions GPT-5.7 à GPT-5.9. Non vérifié.
• 1 août 2026 — OpenAI a annoncé « Astra » comme nom de sa prochaine famille de modèles, via un rapport de recherche affirmant que dix problèmes mathématiques ouverts ont été résolus. On ne sait pas encore si Astra sera commercialisée sous le nom GPT-6.
• 7 août 2026 — OpenAI a suspendu le développement d'Astra et a retardé le déploiement après qu'une revue interne de sécurité a signalé un risque de cybersécurité « critique » — le premier modèle à déclencher ce niveau. Altman a déclaré que la sortie générale « nécessite un peu plus de temps ».
• Marchés de prédiction — À la mi-août, les traders estimaient la probabilité d'une sortie de GPT-6 d'ici le 30 septembre à environ 62 %, et d'ici le 31 décembre à environ 90 %.
• Spécifications présumées — un contexte d'environ 2 millions de jetons, des performances supérieures d'environ 40 % à la génération actuelle, une mémoire personnalisée et une architecture multimodale native sous le nom de code « Symphony ». Tout cela n'est pas vérifié.
Donc le modèle derrière « 2x plus lent » n'a pas encore été publié, n'a pas de date de sortie confirmée, et fait l'objet d'un examen de sécurité en cours. Un chiffre de vitesse de service qui lui est associé est spéculatif à double titre — une fois pour la date, une fois pour la vitesse.

Le seul tableau d'affichage qui soit honnête aujourd'hui
Comme GPT-6.7 n'existe pas encore, un tableau de bord ne peut que comparer la rumeur à ce qui est réellement disponible :
GPT-6.7 (non publié) — statut : non publié ; sortie : automne 2026 (rumeur) ; contexte : ~2M de tokens (rumeur) ; vitesse : « 2x plus lent ? » non vérifié ; prix : n/a ; routable : pas encore.
• GPT-5.6 Sol (live) — statut : expédition ; contexte : 1,05 M de jetons, 128 K de sortie max ; vitesse : ~290 jetons/s observés sur les statistiques sur 7 jours d'OrcaRouter ; prix : 5,00 $ en entrée / 30,00 $ en sortie par million de jetons au niveau d'entrée standard ; routable : oui, au prix catalogue du fournisseur.
L'écart intéressant se trouve dans la colonne des prix. Le produit phare actuel d'OpenAI coûte 5 $ / 30 $ par million de jetons via OrcaRouter, et le taux de répercussion est le prix catalogue du fournisseur lui-même, sans aucune marge — donc quel que soit le prix auquel OpenAI fixe GPT-6.7, le chiffre de notre côté change le jour même de sa sortie, sans renégociation. C'est la partie utile du tableau de bord pour quiconque planifie en fonction du prochain modèle.

Comment traiter une fuite comme celle-ci
Le schéma est bien connu : un modèle non publié, un chiffre spectaculaire, une personne nommée. Chaque élément est plausible et rien n'est vérifié. La bonne réaction n'est ni d'ignorer la rumeur, ni de parier dessus — c'est de structurer la décision de manière à ne pas avoir à choisir.
C'est le cas pour le routage. Lorsque GPT-6.7 sortira, la façon d'évaluer une affirmation de lenteur 2x sans engager un chemin de production consiste à la placer derrière le même endpoint que vous utilisez déjà : une clé API, un basculement automatique vers GPT-5.6 Sol dès que le nouveau modèle sous-performe, et le trafic réel qui décide si la rumeur était vraie. L'affirmation devient alors une mesure plutôt qu'un tweet. Si la grille tarifaire d'OpenAI change avec la nouvelle version, le taux de répercussion est mis à jour le jour même — OrcaRouter transmet les prix catalogue des fournisseurs sans marge, donc une baisse (ou hausse) de prix d'un fournisseur est appliquée ici immédiatement, sans renégociation.
Pendant ce temps, le produit phare actuel est ce qui est concret. GPT-5.6 Sol est en ligne sur OrcaRouter aujourd'hui à 5 $/30 $ par million de tokens, avec le contexte de 1,05 M de tokens et ~290 tok/s comme l'indique le classement. Le mode Ultrafast annoncé le 13 août — jusqu'à 14 fois plus rapide, environ 750 tokens par seconde sur l'infrastructure Cerebras — s'applique à ce modèle, pas à GPT-6.7, et cela rappelle qu'OpenAI peut attaquer les coûts de service aussi bien avec l'infrastructure qu'avec les kernels.

Ce que nous regardons maintenant
• Que le départ de Bob soit confirmé. OpenAI ne commente pas qui est Bob ; l'événement officiel le plus proche est le nom de Scott Gray sur la liste des départs de 2026. Si OpenAI ou Gray le confirme, le premier maillon de la chaîne devient un fait.
Savoir si le chiffre « 2x plus lent » aura un jour une base. Si GPT-6.7 sort et que des mesures de vitesse indépendantes apparaissent, le chiffre cesse d'être une rumeur — soit confirmé, soit retiré. En attendant, ce n'est qu'un chiffre dans une publication.
• Si la pause de sécurité d'Astra repousse la date. Les marchés de prédiction ont déjà déplacé GPT-6 hors d'août ; la désignation « critique » et les tests gouvernementaux qu'OpenAI dit vouloir sont tous deux des sources naturelles de délai supplémentaire.
• Que le benchmark du noyau re-trie. Si l'équipe de service d'OpenAI absorbe la perte — ou si la légende exagère la part d'une seule personne — toute la rumeur devient sans objet, et le premier signe sera la performance de service du prochain modèle par rapport à son prédécesseur.
Le constat honnête : « 2x plus lent » est une histoire convaincante et, pour l’instant, rien de plus. Le départ du sorcier du noyau est un vrai point de données avec une vraie trace écrite ; le chiffre de vitesse n’est qu’un chiffre dans un tweet. En attendant que GPT-6.7 sorte, la position défendable consiste à prévoir les deux issues — supposer que la rumeur pourrait être en partie vraie, et concevoir le routage de sorte qu’un modèle phare plus lent que prévu ne vous coûte rien à tester. C’est tout l’intérêt de router un modèle que vous n’avez jamais rencontré.
