Une carte de titre hero pour GPT-6.7, le prochain produit phare encore non dévoilé d'OpenAI, intitulée « GPT-6.7 : la question du noyau », représentant une icône plate de puce GPU avec un point d'interrogation en gras au-dessus, un cadran de jauge avec une aiguille rouge sur une étiquette « 2x », de petites icônes linéaires de compteur de vitesse, clé et document divulgué, et une bande inférieure indiquant « GPT-6.7 · NON PUBLIÉ · CE QUE NOUS SAVONS JUSQU'ICI », avec le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

GPT-6.7 et la question « Bob » : le produit phare non publié d'OpenAI tournera-t-il vraiment 2x plus lentement ?

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 15 août, un post X du compte @Yuchenj_UW a résumé une rumeur en une phrase : « Bob, le roi des kernels GPU, a quitté l'entreprise ? GPT-6.7 tournera 2x plus lentement… ». Deux affirmations reposent sur ce point d'interrogation — que l'ingénieur le plus secret de l'entreprise est parti, et que son départ réduit de moitié la vitesse de service de GPT-6.7, le fleuron non encore publié de l'entreprise (renommé GPT-6-7 en octobre dernier). Aucune de ces affirmations n'est vérifiée. Mais ce post arrive à un moment où le prochain modèle de l'entreprise est déjà une question de quand, pas de si : le nom de la famille Astra a été dévoilé le 1er août, un examen de sécurité l'a suspendu le 7 août, et GPT-5.6 Sol — le fleuron actuel, en service sur OrcaRouter — est le seul point de référence concret que la prochaine génération doit surpasser. Voici ce que l'on peut réellement savoir à ce jour.

Une chose d'emblée : personne en dehors d'OpenAI n'a exécuté GPT-6.7. Toute affirmation sur sa vitesse de service des tokens est une extrapolation — y compris le chiffre « 2x plus lent ». Ce qui suit sépare les faits vérifiés (le renommage, le calendrier de sortie, les départs qui sont documentés) de la légende (Bob, le noyau et le nombre). Tout le matériel de rumeur est étiqueté comme tel.

Qui est « Bob », et pourquoi un seul ingénieur est devenu une légende

« Bob » est le surnom que les employés d'OpenAI donnent à un ingénieur dont l'entreprise n'a jamais confirmé le nom. Des articles de presse datant de septembre 2025 — notamment de QbitAI, The Paper et itbear, tous citant d'anciens et d'actuels employés d'OpenAI — décrivent un chercheur discret qui écrit à lui seul les kernels CUDA utilisés pour l'inférence, ce code GPU de bas niveau qui transforme les mathématiques des transformers en tokens. Son kernel d'attention, appelé « Bob kernel » en interne chez OpenAI, serait exécuté des milliers de milliards de fois par jour sur des centaines de milliers de GPU, avec une précision à la hauteur : un bug forcerait un retour en arrière des checkpoints et un cycle de réentraînement.

La légende est constante d'un témoignage à l'autre. D'anciens employés affirment que Bob a résolu en quelques minutes un problème de performance sur lequel des collègues avaient bataillé pendant une semaine. Le Slack interne d'OpenAI dispose d'un emoji « Bob magic ». Les estimations du secteur citées dans le même reportage évaluent à moins d'une centaine le nombre de personnes vivantes capables d'écrire des kernels CUDA d'entraînement haute performance — c'est pourquoi une dépendance de ce type envers une seule personne est considérée comme un risque réel plutôt qu'un simple plus.

Sur l'identité, OpenAI n'a jamais dit qui est Bob. L'hypothèse principale, reprise dans la même couverture de presse, est Scott Gray — un diplômé en physique et en informatique qui a rejoint OpenAI en 2016, a été l'auteur principal de l'article de blog d'OpenAI de 2017 « Block-sparse GPU kernels », puis a co-écrit le rapport technique de GPT-4 et l'article sur les lois d'échelle, avec 51 publications et plus de 80 000 citations. La correspondance est circonstancielle mais largement reprise ; c'est une inférence, pas une confirmation.

Est-ce que Bob est vraiment parti ?

Le tweet est une question, pas une affirmation. Mais le départ auquel il fait allusion a une trace écrite. Un récapitulatif des départs de dirigeants publié le 15 août 2026 place Scott Gray — décrit comme un « ingénieur systèmes GPU de longue date » qui a rejoint OpenAI en 2016 et a contribué à construire l'infrastructure derrière les transformers épars, les lois de mise à l'échelle et GPT-3 — parmi au moins douze cadres supérieurs ayant quitté OpenAI en 2026. La même liste nomme la directrice du chiffre d'affaires Denise Dresser, l'ancien directeur des opérations Brad Lightcap, le PDG des applications Fidji Simo, le directeur de Sora Bill Peebles, et les responsables de la sécurité, de l'éthique, du marketing et du matériel. Ce n'est qu'un compte rendu secondaire, pas une confirmation officielle, et il ne donne aucune date de départ pour Gray.

Le contexte plus large rend la rumeur moins surprenante. Les reportages de la même semaine présentent ce remaniement comme une réorganisation précédant l'introduction en Bourse : le cofondateur Greg Brockman concentre l'autorité opérationnelle entre ses mains avant une cotation publique prévue, et CNBC a rapporté le départ du CRO le 13 août. Et « Bob » est une cible de recrutement connue depuis un an — des reportages de septembre 2025 indiquaient que Mark Zuckerberg, de Meta, avait fait de « qui est Bob ? » un point permanent à l'ordre du jour des réunions de recrutement. La guerre des talents autour de cet ensemble de compétences spécifiques est bien réelle, ce qui explique en partie pourquoi la fuite semble plausible.

Néanmoins, la chaîne d’affirmations comporte deux maillons non vérifiés : que Scott Gray est bien Bob, et que la liste du décompte correspond au même départ que celui évoqué dans le tweet. Il est tout à fait possible que le tweet reprenne une rumeur antérieure à tout départ réel. Cette section est le résumé honnête : officiellement, un ingénieur GPU senior nommé Scott Gray apparaît sur une liste de départs de 2026 ; officieusement, cette personne est peut-être, ou peut-être pas, le « Bob » dont parle le tweet.

Pourquoi "2x plus lent" aurait de l'importance — et pourquoi ce n'est probablement pas si simple.

Les kernels déterminent les deux nombres qui décident de l'économie d'un modèle : les tokens par seconde et le coût par token. Si GPT-6.7 était livré avec des kernels de service deux fois moins efficaces que la version hypothétique « optimisée par Bob », le même matériel servirait la moitié des tokens et la même requête prendrait deux fois plus de temps — à un coût marginal environ deux fois plus élevé. Pour un développeur qui achemine du trafic de production, cela représente une pénalité de 2x en latence et de 2x en coût sur le modèle phare, le genre de chiffre qui change précisément un choix de modèle. C'est pourquoi cette rumeur a du mordant.

Maintenant, les raisons de s'en méfier :

• Le « 2x » n'a aucune base énoncée. C'est un chiffre dans une publication — une expérience de pensée, pas une mesure, et l'image liée n'en indique pas non plus.

Les kernels sont du code, et le code survit à ses auteurs. La pile de service que Bob (ou quiconque) a écrite pour les modèles précédents ne disparaît pas lorsqu'une personne s'en va ; le modèle suivant en hérite en grande partie.

L'organisation de l'infrastructure d'OpenAI est vaste, et la légende selon laquelle « une seule personne écrit tout » est presque certainement une simplification. Le risque de personne clé est réel, mais rarement binaire.

• Même une perte d'efficacité réelle ne changerait pas la capacité. Cela change le coût et la latence — c'est douloureux, mais un fournisseur peut en partie l'absorber ou ajuster ses prix en conséquence, et OpenAI a déjà lancé une fonctionnalité de vitesse (Ultrafast, jusqu'à 14 fois plus rapide sur le flagship actuel) visant précisément ce type de pression sur les coûts de service.

La version la plus forte de l'affirmation est la statistique de moins de cent. Si la personne qui a écrit les noyaux de service du produit phare n'est plus là, son remplacement n'est pas une simple embauche — c'est une montée en compétence sur plusieurs années. C'est un risque légitime pour l'économie de service d'OpenAI. Mais c'est un risque lié à l'équipe, pas un fait mesuré concernant un modèle qui n'a pas encore été déployé.

Ce que nous savons réellement de GPT-6.7

Le modèle dont parle la rumeur a un historique public plus long que ce que suggère le tweet, et la majeure partie en est récente :

• 31 oct. 2025 — Sam Altman a annoncé sur X que « GPT-6 » serait renommé « GPT-6-7 », largement interprété comme un clin d’œil à l’argot de la génération Alpha « 6-7 ». Que « GPT-6.7 » et « GPT-6-7 » soient strictement la même chose n’est pas officiel ; le tweet les traite comme interchangeables, tout comme la plupart des articles.

• Avril 2026 — Des rapports indiquaient que le pré-entraînement de GPT-6 était terminé, avec une sortie supposée autour du 14 avril. Cette date est passée sans lancement.

• Août 2026 — Des fuites affirmaient que le lancement avait été avancé à début août, OpenAI sautant les versions GPT-5.7 à GPT-5.9. Non vérifié.

• 1 août 2026 — OpenAI a annoncé « Astra » comme nom de sa prochaine famille de modèles, via un rapport de recherche affirmant que dix problèmes mathématiques ouverts ont été résolus. On ne sait pas encore si Astra sera commercialisée sous le nom GPT-6.

• 7 août 2026 — OpenAI a suspendu le développement d'Astra et a retardé le déploiement après qu'une revue interne de sécurité a signalé un risque de cybersécurité « critique » — le premier modèle à déclencher ce niveau. Altman a déclaré que la sortie générale « nécessite un peu plus de temps ».

• Marchés de prédiction — À la mi-août, les traders estimaient la probabilité d'une sortie de GPT-6 d'ici le 30 septembre à environ 62 %, et d'ici le 31 décembre à environ 90 %.

• Spécifications présumées — un contexte d'environ 2 millions de jetons, des performances supérieures d'environ 40 % à la génération actuelle, une mémoire personnalisée et une architecture multimodale native sous le nom de code « Symphony ». Tout cela n'est pas vérifié.

Donc le modèle derrière « 2x plus lent » n'a pas encore été publié, n'a pas de date de sortie confirmée, et fait l'objet d'un examen de sécurité en cours. Un chiffre de vitesse de service qui lui est associé est spéculatif à double titre — une fois pour la date, une fois pour la vitesse.

A timeline infographic titled 'GPT-6.7 — the trail so far' with five milestone cards: Oct 31 2025 (renamed GPT-6-7 by Altman), Apr 2026 (pre-training reported done), Aug 1 2026 (Astra family name announced), Aug 7 2026 (safety pause: critical cyber risk), Aug 15 2026 (Bob departure rumor circulates); footer reads 'Timeline per OpenAI announcements and press reports; model unreleased as of Aug 15 2026.' OrcaRouter logo in the bottom-right corner.

Le seul tableau d'affichage qui soit honnête aujourd'hui

Comme GPT-6.7 n'existe pas encore, un tableau de bord ne peut que comparer la rumeur à ce qui est réellement disponible :

GPT-6.7 (non publié) — statut : non publié ; sortie : automne 2026 (rumeur) ; contexte : ~2M de tokens (rumeur) ; vitesse : « 2x plus lent ? » non vérifié ; prix : n/a ; routable : pas encore.

• GPT-5.6 Sol (live) — statut : expédition ; contexte : 1,05 M de jetons, 128 K de sortie max ; vitesse : ~290 jetons/s observés sur les statistiques sur 7 jours d'OrcaRouter ; prix : 5,00 $ en entrée / 30,00 $ en sortie par million de jetons au niveau d'entrée standard ; routable : oui, au prix catalogue du fournisseur.

L'écart intéressant se trouve dans la colonne des prix. Le produit phare actuel d'OpenAI coûte 5 $ / 30 $ par million de jetons via OrcaRouter, et le taux de répercussion est le prix catalogue du fournisseur lui-même, sans aucune marge — donc quel que soit le prix auquel OpenAI fixe GPT-6.7, le chiffre de notre côté change le jour même de sa sortie, sans renégociation. C'est la partie utile du tableau de bord pour quiconque planifie en fonction du prochain modèle.

A two-column scoreboard titled 'GPT-6.7 vs GPT-5.6 Sol — the scoreboard'. Left column GPT-6.7 (unreleased): Status not shipped, Release rumored autumn 2026, Context ~2M (rumored), Speed 2x slower? (unverified), Price n/a, On OrcaRouter not yet. Right column GPT-5.6 Sol (live): Status shipping, Release live now, Context 1.05M tokens, Speed ~290 tok/s, Price $5.00/$30.00 per M, On OrcaRouter yes at list price. Footer: 'GPT-6.7 figures rumored/unaudited; GPT-5.6 Sol per OrcaRouter model page.' OrcaRouter logo in the bottom-right corner.

Comment traiter une fuite comme celle-ci

Le schéma est bien connu : un modèle non publié, un chiffre spectaculaire, une personne nommée. Chaque élément est plausible et rien n'est vérifié. La bonne réaction n'est ni d'ignorer la rumeur, ni de parier dessus — c'est de structurer la décision de manière à ne pas avoir à choisir.

C'est le cas pour le routage. Lorsque GPT-6.7 sortira, la façon d'évaluer une affirmation de lenteur 2x sans engager un chemin de production consiste à la placer derrière le même endpoint que vous utilisez déjà : une clé API, un basculement automatique vers GPT-5.6 Sol dès que le nouveau modèle sous-performe, et le trafic réel qui décide si la rumeur était vraie. L'affirmation devient alors une mesure plutôt qu'un tweet. Si la grille tarifaire d'OpenAI change avec la nouvelle version, le taux de répercussion est mis à jour le jour même — OrcaRouter transmet les prix catalogue des fournisseurs sans marge, donc une baisse (ou hausse) de prix d'un fournisseur est appliquée ici immédiatement, sans renégociation.

Pendant ce temps, le produit phare actuel est ce qui est concret. GPT-5.6 Sol est en ligne sur OrcaRouter aujourd'hui à 5 $/30 $ par million de tokens, avec le contexte de 1,05 M de tokens et ~290 tok/s comme l'indique le classement. Le mode Ultrafast annoncé le 13 août — jusqu'à 14 fois plus rapide, environ 750 tokens par seconde sur l'infrastructure Cerebras — s'applique à ce modèle, pas à GPT-6.7, et cela rappelle qu'OpenAI peut attaquer les coûts de service aussi bien avec l'infrastructure qu'avec les kernels.

Screen capture of the OrcaRouter model page for GPT-5.6 Sol, showing the OpenAI flagship's pricing ($5.00 in / $30.00 out per million tokens), a 1.05M-token context window, 128K max output, Vision/Tools/JSON/Reasoning capability tags, and a p50 time-to-first-token of 1.87 seconds.

Ce que nous regardons maintenant

• Que le départ de Bob soit confirmé. OpenAI ne commente pas qui est Bob ; l'événement officiel le plus proche est le nom de Scott Gray sur la liste des départs de 2026. Si OpenAI ou Gray le confirme, le premier maillon de la chaîne devient un fait.

Savoir si le chiffre « 2x plus lent » aura un jour une base. Si GPT-6.7 sort et que des mesures de vitesse indépendantes apparaissent, le chiffre cesse d'être une rumeur — soit confirmé, soit retiré. En attendant, ce n'est qu'un chiffre dans une publication.

• Si la pause de sécurité d'Astra repousse la date. Les marchés de prédiction ont déjà déplacé GPT-6 hors d'août ; la désignation « critique » et les tests gouvernementaux qu'OpenAI dit vouloir sont tous deux des sources naturelles de délai supplémentaire.

• Que le benchmark du noyau re-trie. Si l'équipe de service d'OpenAI absorbe la perte — ou si la légende exagère la part d'une seule personne — toute la rumeur devient sans objet, et le premier signe sera la performance de service du prochain modèle par rapport à son prédécesseur.

Le constat honnête : « 2x plus lent » est une histoire convaincante et, pour l’instant, rien de plus. Le départ du sorcier du noyau est un vrai point de données avec une vraie trace écrite ; le chiffre de vitesse n’est qu’un chiffre dans un tweet. En attendant que GPT-6.7 sorte, la position défendable consiste à prévoir les deux issues — supposer que la rumeur pourrait être en partie vraie, et concevoir le routage de sorte qu’un modèle phare plus lent que prévu ne vous coûte rien à tester. C’est tout l’intérêt de router un modèle que vous n’avez jamais rencontré.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube