
GPT-6.7と「Bob」問題:OpenAIの未発表フラッグシップは本当に2倍遅くなるのか?
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
8月15日、@Yuchenj_UWというアカウントによるXの投稿は、噂を一文に凝縮した。「GPUカーネルの王、ボブが会社を辞めた? GPT-6.7は2倍遅くなる…。」その疑問符には2つの主張が込められている——同社で最も秘密主義のエンジニアが退社したこと、そしてその退社により、未発表の旗艦モデルであるGPT-6.7(昨年10月にGPT-6-7と改名)のサービング速度が半減するということだ。どちらの主張も検証されていない。しかしこの投稿がなされたのは、同社の次期モデルがすでに「いつではなくもし」という問いに直面している時期だ。つまり、Astraというファミリー名は8月1日に登場し、安全性審査により8月7日に保留され、現在の旗艦モデルであるGPT-5.6 Sol(OrcaRouter上で稼働中)が、次世代が打ち負かすべき唯一の具体的な基準点である。本日時点で実際に分かっていることは以下の通りだ。
先に一つ言っておきます:OpenAIの外部でGPT-6.7を実行した人は誰もいません。トークンの提供速度に関するあらゆる主張は外挿に過ぎません——「2倍遅い」という数字も含めてです。以下では、検証済みの事実(名称変更、リリース時期、記録に残っている退任者)と、伝説(Bob、カーネル、そして数字)を区別します。噂に関する情報はすべてその旨が明記されています。
「ボブ」とは誰か、そしてなぜ一人のエンジニアが伝説となったのか。
「Bob」は、OpenAIの従業員が、同社が名前を公表したことのないエンジニアに対して使うニックネームである。2025年9月の報道—QbitAI、The Paper(澎湃新聞)、itbearなどが、いずれも元・現OpenAIスタッフの証言を引用して報じたところによると、推論に使われるCUDAカーネルを独力で書いている秘密主義の研究者がいるという。CUDAカーネルとは、トランスフォーマーの計算をトークンに変換する低レベルのGPUコードである。彼のアテンションカーネルはOpenAI内部で「Bobカーネル」と呼ばれ、数十万基のGPU上で1日に数兆回実行されているとされる。その精度もそれに見合うもので、バグがあればチェックポイントのロールバックと再トレーニングのサイクルを余儀なくされる。
伝説はアカウント間で一貫している。元従業員によれば、ボブは同僚たちが1週間格闘していたパフォーマンス問題を数分で修正したという。OpenAIの内部Slackには「ボブ・マジック」絵文字が存在する。同じ報道で引用された業界の推定では、高性能トレーニング用CUDAカーネルを書ける存命の人物は100人未満とされており、だからこそこの種の個人依存は「あれば便利」ではなく、真にリスクがあるものとして扱われているのだ。
Bobの正体について、OpenAIはこれまで一度も明言していない。同じ報道で繰り返し出てくる有力な仮説はスコット・グレイという人物だ。彼は物理学とコンピュータサイエンスを専攻した卒業生で、2016年にOpenAIに入社し、OpenAIの2017年のブログ投稿「Block-sparse GPU kernels」の第一著者を務めた。その後、GPT-4のテクニカルレポートとスケーリング則の論文の共著者にもなっている。論文数は51本、被引用数は8万以上。この憶測は状況証拠に基づくもので広く語られているが、確証ではなく推測にすぎない。
ボブは実際に去ったのですか?
そのツイートは主張ではなく質問だ。しかし、そこが指し示す退職には記録の裏付けがある。2026年8月15日付で発表された経営陣の交代をまとめた記事には、2026年にOpenAIを退社した少なくとも12人の上級幹部の中に、スコット・グレイの名前が挙がっている。彼は「長年のGPUシステムエンジニア」と評され、2016年に入社し、スパーストランスフォーマー、スケーリング則、GPT-3の背後にあるインフラ構築に貢献した。同じリストには、最高収益責任者のデニス・ドレッサー、元COOのブラッド・ライトキャップ、アプリケーションズCEOのフィジー・シモ、Sora責任者のビル・ピーブルズ、そして安全性、倫理、マーケティング、ハードウェアの各責任者も名を連ねている。これは公式の確認ではなく二次的な報道であり、グレイの退職日は記されていない。
より広い文脈を踏まえると、この噂はそれほど驚くべきものではない。同じ週の報道は、この人事の動きをIPO前の組織再編として位置づけている。共同創業者のグレッグ・ブロックマンは、予定されている上場を前に、業務執行権限を自らに集めつつあり、CNBCは8月13日に最高収益責任者(CRO)の退任を報じた。また、「ボブ」は1年前から採用ターゲットとして知られていた——2025年9月の報道によれば、Metaのマーク・ザッカーバーグは採用会議で「ボブとは誰か?」を常設議題にしていたという。この特定のスキルセットをめぐる人材獲得競争は現実のものであり、それがこのリークがもっともらしく読める理由の一端でもある。
それでも、主張の連鎖には検証されていない点が2つある。スコット・グレイがボブであることと、そのまとめ記事の記載がツイートが意味する退職と同じものであることだ。ツイートが実際の退職に先立つ噂を繰り返している可能性も十分にある。このセクションは正直な要約である:公式には、スコット・グレイという上級GPUエンジニアが2026年の退職リストに載っている。非公式には、その人物がツイートが意味するボブであるかどうかは分からない。
「2倍遅い」がなぜ重要になるのか——そして、おそらくそれほど単純ではない理由
カーネルは、モデルの経済性を決定する2つの数値、すなわち毎秒トークン数とトークンあたりコストを決める。もしGPT-6.7が、仮想的な「Bob-optimized」バージョンの半分しか効率的でないサービングカーネルで提供された場合、同じハードウェアでは半分のトークンしか処理できず、同じリクエストは約2倍の限界コストで2倍の時間がかかることになる。本番トラフィックをルーティングする開発者にとって、これはフラッグシップモデルにおける2倍のレイテンシと2倍のコスト増を意味し、まさにモデル選択を変えるような数値だ。だからこそ、その噂には信憑性がある。
さて、それを信頼しない理由は以下の通りだ:
• 「2x」には明示された根拠がない。それは投稿内の数字であり、思考実験であって測定値ではない。また、リンクされた画像にもそのような根拠は含まれていない。
• カーネルはコードであり、コードは作者よりも長生きする。ボブ(または誰か)が以前のモデル用に書いたサービングスタックは、人が去っても消えない。次のモデルはその大部分を引き継ぐ。
• OpenAIのインフラ組織は大規模であり、「一人がすべてを書いている」という伝説はほぼ間違いなく単純化しすぎである。キーパーソンリスクは現実のものだが、それが全か無かで表せるほど単純であることは稀だ。
• 実際の効率低下であっても、能力は変わりません。それはコストとレイテンシーを変えます。痛みは伴いますが、ベンダーはその一部を吸収するか、価格に織り込むことができます。そしてOpenAIは、まさにこの種のサービス提供コストの圧力に対応するため、速度機能(Ultrafast、現在の最上位モデルで最大14倍高速)をすでにリリースしています。
この主張の最も強い形は「100人未満」という統計だ。主力モデルのサービングカーネルを書いた人物が去った場合、後任は単なる人員補充では済まない——それは複数年にわたる習熟期間を要する。これはOpenAIのサービング経済にとって正当なリスクである。しかしそれはチームに関するリスクであり、まだ出荷されていないモデルについて測定された事実ではない。
GPT-6.7について実際に分かっていること
噂の対象となっているモデルには、ツイートが示唆するよりも長い公開記録があり、そのほとんどは最近のものだ:
• 2025年10月31日 — サム・アルトマンはX上で「GPT-6」を「GPT-6-7」に改名すると発表した。これはGen-Alphaのスラング「6-7」への言及と広く解釈されている。「GPT-6.7」と「GPT-6-7」が厳密に同じものかどうかは公式には確認されておらず、ツイートでは両者は互換的に扱われており、ほとんどの報道も同様である。
• 2026年4月 — GPT-6の事前学習が完了したとの報道があり、4月14日頃のリリースが噂されていた。しかし、その日が過ぎても発表はなかった。
• 2026年8月 — リーク情報によると、発売は8月上旬に前倒しされ、OpenAIはGPT-5.7からGPT-5.9をスキップするとのこと。未確認。
• 2026年8月1日 — OpenAIは、次世代モデルファミリーの名称として「Astra」を発表した。未解決の数学問題10問を解いたとする研究報告書を通じての発表である。AstraがGPT-6の名称で提供されるかどうかは確認されていない。
• 2026年8月7日 — OpenAIは、内部の安全性審査で「重大な」サイバーセキュリティリスクが指摘された後、Astraの開発を一時停止し、展開を延期した。これはその深刻度区分に初めて該当したモデルとなった。アルトマン氏は、広範なリリースには「もう少し時間がかかる」と述べた。
• 予測市場 — 8月中旬時点で、トレーダーは9月30日までのGPT-6リリースの確率を約62%、12月31日までの確率を約90%と見積もっている。
• 噂されるスペック — 約200万トークンのコンテキスト、現行世代より約40%高いパフォーマンス、パーソナライズされたメモリ、コードネーム「Symphony」によるネイティブなマルチモーダルアーキテクチャ。すべて未検証。
「「2x slower」の背後にあるモデルはまだリリースされておらず、確定したリリース日もなく、進行中の安全性審査の対象となっています。そのモデルに付随する推論速度の数値は、日付についても速度についても、二重に推測に過ぎません。」

今日、正直なスコアボードはこれだけだ。
GPT-6.7はまだ存在しないため、スコアボードは噂と実際に公開されているものとを対比するしかできません:
• GPT-6.7(未リリース)— ステータス:未出荷;リリース:2026年秋と推測;コンテキスト:約2Mトークン(推測);速度:「2倍遅い?」未検証;価格:なし;ルーティング:未対応。
• GPT-5.6 Sol (live) — ステータス: 出荷中; コンテキスト: 1.05M トークン、最大出力 128K; 速度: OrcaRouter の7日間統計で約290 tok/s を観測; 価格: 標準インプット層で100万トークンあたり $5.00 入力 / $30.00 出力; ルーティング: 可能、プロバイダー定価に準拠。
興味深い違いは価格の列です。OpenAIの現在のフラッグシップモデルは、OrcaRouter経由で100万トークンあたり5ドル/30ドルです。パススルー率はベンダー自身のリスト価格そのままで、マークアップはゼロです。つまり、OpenAIがGPT-6.7をどの価格に設定しようとも、当社側の数字はリリース当日に同額で変動し、再交渉は必要ありません。次のモデルに備えて計画を立てる人にとって、これがスコアボードの有用な部分です。

このような漏れの対処法
このパターンは見覚えのあるものだ。未発表のモデル、劇的な数字、名前のある人物。それぞれの要素はもっともらしいが、どれも裏付けはない。正しい対応は、噂を無視することでも、それに賭けることでもない。そうではなく、選択を強いられないように意思決定を構築することだ。
それがルーティングの場合です。GPT-6.7 が出荷されたとき、2倍遅いという主張を本番パスに賭けずに評価する方法は、それを既に使っているエンドポイントの背後に置くことです。つまり、1つのAPIキー、新しいモデルが性能を下回った瞬間に自動でGPT-5.6 Solへフェイルオーバー、そして実際のトラフィックが噂が本当かどうかを判断します。そうすれば、主張はツイートではなく測定結果になります。OpenAIの価格表が新リリースで変われば、パススルー率は同じ日に更新されます。OrcaRouterはプロバイダーのリスト価格をゼロマークアップでそのまま通すので、ベンダーの値下げ(または値上げ)は再交渉なしで即座にここで反映されます。
一方、現在のフラッグシップこそが具体的な実体です。GPT-5.6 Solは本日、OrcaRouter上で1.05Mトークンのコンテキストと、スコアボードが示す毎秒約290トークンを備えて稼働しており、価格はトークン100万個あたり5ドル/30ドルです。8月13日に発表されたUltrafastモード(最大14倍高速で、Cerebrasインフラ上では毎秒約750トークン)はGPT-6.7ではなくこのモデルに適用され、OpenAIがカーネルだけでなくインフラストラクチャによっても推論コストに挑めることを示しています。

私たちが今見ているもの
• ボブの退社が確認されるかどうか。OpenAIはボブが誰なのかについてコメントしていない。記録上最も近い出来事は、2026年の退社リストにスコット・グレイの名前があることだ。OpenAIまたはグレイがそれを確認すれば、連鎖の最初のリンクが事実となる。
「2x slower」という数字が根拠を得る日が来るかどうか。GPT-6.7が出荷され、独立した速度測定結果が現れれば、その数字は噂ではなくなる——裏付けられるか、否定されるかのどちらかだ。それまでは、投稿の中の一つの数字に過ぎない。
アストラの安全停止が日程を延期させるかどうか。予測市場はすでにGPT-6を8月から先送りしており、「重大」指定と、OpenAIが望む政府のテストは、どちらもさらなる遅延の自然な要因である。
• カーネルベンチが再ソートされるかどうか。OpenAIのサービングチームがその損失を吸収するなら——あるいは伝説が一人の貢献度を誇張しているなら——その噂全体は無意味になり、最初の兆候は、次期モデルのサービング性能が前モデルと比較してどうなるかである。
正直な見方をすれば、「2倍遅い」というのは説得力のあるストーリーであり、今のところそれはそれだけにすぎない。カーネルウィザードの退社は、実際の証跡を伴う確かなデータポイントだ。一方、速度の数字はツイートの中の数字にすぎない。GPT-6.7が出荷されるまでは、どちらの結果にも備えるのが妥当な立場だ。つまり、噂が部分的に正しい可能性を想定し、期待よりも遅いフラッグシップをテストするのに何のコストもかからないようなルーティングを構築することだ。それが、まだ会ったこともないモデルをルーティングすることのすべての要点である。
