
Deep Think Mathematica:Googleから流出した数学モデルの内側、そしてその推論トレースに響く悲鳴
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
最も雄弁に物語っているのは、Deep Think Mathematica——今週、社内テストで姿を現したGoogleの数学モデル——が、どうやら大声で叫ぶように見えるという点だ。「Lyra」の名で投稿しているXアカウントが2026年9月16日、内部推論ログのスクリーンショットを公開したが、その痕跡は証明支援ツールというより、ホワイトボードの前でひらめきを得た人間のようだった。「待って」「なんてこった」。そして、方程式の簡略化に成功したあとには、こんな文字列が続いていた——数学の母なる神よ!!!!!!!!!!!!!!!!!!!!!!!! 反応は即座的で、愛情に満ちていた——Googleはどうやら、数学を心から愛するAIを作り上げたらしい。だが、その反応こそがこのリークから得られる最も役に立たないものだ。ここにあるものはGoogleによって何も確認されていない。モデルカードも、公開リストに載るモデルIDも、価格も、リリース日もない。存在するのは、ビルド文字列、2つの内部ラベル、トークン予算、一連のスクリーンショット、そして同じファミリーにおける最良の実運用上の比較対象、Gemini 3.1 Deep Think——今日実際に使えるモデルであり、このリークが最終的に評価される際の基準となるものだ。
では、以下のすべてを、それが本来あるとおりのものとして扱ってください:各項目に出典が付いた主張のリストで、それがどれだけの重みに耐えるかによって並べられています。
シグナルが実際に語っていること — そしてその上に潜むサイン
そのシグナル自体は@testingcatalogから来た。Googleに関しては堅実な実績を持つアカウントで、Geminiのデスクトップ向けコンピュータ操作計画を明らかにし、Googleが何も言う前にNano Banana 2の初期プレビューカードを内部名「GEMPIX2」で発見していた。9月16日の投稿には、質が大きく異なる2つの主張が含まれている。
2つ目の主張はそのモデルに関するものだ。新しい「Deep Think Mathematica」が社内テストで確認されており、昨年Googleが選ばれた機関に提供したDeep Think IMOモデルの精神的後継だと説明されている。
最初の主張こそが決定的な手がかりであり、理解する価値があるのはそれだ:「Geminiが背景を変えようとしているときは、何か大きなことが起ころうとしている」 それはモデルについての事実ではない。Googleのリリースの振り付けに関するコミュニティの経験則だ——Geminiアプリの外観が目に見えて刷新されることが、Googleのより大きな発表の数々に先立ってきたという観察である。このような経験則には確かな実績があり、予測力は皆無だ。UIの刷新はモデルではない。
両方の主張は検証されていない。どちらもリリースではなく、本稿はそれをリリースとして扱わない。
ビルド文字列をデコードしている。それがここで最も具体的な成果物だからだ。
現時点で出回っている中で最も有力な証拠は、流出したログに由来するとされるビルド識別子である:
• ビルドパス —models/deepthink-mathematica-tf-raw-thoughts、2026年9月16日にAI Sightがスクリーンショットと併せて報告。
その文字列は注意深く読む価値があり、多くの報道がそこで止まってしまう。そのうち3つの部分が情報を担っている。
• "deepthink" —は、モデルをメインラインの Gemini 系列ではなく Deep Think 系列に位置づけます。これは重要な点です。Deep Think は Google の出荷済み製品におけるモードであり、独立したファミリーではなく、複数の候補解を同時に実行する並列推論の経路です。
• 「tf」 — 文脈上は「Teamfood」の略で、そのビルドとともに報告された2つの社内ラベルのうち2番目のものです。Google の社内用語では、これはドッグフーディング段階の初期の呼称であり、顧客ではなく従業員が使用していることを意味します。
• 「raw-thoughts」——これが最も興味深い部分であり、あの叫びの鍵でもある。これはフィルタリングされていない思考の連鎖(chain-of-thought)構成、つまり礼儀に配慮した調整、スタイル上の制約、出力フィルタリングを一切施さずにモデルの推論をそのまま出力するものを指す。「raw thoughts」ビルドは製品ではない。それは、誰かが体裁を整える前に、モデルが何をしているのかをエンジニアが確認したいときに見るものだ。
2番目に報告されたラベルはUNSTABLE_EXPERIMENTALで、これはほぼ説明不要であり、「Teamfood」と同じ方向性を示している。つまり、初期段階、社内用、顧客向けではない。
さらに2つの数値は同じログに基づくもので、単一情報源しかないため、参考程度にとどめてください:
• コンテキストウィンドウ —約1,000,000トークンで、Googleが最先端のGeminiモデルで既に提供している100万トークンのウィンドウと一致します。
• 出力上限 — 65,536トークン。推論モデルにとって、これは回答に至るまでに非常に長い思考を要することを意味します。
これがこのリークの技術面のすべてだ。ビルドパス、2つのステージラベル、コンテキストウィンドウ、そして出力上限。何かがテストハーネス内に存在すると言うには十分だが、それがどんなスコアを出すかを言うには十分ではない。

なぜ声高に主張する推論トレースが見た目よりも弱い証拠になるのか
感嘆符こそがこのリークが広まった理由であり、そしてそれを扱う際に注意すべき理由でもある。
報告された説明は平凡で、ビルド文字列に正確に一致する。つまり、フィルターなしの推論設定を高い生成温度で実行し、礼儀と書式設定の層を取り除いたものだ。モデルを落ち着いて聞こえさせるチューニングを取り除いても、その魂が明らかになるわけではない——明らかになるのはそのサンプラーだ。感嘆符の多い出力は、興奮した続きを高温でサンプリングしたときに現れるものだ。感情的な読み方は設定が生み出した人為的な産物であり、モデルについての知見ではない。
より深い論点は、思考の連鎖とは何なのかということにある。推論のトレースとは、たまたま問題解決に役立つ生成されたテキストにすぎない。その記録を読んで、熱意や苛立ち、喜びといった内部状態を推し量るのは、電卓がきれいな整数をはじき出したときに喜んでいると推し量るのと同じカテゴリー錯誤である。これははっきりと言っておく価値がある。というのも、このリークに関する中国語の報道はジョーク(「等等」「我的天」)に寄りかかっており、一部の英語の報道はそのジョークを、モデルの性格についての記述へと硬化させてしまったからだ。
そうしたことのいずれも、そのトレースを無価値にはしない。生の思考をそのまま出力するビルドを公開することは、現実のエンジニアリング慣行に関する本物の証拠である——フィルタリングされていない推論をログに記録するのは、推論そのものをデバッグしているときだけであり、それは、難しい問題をどれだけうまく考え抜けるかを価値提案のすべてとするモデルに対して行うことまさにそれだ。そして、そのトレースが意図的なデバッグから生じたものか、意図しないログ記録から生じたものかは検証されていない。
正直な要約:感嘆の声は、生の推論構成が存在することを教えてくれる。数学的能力については何も教えてくれない。
Millennium Bench はミレニアム懸賞問題ではありません。
このリークに関するいくつかの記事は、9月16日に出回ったアグリゲーターの要約を含め、モデルが「Millennium Benchをターゲットにしている」と述べ、そこで終わっている。この名前は偶然の役割を果たしている。というのも、それははるかに有名で、はるかに重みのあるもの——クレイ数学研究所の7つのMillennium Prize Problems(それぞれ100万ドルの懸賞金がかけられ、今月OpenAIとナビエ・ストークス方程式の証明に関する、別の完全に未確認の主張の主題となっている)——と一語しか違わないからだ。そのスレッドからのある報告によると、Googleが88時間でその問題を「解決した」AIを構築したという。Clayは依然としてそれを未解決としてリストしている。
これらは別物であり、混同するとこのリークがかなり膨らみます。
ICLR 2026 論文で導入された MILLENNIUM-BENCH は、「演繹が破綻する場所:研究レベルの数学における推論失敗の診断」という、数理物理学、位相幾何学、測度論的確率論を含む9つの領域にまたがる専門家厳選の研究レベル問題からなるベンチマークです。これは、競技数学をはるかに超えて持続的な多段階推論を行うことを要求するように構築されました。
その論文の主要な結果こそが、このリークを読むうえで重要な部分である。5つのフロンティアモデルにわたり、各問題を100回実行したところ、最も強いモデルでも最大でpass@1が24%、pass@3が39%だった。モデルがどのように失敗するかについての論文の診断は、スコアよりも有用である:フレームワーク幻覚、これはモデルが適用不可能な理論をでっち上げ、その中で首尾一貫して推論するものであり、そして捏造された定理、これは存在しない結果を、でっち上げられた著者名や定理番号付きで引用するものである。
その両方を併せて心に留めておいてください。最高のモデルでも問題の4分の1程度で頭打ちになり、その特徴的な失敗が自信たっぷりの捏造であるようなベンチマークは、まさに漏えいしたスクリーンショットが何かを示すのに最も適さないベンチマークです。作業中に大声で叫ぶモデルとは、その出力を作者以外の誰かに採点してもらいたくなるモデルです。
Googleがこのラインで実際に投入してきたもの
そのリークは、公表済みの記録と照らし合わせてこそ読み解ける。なぜなら、Googleの数学をめぐる物語は文書化された積み重ねであり、リークされた名称はその信憑性を借りているからだ。
• 2025年7月 —Gemini Deep Thinkの高度なバージョンが、国際数学オリンピックで金メダル水準に到達し、6問中5問を解いて42点中35点を獲得した。採点は、生徒に適用されるのと同じ基準の下でIMOの関係者によって行われた。Demis Hassabis氏は、形式的な構文への変換なしに、自然言語でエンドツーエンドに動作したと述べた。
• 2025年8月1日 — GoogleはGemini 2.5 Deep Thinkを一般公開したが、ゴールドモデルではなかった。公開されたバージョンについてGoogleは、より高速で最適化された派生版だと説明しており、Googleの内部評価によれば2025年のIMOベンチマークでブロンズレベルの性能に達した。これは最上位のコンシューマー向けティアに限定されていた。同時にGoogleは、完全なゴールドモデルを厳選された数学者と研究者のグループ——リークされたシグナルが言及している「選ばれた機関」——に提供した。
• 2025年12月 — Gemini 3 Deep Thinkは、世代をまたぐ大きな飛躍を遂げ、Googleが報告したところによると、コード実行ありでARC-AGI-2の45.1%、ツールなしでHumanity's Last Examの41.0%を記録した。
• さて — Gemini 3.1 Deep Think、Gemini 3.1 Proを基盤とし、最上位の消費者向けサブスクリプション階層と招待制のAPIプログラムを通じて販売されている。Google自身が公表した数値はベンダー報告によるもので、独立して再現されたものではないが、ARC-AGI-2で84.6%、Humanity's Last Examはツールなしで48.4%、検索とコード併用で53.4%、IMO 2025で81.5%、Codeforces Eloは3455としている。
関連する2つの取り組みも重要です。Aletheiaは、Gemini Deep Think上に構築された数学研究エージェントで、第三者によってIMO-ProofBench Advancedで約95.1%と報告されている。注目すべきはその数値よりも、解を捏造するのではなく「解なし」と言うように設計されている点である。2026年2月のFirstProofチャレンジでは10問中6問を解き、残りは辞退した。また、Gemini 3.1 Pro上で動作するAI Co-Mathematicianのセットアップは、FrontierMath Tier 4の性能を19%から47.9%に引き上げたと報告されている。

その最後の数字は、少し立ち止まって考える価値がある。なぜなら、それはこのリークを報じられた通りの形で読むことに対する、最も強い反論になるからだ。研究レベルの数学における19%から47.9%への跳躍は、新しいチェックポイントではなく、汎用Geminiモデルを包むスキャフォールドによって達成された。これは、Googleの数学性能における最近の最大の向上が、その下にある専門モデルからではなく、モデルを囲むハーネスからもたらされたことを示唆している。だからといって、Mathematicaがスキャフォールドだという意味ではない。「これは新しい専用の数学モデルだ」という主張の立証責任は、報道が想定していたよりも高いという意味である。
そのすべての上にもう一つの文脈が横たわっている。DeepMindは2026年8月に組織を再編し、デミス・ハサビスは会長職に移った。再編中の研究所内部からのリークは、安定した研究所からのリークよりも信頼できるわけではなく、報道はこのタイミングを関連するものとして扱ってこなかった。実は関連するのかもしれない。
モデルか、それともスキャフォールドか?このリークが決着させない問い
報道では、Mathematica がそもそも新しいモデルなのかどうかをめぐって、現在も活発な議論がある。一方の陣営は、ビルド文字列の「deepthink」という接頭辞を指して、それを別個のチェックポイントと解釈している。もう一方の陣営――私たち自身の以前の Deep Think V3 の噂に関する記事が属していた陣営――は、Google の専門数学の成果は汎用 Gemini モデルを包み込むエージェント・スキャフォールドから得られており、その数字が本物であるために別個の数学モデルが存在する必要はない、と主張している。
ビルド文字列は最初の陣営にわずかに有利な根拠となる。models/deepthink-mathematica-tf-raw-thoughts はモデルを名指ししており、「raw-thoughts」はハーネス層ではなくモデルの構成を表している。スキャフォールドなら、デバッグのために推論をろ過されていない状態にする必要はない。であるモデルなら、そうするだろう。それは本物のシグナルだ。
それは決定的なものではない。ハーネスにも設定があり、内部パス文字列はスキーマによってではなく、ログを設定した誰かによって書かれる。それを決着させるのは、誰も持っていないもの、すなわちモデルカードか、エンドポイントか、その答えに利害関係のない人物が実行したベンチマークだ。
今日実際に電話できる相手
これらはどれも、今週本番環境に投入できるものを変えるものではない。そして、このギャップについては率直に言う価値がある。Deep Think mathematicaはどのAPIにも搭載されていない。Gemini 3.1 Deep Thinkもトークン単位で販売されているわけではない — それは最上位のコンシューマー向けサブスクリプション階層の背後にあり、階層に応じて月額$99.99から$199.99の間で記載され、加えて招待制のAPIプログラムがある。それについて公開された100万トークンあたりの価格は存在しない。
それが基盤としていると報じられているベースモデルは別の話だ。Gemini 3.1 Proの価格は、20万トークン未満のコンテキストで100万入力トークンあたり2.00ドル、キャッシュ済みで0.20ドル、100万出力トークンあたり12.00ドルで、それを超えると4.00 / 0.40 / 18.00ドルに上がる — Google自身が公表した料金である。
その価格の詳細こそ、実用上の判断がかかっている点です。というのも、推論モード間のコスト差は小さくありません。ARC-AGI-2では、Deep Thinkは約85%で1タスクあたり約$13.62、Gemini 3.1 Proは77%で1タスクあたり約$0.96と報告されています。8ポイントのために約14倍支払っていることになります。これは難しい研究課題にとっては正当化できるトレードオフであり、主に通常の作業を処理する本番経路にとっては正当化できないものです。そして正しい答えは通常、前もってサブスクリプションを決めることではなく、両方に同じ場所からたどり着けるようにしたい、というものです。

それは1つのキーでルーティングする場合の話です。現在呼び出し可能なGeminiモデル — Gemini 3.1 Pro Preview、Gemini 3.8 Flashは100万入力トークンあたり$0.750、キャッシュ読み取りは$0.075、そしてファミリーの残りのモデルたち — は15社のプロバイダーにまたがる198モデルというOrcaRouterのカタログ上に並んでおり、1つのOpenAI互換エンドポイントの背後にあります。プロバイダーの定価に上乗せはないため、Googleの価格変更は再契約を待つことなく、その日のうちに当社側へ反映されます。自動フェイルオーバーにより、実績のないモデルやプレビューモデルを、単独で本番パスを担わせることなくルートに置けます。これはまさに漏洩したモデルにふさわしい姿勢です。試してみる、フォールバックは確保しておく、それ以外は何も変えない。ルーティングDSLは複数のモデルを1回の呼び出しに合成し、モデルフュージョンはパネルを実行して回答を統合します。どちらも、問いが難しく、正直なところ複数のモデルの意見が欲しいという状況で役立ちます。
境界について明確にしておくと、OrcaRouterはDeep Think mathematicaをホストしておらず、Gemini 3.1 Deep Thinkもホストしていません。これらは当社のカタログにはなく、ここでそうでないと示唆するものは何もありません。カタログに載っているのは、それらの下にあるGeminiレイヤーです。
これを、リークからニュースへ変えるものは何か。
物語をどれほど動かすか、おおよその順に並べた4つのこと。
• モデルカード。GoogleのDeep Thinkのリリースには、公開された評価が添えられてきた。明記された条件下で実行されたMILLENNIUM-BENCHやIMO-ProofBench Advancedの数値を載せたカードがあれば、これはビルド文字列からモデルへと変わるだろう。
• エンドポイント。 最も明確なシグナルは、MathematicaがGemini APIやGoogleのモデル一覧に、どのような名称であれ登場することでしょう。それが実現するまでは、誰も呼び出すことができず、比較できる価格も存在しません。
• 研究機関ルート。2025年におけるGoogleのパターンは、最強の数学モデルをまず選ばれた数学者たちに提供し、一般向けにはより高速なバリアントを後から提供するというものだった。研究者向けの静かな展開はその前例に合致し、製品発表より前に明るみに出る可能性が高い。
• サードパーティによる実行。 問題のベンチマークは、入手可能な最良のモデルでもpass@1が24%付近で頭打ちになり、その特徴的な失敗モードが自信に満ちた捏造であることを踏まえると、独立した評価だけが信頼に足る証拠となる。本稿で数値を伴うあらゆる数字は、Google自身のもの、第三者が報告したもの、あるいは未検証であると明示的に注記されたもののいずれかであり、それらのいずれも、DeepMind外部の誰かが実行したモデルから得られたものではない。
今やる価値がある唯一のことは、待つことではない。Googleのmath modeとそのベースモデルの差は、コストで14倍、精度で8ポイントに達しており、そのトレードオフはすでに稼働している。今日にでも、1つのキーでGemini 3.1 Pro Previewを使い、その背後にフォールバックを置けば実現できる。Mathematicaにモデルカードが登場するころには、難しい問題をどうルーティングするかをすでに決めておきたくなるはずだ——そしてその答えは、リークされたモデルが結局何だったかには左右されない。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
