ヒーロータイトルカードには「OpenAIの722件の数学原稿」と表示され、サブ見出しには「それを支えるモデルには名前も価格もAPIもない」、琥珀色のバッジには「未リリースモデル — 結果のみ」と記され、さらに3枚のカードがある:「リリースされたもの:722件の原稿、372ファミリー」、「リリースされなかったもの:モデルカードなし、識別子なし、日付なし」、「OpenAIの説明:モデルのリリースに向けて取り組み中」。
Guides & Insights

OpenAIの722件の数学原稿:その背後にあるモデルには名前も価格もAPIもない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年10月6日 21:47 UTCに、openai/mathというリポジトリが、説明も初回コミットもない状態でGitHubに現れた。14分後、OpenAIはそれをXに投稿し、コンパニオンページ「数学におけるAIの進歩の共有」を公開した。この2つを合わせると、前例のない出来事が浮かび上がる。722本の数学論文が372のファミリーに分類され、OpenAIが名前も公表しておらず、価格も設定しておらず、どのAPIからも呼び出せない社内のフロンティアモデルによって生成されたのだ。そのモデルより下位にある、今日実際に利用できるモデルは、GPT-6 Astra(100万トークンあたり$10 / $50)とGPT-6.1 Sol($2 / $10)であり、これらの論文を書いたのはどちらでもない。OpenAIは、書いたモデルはまだ訓練中であり、「責任をもってリリースすること」に取り組んでいると述べている。これが、これまでに検証されたこと、検証されていないこと、そして読者がここから持ち帰るべき一つの問いである。

このリリースが何ではないかから始めよう。これはモデルのローンチではない。モデルカードも識別子もコンテキストウィンドウもベンチマーク表も日付もない。論文でもない。ここにあるものは何も査読を受けておらず、OpenAIは、Lean形式化なしの結果には「問題があり得る」とはっきり述べている。そして、これは漏洩でもない——この記事が「今のところわかっていること」という枠組みで書かれている理由は、資料が秘密だからではなく、主題そのものであるモデルが未公開だからだ。以下の残りはすべて、リポジトリ、OpenAI自身の投稿、そしてOpenAIが意見を求めたと述べているアドバイザリーグループに照らして確認できる。

実際に10月6日に何が登場したのか

このリポジトリは公開されており、Apache-2.0ライセンスで、Leanで書かれている。そのREADMEには、カタログが「722の原稿を372のファミリーに編成して収録している」と記されており、ここでファミリーとは、主要結果を、付随する議論、帰結、または別証明とともにまとめたものである。原稿マップは監査できるほど詳細で、それぞれに主要結果を1つ持つ372のファミリーが、それらを構成する論文と、利用可能な場合はLean形式化へのリンクとともに列挙されている。

OpenAIの投稿には、その出所に関する数値が付け加えられているが、これらはOpenAI自身によるもので、独立した監査は受けていない:

• 出題された問題 — 約4,000、そこから公開されたファミリーが選ばれた

• 結果あたりのコンピュート — 平均して、ChatGPT Pro の約3時間の思考に相当

• 推論サマリー — 10件公開、πの無理性指数、対称および一般マーラー予想、標数2におけるカプランスキーの直接有限性予想、希釈スピングラスに対するメザール–パリジ公式、三次元相対論的ブラソフ–マクスウェル系を含むファミリーを網羅

• 改訂ポリシー — 訂正のために新しいバージョンが公開され、以前のバージョンも引き続きアクセス可能です

主題は全体像にまたがる:数論、代数幾何と複素幾何、組合せ論、理論計算機科学、作用素環、確率論と数理物理学。ファミリーのタイトルのいくつかは、一見すると非常に大きな主張である — ライザーの被覆予想への反例、整数乗算がn log nを下回ること、指数が高々 9/4 の行列乗算、マーラーの予想、バウム–コンヌとカディソン–カプランスキーへの反例。与えられたものが成り立つかどうかは、このリリースがあなたに代わって決着をつけない、まさにその問いです。

Screenshot of the GitHub repository page for openai/math, created October 6, 2026, showing the README statement that the repository contains mathematical manuscripts and supporting proof artifacts produced by an internal OpenAI model, the description of 722 manuscripts organized into 372 families, and the list of ten released reasoning summaries.

そのモデルは名前もなく未公開だが、OpenAIは登場すると述べている

READMEは著者について明確に述べている。「OpenAIの内部モデルによって作成された数学的原稿と、それを裏付ける証明成果物」であり、その大半は「未公開のOpenAI内部モデルを使用して」得られたものだ。名前もコードネームも規模もない。他の報道で出回っている名前はOpenAIによって確認されておらず、私たちは名前を提示するつもりはない。

日付を特定できるのは、それを取り巻くタイムラインだ。2026年8月28日、OpenAIの数学諮問グループに関する同社のページによれば、同社は「新しい内部モデルの訓練を開始した」。そのモデルはその後、ナビエ–ストークス・ミレニアム懸賞問題を解決し、OpenAI自身の集計によれば、100件を超える長年の未解決問題も解決した。ナビエ–ストークスに関する結果は2026年9月8日に別途発表され、その際OpenAIは、その背後にあるモデルを「GPT-6 Astraよりも大幅に高性能」と表現し、訓練はなお進行中だと述べた。今週の論文集に含まれる原稿のうち2本は標準的な手順を破っており、これは注目に値する。というのも、今回の公開が単一の均一なパイプラインではないことを意味するからだ。リーマン・ゼータ関数の零点のない領域に関する研究と、CMアーベル多様体に対するホッジ予想の証明は、異なる方法で扱われており、OpenAIによれば、ゼータに関する文書は読みやすさのために人間が編集したという。

次に、これを踏まえて計画している人にとって重要な文があります。OpenAIは「この結果を生み出したモデルを責任を持ってリリースするために取り組んでいる」と書いています。それは意図の表明であり、日付ではありません。それが提供開始されるまで、開発者が呼び出せるOpenAIのモデルは、すでに価格表に載っているものだけです。

ここで「検証」が意味するもの — そしてそれがどこで止まるのか

これは、そのリリースに関するほとんどの報道が一言に圧縮してしまう部分であり、個々の論文にどれほどの重みを与えるかを決める部分でもある。

OpenAIは「このコレクションには、検証のさまざまな段階にある結果が含まれている」と明言している。このバンドルの中で最も強力な証拠形態はLeanによる形式化であり、これによって人間ではなくコンピュータが証明を検証できる。リポジトリ自身の形式化マニフェスト — 主要結果が形式化された論文のカタログ — には162件が掲載されている。したがって、722本の論文のおよそ5本に1本は、公開ツリー内で機械検証可能な証明に裏付けられている。OpenAIは「入手し次第、さらに追加していく」と述べている。

残りの大多数はその意味では検証されておらず、OpenAIもコレクション全体についてそうでないふりはしていない。「形式化されていない結果の一部には問題がある可能性があります。そのような問題は迅速に修正するよう努めます。」これがオープンなリリースではなく管理されたリリースであることを裏付ける構造的な詳細が2つある — リポジトリではIssueが無効化されており、プルリクエストはコラボレーターに限定されている。その場で証明に異議を唱える公開の手段はない。

正直に読み解くと、見出しの数字が示唆するよりも範囲は狭い:

• 機械検証済み — 公開Leanツリー内で主結果が形式化された162本の論文

• 機械検証なし — 残りはOpenAI自身がエラーを含む可能性があると指摘しているもの

• 人間の責任 — 誰も名指しされていない;OpenAI自身の枠組みでは、生成されたものの大半の背後にある論拠を誰も理解していない

• 独立した評価 — 公表されたものはない。どの結果が含めるに値するほど「重要」かという選別はOpenAIが行った

そうした事柄はどれも、その作業が誤っていることを意味するものではない。それは、今のところ「OpenAIが722件の証明を公開した」と「722件の証明が検証された」は別の主張であり、今日当てはまるのは最初のものだけだ、ということを意味している。

Three-column infographic titled "How much of the 722 is actually checked", contrasting "Machine-checked: 162 manuscripts, formalized main result, in the public Lean tree", "Not machine-checked: the remaining majority, no Lean formalization, OpenAI says could contain issues", and "Human or independent review: none named, none published, selection made by OpenAI", with a footer reading "Figures per OpenAI's repository and post, October 6 2026".

諮問グループは条件を付け、それは記録に残っている。

OpenAIの投稿によると、同社はプリンストン高等研究所の数学・人工知能に関する独立諮問グループに意見を求め、「その助言と公開提言」を参考にしたという。これらの提言は2026年9月29日に公開され、同グループが数学界から600件を超える回答を受け取った後にまとめられたもので、同グループは単なるお墨付きを与える存在ではないため、直接読む価値がある。

同じ文書は冒頭で、この団体がその慣行をまったく支持していないと述べている。「一部のフロンティアAIラボは、より広範な科学コミュニティにとって依然としてアクセスできない独自モデル上で高度な数学的問題をテストしている……私たちはこの慣行を支持しておらず、中止するよう求めている」。この団体はまた、独立して運営されており、メンバーは無報酬で、OpenAIに対する意思決定権も持たないと説明している——この関係についての説明は、OpenAI自身の投稿でも同様に述べられている。

グループの提言とこのリリースが一致するのはプロセス面だ:アイデアを導入した研究への引用を伴う徹底的な文献レビュー、生のモデル出力ではなく標準的なスタイルで作成された証明の記述、そして以前のリリースを保持するバージョン管理。一致しないのは、グループが中心と呼ぶ部分だ——誰にも理解されない結果をリリースするラボは、後に続く人間の理解を、ワークショップ、会議、プログラムを通じて資金提供すべきであり、この取り組みはラボ主導ではなくコミュニティ主導であり続けるべきだということ。OpenAIは「AIが生み出した主要な結果の理解に関する一連のワークショップ、会議、特別プログラム」への資金提供を約束し、詳細は追って発表すると述べている。それが未解決の項目であり、彼らに果たさせるべきものだ。

今日呼べるもの、そしてここでルーティングが実際に何のためのものか

これらの原稿を生成したモデルにリクエストを送る方法はなく、サードパーティのプラットフォームもそれをルーティングすることはできません。そうでないと主張する掲載はどれも、誰のカタログにも存在しないモデルについて説明しています。本番運用されているOpenAIのモデルは現行のGPT-6ラインであり、その数値は推測ではなく価格表に記載されています:

• GPT-6 Astra — 100万トークンあたり$10 / $50、キャッシュ読み取りは$1。272Kプロンプトトークンを超える長コンテキスト層は$20 / $75。コンテキスト長1.05Mトークン、最大出力128K

• GPT-6.1 Sol — 100万トークンあたり $2 / $10、キャッシュ読み取り $0.10、同じ長文コンテキスト段階制で $4 / $15、1.05Mトークンのコンテキスト、最大出力128K

どちらもOrRouterのカタログに掲載されている。そしてこれは、このリリースを能力に関するシグナルとして読む人にとって実用的なポイントだ。つまり、今日あなたが使うことを許されているモデルは、あなたのプロンプトがすでに合わせて形づくられているモデルでもあり、それらと内部モデルとの間のギャップこそ、まさにOpenAIが数学者たちに埋めてもらおうとしているギャップなのである。

そのギャップもまた、実験用の請求を本番パスから切り離しておくべき理由の一つだ。OpenAIがこのモデルに名前と価格を付けるとき、最初の1週間は検証されていないベンチマークの主張が洪水のように押し寄せ、慌ただしい再統合作業が大量に発生する。私たちのようなプラットフォームにとってルーティングを選ぶ理由は、未検証のモデルを試すコストがモデル文字列一つで済み、移行にはならないという点にある。GPT-6 Astraは$10 / $50、GPT-6.1 Solは100万トークンあたり$2 / $10で、リスト価格のまま0%のマークアップでそのまま提供され、ベンダーの価格変更はそれが届いたその日に反映される。自動フェイルオーバーにより、新しいモデルにトラフィックの一部を担わせ、リクエストパスを道連れにすることなく外すことができる。そしてルーティングDSLを使えば複数のモデルを1つの呼び出しに合成できる。単一の答えではなく長い導出についてセカンドオピニオンが欲しい場合にな。こうしたことはどれも、まだ出荷されていないモデルには当てはまらない——しかしそれはまさに、次のモデルが出荷される前に整えておきたいインフラなのだ。

Screenshot of the OrcaRouter model page for OpenAI GPT-6.1 Sol, showing a 1.05M-token context window, 128K max output, a base pricing tier of $2.00 per million input tokens and $10.00 per million output tokens with a $0.100 cache read and $2.50 cache write, a long-context tier above 272K prompt tokens at $4.00 / $15.00 with $0.200 cache read and $5.00 cache write, plus live performance and benchmark panels.

次に見るもの

重要になりそうな順に、四つのこと。 形式化件数。なぜなら、これは今回のリリースで唯一、「OpenAIが言っている」から「機械が検証した」へと変わり得る数字であり、しかも公開されているからだ。 名前の挙がった結果に対する、初の真に独立した評価。OpenAIの外にいる数学者が、そのコレクションの要約ではなく、特定の論文を公開の場で読み解くこと。 OpenAIがまだ検討中だと述べている、コミュニティ運営のリポジトリ。これが実現すれば、その成果物はOpenAI自身の説明からこの分野の手へと移る。 そして、モデルそのもののリリース。OpenAIは約束しているが、予定はまだ組まれていない。

722件の原稿は、AIがこれらの問題を解決したことを意味するのでしょうか?

一部については、数学的に正しければ、このコレクションはよく知られた未解決問題にまたがる反例と証明を主張しており、162本の論文には主結果を支える機械検証可能な形式化が存在する。残りについては、モデルがその問題について原稿を生成したという主張であり、これは検証済みの解決策よりも弱い主張だ。OpenAI自身も、形式化されていない結果には誤りが含まれる可能性があると警告している。「証明を生成した」ことと「証明を持っている」ことの区別こそが、このリリースのすべてを物語っている。

こうしたもののうち、今日の製品で使えるものはありますか?

いいえ。原稿はPDF、Leanソース、推論サマリーであり、研究成果物であってサービスではありません。モデルIDもエンドポイントも価格もアクセス申請フォームもありません。このリリースで開発者にとって実用的に役立つ部分は、OpenAIがGPT-6 Astraを実質的に超えるモデルを学習中であるという確認であり、それは今週呼び出せるものではなく、今後12か月の計画立案のためのシグナルです。

なぜOpenAIはモデルではなく結果を公開したのですか?

なぜなら、この2つはリスクプロファイルが異なるからだ。論文を公開するのは可逆的である——OpenAIは以前のバージョンを保持しており、問題を修正すると述べている——一方、モデルを出荷するのは可逆的ではない。OpenAIは、責任ある方法でリリースするために取り組んでいると述べており、同社が参照したとしている諮問グループの提言は、まさにこの順序を中心に組み立てられている。つまり、引用とバージョン管理を伴って研究成果をその分野の手に届け、その後、それに続くべき人間の理解に資金を提供する、という順序だ。

ざっと流し読みする人向けの一行版:AIが生み出した数学の、真に前例のない一大成果群が10月6日に公開された。そのおよそ5分の1は機械検証済みで、どれも査読は受けておらず、すべてがあなたには使えないモデルに紐づいている。興味深い問いは、そのモデルが有能かどうかではない——4,000問にわたって1つの結果あたり3時間のフロンティア思考コンピュートを使えばそれには答えが出るし、OpenAIはこのモデルがGPT-6 Astraより大幅に高性能だと述べている——そうではなく、次のリリースがこれをお役御免にする前に、検証と人間の理解が追いつくかどうかだ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新