記事「Reflection Beam、APIをベータ版で提供開始、重みはまだ2週間先」向けに生成されたヒーローカード。タイトルは「Reflection Beam」、サブタイトルは「APIはベータ版、重みはまだ公開されていない」、3つのチップは「合計501B / アクティブ23B」「256Kコンテキスト」「価格未公表」と表示されます。
Guides & Insights

Reflection Beam、ベータ版APIをリリース——モデルの重みはまだ2週間先

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Reflectionの最初のモデルはReflection Beamと呼ばれており、今朝このモデルについて興味深いのは、それが存在することではなく、その半分しか存在しないということだ。同社は2026年10月5日にBeamを、総パラメータ5010億、トークンあたり230億がアクティブなスパースな混合専門家(MoE)モデルとして発表し、同日にベータ版のOpenAI互換エンドポイントをその前面に用意した。重みは今月中にApache 2.0の下で公開される予定で、テクニカルレポート、モデルカード、サービングスタックも同時に示される。それらが登場するまで、Beam-501B-A23Bを実行できるのは、Reflectionがウェイトリストのキーを渡した相手だけであり、出回っているあらゆる性能指標は、ある1つのラボが自ら公表した表に由来している。

ローンチがそこで止まるのは奇妙な場所だし、私たちが手にしているのがどちらの半分なのか、正確に言っておく価値がある。Reflection は、サインアップできるプレビューと、誰も再現していない一連のベンチマーク表を公開している。見出しにある「open-weight」が指すものは公開していない。

今朝、実際にライブなのは何ですか

このセクションの内容はすべて、2026年10月6日に読んだReflection自身のブログ記事とドキュメントからのものです。

• モデルID — Beam-501B-A23B、2026年10月5日作成、api.reflection.ai/openai/v1 で提供され、Chat Completions と Models リストのみで、それ以外は何もない。

• 形状 — 総パラメータ数は5,010億、トークンごとに230億がアクティブで、アクティベーション率は約4.6%です。規模感を示すと、GLM 5.2は約5.4%です。

• コンテキスト — APIでは256,000トークン。その数値自体に、ベータ期間中はウィンドウが変更される可能性があるという脚注が付いています。最大出力は128,000トークンです。

• 推論 — 5つの設定(low、medium、high、xhigh、max)を持つ reasoning_effort パラメータです。デフォルトは medium で、モデルは常に推論します。オフに切り替えるスイッチや非推論モードはありません。

• モダリティ — {{1}}テキスト入力、テキスト出力{{/1}}。{{2}}ローンチ時点では画像、音声、動画の入力には対応していません{{/2}}。

• 価格 — 未公開。ブログ記事にも記載はなく、ドキュメントにも記載はなく、プラットフォームのコンソールはサインアップの壁の向こう側にある。

• アクセス — ウェイトリストです。セルフサービスでの利用経路はなく、重みも存在しないため、ダウンロードも量子化もファインチューニングもありません。

価格の行こそが、他のすべての読み方を変える。Reflection自身の表でBeamが比較されている7つのモデルのうち4つは、今日スプレッドシートに入れられる公開定価を持っている。Beamにはそれがなく、したがって現時点でBeamに関するコストの主張は、ドルではなく計算資源に関する主張である。

A screenshot of the coding and agentic table in Reflection's Beam launch post, captured 6 October 2026, showing the header 'The below figure shows Beam's performance across a range of coding, agentic, reasoning, and STEM benchmarks. NR denotes scores that have not been reported.' and Beam's own column of rows — DeepSWE v1.1 44.4, SWE-Bench Pro v2-Hard 77.2, SWE-Bench Pro v1 65.5, Terminal-Bench v2.1 80.1, SWE Atlas Codebase QnA 34.6, SWE-Bench Multilingual 78.0 and SWE-Bench Verified 80.9 — beside the comparison columns for Inkling and Nemotron 3 Ultra.

打ち上げがかかっている数字

Reflectionの売りは推論効率であり、それが何を意味するかについては異例なほど具体的だ。高度な推論ベンチマークにおいて、BeamはGLM 5.2と同等のスコアを、3~4分の1の推論計算量で達成する。2兆パラメータ級のモデル、すなわちQwen 3.8-Maxが位置づけられるカテゴリに対しては、その優位性はさらに大きいと説明されている。

その主張の背後にある図表は、注意深く読む価値がある。なぜなら、それは投稿全体の中で中心的な根拠になっているからだ。これは DeepSWE、Humanity's Last Exam、Terminal-Bench 2.1 にわたって、推論スコアを推定推論 FLOPs に対してプロットしており、FLOPs をおよそ「アクティブパラメータ数の 2 倍 × 試行あたりの平均生成トークン数」と見積もっている。この式は、プロンプトのプリフィル、文脈依存のアテンション演算、サービングのオーバーヘッドを意図的に除外している——Reflection は図のキャプションでそう述べている。それは誰かの請求額を測定したものではなく、モデル間の一貫した比較であり、また効率性の主張を支える唯一の定量的根拠でもあり、それを書いたのはそのモデルを開発したラボだ。重みによって他の誰かが検証できる仮説として、これを扱いなさい。

アーキテクチャが実際にもたらすのは、サービングプロファイルだ。230億のアクティブパラメータは、比較的少数のGPUで対話的なレイテンシで実行できる可能性が高いモデルであり、カード上の数字が同じでも、5010億パラメータの密なモデルとは別の製品だ。だからこそReflectionは、データセンター規模の展開について語ることなく、フロンティアに隣接する推論について語れるのだ——そして最終的な重み公開が、ベータキーよりも重要な出来事である理由もそこにある。

Beam が Reflection 自身のテーブルでどこに位置するか

以下の数値はすべてベンダー報告によるもので、Reflectionのローンチ記事にある表から引用したものであり、そのいずれも第三者が独立して再現したものではありません。Reflectionがモデルについて数値を公表していない箇所では、元の表ではセルにNRと記載されています。比較用の列はReflectionによるものであり、当社のものでも第三者によるものでもありません。

コーディングとターミナル作業

• Terminal-Bench v2.1 — Reflection Beam は80.1、それに対して GLM 5.2 は81.0、GLM 5.3 は88.2、Kimi K3 は88.3、Qwen 3.8-Max は86.6、DeepSeek V4.1 Flash は90.6。Beam はそれらすべてを下回っている。

• SWE-Bench Verified — Reflection Beam 80.9 対 Inkling 77.6、Nemotron 3 Ultra 70.7。ここが Beam の最も強みに見えるところだが、リスト上で最も弱い2つのモデルだけがこれで実行された点には注意してほしい。

• SWE-Bench Pro v1 — Reflection Beam 65.5 に対し、Qwen 3.8-Max 67.7、GLM 5.2 62.1、Inkling 54.3、Nemotron 3 Ultra 46.4。

• SWE-Bench Pro v2-Hard — Reflection Beam は 77.2 で、Kimi K3 の 88.2、GLM 5.3 の 84.3、Inkling の 56.9 と対戦。首位とは 10 ポイント差。

• DeepSWE v1.1 — Reflection Beam は 44.4 で、DeepSeek V4.1 Flash は 74.2、Kimi K3 は 68.0、GLM 5.3 は 61.0、Qwen 3.8-Max は 51.0、GLM 5.2 は 44.0。Beam は前世代と同水準に並び、首位から 30 ポイント遅れている。

• SWE Atlas Codebase QnA — Reflection Beam 34.6 に対し、Kimi K3 は 68.0、GLM 5.3 は 61.0。長いやり取りを通じて大規模リポジトリを頭に保持し続けることは、このリストで最も難しいことであり、Beam の 34.6 は丸め誤差ではない。

推論と科学

• AIME 2026 — Reflection Beam 97.8 対 GLM 5.2 99.2、Inkling 97.1。

• ツールなしのHLE — Reflection Beam 36.2 対 Kimi K3 46.9、Qwen 3.8-Max 43.6、GLM 5.3 42.3、GLM 5.2 40.5、DeepSeek V4.1 Flash 39.1、Inkling 29.7、Nemotron 3 Ultra 26.7。中位グループで、前世代の2モデルのみを上回る。

• GPQA Diamond — Reflection Beam 90.5 に対し、Kimi K3 93.5、Qwen 3.8-Max 92.6、GLM 5.3 91.7、GLM 5.2 91.2、DeepSeek V4.1 Flash 90.9。

• SciCode — Reflection Beam 49.7 対 GLM 5.3 59.0、Kimi K3 58.7、Qwen 3.8-Max 52.1、DeepSeek V4.1 Flash 52.0。

• CriPT AA — Reflection Beam 16.3 対 Kimi K3 23.4、GLM 5.2 20.9、Qwen 3.8-Max 20.0、GLM 5.3 19.1、DeepSeek V4.1 Flash 14.3、Inkling 5.4、Nemotron 3 Ultra 3.1。

ツール、検索、ロングコンテキスト

• MCP Atlas — Reflection Beam 78.7 対 Qwen 3.8-Max 84.5、GLM 5.3 84.2、Kimi K3 82.3、GLM 5.2 77.8。

• AutomationBench、公開スプリット — Reflection Beam 37.0 に対し、DeepSeek V4.1 Flash 54.8、GLM 5.3 48.2、Kimi K3 46.7、Qwen 3.8-Max 39.8、GLM 5.2 26.2。

• tau3 banking — Reflection Beam 38.0 対 Qwen 3.8-Max 55.2、GLM 5.2 37.1、Kimi K3 37.1。

• コンテキスト管理ありのBrowseComp — Reflection Beam 77.4 対 Kimi K3 91.2、Inkling 77.1、Nemotron 3 Ultra 44.4。

• コンテキスト管理を用いたDeepSearchQA — Reflection Beam 80.1 対 Kimi K3 95.0。

• AA-LCR — Reflection Beam 79.3 対 Kimi K3 88.7、DeepSeek V4.1 Flash 84.0、Qwen 3.8-Max 80.3、GLM 5.3 79.7、Nemotron 3 Ultra 79.3、GLM 5.2 78.3、Inkling 77.3。長文脈想起は、Beam が中位ではなく真に競争力を持つ唯一の汎用能力項目である。

4つの表をまとめて読むと、一貫した形が見えてくる。BeamはReflectionのリスト上で、前世代の2つのモデルには勝ち、現行モデルにはほぼすべての行で負けている。その差は小さいものから失格級まで幅がある。自社のモデルがこれほど多くの行で後れを取る表を公開するベンダーは、そのラボの誠実さを示す良い兆候だ。それは、そのモデルが最先端にあるという兆候ではない。

A screenshot of the efficiency section of Reflection's Beam launch post, captured 6 October 2026, showing the sentence 'On advanced reasoning benchmarks, it achieves scores comparable to GLM-5.2 while using 3-4x less inference compute.', the note that gains are more pronounced against 2T+ parameter models like Qwen 3.8-Max, the claim that the results mean 'more intelligence per token', and a score-versus-estimated-FLOPs chart plotting DeepSWE, HLE (text only) and Terminal-Bench 2.1 across reasoning-effort settings.

これまで唯一の独立した声、そしてそれが語らないこと

記録に残っている唯一の第三者評価はArtificial Analysisで、同社は10月5日、Reflectionからアクセス提供を受けたと述べ、独自にベンチマークを実施していると説明し、さらに初期結果はBeamが同等の知能水準に達していないことを示唆していると付け加えた。

それは、ほとんどの購入者が実際に読むインデックスを持つ組織による意義深い声明であり、同時に数字が一つも入っていない声明でもある。今朝の時点で、Artificial AnalysisのリーダーボードにBeamの行はない——モデルページは404を返し、リーダーボードのペイロードにもBeamのエントリは含まれていない——したがって、トークン効率の主張は、現時点では、何かを公表するという第三者からの約束にすぎない。そのインデックスでは、Beamで再計算されたものはまだ何もない。

訓練に関する開示は、今回のリリースの中で最も強力な部分である

Reflectionの投稿のエンジニアリングセクションには、ほとんどのラボなら内部にとどめておくような数字が含まれており、それらは記録に値する。1か月後になってもなお興味深いのは、そのリリースのこの部分だからだ。

• 事前学習 — NVL72ラック内の6,144個のNVIDIA GB300チップ上で、23.8兆個のキュレーション済みトークンを、エンドツーエンドで4週間未満で完了。報告されているグッドプットは92.3パーセントで、その過程で9回の半自動リワインドが発生し、それらは勾配ノルムの急増またはサイレントデータ破損の疑いに起因するとされた。

• 強化学習 — 10,500個のGB300チップを4週間、1億回を超えるロールアウト、最大256,000トークンのロールアウトコンテキスト、約13億個のサンドボックス、そしてコーディング、エージェント型、STEMタスク向けに調達された約100万の異なる環境。

• サービング — 新しい重みは、中央値約12秒で推論フリートに到達し、階層的配布によってラック間トラフィックを75%削減し、フリート全体への展開を、各レプリカが自ら重みを取得する場合より2.2倍高速化しました。

• 安定性 — 1日古くなったインタラクションから学習する際も数値的に安定する完全非同期のポリシー勾配に加え、再トレーニングなしで推論の長さとスコアをトレードオフするための制御可能な長さペナルティ。

• データ — 解析、重複排除、キュレーションを通じて、生のインターネットトークンの約95パーセントが排除された。従来のフィルターでは、Reflectionが保持したトークンのうち約1.8兆を見逃していただろうという主張があり、これには、Reflectionがキュレーションしたウェブコードトークンの87パーセントが含まれる。

2行には注意を促す価値がある。投稿は、midtraining が Beam の有効コンテキストを100万トークンに拡張すると述べている一方、API ドキュメントにはベータ版の脚注付きで256,000トークンのサービング上限が記載されている。これらは矛盾ではなく、学習側の能力とサービング側の制限だが、2つ目の文書を誰も読まなければ、この差こそが「1M context」という見出しになる。そして1億回を超えるロールアウトという RL の数字は、オープンラボによる最大規模のこうした実行のひとつとして提示されている――これは規模についての主張であって、その規模が何をもたらしたかについての主張ではない。スコア対ロールアウトの曲線はベンダー自身のものであり、ベンダーがプロットをやめたところで止まっている。

A generated single-column card titled 'Reflection Beam — the state of play, 6 October 2026', used as the article's closing fact sheet. Rows read 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300, under four weeks', 'RL campaign: 10.5K GB300, 4 weeks, 100M+ rollouts', 'API context: 256,000 tokens, beta footnote', 'Reasoning effort: five levels, default medium, no off switch', 'Price: not published anywhere' and 'Independent score: none yet - no Artificial Analysis row'. The footer reads 'Vendor-reported; nothing independently reproduced. Weights, tech report and model card promised later this month.'

Reflection Beam で今日できること

ひとつだけ:ウェイトリストに登録し、キーを入手したら、OpenAI形式のクライアントでReflection自身のエンドポイントを通じてBeam-501B-A23Bを呼び出してください。公開価格が存在しないため、それにかかるワークロードのコストを見積もる方法はありません。重みが存在しないため、セルフホスティングも量子化も第三者による再現もできません。独立したベンチマーク行が存在しないため、上記の性能全体像は単一のラボの表だけに依拠しています。

Reflection Beam は当社のルートの一つではありませんし、そうであるかのように示唆するつもりもありません。お伝えできるのは、それが参入しようとしている分野の価格です。今朝、当社自身のカタログからライブで読み取ったものです。GLM 5.2 は100万トークンあたり入力 $1.40、出力 $4.40、GLM 5.3 は $1.26 と $3.96、Qwen 3.8-Max は $2.00 と $6.00、DeepSeek V4.1 Flash は $0.15 と $0.60 です。入力だけで見ても、最安と最高の間には9倍以上の差があります。だからこそ、価格表にないベータモデルは、効率チャートがどれほど良く見えても、意思決定に組み込むのが本当に難しいのです。

OrcaRouterは、これら4つとその他200以上ものモデルにわたって、1つのOpenAI互換キーを運用します。プロバイダーの定価を一切上乗せせずにそのまま通しているため、ベンダーの価格変更は、リセラーが価格表を更新するのを待つのではなく、同じ日に当社側で反映されます。自動フェイルオーバーは各プロバイダーごとに自前で組み込むものではなく、ルーティングの一部です。つまり、再現もできず、独立したスコアも価格もない未検証のモデルは、まさにクリティカルパスに置くのではなく、トラフィックの一部に載せるべき類のものなのです。

クレームが検証可能になるとき

これを決着させるのは3つのことで、Reflectionはそのうち2つを今月中に置いた。

第一は重みだ。Apache 2.0と技術レポートがあれば、数ノードを持つ誰もが、本当に重要なもの——固定された品質基準でのGPUあたり1秒あたりのトークン数、そして230億のアクティブパラメータが本当にグラフの示唆するFLOPあたりスコアを叩き出すかどうか——を測定できる。それまでは、効率性の主張はナプキンの上での計算にすぎず、それを繰り返す人は皆、Reflectionのキャプションを繰り返しているだけだ。

二つ目は価格だ。定価のないモデルは、コスト比較の場に居場所がない。BeamがGLMとDeepSeekの価格帯を上回るなら、予算のある誰にとっても計算資源の話は重要でなくなる。下回るなら、状況はあっという間に変わる。

三つ目はその指標だ。Artificial AnalysisはBeamをベンチマーク評価していると述べているが、数値は一切公表していない。その行が現れたとき、それはこの話の中でReflectionが算出しなかった最初の数字となる。

今日、有能なエージェント型コーダーが必要で、そのコストも知りたいというなら、答えはまだ Reflection Beam ではない。3週間後なら、そうなっているかもしれない。効率性の主張に賭ける価値があるモデルとは、重みを自分でダウンロードでき、FLOPs を自分で数えられるモデルのことだ——そしてそのテストにおいて、Reflection が私たちに与えたのは日付とウェイトリストであって、モデルではない。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新