
Reflection Beam 解説:501Bパラメータ、23Bアクティブ、そしてまだ公開されていない重み
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 145 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 128 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 183 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
2026年5月にReflectionは発表したReflection Beam、総パラメータ数5010億のスパース混合エキスパート言語モデルで、トークンあたり230億のパラメータを活性化する。そして同じ日に、そのモデルのベータ版のOpenAI互換エンドポイントを提供開始した。これはモデルの4.6%が常時稼働していることを意味する——現在のオープンウェイト分野の基準から見ても攻めた比率だ——そしてローンチ全体がこの数字に懸かっている。Reflectionは、完全な重み、技術レポート、モデルカードが今月中にApache 2.0の下で公開されると述べている。本日時点ではまだ公開されていない——Reflection自身のプロパティのどこにも価格は公表されておらず、Artificial Analysisにはこのモデルの行もない。したがって、このローンチの正直な要約はこうだ:効率に関する非常に具体的な主張であり、それはモデルを訓練したラボによるもので、裏付ける数字はすべてそのラボが提供したものである。
Reflection自身の比較表では、Reflection BeamをInkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen3.8 MaxおよびDeepSeek V4.1 Flashと並べている。これは、Beamが狙う層——強力だが最先端ではないオープンおよびセミオープンモデルで、そのいくつかはBeamのサイズのほんの一部である——を公正に描いたものだ。Beamは素の能力でその分野を打ち負かすことはなく、我々はそれがどこで負けるかを正確に示す。Beamが主張しているのは、同程度の推論スコアにおいてGLM 5.2よりおよそ3~4倍少ない推論計算量で、その上位付近に到達するということだ。その主張がこの記事である。
今日、実際に存在するもの
このセクションの内容はすべて、2026年10月6日に読んだReflection自身のドキュメントによるものです。APIはウェイトリスト制のベータ版として公開されていますが、モデルの重みはまだ公開されていません。
• モデルID — Beam-501B-A23B、2026年10月5日作成。
• インターフェース — api.reflection.ai/openai/v1 にある OpenAI 互換のサーフェスで、Chat Completions と Models 一覧のみを公開し、それ以外は何もありません。Completions も embeddings も batches もありません。
• コンテキスト — 256,000トークン、その数字自体に脚注が付いています:「コンテキストウィンドウはベータ版の間に変更される可能性があります。」最大出力は128,000トークンです。
• 推論 — 5つの値(low、medium、high、xhigh、max)を持つ reasoning_effort パラメータ。デフォルトは medium で、設定に関係なくモデルは常に推論を行います — オフに切り替える方法はありません。
• モダリティ — テキスト入力、テキスト出力。ローンチ時点では画像や音声の入力はなく、これは7月にMira Murati氏のThinking Machinesがリリースしたマルチモダリティ優先モデルであるInklingとは実質的な違いです。
• 知識のカットオフ — 2026年6月30日
• 価格 — 非公開。Reflectionのブログ記事、そのドキュメント、モデル一覧のいずれにも記載がなく、プラットフォームのコンソールは登録の壁の向こう側にある。
その最後の一文は、見た目以上に重要だ。Beamの比較対象セットに含まれる他のすべてのモデルには、今日スプレッドシートにそのまま入力できる公開リスト価格がある。Beamにはそれがなく、つまり現時点でBeamに関するコストの議論は、ドルではなくコンピュートについての議論だということになる。

501対23という比率こそが論拠だ
スパース性は新しいものではない。問題は、ラボがそれをどこまで推し進めようとするかだ。GLM 5.2は、約7,440億と報じられている総パラメータ数のうち、およそ400億のアクティブパラメータで動作する——約5.4パーセントだ。Reflection Beamは5,010億のうち4.6パーセントに位置する。数字の上では、それは控えめなさらなる一歩であり、Reflectionはそれについて何を主張するかに慎重だ。
ローンチ記事の効率値は、Artificial AnalysisとDataCurveのデータに基づいて作られたチャートから来ており、推論能力スコアを推論時の推定FLOPsに対してプロットしたものです。ここでFLOPsは、アクティブパラメータ数の2倍に生成トークンの平均数を掛けたものとして近似されています。この式は、プロンプトのプリフィル、アテンションのコスト、サービングのオーバーヘッドを意図的に除外しています。これは大まかな概算モデルであり、測定値ではありません。Reflectionもそれを測定値として提示してはいません。しかし、それは「同じスコアで3~4倍安い」という主張を支える唯一の定量的根拠でもあり、しかもベンダー自身によって書かれています。重みが公開されたとき、他の誰かが検証できる仮説として、これを扱うべきです。
このアーキテクチャが実際にもたらすのは、サービングプロファイルです。230億のアクティブパラメータは、比較的少数のGPU上で対話的レイテンシで実行できるモデルであり、カード上のパラメータ数が同じであっても、5010億パラメータの密なモデルとは異なる製品です。Reflectionがデータセンター規模のデプロイについて語ることなく、フロンティア隣接の推論について語れるのは、そのためです。
事前学習に4週間未満、しかもその開示は異例なほど具体的だ
トレーニングに関する説明は、この発表の中で本当に有益だと感じられる部分だ。なぜならReflectionは、ほとんどのラボが内部にとどめておくような数字を公表したからだ。
• 事前学習 — NVL72ラックの6,144基のGB300チップ上で23.8兆トークン、報告されている92.3%のグッドプットで4週間未満で完了し、その過程でチェックポイントからの9回の巻き戻しが発生した。
• 強化学習 — 4週間にわたり10,500個のGB300チップ、1億回を超えるロールアウト、最大256,000トークンのロールアウトコンテキスト、約13億のサンドボックスと約100万の異なる環境、平均110,000件のロールアウトが同時実行。
• Midtraining — モデルの有効コンテキストを100万トークンに拡張します。
• 安定性 — 日単位の陳腐化があっても安定する非同期ポリシー勾配に加え、再トレーニングなしで推論の長さを調整できる制御可能な長さペナルティ。
事前学習とRLの行を一緒に読むと、この主張の輪郭が見えてくる。効率性の話は、推論時のアクティブパラメータだけにとどまらない。モデルがどれだけ速く訓練されたか、そして計算資源のどれだけが、より多くのトークンではなく環境に束縛されたRLに投じられたかにも関わる。100万の環境と13億のサンドボックスは、ツール使用とエージェント型訓練インフラに関する表明であり、Reflectionが最初に掲げることを選んだベンチマークとも符合する。
1つの数字には注記を付す価値がある。ブログでは、ミッドトレーニングによって実効コンテキストが100万トークンに拡張されると述べられている。一方、APIドキュメントには、ベータ版の脚注付きで256,000トークンという提供上限が記載されている。これらはトレーニング側の能力と提供側の制限であり、矛盾ではない。しかし、この隔たりは、2つ目の文書を誰も読まなければ「100万コンテキスト」という見出しになりかねない、まさにその類のものであり、来週Beamについて書く者は2つ目の文書を読むべきだ。

ベンチマーク:Reflection Beamが優位な場面と、そうでない場面
以下の数値はすべてベンダー報告によるもので、Reflectionのローンチ記事内の表に基づいており、そのいずれも独立に再現されたものではありません。比較列は、Reflectionが他のモデル向けに公開したものと同じ数値です。元の表でセルに「NR」と表示されている場合、そのモデルは実行されていません。BeamにはArtificial Analysisの行がないため、ここにあるものはどれも第三者による評価ハーネスを経ていません。
エージェント型コーディング
• Terminal-Bench v2.1 — Beam 80.1 対 GLM 5.2 81.0、GLM 5.3 88.2、Kimi K3 88.3、Qwen3.8 Max 86.6、DeepSeek V4.1 Flash 90.6、Inkling 63.8、Nemotron 3 Ultra 56.4。
• SWE-Bench Pro v1 — Beam 65.5 対 Qwen3.8 Max 67.7、GLM 5.2 62.1、Inkling 54.3、Nemotron 3 Ultra 46.4。
• SWE-Bench Pro v2-Hard — Beam 77.2 対 Kimi K3 88.2、GLM 5.3 84.3、Inkling 56.9。
• SWE-Bench Verified — Beam 80.9 対 Inkling 77.6、Nemotron 3 Ultra 70.7。
• SWE-Bench Multilingual — Beam 78.0 対 Nemotron 3 Ultra 67.7。
• DeepSWE v1.1 — Beam 44.4 対 DeepSeek V4.1 Flash 74.2、Kimi K3 68.0、GLM 5.3 61.0、Qwen3.8 Max 51.0、GLM 5.2 44.0。
• SWE Atlas Codebase QnA — Beam 34.6 対 Kimi K3 68.0、GLM 5.3 61.0。
最後の行こそ、じっくり向き合うべきものだ。長期的なリポジトリ質問応答は、モデルが長いやり取りを通じてコードベースを頭の中に保持しなければならない領域であり、34.6 対 68.0 は丸め誤差ではない。DeepSWE も同様のことを示している。44.4 は Beam を GLM 5.2 と同水準に置き、DeepSeek V4.1 Flash には大きく後れを取らせている。
推論
• AIME 2026 — Beam 97.8 対 GLM 5.2 99.2、Inkling 97.1。
• HLE、ツールなし — Beam 36.2 対 Kimi K3 46.9、Qwen3.8 Max 43.6、GLM 5.3 42.3、GLM 5.2 40.5、DeepSeek V4.1 Flash 39.1、Inkling 29.7、Nemotron 3 Ultra 26.7。
• GPQA Diamond — Beam 90.5 対 Kimi K3 93.5、Qwen3.8 Max 92.6、GLM 5.3 91.7、GLM 5.2 91.2、DeepSeek V4.1 Flash 90.9、Inkling 87.2、Nemotron 3 Ultra 87。
• SciCode — Beam 49.7 対 GLM 5.3 59.0、Kimi K3 58.7、Qwen3.8 Max 52.1、DeepSeek V4.1 Flash 52.0、Inkling 46.1、Nemotron 3 Ultra 44.6。
• CriPT AA — Beam 16.3 対 Kimi K3 23.4、GLM 5.2 20.9、Qwen3.8 Max 20.0、GLM 5.3 19.1、DeepSeek V4.1 Flash 14.3、Inkling 5.4、Nemotron 3 Ultra 3.1。
Beamの推論プロファイルは中位グループで、そのパターンは一貫している。Reflectionのリストにある前世代の2モデルよりは余裕をもって上だが、現行モデルには及ばない。GPQA Diamondの90.5は堅実なスコアだが、他の4モデルがそれを上回っている。
ツールの使用と検索
• MCP Atlas — Beam 78.7 対 Qwen3.8 Max 84.5、GLM 5.3 84.2、Kimi K3 82.3、GLM 5.2 77.8、Inkling 76.0、Nemotron 3 Ultra 63.1。
• AutomationBench、公開スプリット — Beam 37.0 対 DeepSeek V4.1 Flash 54.8、GLM 5.3 48.2、Kimi K3 46.7、Qwen3.8 Max 39.8、GLM 5.2 26.2。
• tau3 banking — Beam 38.0 対 Qwen3.8 Max 55.2、GLM 5.2 37.1、Kimi K3 37.1、Inkling 25.0、Nemotron 3 Ultra 22.6。
• コンテキスト管理を用いた BrowseComp — Beam 77.4 対 Kimi K3 91.2、Inkling 77.1、Nemotron 3 Ultra 44.4。
• コンテキスト管理を備えた DeepSearchQA — Beam 80.1 対 Kimi K3 95.0。
Reflectionはまた、投稿の中で2つの能力デモを示した。「Land or Water」パズルでの95.5パーセントの解決率——16,200点を持つ180×90のグリッドで、大きな盤面状態を保持する必要がある——この数値は、Reflectionが同じタスクでOpus 5とFable 5に帰属させている92.5パーセントと97.8パーセントの間に位置する——そして、最小のGemma-4のText2SQLファインチューニングで、ホールドアウト精度を66.5パーセントに引き上げたデモ。デモは厳選されたもので、モデルがあることを実行できると示すだけで、どれほど頻繁に実行できるかは示さない。
今日それでできること、そしてそれを前提に計画すべきでないこと
今日、一般に可能なことは正確に1つだけだ。ベータアクセスを申請し、OpenAI形式のクライアントを使ってReflection自身のエンドポイント経由でBeam-501B-A23Bを呼び出すことである。公開価格はないため、その上でワークロードのコストをモデル化する方法はない。重みもないため、セルフホスティングも量子化もファインチューニングも、第三者による再現性もない。独立したベンチマーク行もないため、上記の性能全体像は1つのラボの表だけに依拠している。
Reflection Beamは当社のルートの一つではありません。そうであるかのような示唆もいたしませんし、それを持っているかもしれない再販業者を紹介することもありません。お伝えできるのは、比較対象のモデル群の料金です。当社はそのうち4モデルをルーティングしており、以下の数値は今朝、当社自身のカタログからライブで読み取ったものです:GLM 5.2は100万トークンあたり入力$1.40、出力$4.40、GLM 5.3は$1.26と$3.96、Qwen3.8 Maxは$2.00と$6.00、DeepSeek V4.1 Flashは$0.15と$0.60です。これは実際に大きな開きです——DeepSeek V4.1 Flashは入力でGLM 5.2より約10倍安い——そしてこれが、価格のないベータモデルを意思決定に組み込みにくい理由でもあります。OrcaRouterはそれらおよび200を超える他のモデルにまたがる単一のOpenAI互換キーを、プロバイダーの定価をそのまま適用し一切上乗せせずに運用しています。つまり、ベンダーの価格変更は、再販業者が更新するのを待つのではなく、当社側では当日に反映されるということです。そして、自動フェイルオーバーが自分で構築するものではなくルーティングの一部であるため、新しく実績のないモデルは、クリティカルパスではなくトラフィックの一部に載せられる類のものです——これが、ベンチマークをまだ誰も再現できていないものを責任をもって使う唯一の方法なのです。

効率性の主張を本気で信じる前に注目すべき点
その問題に決着をつけるのは3つのことで、そのうち2つは今月中に約束されている。
第一は重みです。Apache 2.0 と技術レポートがあれば、ノードを数台持っている人なら誰でも、本当に重要なもの——一定の品質基準における GPU あたりの毎秒トークン数、そして 230 億のアクティブパラメータが本当にチャートが示唆する FLOP あたりのスコアを実現するのかどうか——を測定できる。それまでは、効率に関する主張はナプキンの上での算術にすぎない。
二つ目は価格だ。定価のないモデルはコスト比較の場に居場所がない。そしてBeamがGLMやDeepSeekの価格帯より上に位置するなら、予算のある人にとって計算資源の話は意味を持たなくなる。下に位置すれば、状況はすぐに変わる。
第三に、そのスイートを実行しているのは第三者である。上のすべての数値は同じ文書に由来しており、自社モデルを16行のうち7行で後れさせているベンダー報告の表は、そのラボの誠実さを示す良い兆候だ——とはいえ、それでもなお、一つのラボ、一つのハーネス、一つのプロンプト群にすぎない。
今日、有能なエージェント型コーダーが必要で、そのコストを知る必要があるなら、答えはまだ Reflection Beam ではない。三週間後かもしれない。効率性の主張に賭ける価値があるモデルとは、重みをダウンロードでき、FLOPs を自分で数えられるモデルだ——そしてそのテストにおいて、Reflection はモデルではなく日付を与えたのだ。
この記事で比較したモデル4
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
