
Reflection Beam 対 Claude Opus 5.5:今日すぐに使えるもの、待たなければならないもの
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Reflection Beam と Claude Opus 5.5 は、まだ本当のライバルではありません。その理由は技術的なものではなく、運営上のものです。Reflection の最初のモデルである Beam は 2026年10月5日に発表された、5010億パラメータのスパースな Mixture-of-Experts モデルで、トークンあたり230億パラメータを活性化します — ただし、アクセスできるのはウェイトリスト経由のみで、重みは今月中に Apache 2.0 のもとで公開されると約束されているものの、価格はどこにも公表されていません。Opus 5.5 は 2026年9月22日に Anthropic のフラッグシップとして出荷されました。100万トークンのコンテキストウィンドウ、テキスト・画像・ファイルの入力に対応し、定価は入力100万トークンあたり$4.00、出力100万トークンあたり$20.00です。つまり、この比較を正直に言えば、一方のモデルは既知のコストで今日の午後から本番環境に投入できるが、もう一方はそうではない、ということです — そしてここに書かれているそれ以外のことはすべて、重みが公開されたときに何が起こるかについての予測にすぎません。
手短に言えば
今週どのモデルを基盤に構築するかという問いなら、それはほとんど議論の余地なくOpus 5.5だ。一般提供されており、独立したスコアリングがなされ、マルチモーダルで、価格が設定され、5分で呼び出せるAPI経由で提供されている。Beamの主張は、Opus 5.5を打ち負かすことには依拠していない——Reflection自身の資料のどこにもそう主張していない。それは、はるかに狭い命題に依拠している。すなわち、ある推論スコアにおいて、Beamは推論コンピュートをおよそ4分の1しか消費しないということだ。Reflectionの外部の誰かが測定したときにそれが成り立つなら、Beamは、答えが最良でなくとも十分に良ければよい大量処理において興味深い存在になる。そうでなければ、Beamはウェイトリスト付きの中位オープンモデルだ。
以下では、この対戦のうち、今日時点で事実である部分と、賭けの部分とを分けて述べる。
各モデルが正確には何であるか
Opus 5.5は、Claude Opus 5のクローズドでホスト型の後継モデルであり、Anthropicは、大規模なコードベース全体にわたる多段階の変更、コードレビュー、長時間の自律セッション向けと位置づけています。テキスト、画像、ファイルを受け取り、テキストを返し、最大128,000出力トークンを備えた1,000,000トークンのコンテキストウィンドウに対応し、構成可能な推論エフォートを伴う拡張思考を利用可能にします。オープンウェイトではなく、その知識は、あなたが制御できるものではなく、Anthropicのトレーニングカットオフによって制限されます。
Reflection Beamは逆の構成だ。総パラメータ数は5010億、アクティブは230億——トークンあたりモデルの約4.6%が稼働する。これはGLM 5.2の約5.4%と比べても積極的な比率だ——安く訓練するためではなく、安く提供するために作られている。テキスト専用だ。APIのコンテキストは256,000トークンで、ベータ期間中にこの数値が変わる可能性があるという脚注が付いており、最大出力は128,000トークンだ。エンドポイントはapi.reflection.ai/openai/v1でOpenAI互換であり、Chat CompletionsとModelsリストのみを公開していて、それ以外は何もない。reasoning_effortパラメータは5つの値を取り、デフォルトはmediumで、オフにすることはできない。
• 価格 — Claude Opus 5.5 は入力 $4.00、出力 $20.00(100万トークンあたり)、キャッシュ読み取り $0.20、キャッシュ書き込み $5.00。一方、Reflection Beam はブログ記事、ドキュメント、モデル一覧のいずれにも公開されていない。
• 提供状況 — Opus 5.5 は本日より一般提供を開始。Beam はベータ版のウェイトリスト受付中で、モデルの重み、技術レポート、モデルカードは今月中に公開予定。
• モダリティ — Opus 5.5 はテキスト、画像、ファイルに対応。Beam はテキストのみ。
• コンテキスト — 1,000,000トークン対256,000トークン、Beamの数値にはベータ版の但し書きが付く。
• オープンウェイト — Opus 5.5は非公開、BeamはApache 2.0での公開を約束しているが、まだ提供されていない。
• 独立したスコア — Opus 5.5 にはあり、Beam にはない。

価格は比較にならない部分です
Opus 5.5の$4.00と$20.00はプロバイダーの定価であり、当社のカタログでも一切上乗せされることなく、そのまま適用されます。キャッシュ読み取り$0.20とキャッシュ書き込み$5.00は、Opus 5.5が投入されているワークロードにとって極めて重要です。同じ200,000トークンのコードベースをターンごとに読み直す長いエージェントセッションでは、そのほぼ全体に対して入力料率ではなくキャッシュ料率を支払うことになります。これは現実的であり、しばしば過小評価されるレバーです。フロンティアモデルは予算外だと結論づける前に、試算してみる価値があります。
Beam には比較できる数字がない。突き合わせる定価も、モデル化できるキャッシュ階層も、ベータ版の公表料金も存在しない。Reflection は、Beam をトークン単位で販売するのか、席単位で従量課金するのか、それとも重みとセットで無償提供するのかを明言していない。今日 Beam の100万あたりコストを引用している人は、それをでっち上げているだけだ。
実際的な帰結はこうだ。価格比較は「Opus 5.5は高価でBeamは安い」ということではない。「一方には価格があり、もう一方には日付がある」ということだ。今日決断を下すチームにとって、この非対称性はベンチマーク以上に決め手となる。
ベンチマーク:重なり合う2つの数値、そしてそれでもなお比較にならない理由
Reflectionの発表時の表にはOpus 5.5も、その他の最先端のクローズドモデルも含まれていない。比較対象はすべてオープンまたはセミオープンだ。Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max、DeepSeek V4.1 Flash。したがって、Beam対Opusの表は手作業で組み立てるしかなく、それを誠実に組み立てるとは、ハーネスの違いをならしてしまうのではなく、明示することを意味する。
両方のモデルに公開された数値があるベンチマークはちょうど2つあり、そのどちらのペアリングも統制されていない。
• Humanity's Last Exam — Reflection はツールなしで Beam が 36.2 と報告している。Artificial Analysis は Opus 5.5 を 61.4 と記録している。異なる 2 つのハーネス、異なる 2 つの構成 — Opus 5.5 の数値にはツールなしというラベルが付いていない — そしてその 25 ポイントの差は、モデルそのものよりもむしろセットアップについて語っている。
• SciCode — ReflectionはBeamを49.7と報告している。Artificial AnalysisはOpus 5.5について66.9を記録している。同じベンチマーク、同じ問題でありながら、一方の数値はベンダー自身の実行によるもので、もう一方はサードパーティのハーネスによるものだ。
それ以外はまったく重複していない。Beamの表はTerminal-Bench v2.1に基づいて構築されているのに対し、現在のArtificial Analysis指数はTerminal-Bench 4.0を実行している — 同じスイートの異なるバージョンであり、だからこそそのボード上のBeamの80.1とOpus 5.5の59.6は比較対象にはならず、並べて記載されるべきではない。指数自体において、Artificial AnalysisはOpus 5.5をMax / Default Fallback構成で57.6とし、その実行における147モデル中4位に位置づけている。Beamには指数の行が存在しない。モデルページは404を返し、今朝の時点でリーダーボードにBeamのエントリはない。
Beamについて記録上、真に独立した唯一の声明は、Artificial Analysisが10月5日に述べたものだ。すなわち、Reflectionが同社にアクセスを提供し、同社がこのモデルを独自にベンチマークしていること、そして初期の指標によれば、Beamはその知能レベルに見合うものとして、同社がこれまで見てきた中で最もトークン効率の高いオープンモデルの一つになる可能性が高い、というものだ。これは適切な情報源による強い一文だが、依然として数字のない一文にすぎない。この対決を決めるのは、その数字なのだ。

効率性の主張が実際に効いてくる場面
リフレクションの主張は、Beamがフロンティアモデルより賢いということではない。BeamがGLM 5.2と同等のスコアを、3〜4倍少ない推論計算量で達成しているということ、そしてQwen 3.8-Maxが位置する2兆パラメータ級のモデルに対しては、その差がさらに広がるということだ。その根拠となるグラフは、生成FLOPsを「アクティブパラメータ数の2倍×試行あたりの平均生成トークン数」として推定しており、そのキャプション自体も、これにはプロンプトのプリフィル、アテンション、サービングのオーバーヘッドが含まれていないことを認めている。
額面どおりに受け取るなら、興味深い標的はOpus 5.5ではまったくない——市場の中間層だ。Opus 5.5はタスク当たりの能力で競い、判断を要するタスクで勝つ。多段階リファクタリング、コードレビュー、誤った答えのコストがトークンより高くつく作業だ。トークン当たり4.6パーセントだけが稼働するモデルは、タスク当たりのコストで競い、量が支配的で品質基準が「十分に良く、下流で検証されればよい」である領域で勝つ。これらは別の製品であり、BeamをOpus 5.5と単一のスコアボードで比べる比較は、間違ったものを測定している。
言及する価値のある二次的効果がある。Beamの効率性に関する主張が正しければ、その自然な用途は、本来ならフロンティアモデルのトークンを、それにはオーバースペックなタスクに費やすことになるような種類のワークロードだ。それはモデル選択ではなくルーティングの判断であり、ここでベンチマークの問いよりも価格の問いのほうが重要になる理由でもある。コストのないモデルへコストを基準にルーティングすることはできないのだ。
それらを並行して実行する場合、Beamが呼び出し可能なとき
Opus 5.5 is on our catalogue today at $4.00 and $20.00 per million tokens, list price passed through with nothing added, and it sits alongside 200-plus other models behind a single OpenAI-compatible key at api.orcarouter.ai/v1. If you wanted to A/B a workload between a frontier model and a cheap open one, that is the shape of the setup: two model IDs, one key, no second contract and no code change — and automatic failover in the routing means a provider having a bad afternoon does not take your pipeline with it.
Beamをまだそれに含めることはできませんし、そうでないふりをするつもりもありません。Reflection Beamは当社のルートの一つではなく、再販する可能性のある相手を紹介することもありません。重みがApache 2.0で公開されたら、ご自身でホストし、ご自身のエンドポイントにルーティングできるようになります。それまでは、唯一の手段はReflectionのウェイトリストです。
フロンティアモデルが本当に必要なワークロードなら、比較すべき相手はBeamではない。カタログ上の他のすべて、つまりGLM 5.3の$1.26と$3.96、Qwen 3.8-Maxの$2.00と$6.00、DeepSeek V4.1 Flashの$0.15と$0.60で、いずれも今朝ライブで確認したものだ。Beamが競争力のある価格を付けば到達するのはこの層であり、ローンチ時のチャートが示唆するよりはるかに厳しい界隈だ。

何がこの評決を変えるでしょうか
三つのこと、どれほど重要になるかの順に。
BeamについてのArtificial Analysisの行——発表ではなく、その行だ。その行がOpus 5の57.6の近くに着地し、トークン効率の主張が第三者評価に触れても生き残るなら、市場の中間層はかなり居心地が悪くなり、Beamは多くの大量ワークロードでデフォルトになる。もし40点台前半のオープンウェイト群のほうに近く着地するなら、Beamは堅実な安価モデルであって、それ以上ではない。
価格。定価のないモデルは、コスト論争で勝てない。比較するものが何もないからだ。もしBeamがGLM 5.3の価格帯を下回るなら、効率の話はあっという間に予算の話になる。もし能力面での優位性なしにDeepSeek V4.1 Flashの$0.15と$0.60を上回るなら、それが想定された大量処理の仕事では苦戦するだろう。
重みだ。それが存在するまで、「オープンウェイト」とはまだ付与されていないライセンスについての主張にすぎず、実際に動かせるモデルに対してスコアあたりFLOPsの算術を検証できる者は誰もいない。それはReflectionが自ら招いておきながら、いまだ可能にしていない検証なのだ。
少なくともそのうちのどれかが実現するまでは、実用的な選択は明らかだ。Opus 5.5 は、検討し、コストを見積もり、実際に投入できるモデルだ。Beam は、注視するモデルだ。
この記事で比較したモデル3
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
