「Reflection Beam vs Kimi K3」というタイトルの生成されたヒーローカード。サブラインは「同じベンチマーク名、2つの異なるハーネス」。3つの統計チップには「Terminal-Bench 2.1: 80.1 vs 88.3」「独立実行: 85.0」「価格: 未公開 vs $3 / $15」と表示されている。その下には3つのフラットなラインアイコンがある。チェックマーク付きのクリップボード、棒を測る定規、棒グラフに重ねた虫眼鏡。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

Reflection Beam vs Kimi K3:同じベンチマーク名、二つの異なるハーネス

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Reflection Beam は Terminal-Bench 2.1 で 80.1 を記録する。Kimi K3 は 88.3 を記録する。これら二つの数値を並べれば、今週の報道の大半がそうしているように、Beam はこの分野で最高のオープンモデルからおよそ8ポイント遅れていると結論づけることになる。だが、その二つの数字は同じ部屋から出たものではない。Beam の 80.1 はベンダー報告値で、Reflection 自身のローンチ投稿の表から取られている。Kimi K3 の 88.3 もベンダー報告値で、今度は Moonshot 自身の表からだ。そしてベンダーの表が競合他社のスコアを載せるのは、それがベンダー自身のハーネスで、ベンダー自身のプロンプトセットのもと、ベンダー自身のエフォート設定で実行された場合だけである。第三者の Artificial Analysis はその後、同じ名前のベンチマークで Kimi K3 を実行し、85.0 を公表した。それは 8.2 ポイントではなく 4.9 ポイントの差だ。しかも、この補正の方向は完全に予測可能である。なぜなら、削られていく数字は常に、証明すべき何かを持つラボから出たものだからだ。

これこそが、この記事のタイトルが約束する比較が抱える問題のすべてであり、本稿が前半をスコアではなく出所の確認に費やしている理由でもある。Reflection Beamは、トークンあたり230億パラメータが有効になる5,010億パラメータのスパースなMixture-of-Expertsモデルで、2026年10月5日にReflection AIが発表し、同日にOpenAI互換のベータ版エンドポイントが稼働した。Kimi K3はMoonshot AIのフラッグシップ・オープンモデルで、当社自身のカタログに2026年7月15日リリースとして掲載されており、Artificial Analysisによる独立したスコアリングも受けている。一方は料金表と第三者によるハーネス実行を備えた出荷済み製品であり、もう一方はウェイトもテクニカルレポートも価格もまだ存在しない、ウェイトリスト制のベータ版である。両者を比較することは対等な営みではなく、そう見せかければ、一見正確でありながら実際には誤っているページが出来上がるだけだ。

30秒版

• Beam は理論上は FLOP あたりでより高速だが、実際には価格が設定されておらず、再現もされていない。Kimi K3 は第三者によって評価されており、100万トークンあたり入力 $3.00、出力 $15.00 の価格で、一般提供されている。

• 両者が実行された唯一のベンチマーク——Terminal-Bench 2.1——では、双方の数値が中立的なハーネスから得られたものであれば、正直な差は約5ポイントであり、8ポイントではない。

• Beamの真の強みは数値ではなく構造にある。23Bのアクティブパラメータというサービングプロファイルと、約束されたApache 2.0ライセンスだ。どちらも現在利用できるものではない。

• 今週モデルが必要なら、これは賭けではない。出荷中のモデルが1つと、ウェイトリストが1つだ。

Reflectionが実際に公表した内容、そしてそれが誰に対するものだったのか

Reflectionの発表記事では、他7つのモデルを相手に1つのスコアカードを並べている。Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8 Max、DeepSeek V4.1 Flashだ。表の数値はすべてベンダー申告によるもので、独立に再現されたものは一つもない。またArtificial AnalysisにはReflection Beamのページが存在せず、2026年10月6日時点で同サイトのモデルページは404になる。オリジナルでは、モデルが実行されなかったためNRと記されたセルがいくつかある。

以下が、その表の Beam 対 K3 の部分全体です。次元ごとに 1 行です:

• Terminal-Bench 2.1 — Beam 80.1 vs Kimi K3 88.3

• SWE-Bench Pro v2-Hard — Beam 77.2 対 Kimi K3 88.2

• DeepSWE v1.1 — Beam 44.4 対 Kimi K3 68.0

• SWE Atlas コードベースQnA — Beam 34.6 対 Kimi K3 68.0

• HLE、ツールなし — Beam 36.2 対 Kimi K3 46.9

• GPQA Diamond — Beam 90.5 vs Kimi K3 93.5

• SciCode — Beam 49.7 対 Kimi K2 58.7

• MCP Atlas — Beam 78.7 対 Kimi K3 82.3

• コンテキスト管理を用いたBrowseComp — Beam 77.4 対 Kimi K3 91.2

• コンテキスト管理を用いた DeepSearchQA — Beam 80.1 対 Kimi K3 95.0

そのリストを正直に読めば、ローンチの輪郭が見えてくる。Reflectionは、どこかでK3に勝利したと主張しているわけではない。同等の推論スコアで、GLM 5.2より3~4倍少ない推論計算量を使いながら、あるティアの上位付近に着地すると主張しているのだ——そして、両モデルが接近している唯一の行、Terminal-Bench 2.1こそ、比較が最も信頼できない行である。

なぜハーネスはスコアよりも重要か

ベンチマーク名はラベルであって、仕様ではない。Terminal-Bench 2.1 は、特定のエージェント・スキャフォールドの下で、特定のリトライポリシー、特定のトークン予算、特定の推論エフォート設定で実行される、特定のタスク群を意味する。2つのラボがどちらも正直に「Terminal-Bench 2.1」の数値を報告しながら、比較不可能な数値を出してしまうことがある。なぜなら、分散の大半はスキャフォールドとエフォート設定に宿るからだ。Artificial Analysis が組織として存在するのは、まさにこの理由による。1つのハーネスを、1つの構成で、多くのモデルにまたがって実行し、それによって自らの数値同士を差し引きできるようにしているのだ。

つまり、ReflectionがBeamについて表示する80.1は、ベンダー自身のハーネス上で測られたベンダー公表値であり、K3について表示する88.1もまたベンダー公表値だ——そのベンダーとはほかならぬReflection自身であり、自社の競合を自ら測定している。この2番目の数値は、この行で最も信頼性の低い数字である。競合の重みを自前の足場で走らせるラボには、それを競合にとって最良の構成で走らせる気もなければ、実際に選んだ構成を開示する義務もない。そこに不誠実な点は一切ない。ただ、その出所が、報道がこの数値に置いてきた重みを支えられないというだけの数値なのだ。

Artificial Analysis自身の実行では、Kimi K3はTerminal-Bench 2.1で85.02、別の、より難しいテストであるTerminal-Bench v4.0では12.6、AA Coding Indexは76.2(ボード上のモデルの中で9位)、Intelligence Indexは43.6、GPQA Diamond 93.5、HLE 46.9、SciCode 59.5、tau-banking 45.98、Long-Context Recallは88.7です。これらは私たち自身のシステム内のK3のカタログカードから読み取ったもので、出典は artificialanalysis.ai、評価スナップショットの日付は2026年7月15日です。Beamはそのリストが扱う範囲で数値を1つ持つだけで、それはReflectionに由来します。その不在は恒久的ではなく一時的であるべきです。Artificial Analysisは、Reflectionが同社にアクセスを提供したこと、そして同社がそのモデルをベンチマーク中であることを述べています。そして同社自身の初期の文言——Beamは「その知能レベルで私たちが見てきた中で最もトークン効率の良いオープンモデルの1つになるだろう」——は、ベンチマーク機関が結果を報告しているのではなく、期待を示しているものです。そのスコアが出力されるまで、この記事の数値は差し引けるものではなく、私たちはそうでないふりをするつもりはありません。

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

それぞれが何であり、それぞれが何であるか

コスト比較は僅差ではなく、そもそも比較と呼べるものでもない。なぜなら、その片側が空白だからだ。

• 価格 — Kimi K3は100万トークンあたり入力$3.00/出力$15.00、キャッシュ読み取りは$0.30。一方、Reflection Beamは、Reflectionのブログ、ドキュメント、モデル一覧のどこにも価格が公開されておらず、プラットフォームのコンソールはサインアップの壁の向こうにある。

• コンテキスト — Kimi K3では1,048,576トークン、Beamベータ版では256,000トークン。Beam自身のドキュメントには「コンテキストウィンドウはベータ期間中に変更される可能性があります」という脚注が付いている。

• モダリティ — Kimi K3はテキストと画像を受け付けます。Reflection Beamはテキスト入力・テキスト出力で、提供開始時点では画像や音声の経路はありません。

• 提供状況 — Kimi K3 は本日より一般提供中。Reflection Beam はウェイトリスト制のベータ版で、モデルの重みは10月後半に Apache 2.0 の下で公開予定。

• 独立系スコア — K3にはArtificial Analysisの完全な行があるが、Beamにはない。

• サービングプロファイル — Kimi K3は、当社のplaygroundで過去1週間に実施した独自測定において毎秒46.8出力トークンを記録する、大規模でdense寄りのフロンティアモデルです。Beamの23Bアクティブパラメータは、低レイテンシとトークンあたりの低コストを実現する真のアーキテクチャ上の根拠ですが、それを測定できる公開エンドポイントは存在しません。

効率性の主張には、もう一言だけ慎重に扱う価値がある。なぜならそれは今回のローンチの目玉であり、背負える以上の役割を負わされているからだ。Reflectionの「推論計算量が3〜4分の1」は、FLOPsをアクティブパラメータ数の2倍に平均生成トークン数を掛けたものとして近似するグラフから導かれている。この式は、プロンプトのプリフィル、アテンションのコスト、サービングのオーバーヘッドを意図的に除外している——長いコンテキストを扱うエージェント作業で請求額の大半を占める部分だ。計算量比率の概算の見積もりであって、実測ではなく、ドル金額でもなく、しかもベンダー自身が作ったものである。これは、重みがあれば他の誰かが検証できる仮説として扱うべきだ。

この中でのOrcaRouterの位置づけ

Kimi K3は当社のルートの一つです。100万トークンあたり入力$3.00、出力$15.00で掲載されていますキャッシュ読み取りは$0.30で、これはMoonshotのプロバイダー料率を一切上乗せせずそのまま通したものです。つまり、Moonshotが料金表を改定すれば、当社ページの数字もリセラーが更新するタイミングを待つのではなく同じ日に動きます。これは以下から呼び出せますOpenAI互換の1つのキーから、200以上もの他のモデルと並んで、これがここで特定の理由から重要になります。「BeamかK3か?」という問いへの正直な答えは、ヘッジしようとしているチームは選ぶべきではない、というものです。なぜなら自動フェイルオーバーは自分で構築するものではなくルーティングの一部だからです。Beamのようなモデル — ベータ版で、価格未定で、第三者によるスコアリングもない — は、クリティカルパスに置くものではなく、トラフィックの一部に割り当てるべきまさにそれです。デフォルトでは作業をK3にルーティングし、ウェイトリストの招待が届いたらBeamに一部を流し、エラー時にはルーティングがK3にフォールバックするようにします。それは未実証のモデルについて下せる判断です。それに本番パスを賭けるのはそうではありません。

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

何がこの評決を変えるでしょうか

三つのこと、大事な順に。

価格。BeamがK3ティアを下回る価格で登場すれば、効率性の主張は理論ではなく具体的なものになる。第二に、重み。Apache 2.0と技術レポートがあれば、2、3ノードを持つ誰もが、固定された品質基準でGPUあたり毎秒トークン数を測定できる——計算能力の主張を実際に決着させるテストだ。第三に、サードパーティ製ハーネスでの実行。ReflectionはArtificial Analysisにアクセスを提供しており、そこからスコアが得られると見込まれている。その数値が公表されるまで、出回っているBeam対K3のあらゆる数値は、2社のうちどちらかが書いた文書に遡る。

直接答える価値のある2つの質問

Reflection BeamはKimi K3よりも優れていますか?

今日入手できる証拠に基づけば、いいえ——そして、そうであるという証拠は誰も公表していません。Reflection自身の表では、上記の共通する10行すべてでK3が先行しており、そのうちいくつかは(SWE Atlas 34.6 対 68.0、DeepSearchQA 80.1 対 95.0)接戦とは言えない差でリードしています。Beamの主張は能力あたりのコストであり、その主張は、重みと価格が存在するまではベンダーが描いた図表にすぎません。

K3 で構築する前に、Beam の重みを待つべきでしょうか。

セルフホスティングが好みではなく要件である場合に限る。なぜなら、それこそが両者が代替品になり得ない唯一の軸だからだ — K3はAPI専用である一方、BeamはApache 2.0の重みを約束している。APIを呼び出しているのであれば、K3は利用可能で、スコアも価格も提示されており、Beamはウェイトリストだ。その判断のためにプロジェクトを遅らせる価値があるなどという状況は存在しない。

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflectionは我々に日付とチャートを与えたが、日付はモデルではない。このローンチが本当に立証している唯一のことは、501Bモデルが23Bのパラメータを活性化し、オープンフロンティアから数ポイント以内に収まるように訓練できるということだ——もし重みが届き、その数値が保たれるなら、これは効率に関する意味のある結果である。それは、第三者が実際に測定したモデルから作業を移す理由にはまだならない。