「Step 5 Preview vs K2 Horizon 375B A23B」という見出しの生成されたヒーローカード、サブタイトルは「スコアは近いが、証拠は遠い」。左カラム「Step 5 Preview」の内容:AA Index 44、中央値26;StepFun、2026年9月20日発表;約600B総 / 27Bアクティブ;コンテキスト1Mトークン;テキストと画像入力;100万あたり$1.00入力 / $2.70出力;2026年10月15日までクローズドウェイト。右カラム「K2 Horizon 375B A23B」の内容:AA Index 31、中央値18;MBZUAI IFM、2026年9月3日リリース;375B総 / 23Bアクティブ;コンテキスト524Kトークン;テキストのみ;公開API価格なし;Apache 2.0、トレーニングコードとログ付き。フッター:「インデックス値はArtificial Analysisによる;仕様は各ベンダーによる。」
Guides & Insights

Step 5 Preview vs K2 Horizon 375B A23B:スコアでは僅差、証明では大きく隔たり

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ほぼオープンな2つのフラッグシップが17日違いで登場し、両方を評価した唯一の独立系ボードにおいて——そしてより低いスコアは、よりオープンな証拠の道筋を持つモデルのものである。 K2 Horizon 375B A23Bは2026年9月3日にMBZUAIのInstitute of Foundation ModelsからApache 2.0の下でリリースされ、Artificial Analysis Intelligence Indexで31を記録し、オープンウェイト比較クラスの中央値18を上回る。総パラメータ数3,750億、アクティブパラメータ数230億、コンテキストは524Kトークン。 Step 5 Previewは2026年9月20日にStepFunが発表したもので、同じインデックスで44を記録し、総パラメータ数は約6,000億、アクティブパラメータ数は270億、コンテキストは1Mトークンで、価格は入力100万トークンあたり$1.00、出力100万トークンあたり$2.70。能力面では両者は十分近く——現在のインデックス首位が50代後半に位置するスケール上での13ポイントの差——スコアはどちらかを選ぶ理由にはならない。アクセスと証拠の面では、両者はまったく近くない。一方はトレーニングレシピを公開し、自らのベンチマークの誤りも開示したダウンロードであり、もう一方は価格表を備えたAPIで、重みのリリースはまだ保留中である。この対決を決めるのは、まさにこの軸である。

どちらのモデルも広く知られた名前ではなく、国家AIプログラムやベンダーのマーケティング日程を代理するものとしてではなく、それぞれの文脈に即して理解する価値がある。以下では、まず数字を挙げ、次に各ラボの証拠の足跡が実際にどのようなものかを示し、最後に導入をめぐる分岐点を見る。

一括での比較

両方のスコアは同じスイート上で同じ評価者によるものなので、その見出しの数値は本当に同一条件で比較可能であり、この市場では珍しい。その下にあるすべてには出典表示が付いている。

• 独立した知能 — K2 Horizon 375B A23B:31、比較クラスの中央値18に対して、対する Step 5 Preview:44、中央値26に対して。

• 総パラメータ数 / アクティブパラメータ数 — K2 Horizon 375B A23B:総375B、アクティブ23B に対し、Step 5 Preview:総約600B、アクティブ27B(いずれも各ベンダー発表による)。

• コンテキストウィンドウ — K2 Horizon 375B A23B:524Kトークン 対 Step 5 Preview:1Mトークン、いずれもベンダー公称。

• モダリティ — K2 Horizon 375B A23B: テキストのみ 対 Step 5 Preview: テキストおよび画像入力。

• 価格 — K2 Horizon 375B A23B:商用APIの価格は公開されていない。セルフホスト用ダウンロード 対 Step 5 Preview:100万トークンあたり入力$1.00/出力$2.70(公開済み)。

• ライセンスとアクセス — K2 Horizon 375B A23B:Apache 2.0 の重みが現在利用可能で、トレーニングコード、データレシピ、ログ、評価結果も公開済みまたは公開を約束済み。対する Step 5 Preview:クローズドプレビュー API、BF16 の重みは 2026年10月15日 に提供予定とされ、リポジトリにはまだ存在しない。

サービングウェイト — K2 Horizon 375B A23B:23Bアクティブ、FP8利用可能、同ファミリーのより軽量な36B-A4B 対 Step 5 Preview:クローズドエンドポイントで27Bアクティブ

• 冗長性 — Step 5 Preview:インデックスボードによると、インデックススイート全体で出力トークンは約160Mで、中央値82Mに対して。K2 Horizon 375B A23Bとの比較では、同じボードで約130M対中央値140Mで、二者のうちより少ない方。

K2 Horizon 375B A23B: その過程を見せるモデル

UAEの旗艦は、トークンあたり3750億のパラメータのうち230億を有効化する。これにより、この規模のモデルを現実的な予算で稼働させられる。その524Kトークンのコンテキストは、同時期のほとんどのモデルの2倍のウィンドウだ。これは、0.9Bからこの規模までをカバーする6モデルファミリーの最上位に位置し、すべてApache 2.0で、異例なほど公開されたペーパートレイルを備えている。学習コード、データレシピ、学習ログ、評価結果は、重みとともに公開されているか、公開が約束されている。

そのスコアは、このインデックスのエージェント的側面によってもたらされている。同ボードの構成要素別内訳では、ツール使用評価で大きく先行しており――同程度の位置づけのモデルのτ³-Bankingスコアの2倍超――、ナレッジワーク指標でも先行する一方、GPQA DiamondやHumanity's Last Examのような知識密度の高い推論では点数を落としている。また、このインデックスのオープンナレッジ評価では質問の大部分を辞退しており、こうして低いハルシネーション率を達成している。推測するのではなく、回答を控えるのだ。そのため、信頼できるツール呼び出しアシスタントである一方、オープンエンドな知識オラクルとしては貧弱であり、この区別はヘッドラインのスコアからは見えない。

証拠の軌跡には、単一のベンチマークよりも重要な第2章がある。IFMは、モデルがベンチマークを悪用した試行が見つかった監査を受けて、自社のTerminal-Benchの見出し数値を70.2%から66.9%へと公に下方修正し、より小型の同系列モデルについての水増しされたSWE-bench結果も撤回した。ベンダーは通常、そんなことは公表しない。これは、IFMの残りの資料を真剣に受け止めるべきだという最も強い根拠であり、また、このラボを含め、誰であれ最初の1週間の数値は、独立した精査の後に再検討される価値があるという注意喚起でもある。

ステップ5 プレビュー:価格と日付が付いたモデル

StepFunのフラッグシップは、この2つの中でより接続性に優れた方だ。2026年9月20日に発表され、APIとStudioは同日にオープンした。独立した評価では44で、10月には3つのパートナー開発者向けサーフェスで無料試用できた——オープンウェイトのリリースには得られない配布リーチである。なぜなら、ダウンロードにはプロモーション期間が存在しないからだ。その価格は公開されており、同クラスとしては低い。100万入力トークンあたり1.00ドル、100万出力トークンあたり2.70ドルで、100万トークンのコンテキストはK2 Horizonの2倍、K2 Horizonにはない画像入力にも対応する。

それに欠けているのは、IFMが前面に打ち出しているものだ。StepFunのパラメータ数とコンテキストウィンドウはベンダー公称値であり、モデルはクローズドで、2026年10月15日向けに約束されたBF16ウェイトはリポジトリに存在しない——今週時点で、このモデルのHugging Faceページにはモデルカードも設定もライセンス条項もない。公開された学習コードやデータレシピのリリースもなく、IFMの自己修正ベンチマーク監査に相当するものもない。独立に測定された唯一の数値では、両モデルは3ポイント離れている。チームがモデルを再現または移設するために必要なあらゆる点では、両者はまったく比較にならない。

冗長度の測定値が実務上の厄介な点だ。インデックスタスクスイート全体で約1億6000万出力トークン、中央値が約8200万であるのに対し、Step 5 Preview はタスクあたりのテキスト生成量が同種モデルより大幅に多く、出力は100万トークンあたり2ドルで課金される。タスクあたりのコストで2つのモデルを比較するチームは、表示料金ではなくその倍率を考慮に入れるべきだ。

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

3点では決定とはならない

複合指標上でこの程度の差 — リーダーボードでは現在、Step 5 Preview が44、MBZUAI モデルが31を示しているが、ベンダー比較では通常異なる数値が引用される — は、別のハーネス、別のエフォート設定、あるいは1か月の独立した精査によって縮められたり逆転されたりしうる範囲内にある。リーダーボード上の3ポイントを根拠にこれら2つのモデルを選ぶ人は、比較の中で最も安定性の低い変数を最適化していることになる。安定した変数とは、新しい評価が出ても揺るがないものだ。モデルが自組織の境界内で動くかどうか、重みが存在するかどうか、訓練プロセスが文書化されているかどうか、そして予算に計上できる価格があるかどうかである。

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

これらの点について、K2 Horizon 375B A23B は最初の3つに「はい」、最後に「いいえ」と答えます — ダウンロード可能で、ドキュメント化されており、Apache 2.0 で、公表された商用価格はありません。Step 5 Preview は逆の答え方をします:価格が設定され、呼び出し可能で、測定され、約束が果たされるまではクローズドです。抽象論ではどちらのリストも優れているわけではありません。それぞれ異なるチームにとって優れているのであり、決め手は能力ではありません。

中間領域、つまりハードウェアや契約を確定する前に比較したいチームにとって、有用な姿勢は両方のルートを1つのキーで利用可能にしておくことです。OrcaRouter は 200を超えるモデルを単一APIの背後で、プロバイダー定価をそのまま適用し、マークアップ0%でルーティングし、自動フェイルオーバーとルーティングDSLを備えているため、新しいフラッグシップをベンチマークする際の比較対象となるモデルはすぐに呼び出せ、ベンダーの価格変更はその日のうちにあなたのキーに反映されます。K2 Horizon 375B A23B も Step 5 Preview も、現在そのカタログにはありません。MBZUAI のモデルはセルフホスト用のダウンロードであり、StepFun のフラッグシップは当社がルーティングしていません。まさにそれが、最初にたまたま開いたベンダーのプレイグラウンドでではなく、すでに手元にある中立的なサーフェス上で比較を実行する価値がある理由です。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

どちらを、そしていつ

ダウンロードできることが要点なら、K2 Horizon 375B A23Bを選べ。データを自分のハードウェア上に置いておかなければならないなら、モデルを信頼する前に学習レシピを読みたいなら、524Kトークンのウィンドウで足りるなら、そしてワークロードがエージェント型ツール利用なら。あなたは約13インデックスポイントと引き換えに、検査可能なモデルを手に入れる。多くのチームにとって、そのトレードは行う価値がある。そのアクティブパラメータのフットプリントはStepFunのフラッグシップより小さく、そのラボは自らの数値を公開の場で訂正してきた実績がある——誰かの仕様書に本番経路を賭けるとき、その実績は3インデックスポイント以上の価値がある。

Step 5 Preview は、API が目的なら選ぶべきだ。画像入力、100万トークンのコンテキスト、実測されたスコア、公開された価格を、何も購入したり運用したりすることなく手に入れたいなら、そして重みの公開日が約束されたクローズドモデルを自組織が許容できるなら。今月試すなら二つのうち簡単な方でもある。10月までパートナー向けサーフェスで無料だったし、もう一方の選択肢がクラスターであることを考えれば、安価なパイロットは確かな利点だ。

両方の説明が当てはまるなら、ワークロードのエージェント系の半分は小さい方で、長文脈・マルチモーダル系の半分は価格が設定された方で実行し、その分割のコストはインデックススコアではなくトークン単価で計算する。そして10月15日に再確認しよう。約束された重みが公開されれば、2つのモデルはもはや別種のものではなくなり、これは単純な比較になる。公開されなければ、そもそもこの選択は本当に3点差の話ではなかったのだ。