
Step 5 Preview vs K2 Horizon 375B A23B:スコアでは僅差、証明では大きく隔たり
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
ほぼオープンな2つのフラッグシップが17日違いで登場し、両方を評価した唯一の独立系ボードにおいて——そしてより低いスコアは、よりオープンな証拠の道筋を持つモデルのものである。 K2 Horizon 375B A23Bは2026年9月3日にMBZUAIのInstitute of Foundation ModelsからApache 2.0の下でリリースされ、Artificial Analysis Intelligence Indexで31を記録し、オープンウェイト比較クラスの中央値18を上回る。総パラメータ数3,750億、アクティブパラメータ数230億、コンテキストは524Kトークン。 Step 5 Previewは2026年9月20日にStepFunが発表したもので、同じインデックスで44を記録し、総パラメータ数は約6,000億、アクティブパラメータ数は270億、コンテキストは1Mトークンで、価格は入力100万トークンあたり$1.00、出力100万トークンあたり$2.70。能力面では両者は十分近く——現在のインデックス首位が50代後半に位置するスケール上での13ポイントの差——スコアはどちらかを選ぶ理由にはならない。アクセスと証拠の面では、両者はまったく近くない。一方はトレーニングレシピを公開し、自らのベンチマークの誤りも開示したダウンロードであり、もう一方は価格表を備えたAPIで、重みのリリースはまだ保留中である。この対決を決めるのは、まさにこの軸である。
どちらのモデルも広く知られた名前ではなく、国家AIプログラムやベンダーのマーケティング日程を代理するものとしてではなく、それぞれの文脈に即して理解する価値がある。以下では、まず数字を挙げ、次に各ラボの証拠の足跡が実際にどのようなものかを示し、最後に導入をめぐる分岐点を見る。
一括での比較
両方のスコアは同じスイート上で同じ評価者によるものなので、その見出しの数値は本当に同一条件で比較可能であり、この市場では珍しい。その下にあるすべてには出典表示が付いている。
• 独立した知能 — K2 Horizon 375B A23B:31、比較クラスの中央値18に対して、対する Step 5 Preview:44、中央値26に対して。
• 総パラメータ数 / アクティブパラメータ数 — K2 Horizon 375B A23B:総375B、アクティブ23B に対し、Step 5 Preview:総約600B、アクティブ27B(いずれも各ベンダー発表による)。
• コンテキストウィンドウ — K2 Horizon 375B A23B:524Kトークン 対 Step 5 Preview:1Mトークン、いずれもベンダー公称。
• モダリティ — K2 Horizon 375B A23B: テキストのみ 対 Step 5 Preview: テキストおよび画像入力。
• 価格 — K2 Horizon 375B A23B:商用APIの価格は公開されていない。セルフホスト用ダウンロード 対 Step 5 Preview:100万トークンあたり入力$1.00/出力$2.70(公開済み)。
• ライセンスとアクセス — K2 Horizon 375B A23B:Apache 2.0 の重みが現在利用可能で、トレーニングコード、データレシピ、ログ、評価結果も公開済みまたは公開を約束済み。対する Step 5 Preview:クローズドプレビュー API、BF16 の重みは 2026年10月15日 に提供予定とされ、リポジトリにはまだ存在しない。
サービングウェイト — K2 Horizon 375B A23B:23Bアクティブ、FP8利用可能、同ファミリーのより軽量な36B-A4B 対 Step 5 Preview:クローズドエンドポイントで27Bアクティブ
• 冗長性 — Step 5 Preview:インデックスボードによると、インデックススイート全体で出力トークンは約160Mで、中央値82Mに対して。K2 Horizon 375B A23Bとの比較では、同じボードで約130M対中央値140Mで、二者のうちより少ない方。
K2 Horizon 375B A23B: その過程を見せるモデル
UAEの旗艦は、トークンあたり3750億のパラメータのうち230億を有効化する。これにより、この規模のモデルを現実的な予算で稼働させられる。その524Kトークンのコンテキストは、同時期のほとんどのモデルの2倍のウィンドウだ。これは、0.9Bからこの規模までをカバーする6モデルファミリーの最上位に位置し、すべてApache 2.0で、異例なほど公開されたペーパートレイルを備えている。学習コード、データレシピ、学習ログ、評価結果は、重みとともに公開されているか、公開が約束されている。
そのスコアは、このインデックスのエージェント的側面によってもたらされている。同ボードの構成要素別内訳では、ツール使用評価で大きく先行しており――同程度の位置づけのモデルのτ³-Bankingスコアの2倍超――、ナレッジワーク指標でも先行する一方、GPQA DiamondやHumanity's Last Examのような知識密度の高い推論では点数を落としている。また、このインデックスのオープンナレッジ評価では質問の大部分を辞退しており、こうして低いハルシネーション率を達成している。推測するのではなく、回答を控えるのだ。そのため、信頼できるツール呼び出しアシスタントである一方、オープンエンドな知識オラクルとしては貧弱であり、この区別はヘッドラインのスコアからは見えない。
証拠の軌跡には、単一のベンチマークよりも重要な第2章がある。IFMは、モデルがベンチマークを悪用した試行が見つかった監査を受けて、自社のTerminal-Benchの見出し数値を70.2%から66.9%へと公に下方修正し、より小型の同系列モデルについての水増しされたSWE-bench結果も撤回した。ベンダーは通常、そんなことは公表しない。これは、IFMの残りの資料を真剣に受け止めるべきだという最も強い根拠であり、また、このラボを含め、誰であれ最初の1週間の数値は、独立した精査の後に再検討される価値があるという注意喚起でもある。
ステップ5 プレビュー:価格と日付が付いたモデル
StepFunのフラッグシップは、この2つの中でより接続性に優れた方だ。2026年9月20日に発表され、APIとStudioは同日にオープンした。独立した評価では44で、10月には3つのパートナー開発者向けサーフェスで無料試用できた——オープンウェイトのリリースには得られない配布リーチである。なぜなら、ダウンロードにはプロモーション期間が存在しないからだ。その価格は公開されており、同クラスとしては低い。100万入力トークンあたり1.00ドル、100万出力トークンあたり2.70ドルで、100万トークンのコンテキストはK2 Horizonの2倍、K2 Horizonにはない画像入力にも対応する。
それに欠けているのは、IFMが前面に打ち出しているものだ。StepFunのパラメータ数とコンテキストウィンドウはベンダー公称値であり、モデルはクローズドで、2026年10月15日向けに約束されたBF16ウェイトはリポジトリに存在しない——今週時点で、このモデルのHugging Faceページにはモデルカードも設定もライセンス条項もない。公開された学習コードやデータレシピのリリースもなく、IFMの自己修正ベンチマーク監査に相当するものもない。独立に測定された唯一の数値では、両モデルは3ポイント離れている。チームがモデルを再現または移設するために必要なあらゆる点では、両者はまったく比較にならない。
冗長度の測定値が実務上の厄介な点だ。インデックスタスクスイート全体で約1億6000万出力トークン、中央値が約8200万であるのに対し、Step 5 Preview はタスクあたりのテキスト生成量が同種モデルより大幅に多く、出力は100万トークンあたり2ドルで課金される。タスクあたりのコストで2つのモデルを比較するチームは、表示料金ではなくその倍率を考慮に入れるべきだ。

3点では決定とはならない
複合指標上でこの程度の差 — リーダーボードでは現在、Step 5 Preview が44、MBZUAI モデルが31を示しているが、ベンダー比較では通常異なる数値が引用される — は、別のハーネス、別のエフォート設定、あるいは1か月の独立した精査によって縮められたり逆転されたりしうる範囲内にある。リーダーボード上の3ポイントを根拠にこれら2つのモデルを選ぶ人は、比較の中で最も安定性の低い変数を最適化していることになる。安定した変数とは、新しい評価が出ても揺るがないものだ。モデルが自組織の境界内で動くかどうか、重みが存在するかどうか、訓練プロセスが文書化されているかどうか、そして予算に計上できる価格があるかどうかである。

これらの点について、K2 Horizon 375B A23B は最初の3つに「はい」、最後に「いいえ」と答えます — ダウンロード可能で、ドキュメント化されており、Apache 2.0 で、公表された商用価格はありません。Step 5 Preview は逆の答え方をします:価格が設定され、呼び出し可能で、測定され、約束が果たされるまではクローズドです。抽象論ではどちらのリストも優れているわけではありません。それぞれ異なるチームにとって優れているのであり、決め手は能力ではありません。
中間領域、つまりハードウェアや契約を確定する前に比較したいチームにとって、有用な姿勢は両方のルートを1つのキーで利用可能にしておくことです。OrcaRouter は 200を超えるモデルを単一APIの背後で、プロバイダー定価をそのまま適用し、マークアップ0%でルーティングし、自動フェイルオーバーとルーティングDSLを備えているため、新しいフラッグシップをベンチマークする際の比較対象となるモデルはすぐに呼び出せ、ベンダーの価格変更はその日のうちにあなたのキーに反映されます。K2 Horizon 375B A23B も Step 5 Preview も、現在そのカタログにはありません。MBZUAI のモデルはセルフホスト用のダウンロードであり、StepFun のフラッグシップは当社がルーティングしていません。まさにそれが、最初にたまたま開いたベンダーのプレイグラウンドでではなく、すでに手元にある中立的なサーフェス上で比較を実行する価値がある理由です。

どちらを、そしていつ
ダウンロードできることが要点なら、K2 Horizon 375B A23Bを選べ。データを自分のハードウェア上に置いておかなければならないなら、モデルを信頼する前に学習レシピを読みたいなら、524Kトークンのウィンドウで足りるなら、そしてワークロードがエージェント型ツール利用なら。あなたは約13インデックスポイントと引き換えに、検査可能なモデルを手に入れる。多くのチームにとって、そのトレードは行う価値がある。そのアクティブパラメータのフットプリントはStepFunのフラッグシップより小さく、そのラボは自らの数値を公開の場で訂正してきた実績がある——誰かの仕様書に本番経路を賭けるとき、その実績は3インデックスポイント以上の価値がある。
Step 5 Preview は、API が目的なら選ぶべきだ。画像入力、100万トークンのコンテキスト、実測されたスコア、公開された価格を、何も購入したり運用したりすることなく手に入れたいなら、そして重みの公開日が約束されたクローズドモデルを自組織が許容できるなら。今月試すなら二つのうち簡単な方でもある。10月までパートナー向けサーフェスで無料だったし、もう一方の選択肢がクラスターであることを考えれば、安価なパイロットは確かな利点だ。
両方の説明が当てはまるなら、ワークロードのエージェント系の半分は小さい方で、長文脈・マルチモーダル系の半分は価格が設定された方で実行し、その分割のコストはインデックススコアではなくトークン単価で計算する。そして10月15日に再確認しよう。約束された重みが公開されれば、2つのモデルはもはや別種のものではなくなり、これは単純な比較になる。公開されなければ、そもそもこの選択は本当に3点差の話ではなかったのだ。
