
Step 5 Preview対Muse Glimmer:Frontier APIとラップトップモデル
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
リーダーボード上では、Step 5 PreviewとMuse Glimmerは決して僅差ではない。Artificial Analysis Intelligence Index で44対17——現在の首位が50点台後半に位置するスケールにおける27点差——であり、どんなチューニングでもこの差は埋まらない。チームが実際に答えを出さなければならない問い、すなわち自分のトークンはどこで動くのかという問いにおいては、両者は直接の競合である。Step 5 Preview は StepFun のフラッグシップで、2026年9月20日に発表され、総パラメータ数は約6,000億、アクティブは270億、コンテキスト長は100万トークン、価格は入力100万トークンあたり1.00ドル、出力100万トークンあたり2.70ドルで、ネットワーク経由でしか利用できない。Muse Glimmer は Meta Superintelligence Labs の300億パラメータのオープンウェイトなエージェント型モデルで、2026年8月10日に Apache 2.0 のもとでリリースされ、4ビットに量子化された状態で提供されるため20GB未満のメモリに収まり、ネットワークを抜いた状態でも単一のコンシューマー向けGPUで動作する。この組み合わせの正しい読み方は「どちらがより賢いか」ではない。「能力か、それとも境界か——この2つの制約のうち、あなたのワークロードが動かせないのはどちらか」である。
この比較は、この市場が身につけてしまった習慣――複合インデックスのスコアをモデルの価値のすべてと見なすこと――に対する有益な矯正でもある。27ポイントの差は現実のものであり、ファイルに載っている唯一の数字ではない。長文脈検索では、同じ独立系ボードが Muse Glimmer を、はるかに大きなウェイトクラスのオープンウェイトモデルと0.5ポイント以内に位置づけており、Meta 自身のエージェントベンチマークも、ラップトップで動くモデルとしては立派なものだ。一方、Step 5 Preview で最も多く指摘される弱点は能力ではなく冗長さであり、約束されたウェイトが10月15日に届くまでクローズドのままだ。
2つのモデル、まったく異なる2つのオブジェクト
Step 5 PreviewはStepFunのインフラストラクチャから提供されるMixture-of-Expertsシステムだ。総パラメータ数は約600B、トークンあたりのアクティブパラメータは27B、テキストと画像の入力に対応し、コンテキストウィンドウは1Mトークン。独立系のIntelligence Indexスコアは44で、同等モデルの中央値26を上回る。出力速度は毎秒87トークンで、同じベンチマークの測定における平均78を上回り、このインデックスのタスクスイート全体で約1億6,000万の出力トークンを生成した。中央値のモデルは約8,200万トークンなので、作業単位あたりおよそ2倍のテキストを生成していることになり、料金は100万トークンあたり2.70ドルだ。BF16の重みは2026年10月15日に公開すると約束されていたが、まだリポジトリには存在しない。そのため現時点でこのモデルは、あなたにとってAPIとしてのみ存在している。
Muse Glimmer は正反対の存在だ。これは Meta のより大規模な Muse Spark 教師モデルからのロジット蒸留によって学習された 30B パラメータモデルで、その後、長文コンテキストのエージェントデータで微調整され、ツール使用に向けて強化されている。Meta はこれを 4 ビットに量子化して提供しており、それによりメモリはフル精度時の 55 GB 超から 20 GB 未満へと抑えられ、24 GB または 32 GB の VRAM の範囲内に収まる。また Meta によって Nvidia RTX 5090 上、および Apple M4 Max と M5 Max シリコン上でテストされた。100 を超える言語にわたるテキストと画像の入力を受け付け、131,072 トークンのコンテキストをサポートし、262,144 まで拡張可能で、目標を受け取り、それをステップに分解し、ツールを呼び出し、失敗した呼び出しを止まることなく再試行するように作られている。Apache 2.0 であり、オフラインで動作する。
• 独立スコア — Step 5 Preview:同クラスの中央値26に対して44、対するMuse Glimmer:ハイ構成で同じ指標では17。
• 規模 — Step 5 Preview:StepFunによると合計約600B、アクティブ27B 対 Muse Glimmer:合計30B、20GB未満で4ビットに量子化
• コンテキストウィンドウ — Step 5 Preview:100万トークン 対 Muse Glimmer:131,072、Metaによると262,144まで拡張可能。
• 価格 — Step 5 Preview:100万トークンあたり入力$1.00 / 出力$2.70(公表値)、Muse Glimmerとの比較:トークン単位の課金なし、GPUは自前で用意。
• 実行場所 — ステップ5 プレビュー: ベンダーのサーバー、HTTP経由 対 Muse Glimmer: 自分のハードウェア、オフライン
• ライセンス — Step 5 Preview:クローズドプレビュー、モデルの重みは2026年10月15日に提供予定 対 Muse Glimmer:Apache 2.0、現在ダウンロード可能。
• 長文コンテキスト検索 — Muse Glimmer は index board の長文コンテキスト推論評価で 80.0 を記録しており、価格帯が数倍異なるモデルに 0.5 ポイント以内で迫り、Step 5 Preview の読解力にも十分近いため、事実探索作業においてその差は意思決定を左右するものではありません。
27のポイント、そしてそれらが測らないもの
20GBのメモリで動作するように蒸留された30Bモデルが、汎用知能指数で600Bのフラッグシップに勝つことはありません。Meta自身の資料もそう主張していません。そのフレーミングの一つは、Glimmerがフルスケールのクラウドモデルの生の推論能力に匹敵するようには設計されていないと率直に述べています。したがって、スコア17はエンジニアリングへの評価ではなく、異なる目的を重視した結果として予想されるものです。正しい問いは、そのギャップが実際にあなたのタスクのどれをカバーするのかということです。
長文コンテキストの読解は、両者が最も接近する領域であり、直感が通用しなくなる領域でもある。Muse Glimmerは、ボードの長文コンテキスト推論評価で80.0を記録している。これはフロンティアモデルにとっては特筆すべきものではないが、コンシューマー向けGPU上で動作するモデルにとっては注目に値するスコアだ。あなたのワークロードが長文書の検索、要約、抽出であれば、そのレベルのローカルモデルは明らかに間違ったツールというわけではない。そして、リクエストがあなたのマシンから一切出ないという事実は、APIからはいくら払っても買えない機能だ。
さらに、この比較にはMetaの数値が示していない部分がある。マルチエージェント・オーケストレーションに関する査読済み研究では、Muse-Glimmer-30Bを制御された環境——同じタスク、同じハーネス、同じコンサルタント——で検証したところ、より大規模なフロンティアモデルが生成した候補を一つも回復できず、各設定で3回の試行すべてに失敗した。これは一つの構成に関する単一の研究にすぎず、モデルのページでは決して表面化しない種類の証拠である。より弱いオーケストレーターがより強力なモデルの失敗から回復しなければならないエージェント型パイプラインにとって、これは本記事で最も意思決定に関わる結果であり、Metaがベンダーとして報告したどのベンチマークよりも先に読む価値がある。
念のため言っておくと、これらのベンチマークはMeta自身によるもので、再現はされていない。SWE-Bench Verifiedでは76.0%、SWE-Bench Proでは51.2%、TerminalBench 2.1では51.7%、OSWorld-Verifiedでは65.9%、GPQA Diamondでは83.5%、Humanity's Last Examでは22%、MCP-Atlasでは75.5。これらは同社のモデルと同じサイズクラスのモデルに対して測定されたものであり、フロンティア推論モデルというよりも、能力の高いローカルエージェントを描写している。

境界が実際どこにあるのか
Step 5 Previewの構造上の強みは、ローカルではできない仕事をこなす点にある。100万トークンのコンテキスト、画像入力、実測されたフロンティア隣接スコア、そしてハードウェアを一切買わずに毎秒87出力トークン——下書き作成、計画立案、大規模リポジトリ全体のコードレビュー、あるいはモデルの天井そのものがボトルネックになるあらゆる場面では、APIが優位に立ち、その27点差が議論のすべてだ。その代償はMuse Glimmerとは正反対である。プロンプトはあなたの境界の外へ出ていき、料金はトークンごとに再適用され、モデルの冗長さゆえに長文出力のワークロードは$2.70という料率が示唆するより高くつく。

Muse Glimmerの強みは、外に出せない仕事を担えることにある。データが規制対象である場合、レイテンシ予算が数ミリ秒である場合、マシンがオフラインである場合、あるいは100万回目のリクエストの限界コストがゼロでなければならない場合、どのAPIも候補にならない——これも、他のどれも。その代償は能力だ。44が存在する場面で17を選んでいるのであり、エージェント型オーケストレーションでは、より強力なモデルの誤りから回復できないコーディネーターを選んでいる可能性がある。
ほとんどのチームにとって、答えは二択ではなく分割であり、その分割には居場所が必要です。OrcaRouter は200 以上のモデルを、1 つの API キーと 1 つの請求で、0% のマークアップ、プロバイダーの定価をそのまま適用してルーティングします。さらに自動フェイルオーバー、そしてタスク・コスト・レイテンシーに応じてトラフィックを振り分けるルーティング DSL を備えています。Step 5 Preview も Muse Glimmer もそのカタログにはありません — StepFun のフラッグシップは当社のルーティング対象ではなく、Glimmer はローカルダウンロードだからです — つまり、提供される価値はどちらのモデルへのアクセスではありません。それは、あなたがそれらをベンチマークする際の比較対象となるセットであり、今日あなたが呼び出せるものです。そうすることで、ローカルかリモートかの判断は、最後に見たベンダーのページではなく、あなた自身のタスク分布によって決まるのです。

どうやって決めるか
上限が制約条件である場合は、Step 5 Preview を選んでください。タスクがオープンエンド、マルチモーダル、長コンテキスト、あるいは有能なプランナーを必要とするという意味でエージェント的であるなら、APIモデルは2つのうちそれらを実行できる唯一のものであり、その価格は同クラスとしては十分に低いため、試験導入はプロジェクトではなく予算項目になります。冗長さを見込んで予算を確保し、10月15日のウェイト日がずれることを前提に計画し、建物の外に出してはならないワークロードは対象に含めないでください。
境界が制約条件になる場合は Muse Glimmer を選びましょう。データを送信できない場合、飛行機や工場内で実行する必要がある場合、あるいは利用量が多くトークン単位の課金が非現実的になる場合、20 GB に収まる 30B Apache-2.0 モデルが現実的な選択であり、その長文脈検索の結果は十分に良好なので、能力差がすべてのワークロードで表面化するとは限りません。そこに信頼を置く前にオーケストレーションでテストしてください。なぜなら、そこが独立した証拠の最も薄弱な領域だからです。
両方の制約が同時に効くなら、両方を動かそう。動かせないデータにはローカルを、より大きなモデルを必要とするタスクにはAPIを。そしてルーティングの判断は、移行ではなく設定変更で済むようにしよう。重要な比較は44対17ではない。あなたのリクエストのうちどれがマシンの外に出てもよいかであり、それはあなた自身のトラフィックにしか答えられない問いだ。
