「Step 5 Preview 対 Intern-S2 Mobius」という見出しの2カラム比較カードを生成しました。サブタイトルは「借りる600Bの旗艦か、動かす35Bの推論モデルか」。左カード「Step 5 Preview」の内容:AA Index 44(実測値);総パラメータ約600B/アクティブ27B;コンテキスト100万トークン;100万トークンあたり入力$1.00/出力$2.70;非公開のプレビューAPI;重みは2026年10月15日に公開予定。右カード「Intern-S2 Mobius」の内容:独立したスコアなし;パラメータ35B;コンテキストは未公開;API価格なし、セルフホスト;Apache 2.0、現在利用可能;約4倍の高速化を主張、未検証。フッターには「Step 5 Previewの数値はStepFunおよびArtificial Analysisによるもの;Intern-S2 Mobiusの数値はInternLMの主張であり、未検証。」と記載されています。
Engineering & Research

Step 5 Preview vs Intern-S2 Mobius:必要なのは600Bのフラッグシップモデルか、それとも高速な35Bの推論モデルか?

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

両者を比較する正直な理由は、Step 5 PreviewとIntern-S2 Mobiusが似ているからではない。それは、同じ購入者——推論ワークロードを実行する必要があり、クラスターを買う気はないチーム——からの異なる2つの問いへの答えだからだ。StepFunのStep 5 Previewは、2026年9月20日に発表された大きい方の答えだ。総パラメータ数は約6000億、アクティブは270億、100万トークンのコンテキスト、独立測定されたArtificial Analysis Intelligence Indexスコアは44、公表価格は入力100万トークンあたり1.00ドル、出力100万トークンあたり2.70ドル。InternLMのIntern-S2 Mobiusは、2026年7月29日にリリースされた小さい方の答えだ。Mobius-v0アーキテクチャ上に構築され、Qwen3.5-35Bから継続的事前学習を行った350億パラメータのオープンウェイトモデルで、その中心的な主張は能力ではなく速度——学習元のベースラインに対する推論ベンチマークでエンドツーエンド約4倍の高速化——にあり、いかなる独立したベンチマークスコアもない。一方は借りるフラッグシップ、もう一方は自分で実行する小規模モデルだ。この比較の本質は、目の前のワークロードがそもそもフラッグシップを正当化するかどうかにある。

数字の前にひとつ事務的な確認を。これは人によっては実際に時間を取られる話なので。InternLMはIntern-S2の名の下に複数のモデルを出荷しており、それらは同じものではない。Intern-S2-397Bは科学的マルチモーダルのフラッグシップであり、Intern-S2 Mobiusはここで扱う35Bの効率的な推論モデルで、以前のIntern-S2リリースはまた別のモデルだ。「Intern-S2」を検索して397Bモデルのベンチマーク表にたどり着いたなら、それは別のチェックポイントについて読んでいる。

各モデルが実際に主張していること

Step 5 Previewの主張は2026年のフラッグシップとしてはありふれたもので、そのうちの一つは独立に検証されている。StepFunは総パラメータ約600B(アクティブ27B)、テキストと画像の入力、100万トークンのコンテキストウィンドウ、入力・出力それぞれ100万トークンあたり$1.00/$2.70の価格を挙げている。Artificial Analysisによる計測では、Intelligence Indexで44となり、同種モデルの中央値26を上回っている。出力は毎秒87トークンで平均78を上回り、インデックスのタスクスイート全体で生成された出力トークンは約1億6000万で、中央値の8200万に対して約2倍——典型的な冗長出力のおよそ2倍であり、出力課金のモデルではこれが重要になる。

Intern-S2 Mobiusの主張はアーキテクチャに関するもので、より限定的だ。その設計は知識を計算から切り離す。グローバルに共有されるMemoryが知識ベクトルを保持し、複数のReasonerがそれに対して反復的に隠れ状態を照会して洗練させる。従来のトランスフォーマーのように、記憶と計算を層ごとに結び付けるのではなく。InternLMが示す利点は、その派生元であるQwen3.5-35Bと比べて推論ベンチマークでエンドツーエンド約4倍の高速化を実現し、推論スコアは同等かそれ以上、さらに可視化される思考の連鎖も短いことだ。モデルはApache 2.0で、テキストと画像の入力に対応し、ダウンロード可能である。

• 規模 — Step 5 Preview:合計約600B、StepFunは27Bがアクティブ 対 Intern-S2 Mobius:合計35B

• 独立系スコア — Step 5 Preview:Artificial Analysis Intelligence Index で 44、これに対する Intern-S2 Mobius:第三者による公表値なし。

• 速度 — Step 5 Preview:平均78に対して毎秒87出力トークン。index boardによる測定で、Intern-S2 Mobiusと比較:「ほぼ4倍」、自身のQwen3.5-35Bベースライン比。ベンダー報告であり未再現。

• コンテキストウィンドウ — Step 5 Preview: StepFunでは1Mトークン、対してIntern-S2 Mobius: 独立したコンテキスト値は公開されていない。

• 価格 — Step 5 Preview:100万トークンあたり入力$1.00 / 出力$2.70 対 Intern-S2 Mobius:API価格なし。ハードウェアの費用を支払う。

• ライセンスとアクセス — Step 5 Preview:ベンダーのAPI経由でのクローズドプレビュー、BF16ウェイトは2026年10月15日提供予定 対 Intern-S2 Mobius:Apache 2.0ウェイトが現在利用可能。

• 冗長性 — Step 5 Preview:インデックスボードによれば、インデックススイート全体で約1億6000万の出力トークンで、中央値8200万に対して(Intern-S2 Mobius との比較):InternLM が主張するより短い可視推論トレースは、他の誰も測定していない。

4倍という主張、そしてそれがここで興味深い数字である理由

2社の数字を並べて見れば、食い違いは明らかだ。StepFunの見出しは能力スコアであり、InternLMのそれはスループット倍率だ。これは偶然ではなく、この比較で最も有用な点である。推論タスクにおける4倍のエンドツーエンド高速化は、他社のハーネスに触れてもなお生き残るなら、インデックス上の数ポイントよりも大規模デプロイにとって価値がある——ワークロードを動かす際の算術そのものを変えるからだ。Intern-S2 Mobiusは、天井の能力ではなく、1ドルあたりの秒間トークン数がボトルネックになっているチームを狙っている。

注意点は、この倍率が Qwen3.5-35B を基準に測定されていることだ。Intern-S2 Mobius はそのモデルから継続事前学習されたもので、Qwen3.5-35B には Mobius トレーニングが施されていない。これは競合相手との比較ではなく、自身の出発点との比較である。スループットの主張を独立に再現したものはなく、第三者によるインデックススコアもなく、ベンダー以外が公開したコンテキストウィンドウもない。「ほぼ4倍」は、仕様としてではなく、興味深いアーキテクチャ上のシグナルであり、自分のハーネスで検証すべき仮説として扱うべきだ。

Step 5 Preview は逆の証拠プロファイルを持つ。その能力値は独立に測定されているが、効率に関する話は弱点だ。インデックスボードの冗長性の測定結果——中央値のモデルが約8,200万出力トークンを出すのに対し、約1億6,000万出力トークン——は、$2.70という出力価格に対する正直な相殺要因であり、長い構造化生成に依存するワークロードは、表示価格が示唆するよりも実質的に多くを費やすことになる。Intern-S2 Mobius にはなく、これにはあるのは、そもそも公開されたAPI価格そのものであり、まさにそれが比較を可能にしている。

約束されたベンダービルドのHugging Faceリポジトリは、物語のもう半分を明かしている。これが、発表済みでありながらまだ出荷されていないオープンウェイトのリリースというものの姿である。

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

フットプリントの問いが実際に効いてくるのはどこか

Intern-S2 Mobiusの真の強みは、誰も測定していないそのスコアではなく、間違っていた場合にどれだけのコストを払うことになるかにある。350億パラメータという規模は、チームがすでに所有しているハードウェア上で提供でき、発注書なしで評価でき、何も償却せずに放棄できる大きさだ。これは、フラッグシップがどれだけ点数を稼ごうと太刀打ちできない構造的優位性であり、この比較を不釣り合いとして切り捨てるのではなく、行う価値がある理由でもある。

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

旗艦モデルの強みは、その裏返しにある。Step 5 Previewの100万トークンのコンテキスト、画像入力、そして測定された汎用推論能力は、35Bモデルではうまくカバーできる可能性が低い作業をカバーしており、しかも無料ウィンドウの期間中は試すのに何のコストもかからない——このモデルは10月中に3つの別々の開発者向けサーフェスで無料提供されてきた。これらの事実はどちらもセルフホストモデルには当てはまらない。自前のGPUを動かすための無料の1週間は存在せず、その決定を明細項目に変換してくれる価格表も存在しない。

比較をプロモーション期間のあとまで残したいなら、作るべきは設定ではなくハーネスだ。OrcaRouter は200 以上のモデルを 1 つの API キーと 1 つの請求の背後で、マークアップ 0%、プロバイダーの定価をそのまま流してルーティングする。自動フェイルオーバーを備え、コスト、レイテンシ、ケイパビリティでトラフィックを誘導するルーティング DSL もある。Step 5 Preview も Intern-S2 Mobius もそのカタログにはない — StepFun のフラッグシップは当社ではルーティングしておらず、Intern-S2 Mobius はセルフホストのダウンロードだ — つまりここでの価値は、どちらかにアクセスできることではない。ベンチマークの相手となるモデルが鍵 1 つで手に入るということであり、測定によって下された判断は、ローンチのブログ記事ではなく証拠とともに動くということだ。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

どうやって決めるか

ワークロードがエージェント的、マルチモーダル、長文コンテキスト、あるいはオープンエンドで、事前にタスクを列挙できないような種類なら、フラッグシップが答えであり、Step 5 Preview はその妥当な一例です。計量済みで価格が設定され、試験導入は安価で、トークン単位で可逆です。目玉の料金ではなく、冗長さの分を予算に入れておきましょう。

ワークロードが限定的で、反復的で、大量の推論を、自社の境界内に留めなければならないデータに対して行うものであるなら、小規模モデルが答えであり、Intern-S2 Mobius はまさに小さいという理由で真剣な候補になる。手持ちのハードウェアで動作し、Apache 2.0 であり、その速度の主張がもし本当なら、ユニットエコノミクスの問いを決める類のものだ。他人の評決を引き継ぐのではなく、ベンダーの主張を自分で検証しているのだと理解して臨もう。

間違いは、この選択を永続的なものとして扱うことだ。まず小型モデルの評価を購入せよ。それが安価な実験だからだ。小型モデルが失敗するタスクにはフラッグシップをレンタルせよ。それが安価な修復だからだ。同じキーと同じハーネス上で両方の選択肢を生かし続けるチームは、結局この判断を自分たちのデータで下すことになる。そしてどちらかのベンダーが後継製品を出したときにも耐えうるのは、その形の判断だけだ。