生成されたタイトルカード「Intern-Decision-4B vs Laya」、サブタイトルは「トークンを生成せずに答える2つのモデル」、チップには「4.54B vs 421M」「どちらも1回のフォワードパス」「どちらもApache-2.0」と表示されている。右下の隅にはOrcaロゴが合成されている。
Engineering & Research

Intern-Decision-4B vs Laya:答えを書くことを拒む2つのモデル、サイズは10倍差

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Intern-Decision-4Bのモデルカードには"Laya — 57.77"と書かれた行がある。Laya自身のドキュメントを読んだことがある人なら、この数字の意味がわかるだろう:convaiinnovations/layaは4億2,100万パラメータの非自己回帰型意思決定モデルであり、57.77は他者のベンチマークでゼロショット使用したときに得られる平均値だ。同モデル自身のカードはもっと率直に同じことを述べている——ベースチェックポイントは下回っており、typed-decisionsベンチマークで多数派クラスベースラインを0.362対0.461で下回っている。一方、internlm/Intern-Decision-4Bはまったく同じ仕事のために作られた45億4,000万パラメータのモデルだ。状態と一連の型付き質問を受け取り、1回の順伝播を実行し、キャリブレーション済みの確率を返し、トークンを一切生成しない。同じアーキテクチャ上の賭け、同じ出力形状、同じApache-2.0ライセンス、10倍のパラメータ数——そして一方はファインチューニングするためのベースであり、他方は完成済みのゼロショットエンジンだと主張している。

彼らは前提では一致している。そこが珍しい点だ。

どちらのカードも同じ主張をしており、これは明言する価値がある。なぜなら業界の大半は逆の主張をしているからだ。あなたの問題が既知の選択肢の中から選ぶことであるなら、散文を生成するのは誤った操作だ。捨てるだけのトークンに金を払い、パーサーが必要になり、しきい値を設定できる確率の代わりに、求めてもいない説明が返ってくる。Layaのカードは「テキストを一切生成しないので、解析するものも、幻覚を起こすものも何もない」と述べている。Intern-Decision-4Bのカードは、そのAPIが「構造化された候補スコアリングを実行する。generate() を呼び出したり、自由形式のテキストをサンプリングしたりはしない。」

両機構は示唆に富む形で異なっている。Laya は型付きの質問を分類ヘッドに与え、較正済みの確率を伴う型付きの回答を単一のフォワードパスで返す。そのパスの前には、0.5ミリ秒未満で文字体系と言語を検出するルーティング層がある。Intern-Decision-4B は、各質問の選択肢を単一トークン記号にマッピングし、フィールドごとに1つのプレースホルダーを持つアシスタント用 JSON スケルトンをレンダリングし、各プレースホルダーの直前でロジットを読み取り、そのフィールドで許可された記号だけに対してソフトマックスを適用する。Laya のそれは分類問題であり、InternLM のそれは、生成問題になることを拒む次トークン問題だ。

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

サイズの差、そしてそれがもたらすもの

421Mと4.54Bのパラメータで2つのモデルに同じタスクを実行させると、予想どおりの結果が出て、その後には驚きが待っている。

予測される部分は、難しい質問に対する能力です。Intern-Decision-4Bは7つの評価セットで平均90.02、InternLM自身の測定ではBrierスコア0.347、期待キャリブレーション誤差0.065であり、単一のRTX 4090上でクエリあたり平均44.16 msで実行されます。Layaのベース英語チェックポイントは、2,000件の意思決定からなるtyped-decisionsベンチマークで精度0.362であり、これは自身のモデルカードが、多数クラス基準線0.461を下回り、0.318のランダムベースラインをかろうじて上回るのみだと指摘しています。同じチェックポイントをそのベンチマーク自身の訓練分割でファインチューニングすると、数値は0.766に跳ね上がります。Layaのモデルカードは自ら結論を下しています:「Layaは特化させるための高速なベースであり、ゼロショットの意思決定エンジンではない。」

驚くべきは、より小さいモデルが二つの側面で完全に勝っていることだ。速度:Laya は単一の T4 上でバッチ処理して毎秒 103~332 問に回答し、そのカードは、Laya が引用する独立測定の p50 236~276 ms という数値に照らして、TypeSafe Jev より約 6~8 倍高速だとしている。パラメータが 10 倍だからといって、逆方向にスループットが 10 倍になるわけではない——Intern-Decision-4B の 44.16 ms は、バッチ処理に関する説明が公表されていない 4090 上でのクエリあたりの値である。そして言語:Laya は、ベンチマークされた 51 言語のうち 45 言語がランダムの 3 倍超で使用可能だと報告しており、13 の非英語言語における MASSIVE インテントではルーティングして 0.451、英語専用チェックポイントでは 0.306 である。Intern-Decision-4B は多言語対応に関する主張を一切していない。

スコアボード

• パラメータ — Intern-Decision-4B は 4.54B BF16(テキストタワー+ビジョンタワー+プロジェクター)、Laya は 421M で、単一のコンパクトなエンコーダクラスのスタック。

• 入力上限 — 両者とも8,192トークンで、いずれも切り詰めるのではなく拒否する。なお、Layaの8,192は多言語チェックポイントに適用されるもので、その出荷時のデフォルトは1,024である。

• 多重性 — Intern-Decision-4B は 1~16 個の質問と、各質問につき最大 62 個の選択肢を受け付けます。そして 62 は恣意的な数字ではありません。これは、その推論契約が扱える単一トークン記号の数とちょうど一致します。Laya も複数の型付き質問を受け付けますが、そのカードには、およそ 50 個の選択肢を超えると急激な崩壊が記録されています。そこでは 77 ラベルの質問に対してラベルごとにわずか 3~4 トークンの予算しか割り当てられず、精度は 0.425 まで低下します。

• 画像 — Intern-Decision-4B は最大8枚で、8,192トークンの予算に算入されます。Laya にはマルチモーダル経路はありません。

• キャリブレーション — Intern-Decision-4B は、1,728 件のケースにわたる NLL 最小化によって選択された 1.99241824 の適合温度を搭載しており、自身のスイートで ECE 0.065 を報告している。Laya は自信過剰な状態で搭載されており、そのカードには、質問タイプと選択肢数ごとに1つの温度を再適合させると、平均 ECE が 0.466 から 0.081 に変化すると記載されている。

• ゼロショットの姿勢 — 文書化されたベースラインが多数派クラス基準を下回っているにもかかわらず、平均90.02を主張する完成済みチェックポイント。

• レイテンシ — RTX 4090 1基での平均 44.16 ms、中央値 44.03 ms に対し、T4 1基でバッチ処理した場合は毎秒 103~332 問。

• 言語 — ルーティング時に51言語のうち45言語が使用可能であることに反する公開された主張はない

• ライセンス — Apache-2.0。商用利用として明示的にタグ付けされた Apache-2.0 に対し、上流の Qwen ライセンスを保持。

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

2枚のカード、まったく異なる情報開示の考え方

ここからは、比較が仕様表ではなくなり、判断の分かれるところになります。というのも、2社は自社のモデルを正反対のスタイルで文書化しているからです。

Layaのカードは自らの失敗を詳細に公表している。英語チェックポイントはクメール語で精度0.000、信頼度0.952だと報告している——間違っているのに自信があるため、そこでは信頼度ゲーティングは役に立たない。さらに、action.act_probabilityには使えるシグナルがなく、396件のラベル付き判断でAUROCが0.30でありながらほぼすべての入力で1.0を示すと報告し、代わりにconfidenceでゲートするよう指示している。同じ項目では0.77に達する。順序尺度のスコア質問を「最も弱いプリミティブ」と名指しし、SST-5で0.372を挙げている。自らの出力のうちどれを無視すべきかを教えるカードは、ほとんどのベンダーが試みないことをしている。

Intern-Decision-4Bのモデルカードは、きれいな表を公開しており、失敗事例はありません。その注意書きは本物で、しかも重要な役割を担っています——キャリブレーションのセクションは、パイロットにおける「before」列がどのユーザーにも見えるものではないこと、そしてテストスイートのラベルが温度の選択に使われなかったことを、異例なほど明確に述べています——しかし、評価セクションは7つの勝利と、何も認めていない内容です。また、InternLMがInternLMのハーネスで実行した5つの競合システムの行も含まれており、この記事の冒頭に出てくるLayaの行もその一つです。それらはそれらのプロジェクト自身の数値ではなく、そのように読むのは誤りでしょう。

つまり、この対戦におけるソーシングの線引きは、より小型のモデルに有利になる形で非対称だ。Layaのエビデンスには自らが記録した欠陥が含まれており、Intern-Decision-4Bのエビデンスは、著者らが選んだものではないテストセットに一度も遭遇していない。

それぞれがどのような問題の形に当てはまるか

英語の短く構造化された状態、閉じた回答集合、そして信頼できる確率が必要とされる状況では、Intern-Decision-4B は紙の上ではより高性能な存在であり、実運用ではより高コストな存在だ——4 つの safetensors シャード、Python 3.12 上の PyTorch 2.9.1 と Transformers 5.14.1、常駐エンジン、そして HTTP エンドポイントが欲しければ自分で書くラッパー。数十言語にわたる高ボリュームのルーティングまたはガードレール判断で、スループットが制約条件となる場合、Laya はより適した形だ:pip install laya、421M のモデル、そして確率を信用する前にファインチューニングせよとすでに告げているモデルカード。

両方のカードが一致している唯一の点は、どちらのモデルも、自分のデータでキャリブレーションを確認せずにゼロショットで信頼すべきではないということだ — Layaは、そのベースチェックポイントが不慣れな意思決定タイプではほぼチャンスレベルであるため、Intern-Decision-4Bは、その0.065のECEが著者自身が作成したスイートに由来するためである。

ルーターがここで変えるものと変えないもの

これらのモデルはどちらも OrcaRouter のカタログにはなく、カタログにあるかのようにほのめかすのではなく、率直に言っておく価値があります。当社のモデルページは Intern-Decision-4B と Laya の両方について 404 を返し、どちらも今日呼び出せるルートではありません。それがこの2つのプロジェクトにとって何を意味するかは同じではありません。Laya の商用利用タグ付き Apache-2.0 ライセンスは、障害が純粋にパッケージングの問題であることを意味します。これは小さいフットプリントのローカル Python パッケージで、現実的に提供できそうな類のものです。Intern-Decision-4B の障害もパッケージングですが、その 4.54B BF16 重みと 8,192 トークンの拒否上限により、これはサービスではなくコンポーネントになっています。

OrcaRouterが実際に役立つのは、意思決定の向こう側です。あなたの構造化された意思決定の問題に、結局のところ推論ステップが必要だと分かった場合、それを担える汎用モデルは200以上のモデルにまたがる1つのキーで利用でき、プロバイダーの定価は0%のマークアップでそのまま適用され、プロバイダー間の自動フェイルオーバーも備えています — つまり、スコアラーと組み合わせるモデルは、2つ目の契約先ではなく、1つのエンドポイントの先にあるのです。

短いバージョン

これら2つのプロジェクトは、意思決定がどのようになされるべきかについて同じ結論に達し、その後、ほぼその他すべての点で異なっていた。Layaは、4億2100万パラメータ、厳密な言語ルーティング、自らの欠陥に対する容赦ない正直さが、あなたが特化させるための高速な基盤を作ると賭けている。Intern-Decision-4Bは、10倍のパラメータと、注意深く設計された単一トークンのスコアリング契約が、完成したゼロショットエンジンを作ると賭けている。決定的な実験は、どちらも公開の場では行っていないものだ。計算可能な答えを持つ一連の意思決定を取り上げ、両方を実行し、その確率が何かを意味しているかどうかを確認する。Layaはその実験を半分だけ公開し、それがどこで失敗するかをあなたに示した。Intern-Decision-4Bはそれをまったく公開していない。

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.