
Intern-Decision-2B vs Laya:22億パラメータ対4億2,100万、両者とも回答を書くことを拒否
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 584 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
internlm/Intern-Decision-2Bとconvaiinnovations/layaは、小規模な意思決定モデルというニッチにおいて最も似通った2つのモデルであり、この比較について最も役立つ事実は、両者が正反対の経路でそこに到達しているということだ。InternLMの2,213,241,664パラメータのチェックポイントは、プレースホルダーの前の固定位置でロジットを読み取り、generate()を決して呼び出さない。Convaiの4億2,100万パラメータのチェックポイントは、ModernBERT-largeバックボーンの上に載った決定ヘッドに入力された質問を送り、1回のフォワードパスで較正済みの確率を返す。どちらもトークンを書き出さず、どちらも確率を約束し、どちらも入力トークン数が8千近くで頭打ちになり、小さい方は5分の1の大きさで、およそ1000倍人気がある。両者を分けるのは能力というよりもパッケージングであり、そのパッケージングの差がほとんどの読者にとって購入の決め手となる。
Intern-Decision-2Bは2026年9月26日05:36 UTCにHugging Faceに登場した。InternLMが予告なしに40秒でアップロードした3つのサイズのうち中間のもので、Apache-2.0の下でQwen/Qwen3.5-2Bからファインチューニングされた。Layaは2026年9月18日に最初にプッシュされ、それ以来3,700件余りのいいね、pipパッケージ、Jev互換HTTPサーバー、ONNXとLangChainの統合、ファインチューニング用ノートブックを蓄積してきた。成熟度の対比こそがこの記事の主題だ。
両者が共有する前提と、異なるメカニズム
どちらのカードも、あなたの問題が既知の回答の中から選ぶことであるなら、散文を生成するのは誤った操作だと主張している。Layaの言い回しは「テキストを決して生成しないので、解析するものも幻覚するものもない」である。Intern-Decision-2Bの主張は、そのAPIが「構造化された候補スコアリングを実行する。generate()を呼び出したり、自由形式のテキストをサンプリングしたりしない」ということである。
メカニズムこそが、それらが分かれるところだ。
Layaは分類器です。ModernBERT-largeエンコーダ(395M、双方向、完全にファインチューニング済み)が、ゼロから学習された決定ヘッド——2つのトランスフォーマー層、オプションマーカー・スコアラー、act/escalateヘッド——に入力し、合計421Mになります。オプションは固定のトークン予算(head_max_len、英語チェックポイントでは192トークン、多言語では256)を共有し、ルーターはパスの前に半ミリ秒未満でスクリプトと言語を検出します。
Intern-Decision-2B は、生成器になることを禁じられた次トークンモデルです。各質問の選択肢を単一トークンの記号 A–Z、a–z、0–9 にマッピングし、フィールドごとに 1 つの <decision> プレースホルダーを持つ完全なアシスタント JSON スケルトンをレンダリングし、1 回の因果フォワードパスを実行し、各プレースホルダーの直前のロジットを読み取り、そのフィールドの有効な記号に対してソフトマックスを適用し、適合させた温度 2.100509348278 を適用します。その下層にあるのは標準的な Qwen3_5ForConditionalGeneration です — 24 層、フルアテンション層 1 つに対して線形アテンション層 3 つ、保持されたマルチトークン予測層、262,144 位置の埋め込み上限 — さらにビジョンタワーとプロジェクターを備えています。
この違いが実用上もたらす帰結は、選択肢容量である。Laya の固定された選択肢ごとの予算は、広いラベル空間では崩壊する。自身のカードには、77ラベルの質問が同じタスクで TypeSafe Jev の 0.870 に対して 0.425 を記録したと記載されている。なぜなら77個の選択肢がそれぞれ約3~4トークンを受け取るからだ。Intern-Decision-2B は質問あたり最大62個の選択肢、および最大16個の質問を扱う。そして62は好みではなく、その契約が扱える単一トークン記号の正確な数である。どちらも数十個を超える選択肢では快適ではない。失敗の形は異なる。

スコアボード

• パラメータ — Intern-Decision-2B は BF16 で 2,213,241,664、さらにビジョンタワーとプロジェクターを備え、ディスク上で約 4.46 GB。Laya 421M は単一の 842 MB safetensors ファイルで、別途 644 MB の多言語チェックポイント付き。
• 入力上限 — 両方とも8,192トークンで、どちらも切り詰めるのではなく拒否する。Layaの8,192はlaya-multilingualに適用され、max_len=8192が必要である点に注意。出荷時のデフォルトは1,024だから。
• 画像 — Intern-Decision-2B は最大8枚まで、同じトークン予算にカウント。Laya にはマルチモーダルパスなし。
• 速度 — Intern-Decision-2B の場合、1 台の RTX 4090 で 1 リクエストあたり平均 33.28 ms、P50 33.15 ms、P95 33.55 ms。Laya は、単一の T4 で 1 リクエストあたり約 33 ms、バッチ処理で毎秒 103~332 問と報告している。
• 言語 — Intern-Decision-2B は多言語に関する主張を一切していない。Laya は 100 以上の言語にまたがってルーティングし、ベンチマーク対象の 51 言語中 45 言語がランダムの 3 倍超で使用可能だと報告しており、13 の非英語言語にわたる MASSIVE 意図では 0.451 を記録する一方、英語のみのチェックポイントでは 0.306 だった。
• ゼロショット精度 — Intern-Decision-2B は、7つのベンダースイートにわたる平均で 84.68 を記録し、Brier 0.437、ECE 0.100 だが、いずれも未再現である。Laya のベース英語チェックポイントは、2,000件の意思決定からなる typed-decisions ベンチマークで 0.362 を記録しており、これは同モデルのカード自体が 0.461 の多数クラス基準線を下回ると指摘している。
• パッケージング — チェックポイント、inference.py、およびトレーニングと評価のコードを備えた新たに公開されたGitHubリポジトリ 対 pip install laya、Jev互換HTTPサーバー、ONNX RuntimeとTileLangの高速パス、MCPとLangChainの統合、そして無料枠のGPUで動作するファインチューニングノートブック。
最も公平な比較は、スペック表が用意するものではない
84.68を0.362の横に並べるのは、ほとんど不誠実と言っていい。そして、その数字をそのままにしておくのではなく、なぜそうなのかを述べておく価値がある。
Laya の 0.362 は、チューニング対象ではないベンチマークでゼロショット測定されたベースチェックポイントです。同モデルのカードは結論を明示しています。「Laya は特化するための高速なベースであり、ゼロショットの意思決定エンジンではない」。そのベンチマーク自身の訓練分割でファインチューニングすると 0.766 に達し、教師の上限 0.735 を超え、同じ判断において TypeSafe Jev の公表値 0.727 も上回ります。一方、Intern-Decision-2B の 84.68 は、7 スイートのベンダー平均であり、そのテストセットは Laya が引用しているものではなく、モデルを開発したラボによって生成され、第三者が実行したことはありません。そのチェックポイントは 1 いいね、ダウンロード 0 を示しています。ファインチューニング済みの結果をゼロショットの結果と比較すること、あるいはベンダー平均を独立したボードと比較することは、比較ではありません。それは同じ書体を共有した二つの異なる測定値です。
本当に比較に値するのは何か:どちらも小規模で、どちらも実行コストが低く、どちらもあなたのドメインにファインチューニングすることはできない。今朝InternLMが公開したリポジトリは、その最後の部分を昨日より実質的に容易にする。なぜなら、トレーニングランチャー、マスク付き次トークン目的関数、7つのスイートにまたがる10,751件のテスト行のハッシュ検証済みバンドル、そして温度フィッティングとリプレイのスクリプトを同梱しているからだ。決定論的キャリブレーション生成器を提供し、リプレイが意思決定を一切変えないと断言するラボは、まさにLayaのカードが推奨する種類の適応を呼び込んでいる。
実際にどちらかをどう呼ぶのか
どちらのモデルも OrcaRouter 上にはありません。OrcaRouter の Intern-Decision-2B のモデルページは 404 を返し、Laya のルートも存在しません。ここに可用性の主張はありません。Intern-Decision-2B は、チェックポイントをダウンロードし、同梱のエンジンを自分の GPU で実行することを意味します。Laya は、pip install laya を実行し、Jev 互換のサーフェスが必要なら、POST /v1/systemone で laya-serve を実行することを意味します。
その根底にあるOrchestrator的な問いは、スコアラー用の第2の運用サーフェスを求めるかどうかです。Layaは組み込みを想定して設計されています — TypeSafe Jevと同じリクエストとレスポンスの形式なので、既存のクライアントはベースURLを変更するだけで、ほかは何も変えません。Intern-Decision-2Bは再現できるように設計されており、現時点では最初の判定が返るまでに約1日分の環境作業が必要です。あなたが行おうとしているクローズドセット判定が、これらのどちらかと形が近いなら、両方のカードがベンチマーク対象としているホスト型の代替はTypeSafe Jev 1.13であり、実際に利用経路があります:入力100万トークンあたり$0.042、65Kコンテキスト、P50 time-to-first-tokenが178 msで、200以上の他のモデルと同じキーで利用でき、プロバイダー定価が0%のマークアップでパススルーされる。

それぞれが優位に立つところ
Layaは運用面のあらゆる点で圧勝している。pipパッケージ 対 チェックポイントのダウンロード。100を超える言語に対応するルーター 対 多言語対応の主張すらないもの。毎秒数百問という単位で測られるバッチ処理スループット 対 バッチ処理の話がないリクエストあたりの数値。2年にわたって培われたエコシステムの厚み——ONNX、TileLang、LangChain、MCP—— 対 公開から2時間しか経っていないリポジトリ。
Intern-Decision-2Bは3つの限定的な点で優位に立つ。画像を扱えるが、Layaは扱えない。ファインチューニングの負債がない:その84.68はゼロショットのベンダー主張であり、一方、Layaの看板数値0.766は、ベンチマーク自身の訓練分割でファインチューニングされたチェックポイントのものである。そして、再現キット——検証可能な評価バンドルと公開トレーニングスタック——によって文書化されている。これは、モデルを他人に正当化しなければならない人にとって、リーダーボードの1行よりも価値がある。
引き分けが前提です。どちらも生成を拒否し、どちらも閾値を設定できる確率を返し、そしてどちらも、ほとんどの実文書が収まる入力長を下回っています。扱う対象がチケット、メール、フォームなら、どちらでも用は足り、Laya のほうがより速く目的に到達できます。対象にスクリーンショットが添付されている場合、または組織として再現の監査可能性が必要な場合、その特定の反論に答えるのは InternLM の中間チェックポイントです。そして InternLM 自身の数値では、それは3つの兄弟の中で最もキャリブレーションが悪く、ECE は 0.100 で、0.066 と 0.065 に対してそうなっています。したがって、それが報告する信頼度を信じる前に、自分で温度をフィットさせてください。
