ヒーロータイトルカードは「Intern-Decision-0.8B vs LFM2.5 2.6B Base」と表示し、サブタイトルは「自分で何かを作る2つの方法」、バッジは「一方は分布を返す」「一方はトレーニング実行を返す」、コーナーにはOrcaRouterのロゴが合成されている。
Guides & Insights

Intern-Decision-0.8B 対 LFM2.5 2.6B Base:自分で何かを作る2つの方法

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Intern-Decision-0.8BをLFM2.5 2.6B Baseの隣に置いてみると、正直に最初に気づくのは、どちらも買い手が通常意味するような製品ではないということだ。Intern-Decision-0.8Bは、InternLMが2026年9月26日に何の告知もなくHugging Faceにアップロードしたチェックポイントである——Qwen3.5-0.8Bを852,985,920パラメータでファインチューニングしたもので、打ち込まれた質問に答え、テキストを出力せず、Apache 2.0の下で提供され、GitHubリンクは404になる。LFM2.5 2.6B Baseは、Liquid AIの26億9000万パラメータの事前学習済みテキストチェックポイントで、2026年8月1日にLFM2.5ファミリーの基盤として公開され、そのカード自体が「大規模なファインチューニングを必要とするタスクにのみ推奨される」と述べている。一方は完成していて狭い。もう一方は未完成で汎用的だ。どちらも、作業をするのはあなたであると想定している——そしてその作業は同じ作業ではない。

その区別こそが比較のすべてであり、単純なスペック表では誤解を招く理由でもある。読者が実際に抱く疑問は「このうちどれをダウンロードすべきか」であり、その答えは、構築する必要があるものが意思決定レイヤーなのか言語能力なのかによって変わる。それらはタイムラインの異なる別々のプロジェクトなのだ。

各モデルがあなたに提供するもの

Intern-Decision-0.8B は動作するシステムとして登場します。リポジトリには inference.py、DecisionEngine クラス、文書化されたリクエストスキーマとレスポンススキーマ、そして固定された4つのPython依存関係をインストールした後に実行できる実例が同梱されています。状態、それぞれ最大62個の選択肢を持つ1~16個の名前付き質問、任意で最大8枚の画像を指定すると、フィールドごとに較正された分布とargmaxラベルが返されます。このエンジンは何かを生成するのではなく、事前レンダリングされたスケルトン内の固定位置でロジットを読み取るため、デコード手順も出力トークンも修復すべきJSONもありません。約1.73 GBのファイルで動作します。

LFM2.5 2.6B Base はその反対のものを提供します。インターフェースを持たない生の能力です。これはテキスト専用の因果言語モデルで、22 の二重ゲート付きショートコンボリューションブロックと 8 のグループ化クエリ注意層として構成された 30 層を備え、16 言語にわたる約 34 兆トークンで事前学習されており、128,000 トークンの語彙と 131,072 トークンのコンテキストウィンドウを持ちます。それ自体には指示チューニングも、モデルカード上のタスクベンチマークもありません。ベースチェックポイントは採点されないからです。採点されるのは、そこから学習させるモデルです。Liquid 自身のポストトレーニングパイプラインが、これをエージェント型 LFM2.5-2.6B に変えるものであり、そのパイプラインこそ、あなたが自分のドメイン向けに、部分的または全体的に再現するよう求められているものです。

つまり、軸は規模ではない。欠けている部分が意思決定契約なのか、それともトレーニング実行なのか、という点だ。

スコアボード、ただし注意事項付き

• 最初の結果が得られるまでの時間 — Intern-Decision-0.8B:チェックポイントを読み込んでpredict()を呼び出すまでが半日。/. LFM2.5 2.6B Base:継続事前学習またはSFTの実行にかかる時間の長さに加え、その準備のためのデータ作業も必要です。

• パラメータ — Intern-Decision-0.8B: 852,985,920。1.50 GBの言語シャード、176 MBのビジョンシャード、25 MBのプロジェクタにまたがる。LFM2.5 2.6B Base: 2.69B、約2.5 GBの重み。

• 入力モダリティ — Intern-Decision-0.8B:テキストと最大8枚の画像に対応し、ビジョンの重みはリポジトリに含まれています。LFM2.5 2.6B Base:設計上テキストのみ — LFM2.5ファミリーにおけるマルチモーダルの取り組みはVLバリアントに存在します。

• 実用的なコンテキスト — Intern-Decision-0.8B:8,192トークン。設定内の最大位置埋め込みが262,144であるにもかかわらず、切り詰められるのではなく拒否された。LFM2.5 2.6B Base:ネイティブで131,072トークン。

• 出力 — Intern-Decision-0.8B:決定論的な、フィールドごとの校正された確率分布とargmaxラベル。LFM2.5 2.6B Base:サンプリングされた継続テキスト。

• ベンチマーク — Intern-Decision-0.8B:7つのベンチマークにまたがるベンダー提供の完全な表だが、誰によっても再現されていない。LFM2.5 2.6 Base:ベース自体については、設計上、何も公開されていない。

• ライセンス — Intern-Decision-0.8B: Apache 2.0、上流の重みに対して保持された LICENSE-QWEN/ を同梱。LFM2.5 2.6B Base: LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

ライセンスの行には、独自のセクションを設けるべきです

どちらのカードにも「open」と書かれているが、その2つの語は本質的に異なる意味を持っている。Intern-Decision-0.8B は Apache 2.0 であり、収益条件も、使用分野の制限も、別途交渉が必要な商用グラントもない。リポジトリ内の2つ目のライセンスファイルは、このモデルが Qwen3.5-0.8B の派生であるために引き継がれた Qwen ライセンスであり、これは制限ではなく正しい取り扱いである。

LFM2.5 2.6B Base は LFM Open License v1.0 の下で提供されており、商用計画がこれに依存する前に、同ライセンスの第5条を全文読む価値がある。Commercial Use に対して付与される権利は、あなたまたはあなたの法人が、ライセンスで年間収益1,000万米ドル以上と定義された閾値を超えないことを条件としている。その線を超えると、本著作物または派生物の商用利用は本契約の下ではライセンスされない。非営利および研究目的での利用は除外されている。これは現実に存在し、執行可能な境界であり、派生物にも及ぶため、ベースからファインチューニングしたあらゆるものに伝播する——そしてベースからファインチューニングすることこそ、このチェックポイントの意図された用途のすべてである。

ここには明快な読み方がある。もし商用で構築していて、あなたの法人が年間売上高$10Mを超えているなら、LFM2.5 2.6B Base は Intern-Decision-0.8B と同じ種類の資産ではない。両者がどれだけ性能を発揮するかに関係なく。しきい値を下回っている場合、研究を行っている場合、または非商用目的でファインチューニングしている場合は、この区別は影響しない。いずれにせよ、これはトレーニング実行の前に答えるべき問いであり、後ではない。

それぞれが実際に正しいダウンロードとなる場所

LFM2.5 2.6B Base は、必要な能力がまだ完成されたモデルに存在しない場合に適した選択です。Liquid のカードには、想定されるケースが明示的に挙げられています。日本語のような言語特化アシスタント、医療のようなドメイン特化アシスタント、API に送信できない独自データでのトレーニング、あるいは新しいポストトレーニング手法の実験です。このリストの背景にある考え方は、34兆トークンの多言語事前トレーニングは再現するのに費用がかかり、継承するのはほぼ無料だというものです。つまり、すでに16言語と128Kコンテキストにわたって十分な能力を備えた出発点を手に入れ、自分に固有の部分に自分の計算資源を費やすということです。

その計画に対するエコシステムのサポートは、これほど新しいモデルとしては異例なほど充実している。Liquidは、UnslothとTRLを通じた継続事前学習、SFT、DPO、GRPOをドキュメント化しており、それぞれのノートブックも用意されている。さらに、そのチェックポイントはTransformers、vLLM、SGLang、llama.cpp、MLX、LM Studioでサポートされている。これは宣伝文句ではない——今週微調整できるベースモデルと、トレーナーに組み込むのに2週間を費やすベースモデルとの違いなのだ。

Intern-Decision-0.8B は、必要な能力がすでに存在し、問題がその形にある場合に正しい選択です。もしあなたのタスクが、閉じた回答集合を持つ境界の定まった判断——このチケットをルーティングする、このクレームをスコアリングする、このレコードをルーブリックに照らして分類する——であるなら、生成モデルはラベルを得るには不格好な方法であり、ベースモデルはラベルを得る方法にすらなりません。求めているのは、分布を返し、その信頼度を伝え、毎回同じ34ミリ秒でそれを実行するものです。単一の RTX 4090 上での InternLM の実測レイテンシは平均 33.98 ms、p95 は 37.50 ms で、カード自体の数値では 2B の兄弟モデルが平均 33.28 ms を示しています——これは、これらのプロンプト長ではコストは重みの実行ではなくスキーマの読み取りにあるという注意喚起です。

あなたがしている取引は、契約と引き換えに柔軟性を手放すことだ。ベースモデルは、データと計算資源があれば、最終的には何にでもなれる。決定ヘッドはすでにそのものそのものであり、決してほかの何かにはならない。あなたのスキーマが毎月形を変えるなら、それは実際のコストだ。そうでなければ、コストにはまったくならない。

Intern-Decision table について誰も教えてくれないこと

Intern-Decision-0.8B の性能数値はすべてベンダー報告であり、ここでの注意点は通常より重い。なぜなら、リリースから1週間しか経っておらず、完全に文書化されていないからだ。論文も、3つのサイズをまとめたコレクションも、動作する GitHub リポジトリも、独立した評価も存在しない。Artificial Analysis を検索しても、このモデルに関する結果は何も返ってこない。

InternLMはベンチマークを選び、比較モデルも選んだ——TypeSafeのJev、ConvaiのLayaとKevを含む意思決定モデルが大半を占めるセットだ——そしてローンチ記事なしでその表を公開した。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

そのラベルが付いていても、この形状は依然として読む価値がある。Intern-Decision-0.8B は Jevbench の3つの分割で 97.92 / 80.56 / 52.25 を記録し、Typed Decision で 77.35、ToolACE で 94.52、平均 79.38 である。そのキャリブレーション・プロファイルは最も興味深い項目だ。Brier は 0.530、期待キャリブレーション誤差は 0.066 で、Brier はより悪いものの、ECE は Jev の 0.095 より良い。平たく言えば、精度はより低いが、どれだけ正確かについてより正直であり、しきい値ベースのワークフローでは、その順序が平均よりも重要である。デプロイを止めるべき列は、Jev の 96.29 に対する WildJailBreak の 64.48 だ。これほど大きな拒否ロバスト性の不足はファインチューニングの性質であり、それが Qwen3.5-0.8B ベース、意思決定チューニングの目的、あるいはパラメータ数に起因するのかは、カードのどこにも記載されていない。

この軸における LFM2.5 2.6B Base との比較は、「どちらのスコアが高いか」という話ではない。ベースにはスコアが存在しないからだ。そうではなく、一方のモデルの数値は未検証であり、もう一方のモデルの数値は存在しない、ということであり、両者の間で選ぶ読者は、どの種類の未知を扱うことになるかを選んでいるのである。

ほとんどの人が実際に最終的に構築することになるパイプライン

両方を使う構成があり、これには名前を付ける価値がある。ほとんどの本番システムが最終的に行き着くのは、この構成だからだ。決定レイヤーは、トリアージ、ルーティング、ルーブリック採点といったクローズドな判断を扱う。そこでは答えの集合が既知であり、100万件のレコードをまたぐとレイテンシが積み重なり、出力トークンは純粋なオーバーヘッドになる。言語レイヤーは、散文、統合、長いコンテキストを必要とするものすべてを扱う。エスカレーション要約、ラベルに添える説明、人間が編集する下書きなどだ。LFM2.5 2.6B Base は、学習させる価値のあるドメインデータがあるなら、後半にとって妥当な基盤となる。決定ヘッドは前半の自然な形だ。

この2つを組み合わせるのが面倒な部分であり、手作業で作らない方がいい部分でもある。OrcaRouterのルーティングDSLはルーティングをコードとして表現する — CEL条件を備えたYAMLで、再デプロイなしに配備できる — そのため、ある種のリクエストを判定エンドポイントへ、別のリクエストを言語モデルへ送るパイプラインは、自分で保守するロードバランサーではなく、1つのルーティングルールになる。このゲートウェイは、OpenAI互換の1つのキーの背後で200以上のモデルをカバーし、プロバイダーの定価をゼロマークアップでそのまま適用する、そして選んだモデルにマークアップを上乗せすることもない。境界について正確に言えば、Intern-Decision-0.8BもLFM2.5 2.6B Baseも当社のモデルではない — どちらもダウンロードしてローカルで実行するチェックポイントであり、どちらの場合もそこが要点だ。というのも、2 GBのモデルを選ぶ理由は、それがあなたのデータがすでにある場所で動くからだ。ゲートウェイの役割は、そうでなければ外部に呼び出しに行くことになるスタックの半分の部分にある。

意思決定レイヤーが、トレーニング実行をそれにコミットせずにテストしたい部分なのであれば、ホスト型の意思決定モデルのほうが安価な実験であり、TypeSafeのJev 1.13はInternLMがベンチマークで比較対象としたものです — 本日から、単一のOpenAI互換エンドポイント経由で、入力トークン100万あたり$0.042で呼び出せ、出力は課金ゼロです。

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

じゃあ、どれ?

LFM2.5 2.6B Base を選べ。まだその能力が存在せず、ドメインデータとファインチューニング実行への意欲の両方があるなら。そして、商業的にその上に構築する前に、LFM Open License の $10M 収益しきい値を確認せよ。Intern-Decision-0.8B を選べ。能力がすでに存在し、答えがプロンプト内ですでに列挙可能で、必要なのがラベルを取得するための高速で決定論的かつライセンス上クリーンな方法であるなら — ただし、そのドキュメントは欠けており、ベンチマークは未監査で、敵対的入力に対する拒否挙動はそれをチューニングしたラボの外の誰もテストしていないことを受け入れるなら。第二はより短い道であり、より大きな未知である。第一はより長い道であり、より文書化が進んだものであり、それらの事実のどちらも「より良い」と同じではない。