「決める側、描写する側」という見出しと「Liquid AI d1-omni-600M vs LFM2.5-VL-3B - オープンウェイト、2026年10月」というサブ見出しを持つヒーロータイトルカード、および2枚のカード:587Mパラメータで出力トークン0のままラベルまたはスコアを返すLiquid AI d1-omni-600Mと、3.1Bパラメータでテキストを書き、画像を読み取って文章を返すLFM2.5-VL-3B。
Guides & Insights

Liquid AI d1-omni-600M 対 LFM2.5-VL-3B:一方は判断し、一方は描写する

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Liquid AI d1-omni-600M と LFM2.5-VL-3B はどちらも小さく、どちらもマルチモーダルで、同じラボが Hugging Face 上で同じ lfm1.0 ライセンスの下に公開している——そして両者を組み合わせるのはカテゴリーエラーだが、それは有用なものになることがわかる。LFM2.5-VL-3B は2026年8月12日に Liquid AI のエッジ向け視覚言語モデルとして登場した。3.1B パラメータ、32,768 トークンのウィンドウ、そして出力は散文である。スキャンしたページを渡すと、レイアウト込みの文字起こしをテキストとして返す。Liquid AI d1-omni-600M は2026年10月7日に、オープンな d1 ファミリーの残りとともにアップロードされ、同じ入力に対して正反対のことをする。587M パラメータの意思決定モデルであり、状態に名前付きの質問を紐付けると、すでに信じている内容——P(yes)、信頼度付きの選択ラベル、2〜10の順序尺度上の位置——を単一のフォワードパスで報告し、出力トークンはゼロで、下流に解析するものは何もない。「小型マルチモーダル Liquid モデル」を検索したなら、今あなたの目の前には2つの形があり、その形こそが意思決定である。

このページは、2つのモデルカード、10月7日のリリース投稿、そしてリポジトリ自体が実際に示している内容である。また、それらがどこまでしか示していないかについても明確にしている。この比較の中身は、Liquid AIの外部では一切再現されていない。そして、2つのモデルのうち一方については、ベンダーは自社の看板能力に固有の精度ベンチマークをまったく公表していない。

横並びの2つのチェックポイント

その仕様書はほぼあらゆる軸で食い違っており、同じ枠を争うことなど想定されていなかった2つのモデルからすれば当然のことだ。

• 概要 — LFM2.5-VL-3B はテキストを書き出す生成型視覚言語モデルであり、Liquid AI d1-omni-600M は構造化された回答を返し、トークンを一切出力しない意思決定モデルです

• パラメータ — LFM2.5-VL-3B は BF16 で 3.1B であるのに対し、Liquid AI d1-omni-600M は 587M。それ自体は 381M の共有トランクと決定ヘッドに加え、94M の視覚エンコーダと 112M の音声エンコーダで構成されている

• バックボーン — LFM2.5-VL-3B は、LFM2.5-2.6B 言語モデルと SigLIP2 NaFlex 形状最適化 400M 視覚エンコーダを組み合わせている。Liquid AI d1-omni-600M は、双方向エンコーダである LFM2.5-Encoder-350M からトレーニングされ、LFM2.5-VL-450M から取得した SigLIP2 タワーと、音声用の 17 層 FastConformer を備えている。

• 入力 — LFM2.5-VL-3B にはテキストと画像、テキストと画像またはLiquid AI d1-omni-600M にはテキストと最大30秒の音声。画像と音声が同じリクエストに含まれると ValueError が発生します

• コンテキスト — LFM2.5-VL-3B では 32,768 トークン、一方 Liquid AI d1-omni-600M ではテキスト、画像、音声を合わせて 16,384 ポジション。同モデルのカードには、画像が存在する場合、状態と質問のテキストはトレーニングに合わせるため 896 トークンに切り詰められると追記されている

• 語彙 — LFM2.5-VL-3B は 128,000 トークン、Liquid AI d1-omni-600M は 65,536

• ランタイム — LFM2.5-VL-3B は transformers と vLLM で動作し、投機的デコーディング用に別個の DSpark ドラフトモデルを備えている。Liquid AI d1-omni-600M はカスタムコードを同梱し、trust_remote_code=True が必要で、そのモデルカードでは GPU 上で float16 を推奨する一方、bfloat16 が一部の行でトップの回答を変えたと警告している

• ライセンス — 両方とも lfm1.0 で、ファインチューニングとデプロイが許可されています

そのリストの中の一行は、他のどの行よりも多くの働きをしている。Liquid AI d1-omni-600M はデコーダではなく双方向エンコーダを基盤としている。それは LFM2.5-VL-3B のサイズ縮小ではなく、異なる系統であり、ベンチマーク表をどう読んでもこの2つのモデルを互いに置き換えられないことのアーキテクチャ上の理由である。

出力契約は、ベンチマーク以上に多くのことを左右する

LFM2.5-VL-3B に画像について質問すると、言語が返ってくる。その答えを人が読む、文字列として記録する、散文を期待する処理に渡す、といった場合には金銭的価値がある。同時に、それは設計で対処しなければならない負債でもある。生成出力は逸れることがあり、JSON 形式の要求はこちらが求めた形とは違う形で返ってくることがあり、トークンごとに課金され、待たされる。このモデルは、単一ターン、高スループット、低遅延のビジョン処理——スキャン文書のバッチ OCR、車両内でのリアルタイム検出、看板のオンデバイス翻訳——に明示的に範囲を絞られており、「この設計図のどこがおかしいか」のような長いコンテキストと重い推論を要する質問からは明示的に遠ざけられている。

Liquid AI d1-omni-600M は、より厳密に絞り込まれた問いに対して、より厳密に信頼できる枠組みで答えます。そのインターフェースは状態 — テキスト、JSON、1 枚以上の画像、または最大 30 秒の音声 — と、それぞれが自身の型を宣言する名前付きの質問の集合です。ある noul質問は yes/no で、0 から 1 の間の P(yes) として返ります。choice質問は、あなたが指定した集合から 1 つのラベルを選び、そのラベル、信頼度、および各選択肢の確率を返します。score質問は、状態を 2 から 10 段階の順序尺度上に位置づけ、期待される段階とその分布を返します。複数の質問を 1 つの状態に紐づけることができ、それらは 1 回のパスで読み取られるため、モデルカードの使用量カウンターは output_tokens: 0 と報告します。生成ステップが存在しないということは、パースに失敗する出力というものが存在しないということです。

あなたが手放すのは、生成された回答が持っていてラベルにはないものすべてです。推論、ヘッジ、チケットにそのまま貼り付けられるフレーズ、同じ会話の中で追加質問ができる能力。Liquidはそれを明確に述べています — このモデルはチャットモデルではなく、テキストを書きません。パイプラインが判定の隣に説明を必要とするなら、Liquid AI d1-omni-600Mはペアの間違った半分であり、正直な答えは両方を実行することです。LFM2.5-VL-3Bは画像の読み取りを生成し、Liquid AI d1-omni-600Mはそれについての判断を生成します。

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

直接比較した視力の数値は存在せず、それが今回の知見です。

直感的に次に取る行動は、視覚ベンチマークを並べて比較することだ。だが、それはできない。LFM2.5-VL-3Bについて、ベンダーは一式を公表している——RefCOCO Macro Precision@1は87.9、ScreenSpot-v2は80.7、ChartQAは81.3、POPEは88.7、MMStarは63.3、BLINKは61.5、MuirBenchは58.3、ToolSandBoxは59.5、OCRBench v2 Englishは47.5、そしてRealWorldQAは73.1で、これは前モデルLFM2-VL-3Bの71.1をわずかに上回る。これらはすべてベンダー報告であり、独立に再実行されたものは一つもない。それでもなお、読者がラボに説明責任を求めることのできる、特定の能力に関する具体的な主張ではある。

Liquid AI d1-omni-600M について、リリース投稿は、Decision Index v0.3 に非公開のビジョン分割が含まれており、「本リリースでは報告していない」と述べ、その代わりに Liquid は 600M チェックポイントが「3つすべてのモダリティを扱う」ことを検証し、その根拠を playground デモに置いたとしています。これが公表されたビジョン記録のすべてです。このチェックポイントには、モデルカードにもローンチ投稿にも、画像ベンチマークの数値はありません。同じ投稿は、音声側で欠けているものについてさらに直接的に確認しており、専用の音声意思決定ベンチマークは、ベンダー自身の言葉では「現在オープンな課題」です。

つまり、この対決を正しく読み解くと非対称であり、そのように明言されるべきだ。LFM2.5-VL-3B は、数字を伴う視覚能力を実証している。Liquid AI d1-omni-600M には、兄弟モデルから借りた視覚エンコーダー、凍結されたバックボーンに対して学習されたアダプター、デモ、そして約束がある。もしあなたの導入環境で、今月、モデルが画像について正確である必要があるなら、この2つのうち、何か拠り所があるのは3Bだけだ。

速度:これらのうち測定されているのは1つだけです

意思決定モデルは何も生成しないため、重要なのはレイテンシであり、ここでもまた片側しか文書化されていない。LFM2.5-VL-3B は、Apple M5 Max で毎秒228トークン、AMD Ryzen AI Max+ 395 で毎秒116トークンと公称されており、どちらもメモリ3.3GB以内で、Galaxy S26 Ultra では毎秒約20トークン、vLLM 上の単一H100では毎秒約11,000トークンである。これらの数値はデコードスループットを表しており、これは文章を書くモデルにとって適切な測定指標である。

Liquid AI d1-omni-600M について、モデルカードには、このモデルが初期研究リリースであり活発に開発中であるため、推論数値は報告されていないと記載されている。同じファミリーの兄弟モデルである d1-3B にはレイテンシ表がある — RTX 4090 で1問あたり8 ms、Jetson AGX Thor で16 ms、Jetson AGX Orin 64 GB で26 ms、Orin Nano で50 ms、そして1つの状態に対して3つの質問を行う場合は、1つの質問の約1.3倍の時間がかかる。これらの数値は3B意思決定モデルに属するものであり、600Mにそのまま当てはめて読んではならない。Liquid AI d1-omni-600M について正直な見解としては、このアーキテクチャは小さく高速なモデルを示唆しているが、研究所の外でミリ秒単位の数値を公表した人はいない、ということだ。

重みのフットプリントは少なくとも推定できる。カードが推奨するfloat16精度では、587Mパラメータはアクティベーション前の重みでおよそ1.2GBになる — 公表されたパラメータ数に基づく計算であり、ベンダーによる測定ではない — これはLiquidがLFM2.5-VL-3Bについて報告する3.3GB未満と対比される。メガバイト単位が制約となるデバイスでは、その差が600Mを選ぶ根拠となる。

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

それらをどう選び分けるか

出力契約を交渉の余地のない固定されたものとして扱えば、その選択はすっきりと決着する。

選びましょうLFM2.5-VL-3B。成果物がテキストである場合:レイアウト注釈付きの全ページOCR、自然言語クエリからのグラウンディングと検出、デバイス上での看板翻訳、人間または下流の言語モデルが答えを消費するあらゆるステップなどです。また、32,768トークンというより広いコンテキストと、実用上より深い言語カバレッジを備えています。なぜなら、その答えはラベルではなく言語だからです。

選ぶべきはLiquid AI d1-omni-600M、成果として求められるのが判断である場合だ:チケットのルーティング、フレームのトリアージ、クリップのモデレーション、ガードレールのゲート判定、応答を2~10の尺度で採点すること——そして、この2つの中で唯一、入力が音声である場合。ペアのうち音声を扱えるのはこれだけで、1リクエストあたり最大30秒だが、そのカードには、音声が英語話者とアシスタントのやり取りで学習されたと記載されている。これは、あなたの呼び出しがやってくる世界についての狭い記述だ。

どちらも選ばず、画像についての読み取りや判定ではなく推論が必要なタスクなら、汎用の視覚言語モデルにとどまってください。両方のモデルカードはそのユースケースには向いていないことを示しており、Liquid AI d1-omni-600M にはそれを試みる仕組みがありません。

実験的なチェックポイントを、パイプラインをそれに賭けることなく試す

Liquid AI d1-omni-600Mは、ベンダー自身の呼称によれば初期研究リリースであり、その視覚と音声の挙動はベンチマークされていません。これはまさに、顧客の前に置くのではなく、フォールバックの背後で評価したいモデルの典型的なプロファイルです。OrcaRouterは200以上のモデルを、プロバイダー間の自動フェイルオーバーを備えた1つのAPIキーでルーティングし、これはこのようなチェックポイントを本番経路に載せる安価な方法です。実験的なルートが劣化したりプロバイダーがダウンしたりした場合、コード変更なしでリクエストはフォールバックに回ります。同じキーが、パイプラインが引き渡すすべてのモデルを、各プロバイダーの定価を0%のマークアップでそのまま通した価格で扱うため、ベンダーの値下げはその日のうちにあなたの価格になります。

一つ注意点があります。これが根幹に関わるからこそ、あえて明言します。オープンな d1 モデルと LFM2.5-VL ファミリーは、現在当社のカタログには含まれていません。重みのセルフホスティングが、ベンダーが両者に対して推奨する方法であり、Apple、AMD、Qualcomm、NVIDIA のハードウェアで初日から llama.cpp がサポートされます。また、ホスト型エンドポイントでこれらを実行する場合は、ベンダー自身の API かサードパーティのプラットフォームを利用することになります。このページを可用性の主張として読むのは誤りです。

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

何を見るべきか

興味深い問いは、600Mが最終的に3Bを何かで上回るかどうかではない——それはないし、そもそもそういう設計でもない。問いは、Liquid AIが伏せているビジョン分割を出すのか、そしてラボがまだ存在しないと言っている音声ベンチマークを誰かが作るのか、だ。それが出るまでは、Liquid AI d1-omni-600MとLFM2.5-VL-3Bの比較は、測定済みのモデルと、もっともらしいモデルの比較にすぎない。測定されていない仕事——音声を入力し、判定を出力し、デバイスに載るほど小さい——において、600Mはこのファミリーで唯一それを試みているオープンウェイトのチェックポイントであり、スコアボードなしで最初であることも、やはり最初であることに変わりはない。

OrcaRouterは1つのAPIキーで200以上のモデルをルーティングし、各プロバイダーの定価を0%のマークアップでそのまま反映するので、ベンダーが値下げすればその当日からそれがあなたの価格になります。