LFM2.5-2.6B-Base-1
Engineering & Research

LFM2.5-2.6B-Base:Liquid AIの最も静かなリリースは、ファインチューナーが実際に望んでいたもの

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Read across the Hugging Face counters on August 5, 2026, and the gap is hard to miss: LFM2.5-2.6B, the agentic on-device model Liquid AI launched on August 4, sits at 47,393 downloads. LFM2.5-2.6B-Base, the pre-trained checkpoint that every one of those weights descends from, sits at 151. Same organisation, same architecture, same week, a 314-to-1 split.

ベースチェックポイントは、リークされたわけでもなければ、隠されていたわけでもない。それはLiquidのローンチ投稿に、正確に一つの括弧内にだけ登場した — 「ベースモデル(LFM2.5-2.6B-Base)およびポストトレーニング済みモデル(LFM2.5-2.6B)は、本日Hugging Faceで入手可能です」 — そしてそれが、この件に関して公表された内容のすべてである。独自のベンチマークもなければ、セクションも、独立したカードもない。以下はすべて、リポジトリから直接読み取ったものだ — モデルカード、config.jsonLICENSEファイル、そしてHugging Face API — それに加えて、私たち自身で行った計算も含まれる。数値がLiquid自身の評価に由来する場合は、その旨を明記する。というのも、この特定のチェックポイントにとって最も重要な事実は、実際に測定された量がどれほど少ないかということだからだ。

それは脚注が示唆する以上に重要だ。ポストトレーニング済みモデルは、試せば判断できる。ベースチェックポイントは、何かを学ぶ前に2週間とGPU予算を費やすことを求めるオファーであり、したがってオファーの条件——中身は何か、ライセンスの対象は何か、評価された内容は何か——がすべての判断基準となる。

リポジトリには実際に何が含まれているのか

Nine files, one shard of weights, no modeling code. The card's specification list, corroborated against config.json:

総パラメータ数2.69B、bfloat16、単一の5.39GBのmodel.safetensors。ストレージとVRAMはその数値に基づいて計画してください。「2.6B」ではなく。

30層、ハイブリッド。カードには、22個の二重ゲート付きショート畳み込みブロックと8個のGQAアテンション層と記載されています。layer_types配列がconfig.json内でそれを正確に裏付けています。すなわち、22個のconvと8個のfull_attentionであり、アテンション層はまとめて配置されるのではなく、おおよそ3〜4ブロックごとに配置されています。

隠れ幅2048、中間層10752、8個のキー・バリューヘッドに対して32個のアテンションヘッド — 4対1のGQA比 — 入力と出力のエンベディングを共有し、rope thetaは10,000,000。

128,000トークンの語彙と、それに付随する18MBのトークナイザー。Liquidは今回の世代で語彙を2倍にしたが、これは2.6Bモデルでは無視できないコストである。タイド埋め込みの場合、語彙テーブルだけでパラメータ予算の約262Mを占め、モデルのほぼ10分の1に相当する。

34兆のトレーニングトークン。 これは、このサイズクラスとしては異例に長い事前学習のランであり、チェックポイントを見るべき唯一の最も強い理由である。

16言語に対応: 英語、アラビア語、中国語、フランス語、ドイツ語、ヒンディー語、インドネシア語、イタリア語、日本語、韓国語、ポーランド語、ポルトガル語、ロシア語、スペイン語、タイ語、ベトナム語。

One inconsistency for anyone planning long-context work: the card advertises a context length of 131,072 tokens, while config.json sets max_position_embeddings to 128,000. Liquid's own blog and docs both say 128K. The 3,072-token difference will not matter to most people, but if you are writing a training script that packs sequences to the advertised maximum, trust the config file over the card.

アーキテクチャ文字列は実質的な見出しです:model_typelfm2であり、クラスはLfm2ForCausalLM — これはLFM2に同梱されていたものと同じクラスです。LFM2.5は既存アーキテクチャに基づく拡張事前学習と新しい事後学習であり、新しいアーキテクチャではありません。したがって、ここでカスタムモデリングコードは一切必要ありません。だからこそ、llama.cpp、vLLM、MLX、ONNX Runtime、SGLang、LM Studioはすべて初日からこのファミリーをサポートしており、UnslothとTRLを介したファインチューニングの経路もパッチなしで機能します。必要となるのはtransformers>=5.0.0です。

あなたが手に入れるカードは、もう一方のモデルのカードです。

ベースリポジトリを開くと、最初の見出しは"LFM2.5-2.6B"—これはポストトレーニング済みモデルの名前であり、あなたが見ているモデルの名前ではありません。これは些細な指摘ではありません。ページ全体が、ベース段落を差し込んだインストラクトカードのように読め、残された3つのアーティファクトがあなたの時間を大幅に無駄にする可能性があります。

LFM2.5-2.6B-Base-2

YAMLフロントマターには base_mode: LiquidAI/LFM2.5-2.6B-Base と書かれています。1行に2つの問題があります:キーはHugging Faceのbase_modelの綴り間違いであり、それはベースリポジトリを自分自身に向けています。何も壊れませんが、適切に宣言された系統から期待されるモデルツリーのリンクはこの指定からは生成されていません。

リポジトリはconversationalとタグ付けされ、chat_template.jinjaを同梱しているため、Hugging Faceは、インストラクションチューニングされたことのないチェックポイントに「Chat template」バッジを表示します。テンプレートが存在するのは、トークナイザ設定を引き継いだためであり、重みがそれをどう扱うかを知っているからではありません。

クイックスタートのスニペットは、そのテンプレートを使用します。ベースカードのPythonの例は、tokenizer.apply_chat_template{"role": "user"}というメッセージで呼び出し、「What is C. elegans?」と尋ねます。これはベースモデルを壊れたように見せる古典的な方法です。未調整の事前学習済みチェックポイントをチャットのターンに包むと、テキストが脱線し、繰り返し、自己継続するようになり、それをプロンプト形式の誤りではなく、モデルが悪いのだと読み取ってしまいがちです。このモデルは、テキスト補完モデルとして、あなたが制御する停止シーケンスを設定し、few-shotでプロンプトしてください。

バリアント表には、ポストトレーニング済みのラインのみが記載されています — LFM2.5-2.6Bと、そのGGUF、ONNX、MLXビルドです。ベースチェックポイントのGGUFビルドやMLXビルドはまったく存在しないため、自分で変換しない限り「今夜LM Studioでローカルに実行する」という選択肢はありません。

Hugging Face はまた、このリポジトリを提供する推論プロバイダーが存在しないと報告している。ベースチェックポイントのホステッドエンドポイントはどこにもなく、そのロジットが必要なら GPU をレンタルすることになる。

存在しないベンチマークセクション

LFM2.5-2.6B-Base については、評価数値が一つも公開されていない。MMLUもMMLU-ProもGPQAもHellaSwagもARCも、perplexityの数値もない。Liquidの三つの面(モデルカード、ローンチ投稿、ドキュメント)のいずれにも、何も存在しない。ベースチェックポイントにとって、これは顕著な欠落である。というのも、そうした知識・推論スコアこそ、34Tトークンの事前学習がファインチューニングに値するものを残したかどうかを判断する、まさにその基準だからである。

存在するものはポストトレーニング済みの兄弟モデルに属し、Liquidによって報告されたものであり、独立に再現されたものではない。Liquid自身の評価では、LFM2.5-2.6BはOpenClawハーネス内で、gemma-4-E2B-it(5.1B)、gemma-4-E4B-it(8B)、Qwen3.5-4B(4.7B)、Qwen3.5-9B(9.7B)と比較して、AIME25で51.87、IFBenchで59.17、Multi-IFで80.07、BFCLv4で56.88、ToolSandboxで77.83、BrowseComp+で26.89を記録している。Liquidのまとめによると、すべての指示追従ベンチマークとほぼすべてのツール使用ベンチマークでトップであり、同社のチャートは例外について率直に認めている:Qwen3.5-9BはAIME25で56.07、BFCLv4で60.13と先行している。速度の主張も同じ規則に従う——M5 Maxでのデコード220トークン/秒、Ryzen AI Max+ 395で113、スマートフォンで約30、メモリ2.5GB未満、H100 1基での高並列時におよそ15K出力トークン/秒——すべてベンダー計測によるものであり、まだ誰にも検証されていない。

The trap is assuming any of that transfers. Those scores are the product of a four-stage pipeline applied on top of this checkpoint: two rounds of supervised fine-tuning, per-domain teacher specialisation, multi-domain on-policy distillation, then agentic reinforcement learning with GRPO run inside real harnesses. Tool-calling and instruction-following are exactly the behaviours that pipeline installs. Take the base weights and you are starting before all of it. What you inherit is the pre-training — the languages, the world knowledge, the long-context capability, the efficient hybrid architecture — and you should assume you inherit none of the agentic scoreboard.

151ダウンロードは単に早いだけではない — それは家族自身のパターンから外れている。

Liquid はベースチェックポイントを定期的にリリースしているため、このリリースは種類としては特段目新しいものではない。計測できるのは、むしろ放置のほうである。各 LFM2.5 ベースリポジトリを、同じ日の instruct 版と比較すると、明確なハウスノルムと、1つの明確な外れ値が見えてくる。

LFM2.5-2.6B-Base-3

LFM2.5-230M — 58,676 downloads against 6,982 for its base: about 8 to 1.

LFM2.5-350M — 94,526 対 9,397: 約10対1.

LFM2.5-1.2B — Instructビルドでは583,914件、ベースでは17,867件:約33対1です。

LFM2.5-8B-A1B — 171,520 対 3,996:約43対1。

LFM2.5-2.6B — 151に対して47,393: 約314対1.

その一部は単に経過時間の問題だ。ベースリポジトリは8月1日に作成され、インストラクトモデルには4日間の先行とローンチ投稿があった。しかし、このファミリーの古いベースチェックポイントは8対1から43対1の間に落ち着いているため、その最悪値から一桁超えているのは、新しいリポジトリの丸めによる産物ではなく、本当の異常値である。

いいねの数は、より微妙な事情を物語っている。ベースリポジトリは151ダウンロードに対していいねが28件 — およそ5回のダウンロードにつき1件のブックマークだ。インストラクトモデルは47,393ダウンロードに対していいねが232件で、約204件につき1件だ。人々はベースチェックポイントを後で戻ってくるためにマークしているのであって、ダウンロードしているわけではない。そのモデルツリーには、すでにコミュニティによるファインチューンが2件と量子化版が7件存在している。これは、本格的に利用が増える前に見られる、採用の最先端の姿だ。

「制限なし」というのは、ライセンスが言っていることではない

Liquidのランチページは、このリリースをオープンウェイトと説明している:「ダウンロード、ファインチューニング、デプロイを制限なく行えます。」一方、リポジトリ内のファイルにはもう少し限定された内容が書かれており、これらのウェイト上に製品を構築しようと考えているなら、このセクションは二度読むべき箇所だ。

LFM2.5-2.6B-Base-4

本ライセンスはLFM Open License v1.0— Apache-2.0でもMITでもなく、また、あなたがおそらく比較しているであろうほとんどの小型オープンウェイトモデルと同じ条件でもありません。ファイルから直接引用すると、第5条は「商用利用の制限」というタイトルで、次のように記載されています:「本ライセンスに基づき商用利用のために付与される権利は、あなたまたはあなたの法人が閾値を超えないことを条件とします。」その後に続いて「閾値を超える法人による本著作物または派生著作物のいかなる商用利用も、本契約の下ではライセンスされません。」第1条は閾値を次のように定義しています:「年間収益が1,000万米ドル($10,000,000)以上であること。」

では、実際的な解釈としては:

年間売上高が1,000万ドル未満 — 複製、二次的著作物の作成、配布、サブライセンス、および商用利用を含む、広範で永続的かつロイヤリティフリーの許諾が付与されます。

$10M以上 — 商用利用は本契約ではライセンスされていません。「帰属表示が必要」でも「通知が必要」でもありません。Liquid に連絡する必要があります。おそらくそれが、カードの最後に営業チームへのリンクが付いている理由です。

二次的著作物はこの制限を継承します。このチェックポイントのファインチューニングは二次的著作物に該当するため、四半期をかけてトレーニングしたモデルにも同じ収益条件付き許諾が適用されます。会社がその閾値を超えた場合—または既に超えている企業に買収された場合—、製品が依存する条件は根底から変わってしまいます。

適格非営利団体は適用除外となります:しきい値は、非営利または研究目的で作品を使用する501(c)(3)または外国の同等組織には適用されません。通常の義務も適用されます — ライセンスを引き継ぎ、帰属表示を維持し、変更したファイルにマークを付けてください。

こうした点はいずれもリリースをけち臭くするものではない。1,000万ドルのしきい値があれば、ほぼすべてのスタートアップと研究者が免除され、重みを公開する正当な方法と言える。しかし「制限なし」というのはライセンスが矛盾するマーケティングコピーであり、その不一致が最も痛烈に響くのはまさにここだ。ベースチェックポイントのファインチューニングは、モデルを採用する手段の中で最もコストが高く、元に戻すのが最も難しい。収益条項を発見するには最悪の場所である。

実際にこのチェックポイントを受けるべきなのは誰ですか?

Liquid自身の指針は清々しいほど絞り込まれており、従う価値がある。カードには、事前学習済みチェックポイントは「重いファインチューニングを必要とするタスク、例えば言語固有(例:日本語)またはドメイン固有(例:医療)のアシスタント、独自データでのトレーニング、あるいは新しいポストトレーニング手法の実験にのみ推奨される」と書かれている。この「のみ」という語には実質的な意味がある。ツールを呼び出すオンデバイスエージェントを求めるなら、ポストトレーニング済みのLFM2.5-2.6Bの方が間違いなく優れた出発点であり、ベースチェックポイントでは1ヶ月を無駄にすることになる。

本当にそれが正しい選択となるケース:

ポストトレーニングが十分にカバーしない言語。16言語にわたる34Tトークンは強力な多言語基盤であり、Liquidはすでに1.2Bラインの日本語ビルドでこのパターンを社内で実証済みです。対象言語での継続事前学習と、その後の独自の命令チューニングにより、英語中心のポストトレーニング済みペルソナと対抗する必要がなくなります。

独自データを扱う規制業界です。推論時2.5GB未満、クラウド非依存、そして収益基準未満なら十分に寛容なライセンスという組み合わせは、データを端末外に持ち出せない医療・法務・産業分野への導入では稀です。

ポストトレーニング研究。Liquidはレシピを公開しました — SFT、教師特化、MOPD、エージェント型RL — そしてそのレシピへの正確な入力を出力とともに提供しました。同じ初期重みで自分の手法を実行し、強力な参照実装と差分を取れることは、珍しく価値のあることです。

蒸留ターゲット。ラップトップ上で毎秒220トークンをデコードする2.6Bハイブリッドは、はるかに大きな教師モデルを出荷可能なものに圧縮するための魅力的な生徒モデルです。

最後のペアこそ、実際にコストがかかる部分であり、それはGPU時間ではなくデータです。Liquidのパイプラインは、教師モデルの特化とオンポリシー蒸留に基づいて動作します。つまり、これに類するものを再現するための真の前提条件は、より強力なモデルから生成された大量のデータに加えて、選好ペアと検証可能な報酬のロールアウトです。それはトレーニングの仕事である前に、多数のモデルを扱う仕事です。自分のドメインで候補となる教師モデルを比較し、勝者となったモデルから大量に生成する必要があります。これは当社製品がまさに対象としている作業の一部です。OrcaRouterは200以上のモデルを単一のAPIキーの背後に0%マークアップで配置するため、合成SFTセットに支払う料金は、ルーティングによる割増ではなく、プロバイダーの定価です(ベンダーが価格を引き下げた場合、それは同日中に当社側に反映されます)。自動フェイルオーバーにより、20時間の生成実行が1つのプロバイダーの不調な時間帯で停止することはなく、ルーティングDSLを使用すると、単一のプロンプトを複数の教師モデルに送り込み、最良の回答を保持できます。提供していないものについて明確にしておきます。LFM2.5-2.6B-BaseはOrcaRouterにはなく、いかなる推論プロバイダーもそれをホストしていません。つまり、これらの重みは自分で実行する必要があります。私たちが役立つのが教師にとってであり、生徒にとってではありません。

同じ使い分けは、何を出荷するにしても心に留めておく価値がある。Liquidの投稿は、ローカルエージェントが推論を無料にし、トークンごとのコストを制約から外すと主張している。しかしこれは限界トークンについて正しいのであって、総請求額には当てはまらない。ハードウェアとして前払い済みであり、2.6Bモデルには依然として上限があるからだ。Liquid自身もそう述べており、コーディング中心または知識集約型のエージェント業務にはこのモデル群を勧めていない。堅実なパターンは、ファインチューニングされたローカルモデルがオンデバイスで大量の一般的な処理を担い、難しい少数のケースをAPI経由でフロンティアモデルにエスカレーションするというものである。これにより、プライバシーとレイテンシーの利点が重要な場面で維持され、2.6Bパラメータがすべてをこなせるふりをする必要もない。

これらの重みから何か使えるものへの道

ローンチ記事にはこの点について何も書かれていないが、ベースカードにはリポジトリ全体で最も実用的なものがひっそりと収められている。ベースチェックポイントが必要とするパイプラインの各段階を正確にカバーする、すぐに実行可能な7つのColabノートブックだ。そのうち2つは継続事前学習用で、1つはテキスト補完、もう1つは翻訳に対応している。これはベースの重みから始めて初めて意味を持つステップであり、誰もチュートリアルを書かないステップでもある。残りは、UnslothとTRLによる教師ありファインチューニング、TRLによるDPO、そして両方を用いたGRPOをカバーしている。また、LiquidはLEAP Finetuneを独自のトレーニングスタックとして同梱しているので、自分で組み立てたくない場合はこれを使えばよい。

Liquidのファインチューニングのドキュメントをこのモデルの形状と照らし合わせて読むと、現実的な手順は次のようになります:

まず、何かを訓練する前に、補完器としてプロンプトで試すこと。 カード上のチャットテンプレートは無視する。Few-shot、生テキスト、独自のストップシーケンスを使う。これにより、事前学習がすでにあなたのドメインと言語をカバーしているかどうかが分かり、継続事前学習が必要なのか、それとも直接SFTに進めるのかが決まる。

継続事前学習は、知識または言語を追加する場合にのみ行います。これはコストのかかる分岐です—コーパス規模であって、サンプル規模ではありません—そして、ポストトレーニング済みの兄弟モデルが本当に提供できない唯一のものでもあります。

次に、LoRAを使ったSFTを500〜5,000件のサンプルで実施します。Liquid自身のガイダンスでは、品質と分布が量に勝り、サンプルは本番入力に一致すべきだとされています。2.6BではLoRAのパスは短く、ドキュメントによれば1.2Bの実行は最新のGPU1枚で数分から数十分程度です。つまり、このサイズでもまだ同じ日の午後には試行を一巡できる規模です。

トレーニング前に、ホールドアウトセットを固定しましょう。率直な助言ですが、特にこのチェックポイントでは繰り返す価値があります。比較できる公開ベースラインがないため、あなたの評価セットが誰もが持つ唯一の数値なのです。

PreferenceやRLの段階は最後に来るものであり、かつ行動自体が問題である場合に限ります。DPOとGRPOのレシピはこのファミリー向けに存在しますが、これらはすでに回答できるモデルに対する改良です。SFTが完了する前にそれらに手を出すことは、ベースチェックポイントのプロジェクトが停滞する原因です。

そのリストに載っていないものに注目してください。ここで必要なものは、カスタムカーネルでも、パッチを当てたトレーナーでも、モデリングファイルでもありません。LFM2.5はLFM2アーキテクチャを再利用しているため、ベースチェックポイントは標準スタックにそのまま組み込まれ、このプロジェクトのコストは、あなたが構築するコーパスと評価セットだけです。

何が状況を変えるだろうか?

注目すべき点が3つある。いずれもLiquidにとっては簡単に解決できるものばかりだが、今日はどれも解決されなかった。

第一は、ベースモデル評価です。事前学習済みチェックポイント上の単一の MMLU-Pro や GPQA の数値は、ローンチ投稿に含まれるすべてのエージェンティックベンチマークを合わせたものよりも、ファインチューナーに多くのことを伝えるはずです。そして、34T トークンが投入されたという事実は、その欠如をますます不可解にしています。第二は、カード自体です。それは、見出しが別のモデルを名指ししており、クイックスタートがチャットテンプレートを非チャットモデルに適用し、そして frontmatter のスペルミスは、base_modelという語に関するもので、これは10分で直せる修正であり、その修正を行えば、指示が原因であるのに重みが壊れていると人々が結論づけるのを防げるでしょう。第三は、LFM2.5 テクニカルレポートです。引用ブロックは arXiv 2511.23404 を指していますが、これは、LFM2の2025年11月のテクニカルレポートです。2.5世代の論文はまだ発表されておらず、そのため、それらの34Tトークンの背後にある事前学習データの構成は未公開のままです。

それまでは、正直な要約としては、これは仕様が明確で、長時間トレーニングされ、効率的な形状を持つ2.6B規模の基盤モデルであり、想定する対象利用者が異常なほど明確である一方、測定結果が一切示されず、収益上限付きライセンスで公開されています。そして今のところ、ほぼ誰もその箱から取り出して使っていません。もしこのモデルカードが説明する対象ユーザーに当てはまるなら、あなたのGPU時間を費やす価値があります。そして、実際にどれほど優れているかを知る最初の一人になるでしょう。

答える価値のある質問

これはLFM2.5-2.6Bがポストトレーニングされた元と同じチェックポイントなのか、それとも別の事前トレーニング実行なのか?

カードには、LFM2.5-2.6B-Baseは{{1}}事前学習済みのテキスト専用チェックポイントであり、すべてのLFM2.5-2.6B派生モデルの作成に使用される{{/1}}と記載されています。{{2}}つまり、これは公開されたパイプラインへの実際の入力であり、並行リリースや縮小版ではありません。{{/2}} それがポストトレーニング研究に役立つ理由です:{{3}}あなたの手法とLiquidの4つのステージは同一の重みから始まるため、両者の比較は有意義です。{{/3}} なお、ベースリポジトリは8月1日に作成され、公開日である8月4日に最後に変更された点は注目に値します — {{4}}早期にダウンロードしたファイルが公開されたファイルだと決めつける前に、コミット履歴を確認してください。{{/4}}

それをファインチューニングして、結果を販売してもよいですか?

貴法人の年間収益が1,000万米ドル未満の場合、はい — LFM1.0の許諾は、ライセンスと帰属表示を維持し、変更したファイルにマークを付けることを条件として、派生作品の商用利用をカバーします。その閾値以上の場合、モデルまたはそこから派生したものの商用利用はライセンスの対象外となり、Liquidとの別途の取り決めが必要です。この閾値は、モデルやそれが生み出す収益ではなく、貴法人の収益に適用されるため、同じファインチューニングモデルがある会社にはライセンスされ、別の会社にはライセンスされないということがあり得ます。また、閾値を超えて成長した会社は、それまで保有していた許諾を維持することはできません。

代わりに、ポストトレーニング済みのLFM2.5-2.6Bをファインチューニングするだけではどうでしょうか?

Most projectsでは、ベースチェックポイントから始めるべきであり、Liquidのカードも事実上そう述べています。ベースチェックポイントから始める理由は、ポストトレーニングが味方ではなく敵に回る場合です。新しい言語や専門コーパスに対する大規模な継続事前学習は、どうしても命令追従動作を損なう傾向があり、SFTやRLによって焼き付けられた拒否パターン、ツール呼び出しの規約、応答スタイルは除去が難しく、簡単に競合してしまいます。知識や言語を追加する場合は、ベースから始めてください。挙動を微調整する場合は、ポストトレーニング済みモデルから始め、誰かがすでに費用を負担した4つの作業段階を維持してください。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube