生成されたタイトルカード。『FrogNano-4B-2609 vs LFM2.5 2.6B Base』と表示され、サブタイトルは「完成した4Bエージェント対2.69Bの事前学習済みチェックポイント」、3つのチップは「RL事後学習完了」「事前学習のみ、2.69B dense・30層構成」「指示チューニングなし」、フッターは「両列ともベンダー報告値。第三者がどちらのモデルも採点したことはない」、そしてOrcaRouterのロゴが右下隅に合成されている。
Engineering & Research

FrogNano-4B-2609 対 LFM2.5 2.6B Base:完成されたスペシャリストと事前学習済み重みの寄せ集め

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

に質問を入力するとLFM2.5 2.6B Base、質問に答える代わりにあなたの文を続けます。これは欠陥ではありません — Liquid AI はこれを LFM2.5 ファミリーの基盤となる事前学習済みチェックポイントとして公開し、指示チューニングは意図的に非 Base の兄弟モデルに任せており、モデルカードには大規模なファインチューニング向けであると明記されています。MicrosoftのFrogNano-4B-2609は、そのパイプラインのもう一端がどのようなものかを示しています。同じ種類の小規模言語モデルを、合成リポジトリタスクでの強化学習の5回の反復に通し、5つのツールを備えたハーネスを通じて構造化されたツール呼び出しと候補パッチを出力するようにしたものです。どちらも公開された独立したベンチマークはありません。違いは、一方は事後学習が完了しているということであり、どちらがそうであるかを知ることが、意思決定のすべてです。

以下のFrogNanoの数値は、Microsoftのモデルカードおよびテクニカルレポートに由来します。LFMの数値は、Liquid AIのカード、そのアーキテクチャ設定、およびライセンスファイルに由来します。どちらのベンダーに帰属する数値もすべてベンダー報告として明示されており、これらのモデルはいずれも第三者による評価を受けていません。LFM2.5 2.6B Baseについては、これは主に設計上の理由によるものです。インストラクションチューニングを施していないチェックポイントは、チャットベンチマークの公平な評価対象にはならないからです。

比較は、何を比較しているのか分かっていなければ成り立ちません。

2つの仕様書を並べてみると、最初に食い違うのはパラメータ数だ。LFM2.5 2.6B Baseは30層に26.9億の密なパラメータを持ち、22の二重ゲート付き短畳み込みブロックと8つのグループ化クエリ注意層を備え、16言語にわたる約34兆トークンでトレーニングされ、128,000トークンの語彙と131,072トークンのコンテキストを持つ。その量子化ビルドはQ4_K_Mで約1.67 GBになる。

FrogNano-4B-2609のカードでは、パラメータ欄が「500M-5B」という範囲として記載されており、モデル概要では約46.6億と説明されている。ダウンロードすれば決着がつく。2つのsafetensorsシャード、合計9.32 GBのBF16重み、738テンソルで、継承されたdense 32層ハイブリッドGated DeltaNetとgated-attentionスタック上にある。24層のvision towerがチェックポイントに含まれており、事後学習は一切されていない。

つまり、サイズ比はおよそ1.7対1で、量子化を考慮に入れるとメモリ比は5.6対1に近くなる。この差はパラメータ数の差よりも重要だ。というのも、これらのモデルはどちらもエンドポイントではなくセルフホストの候補だからであり、それこそが両者が同じ記事で扱われる唯一の理由である。

• 想定用途 — LFM2.5 2.6B Base は、ファインチューニング実行のための素材です。FrogNano-4B-2609 は、Leaf ハーネス内でのリポジトリレベルのソフトウェアエンジニアリング向けに完成されたポリシーです。

• 指示追従 — LFM2.5 2.6B Base は、そのままでは一切備えていない。Liquid AI のモデルカードは、高度なファインチューニングを必要とするタスクにこれを用いることを推奨している。FrogNano-4B-2609 はタスク記述に従い、構造化されたツール呼び出しを出力する。なぜなら、まさにそれがその RL 目的によって訓練されたことだからである。

• コンテキスト — LFM2.5 2.6B Base では 131,072 トークン、FrogNano の評価構成では合計およそ 131K トークン。名目上は同一だが、FrogNano のウィンドウはプロンプトだけでなく、ツールの結果、シェル出力、テストログも保持しなければならない。

• 出力上限 — FrogNano の検証済み構成では、アシスタントの1ターンあたり 8,192 生成トークンが許容されています。LFM2.5 2.6B Base は、回答を終わらせるようには作られていないため、同等のものを公表していません。

• モダリティ — どちらもテキストのみ。FrogNanoの視覚コンポーネントは継承されたものであり、明示的に非対応です。LFM2.5 2.6B Baseは設計上、テキスト入力・テキスト出力です。

• ライセンス — LFM2.5 2.6B Base は LFM Open License v1.0 の下にあり、年間収益が1,000万米ドル未満なら無償で、そのライン以上では別個のライセンスが必要であり、派生著作物もその上限を引き継ぐ。FrogNano のカードは、前付では MIT、本文では Apache 2.0 と記載している。

Microsoft が支払ったもの、そしてあなた自身が支払わなければならないもの

これは最重要のセクションです。というのも、ここがまさにスペック比較が誤解を招く箇所だからです。

FrogNano-4B-2609の付加価値はすべてポストトレーニングにあり、Microsoftはその手法を公開している。汎用モデルとしてLeafハーネス経由でSWE-bench Verifiedで39.4%を記録したQwen3.5-4Bから始める。実際のスナップショットから候補となるリポジトリタスクを生成し、現在のチェックポイントからロールアウトを実行して、時々解けるタスクを見つけ、それらを保持し、訓練し、繰り返す — 5回のイテレーション、合計でおよそ1,500の検証済み合成環境、そしてどの時点でもより大きなモデルからの蒸留はなし。Microsoft自身のモデルカードに記載の結果は、SWE-bench Verifiedで61.5%、SWE-bench Proで37.6%、Terminal-Bench 2.0で31.1%、PatchEval-Verifiedで47.3%である。論文の効率性付録は、同じ上昇をイテレーション全体で48.2%、53.4%、58.3%、58.6%、61.6%として報告しており、これは、同じ実験に関するラボ自身の2つの表でさえ各段階の数値が一致していないことを教えてくれる有用なリマインダーである。

これを LFM2.5 2.6B Base に照らして読んでみよう。それは、その作業が始まる前のチェックポイントだ。そのモデルカード自体の推奨——それをファインチューニングせよ——は、まさに FrogNano が記録している作業である:タスク環境、実行可能な報酬、より長時間稼働するハーネス、そして変化し続けるポリシーに対する複数回の訓練イテレーション。論文はそれが簡単だとは主張していない。報告しているのは、推論トレースが長くなるにつれて中間チェックポイントの訓練が次第に高コストになったこと、ドリフトを止めるためにログ長ペナルティを追加しなければならなかったこと、そして後続のイテレーションがベースモデルの持っていた並列ツール呼び出し能力を失い、同時呼び出し率 1.71% で終わったことだ。別の 2.6B ベースで FrogNano のレシピを実行しようと考えている人は、特にこれら 3 つの問題を見込んで予算を組むべきだ。

LFM2.5 2.6B Base がもたらすのは、ひと味違う先行優位だ。34兆トークンの事前学習予算、文書化されたハイブリッドアーキテクチャ、既存の量子化ビルド、そして131,072トークンという文書化されたコンテキスト ― しかもそのすべてが、9.32 GB の BF16 チェックポイントでは載らないハードウェアで動作するサイズで実現されている。あなたのタスクが、小さなファインチューニングが汎用モデルを上回るほど狭いものであるなら、それは確かな選択肢だ ― そしてそうでなければ、学習を1回分節約できたことになる。

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

どちらにせよ、あなたが構築しなければならないもの

これらのどちらもネットワーク呼び出しではなく、そのことが、どんなスペック表の一行よりも実用的な比較を大きく左右する。

LFM2.5 2.6B Base には推論ランタイムと学習実行が必要です。Liquid AI のカードには native-format、GGUF、ONNX、MLX ビルドが記載されているため、サービング側は十分にカバーされています — ノート PC 上の llama.cpp は、量子化チェックポイントにとって現実的な選択肢です。学習側はあなたの担当です。データ、目的関数、評価、そして結果が良くなったのか、それとも単に違うものになっただけなのかを見分ける方法です。

FrogNano-4B-2609 は、適切なパーサーを備えた OpenAI 互換エンドポイントと、ポッドおよびネットワークポリシーを管理する権限を持つ Kubernetes クラスターを求めている。Microsoft の README は、ハーネスが利便性ではなく依存関係であることを異例なほど率直に述べており、カードには、同一のスコアには一致するチェックポイント、トークナイザー、サービング構成、タスクイメージ、評価プロトコルが必要であると記載されている。ここでは構成は些細な事柄ではない — Qwen3 reasoning parser と Qwen3 coder tool-call parser なしで提供すれば、ハーネスがツール呼び出しを期待する箇所でモデルは散文を書いてしまう。

これがこの対決の構図だ。片側には、小さなサービング問題を抱えた学習プロジェクトがあり、もう片側には、大きな評価問題を抱え、もう学習することが残っていないサービングプロジェクトがある。どちらも数晩の作業で済む。だが、あなたに落ち度がないのに「モデルは十分に良くない」で終わりうる数晩の作業は、そのうち片方だけだ。

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

こうした製作でルーターがその真価を発揮する場面

これらのモデルはどちらも、ホストされた何かを呼び出すパイプラインの中に最終的に組み込まれる。FrogNano自身の評価リグがその証拠だ。LeafハーネスはOpenAI互換のエンドポイントと通信しており、つまりテスト対象のモデルも、それと比較するどのモデルも、同じインターフェースを通じてアクセスされる。これは、理由が衛生面だけである場合でも真似する価値のあるパターンであり、単一のエンドポイントが具体的な何かを行う場面でもある。

OrcaRouterは200以上のモデルを1つのOpenAI互換キーの背後で提供しておりマークアップ0%なので、プロバイダーの定価はそのまま反映され、ベンダーの価格変更は当日に当社側でも有効になります — これは、セルフホストの専門特化モデルがホスト型の汎用モデルをタスクあたりのコストで上回るかどうかを判断する際に、実際に動く数値です。自動フェイルオーバーは、その比較のうちホスト型の側面をカバーするものであり、ご自身で提供しているチェックポイントをカバーするものではありません。当社はFrogNano-4B-2609やLFM2.5 2.6B Baseをホストしていません。どちらもダウンロードです。ルーティングレイヤーが取り除くのは、ベンチマークのホスト型側が変わるたびに生じる2度目の統合作業です。

正直、一つ選ぶなら

タスクが狭く、ハードウェアが小さく、学習実行を自分で担う覚悟があるなら、LFM2.5 2.6B Base を選ぼう——売上 $10M 未満ならライセンスは無料、量子化ビルドは 1.67 GB、そして Liquid AI 自身のカードがまさにこの用途に推奨している。その代償は、得られるのが能力ではなく出発点だという点だ。このリリースには、その上に FrogNano 型の RL 実行を載せたらどんなスコアになるかを教えてくれるものは何もなく、誰も公開していない。

リポジトリレベルのソフトウェアエンジニアリングが対象で、ポストトレーニングがすでに済んでいるものを求めるなら、FrogNano-4B-2609 を選びましょう。61.5%、37.6%、31.1%、47.3% は、手法を詳細に説明したラボによる本物の公開結果です — しかも現時点では、これらは閉じたループでもあります。同じラボ、同じハーネス、同じベースモデルのベースライン。9.32 GB のダウンロード、ハーネス依存、複合ライセンスは、本来なら自分で実行しなければならないトレーニングプロジェクトを省くための代償です。

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

有益な捉え直しは、これらは競合ではないということだ。LFM2.5 2.6B Base は、FrogNano-4B-2609 のようなものを生み出したプロセスの上流にある。もし両者のどちらを選ぶかで悩んでいるなら、本当の問いは、自分の問題にトレーニング実行を自前で持つ価値があるかどうかだ——そして答えがノーなら、ハーネス、公開された手法、ベンダー報告の SWE-bench ラダーを備えた 4B チェックポイントのほうが、完成した状態で届くものだ。