
Solar Mini 4 対 LFM2.5 2.6B Base:インデックスは3倍、そして存在しないコスト比較
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 100万トークンあたり
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 100万トークンあたり · 159 tok/s
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 220 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Solar Mini 4とLFM2.5 2.6B Baseを正直に比較するなら、まず両者が同じ市場に属していないことを認めるべきだ。Solar Mini 4はUpstageの350億パラメータのスパースなMixture-of-Expertsで、2026年9月22日にリリースされ、トークンあたり約30億パラメータを活性化し、プロプライエタリで、入力100万トークンあたり0.10ドル、出力100万トークンあたり0.40ドルで課金される。LFM2.5 2.6B BaseはLiquid AIの26.9億パラメータの事前学習済みチェックポイントで、2026年8月初旬にLFM Open License v1.0の下でHugging Faceに公開され、スマートフォンのメモリに収まるほど小さい。一方はエンドポイントだ。もう一方は重みファイルであり、モデルを呼び出すのではなく実行したいからこれを読んでいるなら、比較はすでに終わっている。
何にせよ、この組み合わせが記事に値するのは、両者が本当に重なり合うただ一つの次元においてだ。どちらも同じ独立した尺度に照らして位置づけられており、その比較の形はパラメータ数が予測するものとは違っている。Artificial AnalysisはSolar Mini 4をIntelligence Index v4.3.2で24とスコアし、LFM2.5 2.6B世代を8.4と評価している——だが後者の数値は推定値であり、この記事のタイトルにあるチェックポイントを測ったものではない。どちらの留保も重要であり、まずそこを整理しなければならない。
スペックシートを並べて表示
• パラメータ — Solar Mini 4は総計35Bを保持しつつ3Bがアクティブ、LFM2.5 2.6B Baseは2.69Bの密なモデルで、何も差し引かれていない。ほぼ同じトークンあたりの計算予算でありながら、Upstage側の重みは13倍。
• アーキテクチャ — Solar Mini 4 はスパースな mixture-of-experts です。LFM2.5 2.6B Base は30層で、うち22層が二重ゲート付きショート畳み込みブロック、8層がグループ化クエリ注意であり、Liquid が CPU およびエッジ推論向けに構築したハイブリッド設計です。
• トレーニング — Upstageはトークン予算を公開していません。Liquidのカードには34兆トークンと、韓国語と日本語を含む16言語にわたる128,000トークンの語彙が記載されています。
• ライセンス — Solar Mini 4 はプロプライエタリです。LFM2.5 2.6B Base は LFM Open License v1.0 の下で提供されており、条件付きで商用利用が認められ、ファインチューニングも可能です。
• コンテキスト — Upstageは512Kトークンと記載しているが、Artificial Analysisは同じモデルについて1.05Mと掲載しているため、上限は未確定と見なすべきだ。LFM2.5 2.6B Baseは131,072で動作する。
• モダリティ — どちらもテキスト入力・テキスト出力です。画像や音声には対応していません。
• 価格 — Solar Mini 4 は100万トークンあたり $0.10/キャッシュ $0.01/$0.40、現在2026年10月22日まで50%オフ。LFM2.5 2.6B Base には料金表が一切なく、ホストの Artificial Analysis は LFM2.5 2.6B 世代の価格を $0.00 と記録しています。
「"8.4, estimated" が測定するものと、測定しないもの」

Artificial Analysis の LFM2.5 2.6B 世代に関する項目 — 事後学習済みモデルであり、事前学習済みの Base ではない — には、推定値としてフラグが付けられた 8.4 のインデックスが掲載されており、そのコンポーネント評価のほとんどにも同じフラグが付いている。それはリーダーボード上の位置であり、それに基づいて構築すべき仕様ではない。誰かが Base チェックポイントをそのスイートで実行したかのように引用しては決してならない。誰も実行していない。Liquid 自身のモデルカードは、LFM2.5 2.6B Base のベンチマーク表を一切公開していない。これは事前学習済みのテキスト補完チェックポイントであり、カードには、大規模なファインチューニングにのみ推奨されると明記されている。
採点された兄弟モデルは別の成果物である。Liquid がポストトレーニング済み LFM2.5 2.6B について示すベンチマーク表では、IFStruct が 85.5、Multi-IF が 80.1、AIME25 が 51.9、LiveCodeBench v6 が 59.4、BFCLv4 が 56.9、τ³-Banking が 5.7 となっており——すべてベンダー実施で、すべてインストラクションチューニング済みビルド上でのもので、τ³ の数値こそが警告のように読める。
Solar Mini 4 のプロファイルはまったく別の形だ。長文脈推論の AA-LCR v1.1 では 83.3%、SciCode では 47.6%、AA-Omniscience では −10.8 を記録し、精度は 18.4%、非ハルシネーション率は 64.2% だ。また Terminal-Bench 4.0 では 1%、AutomationBench-AA では 22.3% を記録する。どちらの系統もエージェント作業は苦手だ。Upstage のモデルはエージェント作業が苦手でありながら高価で、これはエージェント作業が苦手でも無料であるより悪い立場だ。
Solar Mini 4 がその価格に見合う点は、推論の規模にある。インデックスタスクあたり 88,300 の出力トークン——そのうち 71,600 が推論——を費やし、2.6B の密モデルがより長いプロンプトを渡されるだけでは真似できない形で計算資源を使う。2.69B パラメータのモデルには、一歩ずつ考えよと言うことはできても、35B パラメータを持てと言うことはできない。それが実際の製品だ。
指数の3倍で、比較できるコスト数値もない
Artificial Analysisは、Solar Mini 4を完了したインデックスタスクあたり0.36ドル、Granite 4.2 3Bを0.006ドルと評価しており、LFM2.5 2.6B世代は価格がゼロに設定されている。したがって、これを公平な比率にするタスクあたりコストの数値は存在しない。よって、「Solar Mini 4はLFM2.5 2.6B Baseよりはるかに費用がかかる」という枠組みは真ではあるが、やや的外れである。関連する問いは、Solar Mini 4が向けて作られた韓国語の長文ドキュメントの構造化抽出作業を、2.69Bの事前学習済みチェックポイントがそもそも実行できるかどうかである。通常それはできず、その場合の比較はSolar Mini 4対スマートフォン向けモデルではなく、Solar Mini 4対フロンティア汎用モデルになる。
LFM2.5 2.6B が勝つのは、安いからという場合ではない。微調整によって差が埋まるほど、タスクが十分に狭い場合だ。既知の文書からの構造化フィールド抽出、固定された分類体系に対する分類、ネットワークなしで動作しなければならないオンデバイスアシスタント——これらは、2.69B のチェックポイントと自前の訓練データが、35B の汎用モデルと料金表に勝るタスクであり、トークンのメーターではなく 1 台のインスタンスで済む。Liquid がベースチェックポイントとともに、継続事前学習、LoRA SFT、DPO、GRPO のレシピを Unsloth と TRL 経由で提供しているのは、まさにその動きのためだ。
どちらに電話しますか
Solar Mini 4 は、入力が長く、出力を推論する必要があり、言語の混在に韓国語や日本語が含まれる場合、そして難しいタスクあたり7分のデコードが許容できる場合に選ぶとよい。LFM2.5 2.6B Base は、重みを自分たちのものにする必要があり、デバイスにネットワークがなく、タスクがファインチューニングできるほど狭い場合に選ぶとよい。興味深い導入事例では両方を使用する。なぜなら、これらは代替手段ではないからだ。小規模なローカルモデルがルーティング、秘匿化、抽出を行い、ホスト型モデルは、実際に35Bパラメータを必要としたリクエストの一部に対してのみ呼び出される。
LiquidのモデルはOrcaRouterにはなく、Upstageのものも同様なので、どちらのルートも当社がお客様に販売できるものではありません。当社にできるのは、この比較を意思決定から設定へと変える部分です:プロバイダーの定価に0%のマークアップで、1つのキーの背後に200以上のモデル、プロバイダー間の自動フェイルオーバー、そして複数のモデルを1回の呼び出しに組み合わせられるルーティングDSL。正しい答えが「ほとんどの場合は安いもの、重要なときは良いもの」であるとき、それはルーティングの問題であり、ルーティングDSLが存在する理由です。

どちらのベンダーもスライドに載せない数字
レイテンシ。Solar Mini 4 は Intelligence Index のタスクあたり 88,300 出力トークンを消費し、実測 204 トークン/秒だったため、各難しいタスクで平均 430 秒——7 分強——かかった。LFM2.5 2.6B 世代は、Artificial Analysis がテストしたホスト上で、45.7 トークン/秒で動作し、最初のチャンクまでの待ち時間は 2.8 秒だったが、それは通常ならあなたのデスク上で動くはずのモデルをデータセンターのホストが動かしている場合の話だ。Liquid 自身の測定では、同じアーキテクチャは M5 Max で 220 トークン/秒、Ryzen AI Max+ 395 で 113、スマートフォンで約 30 トークン/秒——これはネットワークのないデバイス上でも実用的なエージェントループだ。
ワークロードが対話型であれば、この比較は接戦どころではなく、どんなベンチマークスコアもその結論を覆すことはありません。ワークロードがバッチ処理で、待っているのがcronジョブであれば、7分は許容範囲であり、その推論の深さには十分な価値があります。

最後に、出典に関する注記が2点あります。ここに示す Artificial Analysis の数値はすべて、同組織が共通スイート上で行った独立した測定です。LFM2.5 2.6B のインデックスは明示的に推定値であり、上記で名前を挙げた事前学習済みの Base チェックポイントではなく、事後学習済みモデルを対象としています。Liquid AI の数値はすべて、ベンダー自身が自社のベンチマークで実行したもので、再現はされていません。また、Base チェックポイント自体には公表されたスコアがまったくありません。これは事前学習済みモデルに関する事実であり、このモデルへの批判ではありません。
