
AREX-2 対 LFM2.5 2.6B Base:空のリポジトリと説明のないチェックポイント
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
置くAREX-2の隣にLFM2.5 2.6B Baseまず両者に共通するのは、どちらも今日使える製品ではないという点だ——しかもその理由は互いに何の関係もない。AREX-2は、BAAIが2026年9月29日17:56 UTCに作成したHugging Faceリポジトリで、含まれているのは.gitattributesファイルだけ、モデルデータは0バイト、モデルカードもライセンスタグも、どんな告知も一切ない。Liquid AIが2026年8月に公開したLFM2.5 2.6B Baseは、正反対の意味での未完成だ。LFM Open License(lfm1.0)の下で提供される、完全にダウンロード可能な26.9億パラメータのテキスト専用チェックポイントであり、指示チューニングを意図的に欠いたまま出荷されている。質問に答えるためではなく、ファインチューニングされるためのものだからだ。
一方は成果物が存在しないことだ。もう一方は、本来持つはずのない工程が欠けている成果物だ。ざっと目を通しているだけなら、これらは同じカテゴリーに見える。そして、それらを同じカテゴリーとして扱うことが、チームが間違ったものを待つ羽目になるまさに原因だ。この二者を有益に比較する際に比べるべきは、能力ではなく——測定すべきAREX-2は存在しない——それぞれが何の原材料となるか、そして、それが良いものかどうかを見極めるのにどれだけのコストがかかるか、だ。
種類の違い、まず述べられる
LFM2.5 2.6B Base は素材である。これは Liquid AI の LFM2.5 ハイブリッドファミリーの事前学習済みチェックポイントだ。30 層のうち 22 層がデュアルゲート付きショート畳み込みブロック、8 層がグループ化クエリ・アテンションで、16 言語にわたる約 34 兆トークンで学習され、131,072 トークンのコンテキストウィンドウを持ち、量子化ビルドは Q4_K_M で約 1.67 GB になる。指示チューニングはされていない。質問を入力するとテキストを続けるだけで、答えるわけではない。Liquid AI 自身のカードは、想定用途として大規模なファインチューニングを挙げており、プロンプトに応答するモデルを求める人向けにはポストトレーニング済みの兄弟モデルがある。これは基盤であり、プロンプト追従ベンチマークで低いスコアを取るという事実は欠陥ではない——それがこのものの定義なのだ。
AREX-2は物質でも製品でもない。それは名前空間である。利用可能な唯一の事実は、組織(BAAI)、作成タイムスタンプ(2026年9月29日)、そして名前だけである。何もアップロードされておらず、何も述べられていない。この名前自体は、実在するファミリーに属する。2026年7月23日、BAAIはAREX-Baseをリリースした。これはQwen3.5-122B-A10B上に構築された、100億のアクティブパラメータを持つ1220億パラメータのmixture-of-expertsである。またAREX-Turboは、Qwen3.5-4B上に構築されたdenseな4Bである。どちらもApache 2.0で、どちらも、証拠を集め、信頼度の数値を伴う候補回答を生成し、その後その回答を元の制約に照らして検証し、改善または再起動する二重ループ設計のディープリサーチエージェントである。その公表された数値は、ベンダー報告によるもので独立には再現されておらず、BaseではBrowseCompで82.5、GAIAで85.4、Turboでは70.7 / 81.6に達する。
• 入手可能性 — LFM2.5 2.6B Base は現在ダウンロード可能です。AREX-2 のリポジトリにはファイルがありません。
• サイズ — Liquidモデルの2.69Bの密なパラメータで、チェックポイント内で全て確認できます。AREX-2については不明。このファミリーは122B MoEと密な4Bにまたがるため、「2」は何も予測しません。
• コンテキスト — LFM2.5 2.6B Base は 131,072 トークン。AREX-2 については何も公開されていません。
• ライセンス — LFM Open License v1.0。年間収益1,000万ドル未満は無償で、そのライン以上では別途ライセンスが必要です。AREX-2にはまだライセンスタグがありません。初代AREXはApache 2.0でした。
• これは何か — ファインチューニング用の基盤であるのに対し、このファミリーから判断するならば、その価値は重みではなく検索・検証ループにあるホスト型エージェント。

正反対のことを意味する白紙のスコアカード
どちらのモデルにも、それを基準に計画を立てるべきベンチマークは存在せず、その理由はまったく異なります。
Liquid AIは、Baseを未評価のままにすることで何も隠していない。事前学習済みチェックポイントを指示追従ベンチマークでスコアリングすると、基盤の品質ではなく微調整の不在を測ることになる——だから同社はポストトレーニング済みの兄弟モデルをベンチマークし、Baseは未評価のままにする。その空白はあなたの側で検証可能であり、まさにそれが要点だ。1.67 GBをダウンロードし、自分のタスクで自分の評価を実行し、サービングに何か費用をかける前に答えを知ることができる。
AREX-2の空白は設計上の決定ではなく、まだ存在しないだけだ。ダウンロードできるものは何もなく、したがってテストできるものも何もなく、今週実行できるどんな評価も、それについて何も教えてくれない。今後数日以内にAREX-2のベンチマーク数値を公表する者は、測定できるはずのないものを公表していることになる。

2つの異なるファインチューニングの質問
これらはどちらも完成したサービスではなく出発点であるため、それぞれが何の出発点になるのかを正確に述べておく価値がある。まさにそこにおいて、両者は本当に似通わなくなるからだ。
2.69Bのハイブリッドチェックポイントは、小さく安価な特化モデルを作るためのツールだ。興味深い用途は地味なものにある。規制されたワークフローで文書種別を読み取る分類器、フォームを構造化JSONに変換する抽出モデル、データの近くで単一のカード上で動くドメイン特化型リライターなどだ。価値は、後でその成果物を自分が所有でき、呼び出しの限界費用が電気代であるという事実から生まれる。トレーニングループこそが作業であり、それは今日から始められる作業だ。
AREX-2は逆方向を指している。AREXファミリーは製品へと微調整されるようには設計されていない。むしろ、設計されている。それは呼び出される エージェントとして、検索を実行し、証拠を統合し、自身の回答を制約に対して検証するものである。第二世代がそれを続けるなら、評価することになるのは軌跡だ — 何ステップかかるか、矛盾に気づくか、候補回答の信頼度の数値が意味を持つかどうか。それは微調整の問いではなく、重みの問いでもない。それはサービングの問いであり、誰かが重みとカードを公開することから始まる。
これらはどの規模であっても代替品ではない。自社で所有し再トレーニングできるモデルを必要とするチームは、AREX-2を待っているわけではない。研究エージェントを必要とするチームは、2.6Bのハイブリッドをファインチューニングして研究エージェントにするつもりはない。
それぞれについて、ルーティング層がどこに当てはまるか
これら二つの実用的な違いは、モデルがアプリケーションに組み込まれた瞬間に現れます。というのも、両者はホスティングに対して正反対の関係にあるからです。
LFM2.5 2.6B BaseはOrcaRouterのカタログにはなく、LFM2.5のどのバリアントも載っていません。したがってこれはLiquid AI自身の配布物と一般的なサードパーティホストから供給されるもので、ルーティングされたエンドポイントではなくローカルの成果物です。AREX-BaseとAREX-Turboも当社のカタログにはありません。ルーティング層が本当は何のためのものかつまり、自分のファインチューニングを、それが打ち負かさなければならないモデルと比較する日が来たとき、その比較が調達サイクルではなく設定変更のコストで済んでほしいと望むはずです。200以上のモデルの前に立つ1つのAPI、プロバイダーの定価をトークンごとに何も上乗せせずそのまま透過し、パネル全体で1つのキー、そしてあるプロバイダーの不調な午後があなたの評価の不調な午後にならないようにするフェイルオーバー。これらこそ、実証されていないモデルに対するA/Bテストが実際に実行できるほど安価になる条件です。
それはAREX-2自身についても、正直な捉え方だ。リリースされるとき——前身の2つがそうしたようにオープンウェイトで出荷されると仮定すれば——まったく新しいエージェントを実ワークロードで試す賢明な方法は、本番ループが依存する唯一のプロバイダーとしてではなく、フェイルオーバーの背後にあるサイドパスで試すことだ。
分別のある人は今週、それぞれについてどう行動するか
小規模で限定的なタスクがあり、データを自社インフラの外に出せないなら、Liquid チェックポイントは利用可能で、小さく、収益しきい値未満なら寛容なライセンスで、今日の午後にも試せます。ダウンロードして、自分の評価セットで実行し、結果に判断させてください。AREX-2 に関する何もの、その計画を変えません。
今日、長期的な研究行動が必要なら、頼るべきモデルはすでに存在するものだ。AREX-Baseは7月にリリースされ、少なくとも論文と照らし合わせて確認できるエージェントベンチマークが公開されている。AREX-2はタイムスタンプ付きの名前にすぎず、その位置づけを変える2つの事柄は外部から見える——ツリーにファイルが現れるかどうか、そしてパラメータ数とライセンスを記載したカードがそれらとともに現れるかどうかだ。
この記事が防ごうとしている失敗パターンは、予約された名前がロードマップ上の項目として扱われてしまうケースだ。そうではない。それはBAAIが昨日作ったリポジトリであり、今それについて行うべき計画の適切な量はゼロだ。
