
AREX-2 vs Gemma 4 12B:このうち1つはモデルである
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
このブログの他のどの対決にもない性質が、Gemma 4 12BとAREX-2の比較にはある。それは、2つの列のうち片方が空であるということだ。なぜなら、その側のモデルはまだ存在しないからである。Gemma 4 12B は出荷済みの成果物だ。Google DeepMind が 2026年6月3日に Apache 2.0 の下で 119億5000万パラメータの密なオープンウェイトモデルとして公開したもので、完全なモデルカード、256K トークンのコンテキストウィンドウ、ネイティブの音声入力と画像入力、そして3か月半にわたる独立したテストを備えている。AREX-2 は、BAAI が 2026年9月29日 17:56 UTC に作成した Hugging Face リポジトリであり、まだ何も入れられていない。重みも、カードも、ライセンスタグも、評価も、発表もない。
その非対称性は、比較を省く理由にはならない。それこそが比較なのだ。答える価値のある問いは、これらのどちらが優れているかではない——AREX-2にファイルが入るまで、そんなことに答えられるものは何もない——そうではなく、そもそも第2世代のBAAIリサーチエージェントが12Bエッジモデルと競合することになるのかどうか、あるいはこの二つが、決して交わらないスタック内の位置を占めるのかどうかだ。それを間違えることが高くつく過ちである。なぜなら、それはチームに間違ったものへ予算を割り当てさせる過ちだからだ。
出荷された側、それ自体の論理で
Gemma 4 12B は、Google の第4世代オープンファミリーの小型モデルであり、その決定的な設計上の選択はアーキテクチャにある。すなわち、独立した視覚エンコーダーを完全に排除し、生の画像パッチと音声波形をトランスフォーマーに直接入力する。これはベンチマークのための小技ではない。これこそがこのモデルを真にポータブルにするものであり、量子化すると 7 GB 未満になる約 27 GB の BF16 重みと、16 GB の VRAM をデプロイ対象として明記するカードがそれを裏づけている。ノートPCや単一のミッドレンジカード上で、これは実際に手元に置けるモデルだ。
能力プロファイルはそこから導かれる。Google自身のモデルカードは——ベンダー報告であり、そのようにラベル付けする価値がある——文書理解でDocVQA 94.9とInfoVQA 88.4、思考モードでMMLU-Pro 77.2、GPQA Diamond 78.8、AIME 2026 77.5、LiveCodeBench v6 72.0を挙げている。独立系のArtificial Analysisは、その推論構成をIntelligence Index 14と評価し、毎秒114トークンと測定し、一般的なサービング呼び出しの価格を入力100万トークンあたり$0.10、出力100万トークンあたり$0.30としている。より大型のGemma 4 31Bについての当社自身のカタログ項目では、GPQA Diamondで85.7を記録している。その姿は、文書と画像に異例なほど強く、推論はそこそこだが、難しい多段階作業ではフロンティアモデルには遠く及ばない、小型の汎用モデルだ。
そのため、その役割は具体的である。ローカルまたはシングルテナントの推論、文書やスクリーンショットの理解、控えめなエージェントループ、そしてデータを建物の外に出せないあらゆる用途だ。それは深掘り調査エンジンではなく、Googleもそう謳ってはいない。

もう一方は、名前とタイムスタンプです
今週AREX-2について確認できることのすべては、一文に収まる。それはHugging Face上のBAAI組織に属するリポジトリで、2026年9月29日に作成され、.gitattributes ファイル以外には何も含んでいない——保存されたモデルデータはゼロバイト、ダウンロード数はゼロ、モデルカードもなく、ライセンス宣言もなく、プロバイダーによるデプロイもない。BAAI自身は何も発表していない。
書き留める価値があるのは、その名前の由来となったファミリーだ。BAAIのAREXシリーズは2026年7月23日に2つのモデルをリリースした。AREX-Baseは、Qwen3.5-122B-A10Bに基づく1220億パラメータのMixture-of-Experts(MoE)で、アクティブパラメータは100億。AREX-Turboは、Qwen3.5-4B上に構築されたdenseな4Bモデルだ。両方ともApache 2.0。どちらもチャットモデルではなくディープリサーチエージェントであり、証拠を集めて信頼度付きの候補回答を生成する内側のループと、その回答を元の制約に照らして検証し、必要ならトラジェクトリ全体を改良または再開できる外側のループを備えている。BAAIの公表数値によれば、AREX-BaseはBrowseCompで82.5、GAIAで85.4、DeepSearch QAで89.9に達し、AREX-Turboは同じ3つで70.7、81.6、78.5に達する。
それらの数値はすべてベンダー自身によるもので、独立して再現されたものは一つもない。しかも別のモデルに関するものだ。AREX-2には数値が一切なく、「2」からはサイズやバックボーン、アーキテクチャについて何も分からない。この系列における第二世代は、より大きなエージェントかもしれないし、より小さな蒸留モデルかもしれないし、バックボーンを差し替えた再学習済みフレームワークかもしれない。
この二人はそもそも会うのか?
ここが、この比較が見た目以上に役立つところだ。AREX-2が何になるかについてのもっともらしい2つの解釈を取り上げよう。
第二世代のリサーチエージェントがBaseと同程度の規模であるなら、それとGemma 4 12Bが競合することは決してない。マルチソース検索を駆動する122BのMixture-of-Expertsは、ホスト型で、トークン単位で課金され、ネットワークに依存するサービスだ。Gemma 4 12Bは、自分でダウンロードして実行するチェックポイントである。両者のどちらを選ぶかは品質の比較ではなく、あなたのワークロードがリサーチループなのか推論エンドポイントなのかという判断である。
もしAREX-2が小規模ティア、つまり122B Baseではなく4B Turboの後継だとしたら、この2つは同じ棚に並ぶことになり、比較は現実的なものになる。そのバージョンのAREX-2は、Gemma 4 12Bのパラメータ数のおよそ3分の1で、マルチモーダルの広範さではなくツール駆動型検索に特化し、DocVQAではなくBrowseCompとGAIAで評価されるだろう。2つの小規模モデル、一方は長い研究の軌跡を保持することに最適化され、もう一方は控えめなハードウェアで見て読むことに最適化されている。ドキュメントパイプラインを構築するチームは前者を気にする必要はない。研究エージェントを構築するチームは後者を気にする必要はない。
• 存在するもの — Gemma 4 12B は本日、完全なモデルカード付きでダウンロード可能です。AREX-2 はファイルが1つも入っていないリポジトリです。
• パラメータ — Gemma 4 12B 向けの dense 11.95B。AREX-2 については明記されておらず、製品名からのみ推測可能。
• コンテキスト — Gemma 4 12Bでは256Kトークン(262,144ポジション)。AREX-2では不明。
• モダリティ — Gemma 4 12Bではテキスト、画像、音声を入力可能。AREX-2については不明。初代AREXはテキストとツール使用に対応していた。
• ライセンス — Gemma 4 12B は Apache 2.0、カードに明記。AREX-2 については明記なし。AREX-Base と AREX-Turbo は Apache 2.0 だった。
• 何のためのものか — 自前のハードウェア上でデプロイ可能なマルチモーダル推論と、このファミリーの証拠から見れば、ホスト型エンドポイントに対する長期的な探索およびエビデンスの集約との対比。

実際に比較できる部分:それぞれがどこで実行されるか
能力の比較が利用できない以上、率直に行うべきは展開の比較であり、しかもその差は僅差ではない。
Gemma 4 12Bは、導入した場所で動作する。料金表も、トークン単位のメーターも、あなたとモデルの間にプロバイダーも存在しない——コストはハードウェアと電気代であり、障害モードはあなた自身のキャパシティプランニングだ。対照的に、AREX-Baseが7月に出荷されたとき、それは122BのMixture-of-Expertsだった。クラスタ上で提供するか、トークン単位で借りるモデルであり、このファミリー自身の4B Turboが存在するのは、まさにその選択に代償があるからだ。第2世代が同じ形を踏襲するなら、AREX-2の経済性は、クエリごとに消費されるトークン数に、軌跡が取る検索ステップ数を掛けた関数になる——その数は、文書読解モデルよりもディープリサーチエージェントのほうがはるかに大きい。なぜなら、エージェントは反復ごとに成長するコンテキストを再読込するからだ。
そこが、ルーティング層が抽象概念ではなく費用項目になり始める地点だ。リサーチエージェントをホスト型モデルに対して動かしつつ、ドキュメント処理用にローカルの Gemma 4 12B を残すことになった場合、通常ならそれは2つの統合になる。200以上のモデルの前面に立つ1つのAPI — プロバイダの定価がそのまま適用され、上乗せのマークアップもないため、ベンダーの価格変更は同じ日に反映される — を通せば、1つのキー、1つの請求、1つのクライアントで済み、フェイルオーバールールによって、エージェントループに気づかれることなく、不調な時間帯にあるプロバイダからリクエストを移せる。当社は現在、Gemma 4 26B-A4B と Gemma 4 31B をルーティングしている。12B はルーティングしておらず、AREX ラインの製品も当社のカタログには一切載っていない。したがって、そのいずれかが必要なモデルであるなら、それはベンダー自身の配布から入手することになる。
今週やること
自分で動かせるコンパクトなマルチモーダルモデルが必要なら、その判断はAREX-2を待つことにはならなかった。Gemma 4 12Bは出荷済みで、ドキュメントも整い、独立した評価も受け、デプロイ可能だ。そして反対側の比較欄は空だ。予約された名前を根拠に何も買ってはいけない。
ディープリサーチエージェントを構築していて、本当に欲しいのが AREX シリーズなら、注目すべきは名前ではなくツリーです。そのリポジトリに safetensors が存在するか、カードにパラメータ数がいくつと書かれているか、そしてどのライセンスタグが付くかです。第1世代は Apache 2.0 でリリースされました。第2世代も同様なら、問題はライセンスの問題ではなくホスティングの問題になります。それまでは、AREX-Base が実際に動かせる AREX モデルであり、7月から利用可能です。
この記事が名目上扱っている比較について、率直に言っておく価値があるのはただ一つだ。片側がリポジトリのコミットで、もう片側が出荷済みモデルであるVSページは、対戦ではなくスケジュールだ。そのスケジュールが示しているのは、Gemma 4 12Bは現在利用可能で、AREX-2はまったく利用可能ではないということだ。
