
Aion 3.5 Mini vs Gemma 4 12B:片方にはスコアボードがあり、もう片方には値札がある
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 180 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
Aion 3.5 Mini と Gemma 4 12B が同じ種類の買い物だと言えるのは、ただ一点においてのみだ。どちらも今日 API 経由で呼び出せる小型モデルである。AionLabs は 2026年9月23日に Aion 3.5 Mini を、入力トークン100万あたり0.70ドル、出力1.40ドルの、クローズドでテキスト専用のマルチモデルシステムとしてリリースした。DeepMind は 2026年6月3日に Gemma 4 12B を、Apache 2.0 の下で公開された11.95Bパラメータのオープンウェイトモデルとしてリリースし、エンコーダ不要のマルチモーダル入力経路と公開された評価カードを備えている。実用的な違いは、パラメータ数でも価格の行でもない。一方は実際に採用する前に測定できるが、もう一方はまったく測定できない、ということだ。
以下に示す Aion 3.5 Mini に関するすべては、AionLabs が自ら公開しているモデル一覧と、その API で提供されている構成に由来します。Gemma 4 12B に関するすべては、その数値の出所であるベンダーのモデルカードに加え、実際にそれを実行したサードパーティの評価ハーネスに由来します。数値がベンダー報告である場合は、そのようにラベル付けされています。Aion モデルについては独立した評価が一切存在せず、これは注意書きではなく事実として述べられています。
両者が実際に一致するところ
「小さいモデル」というラベルが示唆するよりも該当箇所は少なく、実際に一致するものについては正確である価値があります。なぜなら、それらは買い手が最初に確認するものだからです。
• コンテキスト — Aion 3.5 Mini は 262,144 トークンを搭載。Gemma 4 12B は 256K ウィンドウを搭載。名目上はほぼ互角で、実際にもどちらも十分に大きいため、コンテキストが決め手になることはない。
• 最大出力 — Aion 3.5 Mini は 1 回の応答を 32,768 トークンに制限しており、これは Aion カタログ全体で共有される上限です。Gemma 4 12B はカード上に相当する単一数値の上限を公表していないため、これは読んで確認するのではなく、テストして確かめる必要がある項目です。
• ツール呼び出し — どちらも対応しています。Aion 3.5 Mini は OpenAI 互換エンドポイント上でツール定義、JSON レスポンス形式、temperature を受け付けます。Gemma 4 12B は instruction-tuned 形式で function calling を搭載しています。
• 推論制御 — Aion 3.5 Mini はすべての呼び出しで推論を行い、3つの努力レベル(max、high、low)を公開し、デフォルトは high です。推論はオプションではありません。Gemma 4 12B は推論バリアントと非推論バリアントを提供しており、同じハーネス上で両者が異なるスコアを出すのは、異なる量の作業を行っているためです。
• 入力モダリティ — ここが両者の分かれ目がはっきりと現れる最初の点です。Aion 3.5 Mini はテキスト入力・テキスト出力で、アーキテクチャ上、画像入力は存在しないと明言されています。Gemma 4 12B はテキスト、画像、音声、動画を入力として受け取り、テキストを返します。
Gemma 4 12B があなたに見せられるもの
Gemma 4 12Bはベンダー評価カードを伴って登場し、そこに記載された数値は独立に再現されたものではなくベンダー申告によるものだ。しかし、それらは存在し、具体的であり、購入者が実際に議論する軸をカバーしている。
• ベンダー報告による推論と知識 — MMLU Pro 77.2、GPQA Diamond 78.8、ツールなしのHLE 5.2、BigBench Extra Hard 53.0、MMMLU 83.4。
• ベンダー報告によるコーディング — LiveCodeBench v6 72.0、Codeforces ELO 1659、ツール不使用のAIME 2026で77.5。
• ベンダー報告によるエージェント性能 — Tau2は3回の実行平均で69.0、Codeforces ELOは今回もカード上で最も強い単独の成績となっている。
• ベンダー報告のマルチモーダル — MMMU Pro 69.1、MATH-Vision 79.7、MedXPertQA MM 48.7。このカードにはDocVQAの行はなく、最も近い文書指標はOmniDocBench 1.5の平均編集距離0.164です。
• 長コンテキスト想起 — MRCR v2、8ニードル、128k、43.4。これはこのカードに載っている正直な弱点であり、256Kウィンドウがその遠端でも256Kウィンドウのように振る舞うと想定する前に、目を通しておく価値がある。
• 第三者による測定 — Artificial Analysis は、独自のハーネス上で Gemma 4 12B について、Reasoning Intelligence Index を14、Non-reasoning Index を9、推論モードでの出力速度を約毎秒113トークン、リスト価格を100万トークンあたり入力 $0.10、出力 $0.30 と記載しています。インデックスはスナップショット間で改訂されるため、指数は方向性の目安として扱い、価格と速度を持続的な指標として扱ってください。

Aion 3.5 Miniがあなたに見せられるもの
価格、ウィンドウ、アーキテクチャの説明、それだけだ。AionLabsは自社カタログ内のどのモデルについても、SWE-bench Verified、Terminal-Bench、GPQA、MMLU-Proの数値を公表しておらず、3.5の発表資料にはベンチマーク表が一切載っていない。Artificial AnalysisにはAion 3.5 Mini、Aion 3.5、Aion 3.0、Aion 3.0 Miniのページがなく、4つともモデルインデックスに登場しない。
その不在は自動的に致命的というわけではなく、それを致命的であるかのように提示するのは誤りだ。AionLabsは自社のモデルについて、物語やストーリーテリングの作業のために作られたマルチモデルシステムであり、複数の専門化されたモデルがそれぞれ応答に寄与する協調的生成プロセスを備えていると説明している。上記の複合指数は数学、コード、経済のタスクから構成されており、散文を評価するには不適切な道具だ。モデルは、それが作られた目的において本当に優れていながら、コーディングのリーダーボードでは低いスコアになることも、そもそもそこに登録されないこともありうる。
欠落が意味するのは、もっと狭く、より厄介なことだ。完了したタスクあたりのコストを計算することはできない。Aion 3.5 Miniの$0.70と$1.40は、計測された分母のない定価である。Gemma 4 12Bの$0.10と$0.30には、計測された分母が付随しており、それを計測したのと同じハーネスがタスクあたりのコストも報告している。これが非対称性であり、ベンチマークが適切かどうかをめぐるあらゆる議論を経ても生き残る。
価格の差は、能力の差が今後そうなる見込みよりも大きい
2つの料金表を並べると、意思決定の形が変わる。Aion 3.5 Miniは入力トークン100万個あたり0.70ドル、出力100万個あたり1.40ドルを請求する。Gemma 4 12Bは、それを測定するサードパーティ製のハーネスでは入力0.10ドル、出力0.30ドルと表示されている。これは入力料率で7倍、出力料率で約4.5倍であり、しかもそのモデルは、自社ベンダーが比較できるスコアを一切公開していない。
単純な掛け算を複雑にする要素が2つあり、どちらも Gemma 4 12B をさらに有利にします。第一に、Aion 3.5 Mini は呼び出しごとに推論するため、出力行にはあなたが要求しておらず、上限も設定できないトークンが含まれます — AionLabs は、3つの努力レベルのいずれにおいてもモデルが思考に費やすトークン数について何も公表していません。Gemma 4 12B では思考ステップをオフにできるため、請求額とレイテンシの両方が変わります。第二に、Gemma 4 12B は Apache 2.0 の下でオープンウェイトであるため、$0.10 と $0.30 はそれを実行する唯一の方法ではなく、複数の選択肢のうちの1つです。
そうしたことのどれも、どちらのモデルがより上手く書くかは決着させない。どちらもその軸では誰も測っていないからだ。ただ、どちらをステークホルダーの前に出せるかは決着させる。
その2つを一緒に実行する
ここで役立つのは、どちらか一方を選ぶことではない。Aion 3.5 Mini と Gemma 4 12B は異なるインターフェースの背後にありながら、呼び出し規約は同じだ。AionLabs は OpenAI 互換のエンドポイントを公開しており、Gemma 4 12B は一般的な OpenAI 互換ランタイムで提供されている。そのため base-URL レベルでは両者を入れ替え可能で、チェーンを安く組める。アンサンブルこそが呼び出す理由になるプロンプトにはまず Aion 3.5 Mini を、その背後には Gemma 4 12B を置き、慎重に測られたモデル、切り替え可能な思考ステップ、そして料金表が4分の1の規模のものが欲しいあらゆる用途に使う。
ゲートウェイが数百のモデルを単一のキーで前面に置くことは、そのチェーンを第二の統合ではなく設定の一行にする。また、フェイルオーバー規則がその真価を発揮するのもここだ — 429 やプロバイダーの障害は、応答が始まる前に吸収され、失敗したジョブとして表面化することはない。ベンダーが料金表を改定したとき、パススルールーターはプロバイダーの定価をトークンあたり何も上乗せせずに請求するため、変更は次の請求サイクルではなく当日に反映される。思い込む前に確認しておく価値のある細かい点がひとつある。Aion 3.5 Mini も Gemma 4 12B も、この規模のモデルをホストするあらゆるプラットフォームで提供されているわけではなく、特に Gemma 4 12B は、より大型の兄弟モデルを扱っているカタログの一部にも存在しない。組み込む前に、その識別子が解決することを確認してほしい。

どうやって決めるか
• 決断を下す前に数字が欲しいなら — Gemma 4 12B。2つのうち、公開された評価カードと第三者インデックスの両方を備えているのはこれだけで、しかもその評価はあなたの決断に従って行われるのではなく、決断に先立って存在するものである。
• 画像、音声、または動画の入力が必要なら — Gemma 4 12B。Aion 3.5 Mini はテキストtoテキストのみで、それ以外は何も対応しないと明言しています。
• とにかく自分で所有したいなら — Gemma 4 12B。Apache 2.0 の重みならファインチューニングも量子化もセルフホストも自由自在。Aion 3.5 Mini はダウンロードできる重みが存在しないクローズドなシステムです。
• ナラティブや長文の散文が仕事のすべてなら — これは、比較があなたに代わって答えを出せない唯一のケースだ。Aion 3.5 Mini はその作業のために作られ、Gemma 4 12B は汎用モデルとして作られた。どちらがより上手く書くかを教えてくれる公表された数値はない。失っても構わない経路で試してみよう。
• 完成したジョブあたりのコストが判断の分かれ目になるなら — 計算だけを見れば Gemma 4 12B であり、タスクが出力トークンに依存するほどその差は広がる。
Both models are recent, both are live, and only one of them is asking you to take its word for it. Both models are recent, both are live, and only one of them is asking you to take its word for it. The defensible summary is that Gemma 4 12B is the measurable default and Aion 3.5 Mini is a specialist you adopt on purpose, not by comparison — and if you do adopt it, adopt it beside a fallback rather than instead of one.

