Perceptron Mk1.5とGemma 4 12Bの比較用に生成されたタイトルカード。見出しは「Perceptron Mk1.5 vs Gemma 4 12B」、サブ見出しは「一方は文章で答える。もう一方は座標で答える。」、3枚のカードには「Mk1.5のコンテキスト:36,864トークン」「Gemma 4 12Bのコンテキスト:256K」「Mk1.5の出力:ボックスとトラック」と書かれ、脚注は「Mk1.5の数値はベンダー報告。」。
Guides & Insights

Perceptron Mk1.5 対 Gemma 4 12B:一方は文章で答え、もう一方は座標で答える

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

まず目を止めるべき数字はこれだ。Perceptron Mk1.5 は動画と身体性エージェント向けに作られたモデルで、そのコンテキストウィンドウは 36,864 トークン。Gemma 4 12B は 256K ウィンドウを持つ 12B のオープンウェイト汎用モデルだ。ビジョンモデルを比較するときほとんどの人が使う軸——どれだけの映像を渡せるか——では、より小型でクローズドな専用設計モデルは、ダウンロード可能なモデルに7倍の差をつけられて負けている。この逆転は、どちらの製品の欠陥でもない。それはそれぞれが実際に何をするために作られたかを教えてくれるし、その二つの仕事は、スペックシート上の共通の「マルチモーダル入力」という一行が示唆するよりずっと隔たっている。

Perceptron Mk1.5は、Perceptronが2026年9月25日にリリースした身体性推論モデルで、5月のPerceptron Mk1の後継にあたり、テキスト、画像、動画、音声を入力として受け取り、テキストと機械可読な幾何情報を出力します。Gemma 4 12Bは、Google DeepMindの11.96Bパラメータのエンコーダ不要なマルチモーダル・オープンウェイトモデルで、2026年6月3日にApache 2.0の下でリリースされ、テキスト、画像、音声、動画を入力として受け取り、テキストを返します。どちらも安価で、どちらもカメラフィードを読み取りますが、第2の解析段階なしでコントローラにバウンディングボックスを渡せるのは、そのうちの一方だけです。両者の選択は、何を返す必要があるかについての選択です。

それぞれが何を返すように作られているか

二つを並べてみれば、違いは精度ではない。出力の種類だ。Gemma 4 12B にフォークリフトがどこにあるか尋ねれば、返ってくるのは一文であり、ほとんどのアプリケーションではその一文こそが成果物だ——説明であり、要約であり、写真についての問いへの答えである。Perceptron Mk1.5 に尋ねれば、その散文と並んで、点、バウンディングボックス、ポリゴン、クリップ、あるいは<track>要素で、空間的な観察とそれが属するタイムスタンプを運ぶものを求めることができる。60秒のクリップは、シーンについての一つの平均化された推測としてではなく、時間に沿った位置の連続として返ってくる。

それがMk1.5が存在する理由のすべてであり、なぜそれが重要かを正確に述べる価値がある。シーンの記述は完成品である。座標は別の何かへの入力である——把持プランナー、欠陥チェック、タイムスタンプ付き監査証跡。下流のコードが散文を読み、そこから位置を推測しなければならないなら、あなたは2つのモデル間のパーサーを構築したことになり、そのパーサーが今やあなたの障害面である。Mk1.5の売りは、幾何情報が型付きで届くことだ。

Gemma 4 12Bの反論は、Gemma 4 12Bも同じことをするというものではない。あなたが重みを手にできるという点だ。Apache 2.0、11.96Bパラメータ、事前学習済み版と指示チューニング版で公開され、自分で管理するハードウェア上で動作し、公開された評価カードとそれを支える第三者インデックスを備えている。これらは種類の異なる資産であり、どちらも片方の代わりにはならない。

両者が実際に一致するところ

「"multimodal 2026" というラベルが示唆するほどには多くの箇所ではないが、共通の土台は実在しており、そこが買い手のチェックリストのたいていの出発点であるからこそ、正確に述べておく価値がある。

• 入力モダリティ — どちらも真に4モダリティ対応です。Perceptron Mk1.5 はテキスト、画像、動画、音声(WAV、MP3、FLAC)を受け付けます。Gemma 4 12B は、エンコーダーフリーの単一統合パスを通じてテキスト、画像、音声、動画を受け付けます。

• 出力モダリティ — どちらも音声や画像を生成しない。両方ともテキスト出力である。違いは、Mk1.5 のテキストは構造化された空間注釈を伴うことができるが、Gemma 4 12B のテキストはそうではない点にある。

• 関数呼び出し — どちらも対応しています。Mk1.5 はチャット補完で関数呼び出しを公開し、JSON Schema と正規表現による制約付き応答を受け付けます。Gemma 4 12B は、指示チューニングされた形式で関数呼び出しを搭載し、思考モードを設定できます。

• 推論制御 — Mk1.5 は古い vision_config.enable_thinking ブール値を、reasoning_effort フィールドに置き換えます。これは high、medium、low、minimal、none を受け付け、デフォルトは high。Gemma 4 12B は thinking バリアントと非推論バリアントを公開しており、同じハーネス上で異なるスコアを出すのは、行う作業量が異なるためです。

• コンテキスト — Mk1.5は36,864トークン、Gemma 4 12Bは256K。これはリスト上で最大の差であり、次のセクションはこれについて扱います。

• 重みとライセンス — Mk1.5 は SDK を備えたクローズドなホスト型モデルであり、ダウンロードして使うものではありません。Gemma 4 12B は Apache 2.0 なので、ホスト型の価格は、それを実行する唯一の方法ではなく、いくつかある選択肢の一つにすぎません。

A generated two-column scoreboard titled 'Perceptron Mk1.5 vs Gemma 4 12B - the scoreboard', comparing six dimensions: context window 36,864 tokens vs 256K tokens; input text, image, video, audio vs text, image, audio, video; output text plus boxes, tracks and timestamps vs text only; reasoning control 'reasoning_effort, high default' vs thinking on and off; price $0.15 in / $1.50 out per 1M tokens vs $0.10 in / $0.30 out; and independent score 'none yet' vs AA Index 14 of 142. Footnoted that Mk1.5 figures are vendor-reported with no independent index and that the Gemma index is per Artificial Analysis.

36Kウィンドウは設計上の決定であり、不足ではありません

36,864トークンのウィンドウを持つ身体化モデルは、Perceptron がそれと併せて何を作ったかを見るまでは、失敗のように思える。Mk1.5 は asset_idxフィールドを受け付けるので、1回のリクエストで複数の画像や動画を参照し、それぞれを個別に扱える。音声は1アイテムあたり16,384トークンに制限されている——Perceptron のドキュメントでは、これを毎分約750トークンでおよそ21.8分の音声に相当するとしている。そして、ウィンドウを小さく保てる理由は、タスクが狭いからだ。フレーム内の特定のものを探して追跡し、それについて答え、停止する。

それはGemma 4 12Bの仕事とは異なる形の仕事だ。256Kウィンドウは、文書やリポジトリ、あるいは長い会話を保持し、その全体にわたって推論するためのものだ。Mk1.5のウィンドウは、構造化された回答を伴う1つの知覚タスクのための予算であり、Perceptronはそれをリーダーボードではなくそのタスクに合わせてサイズ設計した。違いが効いてくるのは、あなたのタスクが「この40分の検査動画全体を見て、すべてを教えてくれ」という瞬間だ。36Kウィンドウでは文字起こしとフレームと回答を同時に保持できず、Gemma 4 12Bのウィンドウとその長文脈リコールスコアこそが、そのための正直な計器だ。

そのトレードオフの後半は速度です。Perceptronは、単一のH100上での3回の実行の中央値で、エンドツーエンドで最大4.7倍高速だと報告しています。ただし、4.7倍は3回の測定のうち最良の値であり、典型的なケースではないという注意点があります。チャット応答は5.2秒から1.1秒へ、画像QAは1.7秒から0.51秒へ(約3.3倍)、8並列同時実行での60秒動画は19秒から9.1秒へ(約2.1倍)なりました。エンボディドエージェントが実際に実行する動画ワークロードでは、正直な倍率はおよそ2倍です。

これらのうちの1つは他の誰かによって測定されています。

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing the Apache 2.0 licence, Google DeepMind authorship, the gemma4_unified image-text-to-text pipeline tag, and the card text that Gemma 4 models handle text, image and audio input (audio supported on E2B, E4B and 12B) and generate text output, with a context window of up to 256K tokens and multilingual support in over 140 languages.

これがこの対戦において最も明快な非対称性であり、しかもその差は歴然としている。

Gemma 4 12Bにはベンダー評価カードとサードパーティの指標があります。カードにはベンダー報告値が載っています——MMLU Pro 77.2、GPQA Diamond 78.8、MMMU Pro 69.1、LiveCodeBench v6 72.0、ツールなしのAIME 2026 77.5、3回の実行で平均したTau2 69.0——そして、128kにおけるMRCR v2 8-needleに正直な弱点が1つあり、43.4となっていて、256Kウィンドウが遠端でも同様に振る舞うと想定する前に読むべき行です。さらにその上に、独立した測定結果があります。Artificial AnalysisはGemma 4 12BをIntelligence Index 14と評価し、同クラス142モデル中22位、毎秒113.7出力トークン——速度では142モデル中20位——で、定価は入力100万トークンあたり$0.10、出力100万トークンあたり$0.30です。

Perceptron Mk1.5にはそのようなものは一切ない。Mk1.5にもMk1にもArtificial Analysisのインデックス登録はなく、アリーナスコアも存在しない。したがって、このモデルについて存在するあらゆる能力値は、それを販売している企業が算出したものである。その数値群は曖昧ではなく具体的で、一読に値する。egocentric hand_boxで0.9433、これに対してGemini 3.1 Proは0.4467、Perceptron自身の実行における最良のGeminiは0.6179。EgoSchemaは80.40で、同じ競合の81.20に対して、広範な理解ベンチマークでは0.80ポイントの敗北だが、EgoSchema-hardサブセットでは63.75で12%の優位を主張している。Molmo2-Trackではcentre-F1が0.647、point-HOTAが0.628。音声側ではDailyOmniが74.67、AVHBenchが80.56。これらの数値に見られるパターン——細粒度の幾何学では決定的で、一般的な動画理解ではほぼ互角かやや劣る——は一貫しており、製品のストーリーと一致する。しかし、ベンダーが自社モデルについて示すベンチマークはあくまで主張であり、本記事で扱う2つのモデルは同じ種類の証拠で記述されているわけではない。

その表の 1 行には、特定の警告を添える価値がある。Perceptron の追跡比較では、Qwen3-VL-8B が centre-F1 0.180 として、そのモデルの論文に由来する値で、自社モデルの実測値の隣に並べられ、さらに異なるチェックポイントと評価設定にまたがる Qwen3.5-27B の 0.530 と 0.476 と対にされている。実測値の列に論文の数値が入っているのは、同条件で比較できる行ではないし、出所を伴わずに引用されがちな類の行でもある。同じ注意は逆方向にも当てはまり、LiveVQA-W でツールを有効にした Mk1.5 の 56.0 の投稿についても言える——この数値は 4 サンプルの多数決投票から来ている一方、検索グラウンディングありの Gemini 3.8 Flash について比較されている 53.2 はそうではない。そして 4 サンプルでの多数決投票は正当な手法ではあるが、単一の greedy パスと比べてスコアをよく見せる。

実際のワークロードのコスト計算

料金表の差は、製品の差よりも小さい。Perceptron Mk1.5は入力トークン100万個あたり0.15ドル、出力100万個あたり1.50ドルで、キャッシュ入力は0.0375ドル——標準の入力料金のちょうど4分の1で、キャッシュトークンあたりではGemma 4 12Bの標準入力0.10ドルよりも安い。Gemma 4 12Bは、それを測定するサードパーティのハーネスでは0.10ドルと0.30ドルで掲載されており、Apache 2.0なので、ハードウェアがあればセルフホスティングによって限界費用を完全に排除できる。

単純な比較を難しくする2つの事柄があり、それらは逆方向を指しています。第一に、Mk1.5のreasoning_effortはhighが既定です。つまり、設定していないすべての呼び出しは、モデルが提供する最も高コストな推論パスを購入していることになります。medium または low に下げるのは1行の変更で、請求額に直接影響し、このリリースで最も安価な実験です。第二に、Gemma 4 12B では思考ステップを完全にオフにでき、それにより請求額とレイテンシの両方が変わります。また、フレームレベルの分類のような固定タスクでは、非推論パスが正しい選択であることがよくあります。

現実的な事例で計算してみよう。1日あたり4万フレームを処理し、各画像入力がおよそ1,000トークンになるビジョンパイプラインだ。これは1日4,000万入力トークンになる。Mk1.5の入力単価$0.15では、同じシーンが繰り返されるフレームをキャッシュすれば、入力費は1日あたり1桁台前半のドルで済む――どんな基準でも安い。Gemma 4 12Bは入力$0.10でさらに安く、セルフホストするなら限界的には無料だ。どちらのモデルも高価ではない。ここでの判断は予算の判断ではない。座標が必要か、256Kウィンドウが必要か、あるいはその両方かという問題だ。

2つ目の統合なしで両方を呼び出す

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the Specifications table (model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video, audio, audio formats WAV, MP3 and FLAC, an audio limit of 16,384 audio tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, and JSON Schema and regex constrained responses) and the Pricing table beneath it (input $0.15, output $1.50, cached input $0.0375 per million tokens).

この比較を実行するうえでの実務上の障害は価格ではありません。問題は、Perceptron Mk1.5 と Gemma 4 12B が同じカタログに載っていないことです。現在 OrcaRouter ではどちらもルーティングされていません。当社が提供している Gemma 4 のエントリは 31B Instruct と 26B-A4B のバリアントで、Mk1.5 にはルートが一切ありません。したがって正直なところ、Mk1.5 にはベンダー自身の API(api.perceptron.inc)を使い、pip install "perceptron>=0.4.0" でインストールし、キーは PERCEPTRON_API_KEY に設定する方法でアクセスし、Gemma 4 12B にはサードパーティのホスト経由か、Apache-2.0 の重みをご自身でサービングするかのいずれかの方法でアクセスする、というのが誠実な案内です。

この状況でルーティング層が本当に担うのは、あなたがまだ下していない判断です。Mk1.5の構造化出力がアプリケーションに必要なもので、Gemma 4 12Bのウィンドウがもう一方のワークロードに必要なものであるなら、それは2つの統合であり、2つの障害ドメインです。それらを単一のOpenAI互換エンドポイントの背後に置き、自動フェイルオーバーを効かせれば、どちらかでプロバイダーに一時的な不調が起きても、ジョブの失敗ではなくフォールバックへの切り替えで収まり、ルーティングルールを使えば、アプリケーション側がどちらがどちらかを知らなくても、幾何処理のワークロードと長コンテキストのワークロードを別々のモデルに振り分けられます。ベンダーが料金表を変更した場合、パススルールーターはプロバイダーの定価をトークンあたりの上乗せなしで請求するので、変更は次の請求サイクルを待たずに同じ日に反映されます。ルーティングDSLは、比較を段階的に行う方法でもあります — ベンチマーク論ではなく、実際のトラフィックの一部を各モデルに振り分け、あなた自身のフレームで測定するのです。

実際にどっちが欲しいの?

答えが機械可読でなければならないなら、Perceptron Mk1.5を選んでください。何かを駆動していたり、位置と時間が肝心な何かを記録していたりするなら、どれだけ余分なコンテキストウィンドウがあっても型付き座標の代わりにはなりません。そして、この組み合わせでそれを生成する唯一のモデルがMk1.5です。3つの点を覚悟して臨んでください:36,864トークンの予算、高推論のデフォルト、そしてそれに付随するあらゆる性能値がベンダー自身によるものであるという事実です。

それを決着させる最も安上がりな方法は、実トラフィックの一部をそれぞれに振り分け、自分のフレームで計測することです。1つのOpenAI互換エンドポイントの背後に両方があり、OrcaRouter上のそれが、並べて比較するテストを2つ目の統合ではなく設定1行にします。

大量の資料を保持する必要があるなら、重みが必要なら、あるいはベンダーのベンチマークを鵜呑みにしない相手にその選択を正当化する必要があるなら、Gemma 4 12B を選べ。独立したインデックス、公開された評価カード、Apache 2.0 ライセンス、そして7倍大きいウィンドウを備えており、しかもシーンを測定するのではなく描写する。その最後の一節が、判断のすべてだ。これらのモデルの一方は、自分で所有して監査できる汎用モデルであり、もう一方は、ジオメトリを返すから借りる専門モデルだ。専門モデルのほうがウィンドウが小さく、第三者によるスコアがないという事実は矛盾ではない。それは、狭く作られたツールが外から見える姿にすぎない。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新