生成されたタイトルカード。見出しは「AesCode-8B vs Gemma 4 12B」で、角丸のカードが2枚横に並んでいる。左のカード AesCode-8B にはブラウザウィンドウのアイコンと、「Microsoft の研究チェックポイント」「レンダリング済みの HTML ページを出力する」という行がある。右のカード Gemma 4 12B には書類の上に虫眼鏡を重ねたアイコンと、「Google DeepMind、2026-06-03 公開」「画像についての質問に答える」という行がある。両者の間の区切りには「一方はレンダリングし、一方は応答する」と書かれ、上部を横切るキャプション帯には「未発表リリース — 重みのみ、ホストされたエンドポイントなし」と書かれている。OrcaRouter のロゴが右下に合成されている。
Guides & Insights

AesCode-8B vs Gemma 4 12B:2つの小型ビジョンモデル、まったく異なる2つの出力

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

AesCode-8BとGemma 4 12Bはどちらも画像と一文を入力として受け取り、どちらも借りるのではなくダウンロードして使うApache-2.0のチェックポイントです。だからこそ検索エンジンは喜んで両者を並べて表示します。似ているのは確かですが、その類似は浅いものです。Gemma 4 12Bが返すのは答え——説明、文字起こし、コードスニペット、推論のトレースです。AesCode-8Bが返すのはレンダリングされたページ——スライド、ポスター、ダッシュボードを、ブラウザで開いて手作業で編集できる完全なHTMLとCSSのドキュメントとして出力します。入力の形は同じ、おおよその規模も同じ、それなのに出力は互いにほとんど共通点がありません。この一点の違いが、明日どちらをユーザーの前に出せるかを含め、以下に挙げるほぼすべての実用的な問いを左右します。

最初に明言しておく価値がある。なぜなら、それは数字がどれだけの重みを持ちうるかを左右するからだ。Gemma 4 12Bは2026-06-03にDeepMindによって、モデルカード、ドキュメント、エコシステムとともに公開され、それ以来独立にテストされている。AesCode-8Bはまったく公開されていない。Microsoftによるそのリポジトリは2026-09-29に作成され、重みは2026-10-07 03:35 UTCに「Release AesCode-8B」と題されたコミットで登録され、学習およびコーディングのコードは翌日GitHubに現れた。Microsoft Researchの投稿も、製品ページも、リリースノートも、プレプリントも存在しない。モデルカードの引用は「Under review」と記載され、年はプレースホルダーの2027年になっている。これを書いている時点で、8Bリポジトリはダウンロード数2、いいね1を示している。したがって、AesCode-8Bについて定量的なものはすべてMicrosoftのものであり、他の誰によっても再現されていない。

2つのモデルを、それぞれの流儀で

Gemma 4 12Bは中型のオープンモデルであり、119.5億パラメータの高密度チェックポイントだ。その決定的な設計上の選択は、独立した視覚エンコーダも音声エンコーダも持たないことにある。画像パッチと音声波形は直接トランスフォーマーへ入力される。256Kトークンのコンテキストを備え、約16GBのVRAMを必要とする。BF16の重みは約27GB、量子化ビルドは7GB未満だ。ベンダー自身のカード——ベンダー報告によるもので、ここでもそのように明記されている——には、thinkingモードにおけるDocVQA 94.9、InfoVQA 88.4、MMLU-Pro 77.2、GPQA Diamond 78.8、AIME 2026 77.5、LiveCodeBench v6 72.0が記載されている。より重要なのは独立した評価のほうだ。Artificial Analysisは推論構成のIntelligence Indexを14とスコアリングし、毎秒約114トークンを計測し、一般的なサービング呼び出しの価格を入力100万トークンあたり約0.10ドル、出力100万トークンあたり0.30ドルと見積もっている。その背後には3か月半の運用実績がある。

AesCode-8BはQwen3-VL-8B-Instruct4つのsafetensorsシャード、合計17,543,339,408バイトとして公開されています。つまり約88億個のbf16パラメータであり、そのためHugging Faceの丸められたサイズ欄は9Bと表示されますが、ベンダーは8Bと述べています。公開されている設定はQwen3-VLそのままのレシピです。隠れ層36、隠れサイズ4,096、8個のキーバリューヘッドを伴う32個のアテンションヘッド、151,936トークンの語彙、そしてtransformers 4.57以降が必要です。Microsoftが報告した実行では、24,576トークンのコンテキストと最大12,000の出力トークン、temperature 0.8、top-p 0.95を使用し、プロンプトごとに3回生成して選択は行いませんでした。ライセンスはApache 2.0で、ゲートなし、許容利用に関する補遺はありません。含まれていないのは、学習データと評価データ、およびホスト型エンドポイントです。AesCode-8Bがどこかで提供されているのを見つけることはできませんでしたし、私たち自身のカタログにもありません。

モデルが実際に訓練された目的とは

デザインブリーフはモデルカードに引用されており、全体のテーゼとして読む価値がある。コードモデルは「レイアウト、階層、色がキャンバス上でどのように一つになるかを見ることができない」一方、画像生成器は「視覚的に魅力的なページを構成するが、テキスト、数字、論理関係をしばしば誤ってレンダリングする」。AesCode は、構成感覚と検証可能性を同時に保とうとする試みである。

この仕組みは、ある一つの点で異例だ。すべての学習プロンプトには、同じプロンプトから生成された参照画像が対になっており、その画像がレイアウトとスタイルを供給する一方で、内容についての権威はテキストプロンプトに残る。そして推論時、モデルはほとんど画像を必要としない。AesCode-8Bから参照画像を差し控えると、そのVisualスコアは100点満点中1.00点下がる。Qwen3-VL-8B-Instructから差し控えると、低下幅は19.55点になる。同じ評価ハーネスで評価したGPT-5.5から差し控えると、10.04点になる。視覚的プライアは入力ではなく重みの中に宿る結果となり、これこそが見出しの下にある真の研究成果なのだ。

Gemma 4 12Bの学習ターゲットはごく普通のマルチモーダルなものであり、そう言っても批判にはならない。画像を読み、質問に答え、指示に従い、ツールを呼び出す。そのカードには、レンダリングされた成果物の生成を目指したことがかつてあると示唆するものは何もなく、公開されているGemma 4 12Bの評価で、ドキュメントのレイアウト品質、キャンバスのオーバーフロー、デザインの一貫性を測定しているものもない。これらはそのモデルの指標ではないからだ。

スコアボード、そしてそれが誰のルーブリックなのか

A generated two-column scoreboard titled "AesCode-8B vs Gemma 4 12B - the scoreboard". Left column AesCode-8B reads Parameters 8.8B dense, Inputs text plus one image, Output a rendered HTML page, Context 24,576 tokens, Evidence Microsoft rubric with no outside test, Hosted nowhere we can find. Right column Gemma 4 12B reads Parameters 11.95B dense, Inputs text, image, audio, video, Output text and tool calls, Context 256K tokens, Evidence AA Intelligence Index 14, Hosted cheap served calls. A footer line reads "AesCode-8B figures are Microsoft-reported and unreproduced; Gemma 4 12B figures per Artificial Analysis." The OrcaRouter logo is composited bottom-right.

• パラメータ — AesCode-8B:8.8B bf16、dense。Gemma 4 12B:11.95B dense。

• 入力 — AesCode-8B:テキストと任意の参照画像。Gemma 4 12B:テキスト、画像、音声、動画。

• 出力 — AesCode-8B: 完全なHTMLおよびCSSドキュメント。Gemma 4 12B: ツール呼び出しを含むテキスト。

• コンテキスト — AesCode-8B: 報告された構成では24,576トークン。Gemma 4 12B: 256Kトークン。

• ライセンス — 両方ともApache 2.0、ゲートなし、重み込み。

• 根拠 — AesCode-8B:Microsoft自身による300サンプルのインフォグラフィック評価基準、プロンプトごとに3回の生成、独立した再現はなし。Gemma 4 12B:ベンダー提供のカードに加え、独立したIntelligence Indexは14、Artificial Analysisで測定されたスループット。

さて、スコアボードには載せられない部分だ。マイクロソフトの報告では、AesCode-8Bはその300サンプルセットで総合82.94を記録し、参照条件付きGPT-5.5の81.28、Claude Opus 4.8の80.39を上回り、自社のQwen3-VL-8Bバックボーンをビジュアルポイントで31.1上回っている。だが、これはすべてベンダー報告かつ再現未確認として読むべきだ。ベンダーが作ったルーブリックに基づき、ベンダーが選んだサンプル上で、ベンダーがモデルを訓練する相手としたハーネスによって採点されている。そのカードは、比較対象のどのモデルも60をクリアしない次元を公表するだけの誠実さがある — スタイルだ。そこではAesCode-8Bが53.21、GPT-5.5が57.91で首位につけている — そしてマイクロソフト自身によるその次元の定義は、納品前にこれ以上視覚的な修正を必要としないデザインである。人間がそのページを未編集のまま出荷するかどうかを問う唯一の軸では、8Bモデルは首位ではない。誰かが82.94を引用するとき、心に留めておくべき数字はそれだ。

それらが真に重なる場合

共有の棚はただ一つしかなく、それは見た目よりも狭い。ドキュメント中心のパイプライン向けに小規模なオープン視覚モデルを評価しているなら、両方とも候補になる——一方は文書を読むため、もう一方は文書を生成するためだ。社内ダッシュボードをHTMLとして生成し、さらにアップロードされたPDFから図表を抽出する必要もあるチームは、同じ週に両方のプロダクトに触れることになる。

その重なりの内側の切り分けは明確だ。Gemma 4 12B は、入ってくる文書に対して使うモデルだ。AesCode-8B は、成果物がページであるときのブリーフに対して使うモデルだ。どちらも他方の代わりにはならず、両方を求めるパイプラインは選択ではなく、2モデル構成のパイプラインである。

A Hugging Face screenshot of the microsoft/AesCode-32B model card showing tags for Image-Text-to-Text, Transformers, Safetensors, English and qwen3_vl, an Apache-2.0 licence badge, 1 like from the Microsoft organisation, and the card opening text that AesCode generates information-rich visual artifacts such as slides, posters and dashboards as HTML/CSS with output that stays structured, editable and verifiable.

デプロイこそが、非対称性が実際に効いてくる場面だ

Gemma 4 12B のサービングに関する話はもう完成している。ダウンロードし、必要なら量子化し、16 GB の VRAM で動かせる。しかも、すでにこれを実現している大規模なツール基盤が存在する。自分で実行したくない場合は、サービス経由の呼び出しが安価で、独立した価格設定になっている。

AesCode-8B のサービングは、コマンドラインと少しの算数で決まる。モデルカードがそのルートを直接示している — vllm serve microsoft/AesCode-8B --limit-mm-per-prompt image=2 --max-model-len 24576、非 vLLM 経路では transformers 4.57 以降を使う。17.5 GB の bf16 重みを、24,576 トークンおよび最大 2 枚の画像分の KV キャッシュと一緒に置く必要があるため、24 GB カード 1 枚は技術的には足りるものの、かなりぎりぎりだ。現実的な最低ラインは 40〜48 GB、または 24 GB カード 2 枚だ。レンダラーも見込んでおくべきである。というのも、このモデルに関するあらゆる品質の主張は、その HTML 出力をサンドボックス化されたブラウザでレンダリングすることによってなされるため、自分の結果を採点するには、外部リクエストをブロックした Playwright 的なものを立ち上げる必要があるからだ。

次に、可用性についての正直な現状です。当社はAesCode-8Bをルーティングしておらず、調べた限りでは他社も誰もルーティングしていません。今日評価するとなれば、自前のハードウェアに重みを載せることを意味します。呼び出し可能なものの中で最も近いのは、このモデルがファインチューニングされた元となったアーキテクチャです。Qwen3-VL-8B-Instructは現在OrcaRouter経由でルーティング可能で、131,072トークンのコンテキストで入力100万トークンあたり$0.18、出力100万トークンあたり$0.70です。また、当社が実際に提供している2つのチェックポイントも同じ価格体系です — Gemma 4 26B-A4Bが$0.06と$0.33、Gemma 4 31Bが$0.13と$0.38。プロバイダーの定価はマークアップを加えずそのまま適用され、プロバイダー間のフェイルオーバーは自動的に行われます。ですので、あなたのプロンプトがそもそもきちんと機能するかどうかを安く見極める方法は、まず未チューニングのバックボーンをテストし、GPUを1週間かけるのは生き残ったプロンプトだけにすることです。

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Featured badge, the byline "by Google - 2026-04-02", a description of Gemma 4 31B Instruct as a 30.7B dense multimodal model with text and image input and a 256K-token context window, and the pricing row reading $0.13 input and $0.38 output per million tokens with measured latency figures.

実際にどっちが欲しいの?

成果物がページなら、AesCode-8B を選べ。このモデルは構造化された編集可能な HTML — 表は HTML テーブル、チャートは ECharts スペック — を出力する。つまり出力は Git で差分が取れ、再生成しなくてもデザイナーがスタイルを変更できる。そのトレードオフを受け入れよ。告知されていない研究用チェックポイントで、ダウンロード数は二桁、独立した評価はなく、ホスト型エンドポイントもなく、単一のインフォグラフィックページでのみ検証された 24K コンテキストで、カードには英語のみの言語タグが付いている。

それ以外のすべてには Gemma 4 12B を選びましょう。文書の読み取りはサイズが2倍あるほとんどのモデルよりも優れており、音声も扱え、ツールの指示にも従い、25万トークンのコンテキストを持ち、他の人々による3か月半分の経験に裏打ちされています。この2つのうちどちらかを小型視覚モデルとして選ぼうとしていて、特にスライドデッキをコードとして作成するよう求められていないなら、これが答えです。

そして、正直な要件が両方であるなら、それをタイブレークとして扱ってはならない。読み取り作業はホステッドモデルにルーティングし、レンダリング作業は重みを保持できるマシン上に残しておく。

このページを変えるとしたら何ですか

三つのシグナル。82.94と1.00ポイントの参照低下が独立に再現されれば、AesCode-8Bはベンダーの主張から結果へと変わり、8B対12Bというサイズの問いは名目上ではなく本当に興味深いものになる。推論プロバイダーがこのチェックポイントを採用すれば、現在は実用上の違いのすべてを占めているデプロイの列が解消される。そして、Microsoftが査読中として引用している論文——「AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewards」——は、モデルカードでは答えられない問いに答えるだろう。まず、設計グラフそのものが間違っているときに視覚的ルーブリックがどう振る舞うかから始まる。それらのどれかが実現するまでは、擁護できる読みは狭く、しかし現実的だ。AesCode-8Bは、機械が確認できる視覚デザインの部分では非常に優れ、確認できない部分では中程度であり、Gemma 4 12Bは別の仕事をしている完成品である。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新