
AesCode-32B:編集可能なHTMLとしてデッキを書き出す、Microsoftの静かな33Bモデル
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり · 87 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
AesCode-32Bのタイムスタンプは互いに食い違っており、その食い違いこそが報告すべき事柄の大半だ。Hugging Faceリポジトリmicrosoft/AesCode-32Bは2026年9月29日に作成されたが、その中身はすべて2026年10月7日付の単一コミットで到着しており、そのメッセージはただ「Release AesCode-32B」とだけ——そして結果を再現可能にするトレーニングスタックは10月8日にgithub.com/microsoft/AesCodeへプッシュされた。Microsoftは何も発表していない。ブログ記事も、arXivプレプリントも、リーダーボードへの投稿も、自社サイト上のモデルページもない。存在するのは、プロンプトを受け取って完全な自己完結型のHTMLドキュメント——スライド、ポスター、ダッシュボード——を出力する330億パラメータの視覚言語モデルと、その小型の相棒microsoft/AesCode-8Bだ。どちらもQwen3-VL視覚モデル——それぞれQwen3-VL-32B-InstructとQwen3-VL-8B-Instruct——からファインチューニングされており、どちらもApache 2.0で、どちらも今日ダウンロードできる。
リポジトリIDはmicrosoft/AesCode-32Bで、カードはこの仕掛けから始まる。AesCodeは、あなたのプロンプトを、その同じプロンプトから生成された画像と組み合わせ、その画像を美的参照として使い、実際の内容についてはテキストに従う。画像生成器は見栄えのするページを構成するが、そのページ上の数字を誤って描画する。コードモデルは数字を正しく扱えるが、ページがどう見えるかはわからない。AesCodeはその両方を実現しようとする試みであり、2026年10月11日時点でそれについて正直に要約すると、重みは実在し検証可能であり、ベンチマークの数値はラボが自ら作成したハーネス上でラボ自身が得たものであり、Microsoft以外の誰もまだそれに関する数値を公表していない、ということだ。この記事では、これら3つのカテゴリを最後まで区別し続ける。
リポジトリには実際には何が入っていますか、バイト単位で

モデルカードの言葉を一切信用せずに、自分で検証できるものから始めよう。32B リポジトリには、合計 66,714,912,704 バイトの safetensors シャードが 14 個含まれており、これは BF16 では約 334 億パラメータに相当する — カードの「33B params」という記述や、重みだけで約 65 GB のアクセラレータメモリが必要だという警告と一致する。設定は Qwen3VLForConditionalGeneration をアーキテクチャとして宣言し、qwen3_vl をモデルタイプとして宣言している。つまり、これは新しいアーキテクチャではなく、その必要もない。読み込みには次を使う: transformers>=4.57、さらにカードには、4 つのテンソル並列ランクにまたがって提供し、プロンプトごとに 2 枚の画像を許可し、24,576 トークンの上限を設ける vLLM コマンドが同梱されている。
エンゲージメントカウンターは、このリリースで最も静かな部分だ。執筆時点で、32Bリポジトリのダウンロード数は2件、いいねは1件。Hugging Faceの推論プロバイダーマッピングにはエントリがなく、つまりリポジトリページの裏にホスト型エンドポイントは接続されておらず、GGUF、MLX、llama.cppのビルドもどこにも告知されていない。マイクロソフトの名を冠し、ベンダー自身の表でGPT-5.5を上回る結果を記録するモデルにしては、これは驚くほど小さな足跡であり、そしてこれが、ローンチを伴わずに公開されたことを示す最も有力な証拠だ。
コンパニオンコードリポジトリはタイムラインの残り半分を埋めており、リリース日の問題が本当に曖昧になるのはここです。microsoft/AesCodeは2026年7月23日—重みの10週間前—に作成され、14件のコミットを含んでいます。そのすべては同じ貢献者によって作成され、すべてが2026年10月8日のUTC 23:14:04から23:14:24の間に、互いに20秒以内のタイムスタンプを持っています。内容には、プロンプトと検証可能な要件を生成するための仕様、設計グラフとルーブリック質問を構築するデータパイプライン、コールドスタートSFT段階、GDPO強化学習ループ、Playwrightベースのレンダリング検証ツール、テスト、そしてそのすべてを文書化したREADMEが含まれます。リリースもタグもなく、リポジトリの説明は空で、スターは1つです。

では、リリース日はいつなのか?リポジトリの記録では9月29日。モデルが入っているコミットでは10月7日。モデルがどのように作られたかを説明するコードでは10月8日。単一の2週間の期間内に3つのタイムスタンプがあり、そのどれにもMicrosoftが「これを出荷します」と言う一文を添えているわけではない。ほとんどの人が実際にダウンロードする成果物については10月7~8日を実効日とし、リポジトリが確保された日としては9月29日を扱うべきだ。AesCode-32Bがある特定の日に「ローンチした」と言う人は、あなたに代わってそれらのタイムスタンプのどれかを選んでいるだけだ。
メカニズム:美的ガイダンスとしての画像、報酬としてのグラフ
このカードの技術的主張は狭く具体的で、それは有利な点だ。モデルは、学習率1e-5で3,000件のデモンストレーションに対してコールドスタート教師ありファインチューニングで訓練され、その後、GDPO — グループ相対方策最適化の変種 — を用いて7,408件のプロンプトで520ステップ訓練される。8Bモデルは同じレシピを使用し、400ステップで停止した。RL実行では、verlのFSDP-vLLMハイブリッドエンジンを使用し、クリティックなし、別途訓練された報酬モデルなし、ウォームアップなしの一定5e-6のAdamW、ステップあたり128プロンプトで各8ロールアウト、プロンプトと応答はそれぞれ8,192トークンに制限された。
この報酬が珍しいのは、それが単一のスカラーではないという点だ。各訓練ターゲットはキャンバス全体を覆うデザイングラフとして記述されるため、個々のプロパティを別々に帰属させることができる。そのグラフから7つのチャネル――実行、テキスト、境界、テーブルチャート、レイアウト、余白、デザイン――が得られ、それぞれは集約前に自身のロールアウトグループ内で正規化されるため、1つの支配的なシグナルが他のシグナルをかき消すことはない。決定論的検証器はコードとそのレンダリングから解析できるものを採点し、視覚言語ジャッジは解析できないものを、グラフ自身の要素と関係に結びついたルーブリックを用いて採点する。候補HTMLは、外部リクエストをブロックしたサンドボックス化されたPlaywrightブラウザでレンダリングすることによって採点され、その際にDOM、計算済みスタイル、バウンディングボックス、コンソールの状態、スクリーンショットがエクスポートされる。
エンジニアリング上の帰結は、受け取る出力に現れるため、述べておく価値がある。モデルは表を実際のHTMLテーブル構造として、グラフをECharts仕様として出力するよう訓練されているので、どちらもピクセルに焼き込まれるのではなく直接検査できる。これは、デザイナーに渡せるデッキと、リンターに渡せるデッキの違いだ。再現要件はそれに見合って重い。READMEはPython 3.10、CUDA 12.6、8基のB200 GPUを搭載した1ノードを求め、特定のverlコミットを固定し、素のverlにはQwen3-VLサポートがないためそれに対するパッチが必要だと明言している。また、Playwrightのシステムライブラリがないとブラウザは起動時に失敗し、ページのスコアがゼロになること、固定されたOCRスタックがないと対応する報酬チャネルが棄権する代わりにゼロを返し、シグナルを静かに破損させることを警告している。
ベンチマーク表、そしてそれを緩やかに保つ4つの理由
AesCode-32Bの主要な数値は300件のインフォグラフィックサンプルから得られたもので、各プロンプトにつき3回の生成をtemperature 0.8、top-p 0.95で行い、それぞれ最大12,000出力トークンとし、生成結果間での選択は行っていない。スコアはパーセンテージで示す。参照条件ありの場合、32BモデルはText 95.34、Boundary 97.27、Table/Chart 90.37、Rule平均94.33を報告し、視覚面ではContent 85.76、Layout 90.58、Style 55.99で、Visual平均77.44、Overall 85.89となる。同じ表において、参照ありのGPT-5.5はOverall 81.28、参照ありのClaude Opus 4.8は80.39である一方、このモデルの学習元であるQwen3-VL-32B-Instructバックボーンは61.10である。

これらの数値と同じ文脈で語られるべき注意点が4つあり、そのいずれもこの取り組みを貶めるものではない。第一に、GPT-5.5 と Claude Opus 4.8 の行を含むすべての行は、Microsoft が Microsoft のハーネス上で Microsoft のルーブリックを用いて実行したものである。それらは他社ラボの数値ではなく、Microsoft による競合モデルの測定値であり、カード自体もそのルーブリックを各設計グラフに「サンプル固有」だと呼んでいる。第二に、そのルーブリックは訓練データを生成したのと同じパイプラインによって作られており、これはまさにベンチマークがモデルの強みへと偏りうる設定そのものである。カードはそのルーブリックの限界について率直であり、納品前にこれ以上の視覚的修正を要さない設計を求める Style は「あらゆるシステムに共通の天井」と呼ばれ、表内のどのモデルも60を超えていない。第三に、このモデルについての独立した測定はどこにも存在しない。サードパーティのリーダーボードへの登録も再現もなく、ダウンロードが2件であることを踏まえると、ラボ外でまだ誰も実行していない可能性がほぼ確実である。第四に、この比較は、注目に値する形で微妙に非対称である。AesCode-32B の行はすべて参照条件付きであるため、モデルはそれが訓練された構成で測定されており、カードも、参照が与えられたときに品質が依然として最も高いことを示すことで、この点を認めている。
表の中で見出しの結果よりも持ちこたえている唯一の結果は、品質に関する主張ではなく、頑健性に関する主張である。推論時に参照画像を渡さない場合、AesCode-8B の損失はわずか 1.00 ビジュアルポイントで、そのバックボーンである Qwen3-VL-8B-Instruct の 19.55、GPT-5.5 の 10.04 と対照的だ。カードの主張は、参照条件付きトレーニングが、モデルに見たものをコピーさせるのではなく、視覚的計画をポリシーに内部化するというものだ。それはベンダー報告であり、再現もされていない。また、単一の独立した実行で決着がつく類の主張であり、参照画像が常に手元にあるとは限らない本番環境で最も重要になる類の主張でもある。
ランニングコストと、それが比較にとって何を意味するか
このモデルは、セルフホストするうえで安く済む要素が一つもない。1万から1万2000の出力トークンが単一アーティファクトの実用的なサイズであり、ECharts の仕様を含む完全な HTML ドキュメントは、その範囲の下限よりも上限に近い。そのため、どの生成も長いデコードになる。カード自体のサービングレシピでは、約65GBのBF16パラメータを保持するためにテンソル並列で4基のGPUを要求し、トレーニングレシピでは8台のB200を要求している。これは本物のマシンであり、ホビー用のデプロイではない。そしてこれが比較の前提を定める。AesCode-32B が比較されている相手のモデルはトークン単位でレンタルされ、モデル自体は GPU 時間単位でレンタルされる——ハードウェアを所有していようといまいと。
その比較の実用的な形こそがルーティング層の存在理由であり、当社が何をホストし、何をホストしていないかについては正確を期す価値があります。AesCode-32B は OrcaRouter のカタログにはなく、当社が提供しているものでもありません。私が確認できる限り、Microsoft のものを含め、どこにもそのホスト型エンドポイントは存在しません。カタログに載っているのは、その反対側、つまりセルフホスト型の成果物生成器をベンチマーク比較する相手となるホスト型モデルであり、GPT-5.5 や より小型の Qwen3-VL ビジョンモデル、プロバイダーの定価・マークアップ0%で1つの API キーから利用可能、つまりベンダーの価格変更が当日に当社側でも反映されるということです。レンタルのエンドポイントと自分で動かすモデルを比較するのに、2つ目の契約や2つ目の SDK は必要ありません。ルーティング DSL を使えば、セルフホストの呼び出しをホスト型の呼び出しと並べて、単一のエンドポイントの背後に置けます。AesCode-32B がそのモデルカードに謳われている一点において優れていることが判明すれば、それを確かめるコストは GPU の請求額であり、比較している代替手段のコストは、おそらくすでにお持ちの1つのキーです。
今日それでできること、そして存在しないもの
• ダウンロードして実行してください — 重みは Apache 2.0 で、Qwen3-VL バックボーンに準拠しており、14 個の BF16 シャードと、動作する transformers パス(バージョン 4.57 以上)、およびカード内の vLLM レシピを備えています。
• トレーニングを再現する — コードはMITライセンスで、意味がある程度に完全です。報酬検証器、ルーブリックビルダー、SFTとGDPOの各段階、固定されたverlコミットとQwen3-VLサポートを追加するパッチ、そして失敗モードを隠すのではなく列挙したREADMEが含まれています。
• 参照なしで評価する — モデルは参照画像の有無にかかわらずプロンプトを受け付け、カードの最も検証可能な主張はその構成にある。
• それ用のAPIを入手する——できません。ホストされたエンドポイントも、リポジトリ上の推論プロバイダーのマッピングも、GGUFやMLXのビルドもありません。これを実行するとは、ハードウェアを動かすことを意味します。
• 論文を読む——ただし、まだ読めません。このカードがリンクしているのは、AesCode: Aesthetic Code Generation with Decoupled Cross-Modal Rewardsというタイトルの論文ですが、そのカード自身のBibTeXエントリでは掲載先が「Under review」、年が2027年とされています。arXivを検索しても、そのタイトルの論文は見つかりません。ほぼ同一の名前を持つ、より古い別のMicrosoftの論文が存在します——Code Aesthetics with Agentic Reward Feedback(2025年10月)で、AesCoder-4BモデルとAesCode-358Kデータセットを公開しています——そしてAesCode-32Bのカードには、それを引用したり、関係があると述べたりする記述は一切ありません。背景資料を探しに行って、代わりにそちらの論文にたどり着いたのなら、あなたが読んでいるのは、著者が重複する別のモデルについてのものです。
• 公開リーダーボードで比較する — まだだ。サードパーティのインデックスがこれを評価した形跡はなく、ダウンロード数が2回のリポジトリとしては驚くことではない。
誰が注意を払うべきで、誰が待つべきか
この対象読者は、見出しの表が示唆するよりも狭く、「モデルを使って何かを作っている人なら誰でも」というより具体的だ。もしあなたの製品が、プロンプトを、後から誰かが編集しなければならないスライド、ポスター、レポート、ダッシュボードに変換するものであるなら、あなたはすでに、このモデルが狙っている選択に気づいているはずだ。画像生成では、変更できない美しい長方形が手に入り、コード生成では、コンパイラが組み立てたような見た目の、編集可能な何かが手に入る。本物のテーブルとECharts仕様を備えた完全なHTMLドキュメントを出力し、参照を与えない場合でも参照条件付きの品質から約1ポイント以内に収まり、Apache 2.0の下で自社のハウススタイルに合わせてファインチューニングできる33Bのオープンウェイトモデルは、存在してくれると本当に役立つものだ。この規模で、この条件で、まさにその仕事をこなすモデルは他にない。
それに対しては、品質についてあなたが知っていることはすべてベンダーが作成した表に由来し、その背後の評価基準は学習データを作成したのと同じパイプラインによって生成されており、カードが認めている唯一の上限——テストしたすべてのシステムでStyleが60未満——は、まさにデザインに敏感な製品が最も重視する次元だ。生成を社内に留めておくコンプライアンス上の理由と、予備の8-GPUノードがあるチームなら、今日始めるのに十分な材料がある。来週、本番用にモデルを選ぶチームには、選定の根拠となる独立した数値がなく、85.89対81.28を確定した結果として読むべきではない。
何がこれを物語に変えるのだろうか
4つのこと、いずれもまだ存在していない。発表 — マイクロソフトは何も述べておらず、カードが参照している論文は明示的に査読中であるため、カードの要約を超える学習の詳細を含むテクニカルレポートがいつ現れてもおかしくない。独立した実行 — 参照不要の堅牢性の主張と、カードによればサンプルの4.3%で深刻な失敗に落ちるBoundaryスコア(GPT-5.5では34.7%)は、どちらもテストするのに安価で、どちらもテストする価値がある。ベンダーのレシピ外でのサービング対応 — GGUFビルドや主要ランタイムへの登録は、どのベンチマークよりもハードウェアに関する見方を変えるだろう。そしてサイズの問いに関する2つ目のデータポイント:同じ表で8Bモデルが82.94 Overallを記録し、32Bの85.89に対抗しているのは、4分の1のパラメータで2ポイント差であり、これは再現されるか、静かに言及されなくなる類のものだ。
それらのうちのどれかが実現するまでは、AesCode-32B を正確に説明するとこうなる。寛容なライセンスの下にある本物の重み、十分な設備を備えたラボなら再現できるほど詳細なトレーニングスタック、1社が自社モデルと競合2社のモデルを測定したベンチマーク表、そして、どの一日もローンチ日と呼べないリポジトリ履歴。それは、ダウンロード数2件というカウンターが示唆するよりも興味深い成果物であり、85.89という数字が暗示するよりも実証が進んでいない成果物だ。この文の前半も後半も、2026年10月11日時点の評価である。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
