「AesCode 32B vs Qwen3.8 27B」のヒーロータイトルカード。サブタイトルは「ファインチューンとその祖先」。系譜図として描かれ、左側の Qwen3-VL-32B-Instruct チェックポイントカードから「AesCode 32B ファインチューン」カードへ矢印が伸び、そのカードには「セルフホスト専用、65 GB」とラベル付けされている。一方、右下にある別のより新しいカード「Qwen3.8 27B」には、「本日から呼び出し可能」と表示されたライブ API マーカーが付いている。OrcaRouter のロゴは右下隅にある。
Guides & Insights

AesCode 32B 対 Qwen3.8 27B:Microsoft は Qwen 上に構築し、そのうちの一つは呼び出し可能

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この比較全体を組み替える細部は、モデルカードの2行目にある。AesCode 32Bは、Qwen3-VL-32B-Instructを出発点としている。Microsoftの設計特化型コードモデルはQwen3-VLのファインチューンであり、Apache 2.0で、2026年9月29日に作成されたHugging Faceリポジトリに置かれ、コミットは「Release AesCode-32B」というタイトルで2026年10月7日付、そしてMicrosoftからはどこにも発表がない。Qwen3.8 27Bは、その系譜のもう一端だ。ベンダー自身によるオープンウェイトの27B高密度マルチモーダルモデルで、2026年8月14日にApache 2.0の下でリリースされ、MicrosoftがファインチューニングしたVLチェックポイントの後継アーキテクチャにあたる。つまりこれは、2社のフラッグシップ同士の対決ではない。あるラボの汎用オープンウェイトモデルと、競合によるそのファミリーの研究用ファインチューンとの対決であり、両者の実用的な違いは、ファイルを一度手にした後でそれを使って何が許されるかにほぼ完全に帰着する。

同じライセンス、同じファミリー、異なるモデル数

どちらも Apache 2.0 で、どちらもテキストだけでなく画像も受け取り、どちらもテキストを返します。それ以降はすべて分岐し、中でもデプロイメントの行が最も大きく異なります。

• パラメータ — AesCode 32B: Qwen3-32B-Instruct をベースとした 33B dense。Qwen3.8 27B: 27B dense(ビジョンエンコーダを含めると 28B)、隠れ次元 5120 で 64 層。

• 実行に必要なメモリ — AesCode 32B:モデルカードは、bf16 のパラメータだけでおよそ 65 GB のアクセラレータメモリを見込むよう助言しており、同モデルのサービング例では 4 ウェイのテンソル並列を使用しています。Qwen3.8 27B:bf16 で約 55.6 GB。

• コンテキスト — AesCode 32B:報告されている構成では24,576トークンで、学習時のプロンプトと応答は8,192に上限設定。Qwen3.8 27B:ネイティブで262,144トークン、YaRNスケーリングにより1,000,000まで拡張可能。

• アテンション — AesCode 32B: Qwen3-VL バックボーンから継承。Qwen3.8 27B: ハイブリッドで、48 の Gated DeltaNet 線形アテンション層と 16 のフルアテンション層を 3:1 の比率で組み合わせたもので、これにより 262K ウィンドウを低コストで提供できる。

• 用途 — AesCode 32B:編集可能な HTML と CSS として情報量の多いビジュアル成果物を生成すること、およびマルチモーダルなコード生成に関する研究。Qwen3.8 27B:汎用的なエージェントおよびマルチモーダル作業 — コーディング、コンピュータ操作、文書と動画の理解、ツール呼び出し。

• 入手方法 — AesCode 32B: Hugging Face からのダウンロード。これをデプロイしている推論プロバイダーはない。Qwen3.8 27B: 重み、またはホスト型エンドポイント。

コンテキストは2倍、フットプリントはやや小さく、バックボーンは1世代新しく、ライセンスは同一。AesCode 32B が完全に勝っている唯一の行は最初の行であり、それはタスク特化型のファインチューニングによるものだ。

それぞれが実際に何を基準に測定されたか

二つの評価レジームは決して交わらない。そうでないかのように装うのは、この種のページでよくある誤りである。

Qwen3.8 27B のカードは、広範でありながら同時に具体的だ。コーディング:Terminal-Bench 2.1 が 73.0、SWE-bench Pro が 61.7、QwenSWEBench が 79.0、LiveCodeBench v6 が 90.3。推論:GPQA Diamond が 89.2、Humanity's Last Exam が 30.8。コンピュータ操作:OSWorld-Verified が 84.3、WebArena-Verified が 64.8、AndroidWorld が 81.9。視覚:MathVision はベンダーの推論時エンハンスメントありで 94.6、なしで 90.0、OmniDocBench 1.5 が 91.1。これらはすべて、ベンダー自身のハーネス上でのベンダー自身の数値だ — ただし、読む価値のある脚注が付いている。SWE-bench Pro と QwenSWEBench の実行には Claude Code ハーネスが使われたため、別のハーネスで採点されたモデルとは直接比較できない。

AesCode 32B のベンチマークは1つだけで、単一目的のものだ。インフォグラフィックのサンプル300件、各プロンプトにつき選択なしで3回生成し、7つのチャネルでレンダリングして採点する。目玉は、参照画像を提供した場合の Overall 85.89 で、同じハーネス下では GPT-5.5 が 81.28、Claude Opus 4.8 が 80.39 だ。さらに、AesCode 32B が自身の Qwen3-VL-32B バックボーンを Visual 次元で 22.4 ポイント、Overall で 24.8 ポイント上回るという主張も付いている。

それらを並べても、何ひとつ噛み合わない。Terminal-Bench はシェルタスクが完了するかどうかを測り、AesCode の評価はインフォグラフィックのテキストが判読できるか、そのレイアウトがキャンバスからはみ出していないか、その表が本物の HTML テーブルかどうかを測る。共通の指標も、共通のハーネスも、共通のタスクもない。唯一正直に言えるのは、AesCode 32B は自身のバックボーンよりもデザイン成果物にずっと優れているということ、そして Qwen3.8 27B は強力な汎用モデルだということ——そしてどちらの主張も、もう一方について何も明らかにしない。

A two-column comparison scoreboard for AesCode 32B and Qwen3.8 27B: the AesCode 32B column reads 'Parameters: 33B dense (Qwen3-VL-32B base)', 'Memory to run it: about 65 GB bf16, 4-way TP', 'Context: 24,576 tokens', 'Attention: inherited from the Qwen3-VL backbone', 'Where you get it: a Hugging Face download', 'Measured on: one 300-sample infographic benchmark'; the Qwen3.8 27B column reads 'Parameters: 27B dense (28B with vision tower)', 'Memory to run it: about 55.6 GB bf16', 'Context: 262,144 native, 1M with YaRN', 'Attention: hybrid Gated DeltaNet, 3:1 ratio', 'Where you get it: weights or a hosted endpoint', 'Measured on: Terminal-Bench 2.1, SWE-bench Pro, GPQA Diamond and more'; a footer line reads 'AesCode 32B figures Microsoft-reported on its own harness; Qwen3.8 27B figures Alibaba-reported with independent scoring from Artificial Analysis.' and the OrcaRouter logo sits in the bottom-right corner.

今回は、証拠のギャップは一方向に実際に存在する。

ベンダーのベンチマークはこの業界では当たり前のことなので、この2社が自社の主張をどれだけ第三者が検証しているかという点で異なっていることは重要だ。

Qwen3.8 27Bはベンダー自身の表とともに出荷され、その後数週間で外部の結果を蓄積した。このモデルの独立した記録には、法務AI企業HarveyがメモリースタートアップEngramと実施したリーガルエージェント研究が含まれる。そこでは適応済みのQwen3.8 27Bが、250の法務タスクでClaude Opus 4.8を含め、研究がテストしたすべてのモデルを上回った——ただし重要な留保として、適応済みモデルは事前にテスト対象の法律事務所の1億トークンコーパスを学習していたため、これはモデルそのものについてと同じくらい、適応についての結果でもある。これにはCode ArenaのWebDevリーダーボードへのランクインと、Arena.aiのImage-to-WebDevリーダーボードでのオープンウェイト最高位が含まれるが、いずれも公開された方法論ではなく、ベンダーが伝えたランキング上の主張である。また、公開スコアを伴う第三者ボードも含まれる。Artificial AnalysisはQwen3.8 27Bを自社のIntelligence Indexで33.70と記録しており、完了タスクあたりのコストは約1.01ドルで、その背後にあるトークン内訳を公開している。

AesCode 32B にはそうしたものが一切ない。アリーナへの配置も、リーダーボードへの掲載も、第三者による再現も、独立したスループットテストもない——しかもそれは、誰かが調べて不十分だと判断したからではなく、どのプロバイダーも提供していないチェックポイントは、そもそも外部の評価ハーネスでは評価できないからだ。その数値はベンダーのものであり、モデルの学習に使われたのと同じ検証スタックによって、ベンダーが選んだサンプル上で、ベンダーが実行したベースラインと比較して計算されている。このリリースは手法について異例なほど透明だ——報酬チャネル名、ロールアウト回数、デコードパラメータ、失敗率はすべて公開されている——だが、ある数値がどのように生成されたかについての透明性は、他の誰かがそれを生成していることと同じではない。

カード情報の登録が必要なもの

ここで、その系譜は雑学であることをやめ、決断へと変わる。

AesCode 32B は、65 GB のアクセラレータメモリ、マルチモーダルサービングパス、そしてアーリーアダプターとして未発表モデルを実行する覚悟をあなたに求める。そのサービング例自体が 4-way テンソル並列を前提としており、モデルは 24,576 トークンのコンテキスト向けと文書化されているが、フォールバックできるホスト型オプションはない。すでにハードウェアを所有していて、自分のパイプラインが設計固有のファインチューニングを本当に必要としているなら、それは妥当なトレードオフだ。ほとんどのチームにとっては、最初の有用な出力が得られるまでの 2 週間のプロジェクトになる。

Qwen3.8 27BはOrcaRouter自身のインフラストラクチャ上でセルフホストされており、本日から100万入力トークンあたり$0.33、100万出力トークンあたり$2.40で呼び出し可能で、262,144トークンのコンテキストとテキスト、画像、動画の入力に対応しています。これは当社側で一切のマークアップを上乗せせずにパススルーされる定価であり、200以上の他のモデルと同じキー上に載っているため、カタログ上のあらゆる代替案との比較は、二つ目の契約書ではなくリクエストパラメータ一つで済みます。これが実用的な根拠のすべてであり、しかもそれは大きなものです。ファミリーという観点ではAesCode 32Bのバックボーンより一世代遅れているモデルこそが、今日の午後、あなた自身のプロンプトで、数セントの価格で評価できるモデルなのです。

ここには二次的な論点があり、それはルーティングという観点によって具体化される。AesCode 32B は Qwen3-VL チェックポイントのファインチューンであるため、このファミリーを使えば、何かをセルフホストすると決める前に、アーキテクチャのホスト側がそもそも機能するかどうかを安価に検証できる。Qwen3-VL 235B A22B Instruct は入力100万トークンあたり0.40ドル、出力1.60ドルで利用でき、Qwen3-VL 8B Instruct は0.18ドルと0.70ドル。どちらも AesCode 32B ではなく、デザイン品質のために訓練されたものでもない — しかし「視覚言語モデルが私たちのスクリーンショットを読み、必要なマークアップを書けるか」という問いには、彼らを使って数セントで答えを出せる。そして同じエンドポイントの下での自動フェイルオーバーにより、プロバイダの不調な日でもパイプラインが止まることはない。

A screenshot of the Hugging Face model page for microsoft/AesCode-32B, showing the model card header, the Apache 2.0 licence tag and the model-index table carrying the 300-sample infographic evaluation with the 85.89 Overall score (captured October 11, 2026).

誰がどれを選ぶべきか

成果物そのものが納品物なら、AesCode 32Bを選べ。スライド、ダッシュボード、ポスター、レポートを大量に制作し、編集可能かつ差分可能なままの構造化出力が必要で――モデルは完全なHTML文書を出力し、本物のHTMLテーブル構造とECharts仕様を用いるため、どちらも検査可能なままで――そのためのハードウェアか、それをレンタルする予算があるなら。次の3点を受け入れて臨め。どの数値も独立検証はないこと、重みに約65GB、そして長い文書を制約する24Kコンテキスト。カードが報告する4.3%の深刻なキャンバス境界失敗率は、GPT-5.5の34.7%に対して、このリリースで最も心強い単一の数値であり、しかもそれはMicrosoftの数字でもある。

汎用オープンウェイトのマルチモーダルモデルを実際に動かし、実際にサービス提供したいなら、Qwen3.8 27Bを選んでください。262Kコンテキストで、100万まで拡張可能。AesCode 32Bでは収まらない場所に収まるデプロイフットプリント。ライセンス上の位置づけにも違いはありません。その品質と完了タスクあたりのコストの両方について、独立した測定結果もいくつかあります。さらに、今日から始めて、後から統合を書き直すことなくセルフホストできるホスト型オプションもあります。その段階的でレイヤー単位のアテンション設計が、長いコンテキストを手頃なコストで使える理由であり、長いコンテキストこそ、設計やドキュメントのパイプラインが最も必要とするものです。

また、デザイン成果物ジェネレーターと汎用の主力モデルの両方が必要な場合、賢明な分担は、30Bクラスの視覚言語モデルを2つ自前の環境で動かすことではありません。汎用トラフィックはホスト型側へ回し、専門特化モデルはセルフホストのまま、1つのキーの背後に置きます。そうすれば、どちらかの経路でプロバイダー障害が起きても、インシデントではなくフェイルオーバー事象になります。

A screenshot of the OrcaRouter model page for Qwen3.8 27B, showing the model name, the 262,144-token context window, the text/image/video input modalities and the self-hosted pricing of $0.33 per million input tokens and $2.40 per million output.

注目すべきもの

AesCode 32B の立場は、呼び出し可能になれば完全に変わる。現時点でこのモデルの唯一の実質的な弱点はアクセスであり、それは一時的な状況にすぎない——推論プロバイダーがチェックポイントを採用するか、Microsoft がエンドポイントを公開すれば、65 GB の調達がモデル選定へと変わる。それまでは、この対決を正直に要約すると、ファインチューニング版は1つの仕事に優れ、汎用モデルは使えるという点で優れており、しかも汎用モデルのほうがたまたま祖先にあたる。Microsoft が土台として Qwen3-VL チェックポイントを選んだのは、それが利用可能な中で最も強力なオープンなマルチモーダル基盤だったからであり、それ自体が、この比較が Qwen3.8 27B について言える最も有用な事実である。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新