
Qwen3.8-27B ベンチマーク:完全な表(注意事項付き)
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
Qwen3.8-27Bは、Terminal-Bench 2.1で73.0、SWE-bench Proで61.7、LiveCodeBench v6で90.3、OSWorld-Verifiedで84.3を記録しています。しかも、これらの数字はすべてAlibaba自身によるものです。270億パラメータのオープンウェイトモデルは、2026年8月14日にApache 2.0ライセンスでHugging Faceに公開されましたが、8月15日時点で、Alibaba社外の誰もその品質を独立して評価していません。このページは、出典付きの完全な概要です。モデルカードに記載された公式ベンチマーク全25項目、前モデルQwen3.6-27Bからの変更点、独立したAMDスループットテストで測定された内容、そして暫定的に扱うべき主張についてまとめています。
数字を読む前のガイド:ここでいう「公式」とは、AlibabaがQwen/Qwen3.8-27Bのモデルカードに記載した評価値のことだ。これはベンダーによる自己申告であり、再現検証はされていない。「独立」とは、研究室の外部の誰かが測定したことを意味する——現時点では、それはハードウェアのスループットにのみ当てはまり、品質スコアには適用されない。ハーネスが重要なベンチマークは、その旨を文中で明記している。
モデル、仕様ごとに1行
• 27B の dense パラメータ(ビジョンエンコーダを含めると 28B)、64層、隠れサイズ 5120。
ハイブリッド・アテンション — 48層のGated DeltaNet線形アテンション層と16層のフルアテンション層を3:1の比率で組み合わせており、これにより262Kトークンのウィンドウを実用コストで実行できる。
• ネイティブコンテキストは262,144トークン、YaRNスケーリングにより1,000,000まで拡張可能。
ネイティブな画像・動画入力(テキスト出力)、Apache 2.0のウェイト、BF16で約55.6GB。
要約すると、これはAlibabaが2.4兆パラメータのQwen3.8-Maxを構築する過程で得た知見を活かし、それを単一のGPUで実行できるサイズに圧縮することを目的としたモデルです。
スコアカード: モデルカード上のすべてのベンチマーク
以下のスコアはすべて、8月14日のモデルカードでAlibabaが報告したもので、括弧内はこのモデルが置き換えるQwen3.6-27Bのスコアです。
コーディング。Terminal-Bench 2.1(エージェント型ターミナルコーディング)73.0 (63.4);SWE-bench Pro 61.7 (53.5);QwenSWEBench 79.0 (49.3);DeepSWE 1.1 42.2 (13.3);NL2Repo-Bench 42.3 (36.2);LiveCodeBench v6 90.3 (83.9)。SWE-bench Pro と QwenSWEBench の実行は、モデルカードの脚注によると Claude Code ハーネスを使用したものであり、異なるハーネスでスコア付けされたモデルと比較する前に念頭に置く価値があります。
ロングホライズンエージェントとオフィスワーク。 CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / スコア 42.9 (10.6 / 27.3).
推論と知識。 GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1)。HLEはカードに記載のとおり、GPT-4oで判定されています。
ビジョンとコンピュータ利用。 OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 CIあり / 90.0 CIなし (85.1); BabyVision 85.6 CIあり / 65.7 CIなし (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1)。「CI」はAlibabaの推論時拡張であり、そのオンとオフの状態の差は、追加の推論計算でどれだけスコアを買えるかを示す、カード上で最も情報価値のある数値である。

実際にQwen3.6-27Bから何が変わったのか
カード上のすべてのベンチマークが上昇したが、その差分は一様ではない——そして、改善の形状こそが物語の核心だ。その向上は、知識想起ではなく、エージェント型コーディングとコンピューター利用に集中している:
• DeepSWE 1.1(エージェンティックコーディング)13.3 → 42.2、およそ3倍の向上
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam スコア 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 および AndroidWorld 70.3 → 81.9
• BabyVision(CI付き)28.9 → 85.6 — カード上で最大の相対的向上
一方、GPQA Diamondは87.8→89.2へ、RealWorldQAは84.1→85.9へと向上した。実際の改善だが小幅だ。これは「あらゆる面で賢くなる」リリースではない。これは、画面を読み、ツールを使い、複数のステップにわたってコードを書くエージェントに真っ向から狙いを定めたリリースである。

正直なギャップ:いまだに劣る点、そして方法論上の注意点
フロンティアモデルとの比較では、結果は良好だが一方的ではない。Qwen3.8-27BとClaude Opus 4.6 Maxが重複するベンチマークでは、Qwenが過半数で勝利している——SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench、そしてビジョン分野全体だ。MetaのMuse Glimmer-30B、つまり自然なローカルクラスのライバルに対しては、重複する8つのベンチマークすべてで完全に勝利している。しかし、Claude Opus 4.6 Maxには、Terminal-Bench 2.1(73.0対78.2)、GPQA Diamond(89.2対91.3)、Humanity's Last Exam(30.8対40.0)、NL2Repo-Bench(42.3対47.6)では依然として負けている。もし皆さんのワークロードが最難関のフロンティア推論(フロンティア数学、大規模な学際的問題)であるなら、27Bはまだその域に達していない。
これを引用する前に、3つの注意点があります。第一に、このいずれも独立に検証されていません。8月15日時点で、27Bに対するArtificial AnalysisインデックスもLMArenaの実行もなく、Alibaba自身のハーネスは第三者が使うものではありません。第二に、モデルカードはSWE-bench ProとQwenSWEBenchにClaude Codeハーネスを使用し、Humanity's Last ExamにはGPT-4o判定者を使用しています。他のセットアップでスコア付けされたモデルとの比較は数値を変動させます。第三に、AlibabaのMathVision実行は固定プロンプトを使用しましたが、競合他社は2つのバリアントのうち高い方を受け取りました。このいずれも結果が間違っていることを意味するのではなく、他の誰かがモデルを実行するまで、それらが下限ではなく上限であることを意味します。
それを実行するために必要なもの
Qwen3.8-27Bはローカルモデルであり、「性能」の意味を変える。それは価格表ではなく、自分のハードウェアでのスループットだ。BF16の重みは約55.6GB。4ビットに量子化すれば、RTX 3090や4090などの24GBカードに収まる。AMDは発売日にDay-0サポートを提供し、自社のllama.cpp/Vulkan測定(2026年8月時点、3回以上の実行平均)では、Ryzen AI Max+ 395上で24.5トークン/秒、Radeon AI PRO R9700(32GB)上で51.8トークン/秒を記録した。これらはおおよそ24GBを超える可変グラフィックスメモリまたはVRAMを搭載したシステムでの結果だ。NVIDIA GH200でのFP8ビルドのコミュニティテストでは、10件の同時262Kコンテキストリクエストを、最初のトークンまでの時間10ms未満で処理した。あなた自身の数値は異なるだろう——それらは他人のGPUだ——しかし、その形は本物だ。このクラスのQwenリリースとしては初めて、レビューの中だけでなく、単一のワークステーションで実際に動作する。
無料のウェイト、それとも有料API?
このモデルが迫る決断は、ローカルとホステッドを分かつものです。つまり、重み(ウェイト)は無料ですが、GPUは無料ではありません。セルフホスティングはシリコンを所有することを意味します。4ビット量子化と低速な生成を受け入れるなら24GBカード1枚で済みますが、完全な品質でフル262Kコンテキストを求めるなら、より大きなものが必要です。ホステッドの代替案であるOrcaRouterは、入力100万トークンあたり$0.33、出力100万トークンあたり$2.40です。同じ262Kコンテキスト、画像と動画の入力に対応し、p50の最初のトークンまでの時間は過去7日間の測定で225msです。GPUを購入する必要も、VRAMを管理する必要もありません。その計算は、オープンウェイトで常に行うものです。実際に必要なトークンスループットにトークンあたりのコストを掛けたものと、カードの定額価格との比較です。高負荷が継続するボリュームならセルフホスティングが勝ります。バースト的または控えめなボリュームなら、$0.33/$2.40を支払う方が、ほとんどアイドル状態のシリコンを買うより優れています。

結論
Qwen3.8-27Bは、Alibabaがこのサイズクラスでリリースした中で最強のオープンウェイトモデルです。Alibaba自身の数値によれば、エージェント型コーディング、コンピューター利用、視覚推論においてテーブル内トップの性能を誇り、262KのコンテキストウィンドウとApache 2.0ライセンスのウェイトを備えています。スコアカードの正しい読み方は条件的です。すべての数値はベンダー報告に基づき、ハーネス固有のものであり、まだ第三者による再現はされていません。また、フロンティアモデルは依然として最も困難な推論ベンチマークで優位に立っています。セルフホストするかAPIとして呼び出すかを検討中の方は、ベンチマーク表を約束として捉え、AMDのスループット数値を今日存在する唯一の独立した測定値として扱ってください。独立したラボがスコアを発表した日には、このページを更新します。
