
Qwen3.8-27B ベンチマーク:完全な表(注意事項付き)
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Qwen/Qwen3.8-27BはTerminal-Bench 2.1で73.0、SWE-bench Proで61.7、LiveCodeBench v6で90.3、OSWorld-Verifiedで84.3を記録しています——そして、これらの数値はすべてAlibaba自身の測定結果です。{{1}}270億パラメータのオープンウェイトモデルは、2026年8月14日にApache 2.0ライセンスでHugging Faceに公開され、最初の2週間以内に3つの独立した第三者評価結果を獲得しました{{/1}}:リーガルAI企業Harveyとメモリ企業Engramが実施した研究において、HarveyのLegal Agentベンチマークでオープンウェイトモデル首位を獲得{{2}};Alibabaが8月25日に発表したところによると、{{3}}Code ArenaのWebDevリーダーボードで総合9位、同サイズクラスのモデルでは唯一のトップ10入りを果たしました{{/3}}{{/2}};そして8月26日に発表された、Arena.aiのImage-to-WebDevリーダーボードでオープンウェイトモデル首位を獲得し、{{4}}報告されたスコア1,574で総合7位にランクされました{{/4}}。{{5}}このページは、完全かつ出典付きの詳細情報です:モデルカードに記載された全25の公式ベンチマーク、前モデルQwen3.6-27Bからの変更点、独立したAMDスループットテストの測定結果、法務エージェントおよびウェブ開発アリーナの各結果、そしてまだ暫定的と見なすべき主張について解説します{{/5}}。
数字を読む前のガイド:ここでいう「official(公式)」とは、Qwen/Qwen3.8-27Bのモデルカードに記載されているAlibabaの評価を指します。これはベンダーによる報告であり、第三者による再現はされていません。「Independent(独立)」とは、ラボ外の誰かが測定したことを意味します。これまでのところ、該当するのはハードウェアスループットテスト、法務ドメインのエージェント研究、そしてArena.aiのWeb開発リーダーボード2つ(Code ArenaのWebDevとImage-to-WebDevアリーナ)での順位です。ハーネスが重要なベンチマークは、インラインでフラグが付けられています。
モデル、仕様ごとに1行
• 27B の dense パラメータ(ビジョンエンコーダを含めると 28B)、64層、隠れサイズ 5120。
ハイブリッド・アテンション — 48層のGated DeltaNet線形アテンション層と16層のフルアテンション層を3:1の比率で組み合わせており、これにより262Kトークンのウィンドウを実用コストで実行できる。
• ネイティブコンテキストは262,144トークン、YaRNスケーリングにより1,000,000まで拡張可能。
ネイティブな画像・動画入力(テキスト出力)、Apache 2.0のウェイト、BF16で約55.6GB。
要約すると、これはAlibabaが2.4兆パラメータのQwen3.8-Maxを構築する過程で得た知見を活かし、それを単一のGPUで実行できるサイズに圧縮することを目的としたモデルです。
スコアカード: モデルカード上のすべてのベンチマーク
以下のスコアはすべて、8月14日のモデルカードでAlibabaが報告したもので、括弧内はこのモデルが置き換えるQwen3.6-27Bのスコアです。
コーディング。Terminal-Bench 2.1(エージェント型ターミナルコーディング)73.0 (63.4);SWE-bench Pro 61.7 (53.5);QwenSWEBench 79.0 (49.3);DeepSWE 1.1 42.2 (13.3);NL2Repo-Bench 42.3 (36.2);LiveCodeBench v6 90.3 (83.9)。SWE-bench Pro と QwenSWEBench の実行は、モデルカードの脚注によると Claude Code ハーネスを使用したものであり、異なるハーネスでスコア付けされたモデルと比較する前に念頭に置く価値があります。
ロングホライズンエージェントとオフィスワーク。 CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / スコア 42.9 (10.6 / 27.3).
推論と知識。 GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1)。HLEはカードに記載のとおり、GPT-4oで判定されています。
ビジョンとコンピュータ利用。 OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 CIあり / 90.0 CIなし (85.1); BabyVision 85.6 CIあり / 65.7 CIなし (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1)。「CI」はAlibabaの推論時拡張であり、そのオンとオフの状態の差は、追加の推論計算でどれだけスコアを買えるかを示す、カード上で最も情報価値のある数値である。

実際にQwen3.6-27Bから何が変わったのか
カード上のすべてのベンチマークが上昇したが、その差分は一様ではない——そして、改善の形状こそが物語の核心だ。その向上は、知識想起ではなく、エージェント型コーディングとコンピューター利用に集中している:
• DeepSWE 1.1(エージェンティックコーディング)13.3 → 42.2、およそ3倍の向上
• QwenSWEBench 49.3 → 79.0
• Agents' Last Exam スコア 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 および AndroidWorld 70.3 → 81.9
• BabyVision(CI付き)28.9 → 85.6 — カード上で最大の相対的向上
一方、GPQA Diamondは87.8→89.2へ、RealWorldQAは84.1→85.9へと向上した。実際の改善だが小幅だ。これは「あらゆる面で賢くなる」リリースではない。これは、画面を読み、ツールを使い、複数のステップにわたってコードを書くエージェントに真っ向から狙いを定めたリリースである。

初の独立した結果: Harvey の Legal Agent ベンチマークでオープンウェイト第1位
このページが公開されて以来、最も重要な進展は技術的なものではなく、法的なものである。アリババは、Qwen3.8-27BがHarveyのLegal Agentベンチマークで第1位のオープンウェイトモデルであると発表した。これはベンダー自身による順位の主張なので、アリババの発表として扱うべきである。その背後にある結果は、アリババによるものではない研究に基づいている。法務AI企業のHarveyと、AIメモリのスタートアップであるEngramが、約1万のドキュメントと266の案件にわたる1億以上のトークンから、Calderwood & Harknessという合成法律事務所を構築し、その後、パラメトリックメモリ、圧縮ノート、検索ツールを用いてQwen3.8-27Bをそれに適応させた。
250件の法務タスクにおいて、適応させた27Bは平均67%を記録し、この研究でテストされたすべてのモデルを上回った(Claude Opus 4.8を含む)。また、厳格なオール・オア・ナッシング方式の正解率では、Opus 4.8に対して30%対25%でリードし、クエリあたりのコストは約0.13ドルで、Opus 4.8の1.32ドルと比較される。これらの数値はHarvey/Engramが報告したものであり、まだ独立に再現されていない。同モデルは、その企業の自社文書でトレーニングする前は、企業固有の質問でわずか4.7%しかスコアを獲得できなかったが、それらを学習した後は72.6%を獲得した。
#1を読むにあたっては、大きな注意点が一つある。ベンチマークでトップになったモデルは、評価される前に、その企業の1億トークンで適応処理が行われ、テストコーパスを事前に学習していた。つまり、これは27Bがドメイン特化のチューニングによってどれだけ吸収できるかを示す実証であり、中立的な評価環境における素のApache-2.0ウェイトのスコアではない。しかも対象は法律という単一ドメインであり、一般的な品質を示すものではない。この結果が裏付けるのは、そのツイートの背後にある主張、すなわち「ローカルマシンで実行できるほど小さい27Bでも、適切な知識を与えれば、プロフェッショナルレベルの仕事に耐えうるほど強力である」ということだ。
2つ目の独立した結果: Code ArenaのWebDevで総合9位
2つ目の独立した結果はコーディングに関するもので、このページが8月25日に変更された理由です。Code Arenaは、Arena.aiのウェブ開発リーダーボードです。旧称WebDev Arena、旧称LMArenaのサイト上で展開されていたプロジェクトで、ユーザーは匿名化されたモデルのペアを使って実際のアプリを構築し、どちらの出力を採用したいかを投票します。その公開リーダーボードで、Qwen3.8-27Bは総合9位、スコア1595で、そのサイズ帯でトップ10に入っている唯一のモデルです。
その順位は独立した事実です——誰でも開ける第三者運営のリーダーボードに載っているのです。それを取り巻く見出しはAlibabaによる説明です。「トップ10に入った唯一の小規模モデル」という枠組みや付随する順位は、Qwenの8月25日の発表に由来します。それらはそのラベルを付けて繰り返す価値があります。27Bは、はるかに大きいQwen3.8-Max(発表では総合3位)より6つ下の順位で、同じ規模のGemma 4-31B(同じ発表では80位)よりかなり上位です。重要なのは、27BがWebアプリ制作で最先端モデルに勝つということではなく、GPU1枚で動くほど小さいモデルが、他の順位をはるかに大きなモデルが占めるブラインドコーディングの競技場でトップ10に入っているということです。
3番目の独立した結果:Arena.aiのImage-to-WebDevにおいてオープンモデル第1位
3番目の独立した結果は8月26日に到着し、このサイズのモデルとしてはこれまでで最強のものだ。Image-to-WebDevは、Arena.aiにおけるCode ArenaのWebDevの姉妹ボードである。このアリーナでは、モデルがスクリーンショットやその他の視覚的参照を与えられ、それを動作するWebインターフェースに変換する必要があり、盲検の人間の投票者が、自分たちが出荷したいと思う出力を選ぶ。その公開リーダーボードで、Qwen3.8-27Bはオープンモデルの中で#1、全体で#7にランクインし、報告されたアリーナスコアは1,574である。
その順位は独立した要素である。誰でも開ける第三者運営のリーダーボードに載っているものだ。それを取り巻く見出しはAlibabaが発表したものである。Qwenチームの8月26日の発表では、このテストにおいて27Bモデルが「その100倍の規模のモデルと同等」と謳っているが、リーダーボードはその比較を裏付けていない。また、選好ランキングはコード品質の評価ではない。Image-to-WebDevの投票は、人間がどちらの出力を出荷したいかを測るものであり、HTMLが安全で、アクセシブルで、保守可能かどうかを測るものではない。この結果が確かに示すのは、オープンウェイトの27Bモデルが、画像をページに変換するスキルにおいて、オープン分野全体をリードしているということだ。そのスキルこそ、成長中の「スクリーンショットからサイトへ」という製品カテゴリーの基盤となっている。
正直なギャップ:いまだに劣る点、そして方法論上の注意点
フロンティア(最前線)モデルと比較すると、その成績は華々しいが一方的ではない。Qwen3.8-27BとClaude Opus 4.6 Maxが重複する範囲では、Qwenが過半数で勝利している — SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench、そしてビジョン系ブロック全体である。当然のローカルクラスのライバルであるMetaのMuse Glimmer-30Bに対しては、重複する8つのベンチマークすべてで完勝する。だが、それでもClaude Opus 4.6 MaxにはTerminal-Bench 2.1(73.0対78.2)、GPQA Diamond(89.2対91.3)、Humanity's Last Exam(30.8対40.0)、NL2Repo-Bench(42.3対47.6)で敗北する。あなたのワークロードが最難関のフロンティア推論 — フロンティア数学や大規模な学際的問題 — であるなら、27Bはまだその域に達していない。
これを引用する前に、3つの注意点がある。第一に、上記のモデルカードの表は依然として完全にAlibaba社による報告であり、27Bに関するArtificial Analysisの指標はまだ存在しない。現在、独立した第三者による結果が3つあるが、それぞれ範囲が狭い:Code ArenaランキングはテキストプロンプトからのWebアプリ構築を測定し、Image-to-WebDevランキングはスクリーンショットを動作するページに変換することを測定する。どちらも匿名化された出力に対する盲目的投票によって判定される。また、Harveyの法務エージェント研究は、テスト用に訓練されたモデルを用いた単一ドメインを対象としている。いずれも、汎用ハーネスで実行された標準的な重み付けではない。第二に、モデルカードはSWE-bench ProとQwenSWEBenchにClaude Codeハーネスを使用し、Humanity's Last ExamにはGPT-4o判定を使用している。他のセットアップで評価されたモデルとの比較では数値が変動する。第三に、AlibabaのMathVision実行は固定プロンプトを使用したが、競合他社は2つのバリアントのうち高い方を受け取った。これは結果が間違っているという意味ではなく、独立した研究所が中立的な汎用ハーネスでモデルを実行するまでは、結果が下限ではなく上限であることを意味する。
それを実行するために必要なもの
Qwen3.8-27Bはローカルモデルであり、「性能」の意味を変えます。つまり、価格表ではなく、自分のハードウェアでのスループットです。BF16ウェイトはおおよそ55.6GBで、4ビットに量子化すればRTX 3090や4090などの24GBカードに収まります。AMDは発売日にDay-0サポートを提供し、独自のllama.cpp/Vulkan測定(2026年8月、3回以上の実行の平均)では、Ryzen AI Max+ 395で24.5トークン/秒、32GBのRadeon AI PRO R9700で51.8トークン/秒を記録しました。これは、約24GBを超える可変グラフィックメモリまたはVRAMを搭載したシステムでの結果です。NVIDIA GH200上のFP8ビルドのコミュニティテストでは、10件の同時262Kコンテキストリクエストを処理し、最初のトークンまでの時間は10ms未満でした。あなた自身の数値は異なるでしょう—それは他人のGPUですから—しかし、その形は現実です。これはこのクラスのQwenリリースとして初めて、レビューの中だけでなく、単一のワークステーション上で実際に動作するものです。
無料のウェイト、それとも有料API?
このモデルが迫る決断は、ローカルとホステッドを分かつものです。つまり、重み(ウェイト)は無料ですが、GPUは無料ではありません。セルフホスティングはシリコンを所有することを意味します。4ビット量子化と低速な生成を受け入れるなら24GBカード1枚で済みますが、完全な品質でフル262Kコンテキストを求めるなら、より大きなものが必要です。ホステッドの代替案であるOrcaRouterは、入力100万トークンあたり$0.33、出力100万トークンあたり$2.40です。同じ262Kコンテキスト、画像と動画の入力に対応し、p50の最初のトークンまでの時間は過去7日間の測定で225msです。GPUを購入する必要も、VRAMを管理する必要もありません。その計算は、オープンウェイトで常に行うものです。実際に必要なトークンスループットにトークンあたりのコストを掛けたものと、カードの定額価格との比較です。高負荷が継続するボリュームならセルフホスティングが勝ります。バースト的または控えめなボリュームなら、$0.33/$2.40を支払う方が、ほとんどアイドル状態のシリコンを買うより優れています。

結論
{{1}}Qwen3.8-27B は、Alibaba がこのサイズクラスでリリースしたオープンウェイトモデルの中で最強です(Alibaba 自身の発表数値によります)。エージェント型コーディング、コンピューター操作、ビジョン推論でテーブル内最高を記録し、262K のコンテキストウィンドウと Apache 2.0 ライセンスのウェイトを備えています。{{/1}} {{2}}スコアカードの正しい読み方は条件付きです。モデルカードのすべての数値はベンダー報告によるもので、ハーネス固有であり、まだ第三者による再現はされていません。また、フロンティアモデルは依然として最も難しい推論ベンチマークで勝利しています。{{/2}} {{3}}セルフホストするか API として呼び出すかを検討している場合、ベンチマーク表を「約束」として、AMD のスループット数値を「最初の独立したハードウェア測定」として、Harvey のリーガルエージェントの結果を「Alibaba 自身のハーネスの外でもモデルの能力が生き残ることを示す最初の独立した兆候」として、そして 2 つの WebDev アリーナでの順位 — Code Arena の WebDev で総合 9 位、Arena.ai の Image-to-WebDev でオープンモデル第 1 位 — を「その能力を裏付ける最初の独立したコーディングリーダーボードでの確認」として扱ってください。{{/3}} {{4}}より多くの独立したラボがスコアを発表し次第、このページを更新していきます。{{/4}}
