
Boreal vs Qwen3.8 Max:各ベンダーがあなたに飛ばしてほしい行
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
あらゆるモデルの発表には数字を並べたカードが付きもので、どのカードにも、ベンダーとしてはあまり目を留めてほしくない行が一つはある。Qwen3.8 Maxの場合——2026年8月3日リリース——、見栄えのする行を見つけるのは簡単だ。CodeArenaのフロントエンドリーダーボードで1,691ポイントを挙げて首位に立ち、Artificial Analysis Agentic Indexでは58に達してハイエフォート設定のClaude Opus 5と並んだ——中国のラボがこのボードの頂点に最も近づいた例である——そしてGDPval-AAスコアは1,739 Eloで、GPT-5.6 Solを上回った。その下の行は読み取りにくい。同じ評価者のスイートで、計測されたハルシネーションは前世代の23%から40%へ上昇し、モデルの長文脈検索スコアは2ポイント下落した。Borealは、Creatifyの広告動画モデルで、2026年9月15日に1秒1セントでリリースされたが、そのカードにも同じ種類の行がある——しかもより具体的だ。なぜならベンダー自身がそれを公表したからである。
どちらの行も失格にはならない。どちらも見出しのスコアより情報量が多い。だからこそ、バナーを比較するのではなく、両者を並べて見る価値があるのだ。
Qwen3.8 Maxが本当に最も得意としていること
勝利は本物であり、決して小さなものではない。
Qwen3.8 Maxは、2.4兆パラメータのMixture-of-Expertsモデルであり、トークンあたり約950億パラメータがアクティブになる。そしてAlibabaがオープンウェイトとしてリリースすると述べた最初のMaxクラスのQwenである。2026年8月10日の週に発表されると告知されたが、ライセンスも確定日も示されていない。この点は注目に値する。なぜなら、告知はリリースではないからだ。100万トークンのコンテキストウィンドウを持ち、出力上限は131,072トークンで、入力としてテキスト、画像、動画を受け付ける。この最後の点は、この特定の比較において強調に値する。本シリーズがBorealと対比する4つのフロンティアテキストモデルのうち、Qwen3.8 Maxは、完成した動画クリップを渡してそれについて質問できる、わずか2つのモデルのうちの1つなのである。
価格設定は、このセグメントを再形成するほど積極的だ。100万入力トークンあたり$2.00、100万出力トークンあたり$6.00、キャッシュ読み取りが$0.25で、前世代を約20%下回りながら、最大出力長を2倍にしている。私たちのボードでは、それは$2.00と$6.00、100万トークンのコンテキスト、最初のトークンまでの時間のp50が10.00秒——これは私たちの計測が報告する上限なので、正確というより「遅い」と読むべき——そして過去7日間で1億8300万トークンのトラフィックになる。
そしてその下の行
ローンチ記事の見出しにはならなかった部分がこちらです。
Artificial Analysisの独立評価では、Qwen3.7-MaxとQwen3.8 Maxの間に2つの回帰が記録された。長文脈検索の指標は2ポイント低下した。全知性指標は10ポイント低下し、評価者が測定するハルシネーション率は23%から40%に上昇した。同時に、インテリジェンス指数におけるタスクあたりのコストは$0.53から$1.14に上昇した——1タスクあたり約64ターンを要したが、前身は14ターンだった。
それらを合わせて読むと、一貫した像が見えてくる。Qwen3.8 Maxは、単一の正解があるベンチマークが測定できる事柄——コード、エージェント的タスク完了、構造化された問題解決——において改善し、最も採点が難しい事柄、つまり自分が知らないときを知ることにおいて悪化したモデルである。より多く熟考し、より多くハルシネーションを起こすモデルは、自己矛盾しているわけではない。より長い推論トレースは、自信を持った誤った答えにコミットする機会をより多く生み出し、タスク完了を報酬とするベンチマークは、タスクに破るべき隠れた不変条件が存在するまでは、それを罰しない。
買い手にとって、実用的な帰結は狭く具体的だ。モデルの用途がコード生成やエージェント的ワークフローで、誤った答えが大きな音を立てて失敗する場合——テストが落ちる、ビルドが壊れる——回帰はほとんど見えず、利得がすべてだ。用途が検索、要約、あるいは流暢だが誤った答えがチェックなしに人間に届くようなものであれば、23から40への動きこそがあなたの評価を決めるべき数値であり、CodeArenaの順位ではない。
ベンダーが公表した、Boreal自身の最悪の行
この組み合わせを有用にしている対比とは、Creatifyがほとんどのベンダーがしないことをした点にある。つまり、最も弱い結果を最も強い結果と同じ投稿に入れたのだ。
Borealは、プロンプト、解像度、フレーム数、シードを固定した状態で、40件の制作ケースにわたり、自らの未改変ベースモデルに対してブラインドテストを受けました。Creatifyは、Borealへの81%の選好(25対6、引き分け9、符号検定 p<0.001)を報告し、さらにその平均を内訳に分解しています。製品広告:83%。クリエイターおよびUGCシーン:85%。人物1人のトーキングクリップ:60%。
最後の数値がその行です。トーキングヘッドはダイレクトレスポンス広告で最も一般的なフォーマットの一つであり、モデルが自身のベースモデルに対して持つ優位性が最も薄いフォーマットです——誰も出荷するはずがなかったモデルに対しては、コイントスとほとんど変わらない程度にすぎません。レンダリングは720pクラスでリアルタイムと1:1と見積もられ、細部保持はp=0.004で11.3%改善したため、総合的に見れば確かにポジティブな話です。内訳は、このモデルがカテゴリのどちらの半分に向けて調整されたかを教えてくれるだけであり、それはカメラに向かって話す人物がいる半分ではありません。
また、これらの各行がどのような種類の証拠であるかにも注意してください。Qwen3.8 Maxのリグレッションは、独自のハーネスを実行した独立した評価者によって発見されました。Borealの弱い行は、ベンダーが設計・実施したテストにおいて、ベンダーによって開示されました。2つ目は、事実の記述としてはより信頼できるが、比較としては情報量が少ない。なぜなら、Borealのファイルにはどこにも独立した数値が存在しないからです。

スペックの対比
• 出力 — Boreal: レンダリング済み動画、720pクラス、テキストから動画および画像から動画。Qwen3.8 Max: テキストのみ、最大131,072トークン。
• 入力 — Boreal: テキストプロンプトまたは静止画像。Qwen3.8 Max: テキスト、画像、動画。
• 価格 — Boreal:完成した動画1秒あたり$0.01。Qwen3.8 Max:100万入力トークンあたり$2.00 / 100万出力トークンあたり$6.00、キャッシュ読み取りは$0.25。
• コンテキスト — Boreal: 未公開。Qwen3.8 Max: 入力1Mトークン、出力131K。
• レイテンシ — Boreal: リアルタイムと1:1で公称。Qwen3.8 Max: 当社のボードにおける最初のトークンまでの時間のp50は10.00秒。
• 重み — Boreal:プロプライエタリ、Creatify が所有し提供。Qwen3.8 Max:ローンチ時点ではプロプライエタリ。Alibaba は初の Max クラス Qwen のオープンウェイト版リリースを発表しているが、ライセンスも日付も未確定。
• 根拠 — Boreal:ベンダー実施による40ケースのブラインドテストで、独立した評価はなし。Qwen3.8 Max:2件の測定されたリグレッションを含む独立系ベンチマークのカバレッジに加え、OSWorld-Verifiedで86.1、Terminal-Bench 2.1で86.6というベンダー記載の数値。
回帰が購入者にとってどれほどの価値があるか
リーダーボード上のリグレッションは、たいてい些末な話題として扱われる。だが実際には、ベンチマークが公表する中で最も意思決定に関わる事柄に近い。なぜなら、それはベンダーが何を犠牲にしたかを教えてくれる唯一の行だからだ。
有用な行動は、どちらのカードを読むことではなく、両方のモデルを自社のトラフィックで実行することだ。そして実務上の障害は、通常これが2つの契約、2つのSDK、2つの請求関係を意味することだ。これは十分な摩擦となり、ほとんどのチームはテストを省略し、代わりにヘッドラインのスコアで購入してしまう。
その摩擦こそ、ルーティングレイヤーが取り除く部分です。Qwen3.8 Maxは当社のカタログにラインナップされており、前世代と並んでいるため、独自の評価セットで両者を比較するのに必要なのは、調達サイクルではなくモデル文字列の1行の変更だけです。そして、比較の結果からパイプラインの別の段階には別のモデルが適しているとわかった場合も、同じキーでカタログの残りのモデルにアクセスできます。料金はプロバイダー表示レートでマークアップ0%となっており、ここでそれが重要なのには明確な理由があります。Qwen3.8 Maxは、それが置き換えた世代より約20%安く登場しました。この種のベンダーによる価格改定は、次の更新時ではなく、起きた時点で請求書に反映されるべきものですから。
Borealは当社のカタログにはありません。OrcaRouterは動画生成モデルを提供しておらず、ここにある記述を、提供していると主張しているものと受け取るべきではありません。当社が提供するのはその上位層です — コピー、バリエーション、コンプライアンス通過、何が成果を上げたかの分析 — そして、このシリーズのモデルのうち2つ、その中にはQwen3.8 Maxも含まれますが、完成したクリップを渡してレビューさせることができます。

どちらかのカードを読み取る方法
Qwen3.8 Max は、あなたの仕事がコード、エージェント、あるいは構造化推論であるなら、より有力な買いの選択肢だ。しかもその価格は自社の前世代モデルを下回っている。そして、2つの独立したリグレッションこそ、本番へルーティングする前に、あなたの検索と要約のトラフィックでそれを試すべき理由である。40%というハルシネーションの数値は、このモデルを避ける理由にはならない。それは、あなたのワークロードのどれがそれに耐えられるかを知るための理由なのだ。
Boreal は、この比較が名目上扱っている成果物を制作する二者のうち唯一の存在であり、ショートフォーム広告動画の公開料金において最も安価な信頼できる選択肢だ。その制約はフォーマット固有で、ベンダー自身によって明言されている。単独人物のトーキングクリップでは60%の選好率だ。商品広告の前にそのフォーマットをテストせよ。そこが最も伸びしろが小さいからだ。
これを動かすものは2つある。AlibabaがQwen3.8 Max向けに発表したオープンウェイトを出荷すれば、モデルの価格設定と持続性の両方が変わり、それがどのライセンスで登場するかは日付よりも重要になる。そしてBorealにとっては、どのような種類であれ、誰によるものであれ、最初の独立した評価が、自社製品の見え方にブランドが異常なほど敏感なフォーマットに売り込まれているモデルについて、現在すべての証拠の重みを担っている40ケースのベンダーテストに取って代わるだろう。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
