
Boreal 對決 Qwen3.8 Max:各家廠商都希望你跳過的那一列
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
每一次模型發布都會公布一張數字表,而每一張表上都有一行是廠商寧願你別多看兩眼的。至於Qwen3.8 Max,於 2026 年 8 月 3 日發布,其中好看的數字不難找:它在 CodeArena 前端排行榜上以 1,691 分拿下第一,在 Artificial Analysis Agentic Index 上達到 58,與高強度模式下的 Claude Opus 5 並列——這是中國實驗室在該榜單上最接近榜首的一次——而它的 GDPval-AA 得分為 1,739 Elo,領先 GPT-5.6 Sol。這些數字底下的那一行卻較難解讀。在同一個評估機構的測試套件中,測得的幻覺率從上一代的 23% 升至 40%,而該模型的長上下文檢索分數則下降了兩分。Boreal,Creatify 的廣告影片模型,於 2026 年 9 月 15 日發布,每秒定價一美分,它自己的數字表上也有同樣的一行——而且更為具體,因為這是廠商自己公布的。
這兩列都不算是否決條件。兩者都比標題分數更具參考價值,這正是值得將它們並排呈現,而非比較橫幅的原因。
Qwen3.8 Max 真正最擅長的是什麼
這些勝利是真實的,而且它們並不小。
Qwen3.8 Max 是一款 2.4 兆參數的混合專家模型,每個 token 約有 950 億個參數處於啟用狀態,而它是阿里巴巴表示將以開放權重形式發布的第一款 Max 級 Qwen——宣布將於 2026 年 8 月 10 日當週發布,但沒有授權條款,也沒有確切日期,這個細節值得注意,因為宣布並不等於發布。它具備 100 萬 token 的上下文視窗,輸出上限為 131,072 個 token,並可接受文字、圖像與影片作為輸入。最後這一點在這次特定的比較中尤須強調:在本系列與 Boreal 對比的四款前沿文字模型中,Qwen3.8 Max 是僅有的兩款能接收一段完成的影片片段並就其提問的模型之一。
這項定價極具侵略性,重塑了這個市場區隔。每百萬輸入代幣 2.00 美元、每百萬輸出代幣 6.00 美元,快取讀取為 0.25 美元,價格比前一代低約 20%,同時將最大輸出長度加倍。在我們的排行榜上,這落在 2.00 與 6.00 美元、1M 代幣的上下文、p50 首個代幣時間為 10.00 秒——這是我們監測工具所回報的上限,所以請把它讀作「慢」而非精確數值——以及過去七天 1.83 億代幣的流量。
還有下面的那一行
這就是沒能登上發布貼文標題的那個部分。
Artificial Analysis 的獨立評估記錄到 Qwen3.7-Max 與 Qwen3.8 Max 之間的兩項退步。其長上下文檢索指標下降了兩分。其全知指標下降了十分,而評估方測得的幻覺率從 23% 上升至 40%。同時,該模型在 intelligence index 上每項任務的成本從 $0.53 上升至 $1.14——其每項任務大約需要 64 回合,而前代只需 14 回合。
把這些放在一起讀,一幅連貫的圖像就浮現了。Qwen3.8 Max 這個模型,在那些只有單一正確答案的基準測試所能衡量的事情上變得更強——程式碼、代理式任務完成、結構化問題解決——卻在最難評分的那件事上變得更差:知道自己不知道。一個思考得更久、卻也更容易產生幻覺的模型,並不矛盾。更長的推理軌跡會製造更多機會,讓它認定一個自信的錯誤答案;而一個獎勵任務完成的基準測試,除非任務本身帶有某個可被違反的隱藏不變量,否則不會對此施以懲罰。
對買家而言,實際後果狹窄而具體。如果你對模型的使用是程式碼生成,或是在錯誤答案會大聲失敗的代理式工作流程中——測試失敗、建置中斷——那麼這些回歸大致上隱形,而增益就是全部重點。如果你的用途是檢索、摘要,或任何讓流暢但錯誤的答案未經檢查就到達人類手上的情境,那麼 23 到 40 的變動才是應該決定你評估的數字,而不是 CodeArena 的排名。
Boreal 自家最糟的一列,由供應商發布
讓這個配對之所以有用的對比在於,Creatify 做了一件大多數廠商不會做的事:它把最弱的成果和最強的成果放進同一則貼文裡。
Boreal 曾在其自身未經改動的基礎模型上進行盲測,提示、解析度、影格數與種子皆保持固定,涵蓋 40 個實際製作案例。Creatify 報告 Boreal 獲得 81% 的偏好度——25 比 6,9 次平手,符號檢定 p<0.001——接著進一步拆解該平均值。產品廣告:83%。創作者與 UGC 場景:85%。單人談話片段:60%。
最後那個數字就是那一列。真人對鏡頭說話是直效廣告中最常見的格式之一,而在這種格式中,該模型相對於自身基線的優勢最為薄弱——相較於一個根本不會出貨的模型,幾乎只比擲硬幣好一點。渲染速度報稱在 720p 等級下與即時速度為 1:1,而細節保留度在 p=0.004 下提升了 11.3%,因此整體情況確實是正面的。這份拆分只是告訴你這個模型是針對該類別中的哪一半調校的,而那不是有人在鏡頭前說話的那一半。
另請注意,這些列各自屬於哪一種證據。Qwen3.8 Max 的效能退步,是由一位獨立評測者使用自家測試框架發現的。Boreal 表現較弱的那一列,則是由廠商在自家設計並執行的測試中揭露的。後者作為事實陳述更可信,但作為比較則較不具資訊性,因為 Boreal 的檔案中完全沒有任何獨立數字。

規格對比
• 輸出 — Boreal:渲染影片,720p 級,文字轉影片與圖像轉影片。Qwen3.8 Max:僅文字,最高 131,072 個 token。
• 輸入 — Boreal:文字提示或靜態影像。Qwen3.8 Max:文字、圖像與影片。
• 價格 — Boreal:成品影片每秒 $0.01。Qwen3.8 Max:每 1M 輸入 $2.00/每 1M 輸出 $6.00,快取讀取為 $0.25。
• 上下文 — Boreal:尚未公布。Qwen3.8 Max:輸入 1M 個 token,輸出 131K 個 token。
延遲 — Boreal:以與即時 1:1 報價。Qwen3.8 Max:在我們的測試平台上,首個 token 的 p50 時間為 10.00 秒。
• 權重 — Boreal:專有,由 Creatify 擁有並提供服務。Qwen3.8 Max:推出時為專有;阿里巴巴已宣布將為首個 Max 級 Qwen 發布開放權重版本,但尚未確認授權條款或日期。
• 證據 — Boreal:由供應商自行執行的 40 項案例盲測,無獨立評估。Qwen3.8 Max:具備獨立基準測試的涵蓋範圍,包含兩項經實測的效能退步,同時並列供應商自報的 OSWorld-Verified 86.1 與 Terminal-Bench 2.1 86.6 成績。
對買方而言,迴歸值多少
排行榜上的退步通常被當作花絮。它們其實更接近一份基準測試所發布、與決策最相關的東西,因為它們是唯一能告訴你供應商犧牲了什麼的資料列。
有用的做法不是去讀哪一張模型卡,而是用你自己的流量實際跑這兩個模型——而實務上的障礙在於,這通常意味著兩份合約、兩套 SDK 和兩套帳務關係,這樣的摩擦足以讓大多數團隊乾脆跳過測試,轉而根據頭條分數來選購。
那種摩擦正是路由層要消除的部分。Qwen3.8 Max 已在我們的目錄中,與上一代並列,因此要在你自己的評估集上比較兩者,只需改一行模型字串,而不必跑一趟採購流程;而當比較結果顯示你想在管線的不同階段使用不同模型時,同一把金鑰就能觸及目錄中的其餘模型。它的價格是供應商定價、零加成,這在這裡有特別的意義:Qwen3.8 Max 推出時比它所取代的那一代便宜約 20%,而這類供應商重新定價,理應在發生時就反映在你的帳單上,而不是等到下一次續約。
Boreal 不在我們的目錄中。OrcaRouter 不提供影片生成模型,這裡的任何內容都不應被解讀為聲稱相反之事。我們提供的是它之上的那層——文案、變體、合規審查、對成效表現的分析——而本系列中的兩個模型,其中包括 Qwen3.8 Max,可以拿到完成的影片片段來進行審閱。

如何讀取任一卡片
Qwen3.8 Max 是更值得購入的選擇,前提是你的工作涉及程式碼、代理或結構化推理,而且其價格還低於自家前代;而那兩項各自獨立的效能退化,正是你該先在自己的檢索與摘要流量上測試它、再將正式環境導向它的原因。40% 的幻覺數字並不是避開這個模型的理由;而是要讓你明白,自己的哪些工作負載能夠容忍它。
Boreal 是兩者之中唯一能產出這項比較名義上所要比較的成品者,而且在短版廣告影片的公開價目上,它是最便宜且可信的選項。它的限制與特定格式有關,且由其自家供應商明言:單人說話短片有 60% 偏好度。在產品廣告之前先測試該格式,因為那裡的提升空間最小。
有兩件事會改變局面。如果阿里巴巴交付它為 Qwen3.8 Max 所宣布的開放權重,該模型的定價與持久性都會改變,而它推出時所適用的授權條款,重要性將更甚於日期。而對 Boreal 而言,第一份獨立評估——任何種類、由任何人所做——將取代目前承擔全部證據重量的 40 個案例供應商測試;這個模型所銷售的格式,品牌對其產品外觀異常敏感。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
