一張生成的標題卡,寫著「Boreal vs Qwen3.8 Max」,副標題為「每個廠商都希望你略過的那一列」,搭配影片播放畫面的扁平線條圖示、一張有一列被標示突顯的計分卡,以及一個放大鏡,OrcaRouter 標誌合成於右下角。
Guides & Insights

Boreal 對決 Qwen3.8 Max:各家廠商都希望你跳過的那一列

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

每一次模型發布都會公布一張數字表,而每一張表上都有一行是廠商寧願你別多看兩眼的。至於Qwen3.8 Max,於 2026 年 8 月 3 日發布,其中好看的數字不難找:它在 CodeArena 前端排行榜上以 1,691 分拿下第一,在 Artificial Analysis Agentic Index 上達到 58,與高強度模式下的 Claude Opus 5 並列——這是中國實驗室在該榜單上最接近榜首的一次——而它的 GDPval-AA 得分為 1,739 Elo,領先 GPT-5.6 Sol。這些數字底下的那一行卻較難解讀。在同一個評估機構的測試套件中,測得的幻覺率從上一代的 23% 升至 40%,而該模型的長上下文檢索分數則下降了兩分。Boreal,Creatify 的廣告影片模型,於 2026 年 9 月 15 日發布,每秒定價一美分,它自己的數字表上也有同樣的一行——而且更為具體,因為這是廠商自己公布的。

這兩列都不算是否決條件。兩者都比標題分數更具參考價值,這正是值得將它們並排呈現,而非比較橫幅的原因。

Qwen3.8 Max 真正最擅長的是什麼

這些勝利是真實的,而且它們並不小。

Qwen3.8 Max 是一款 2.4 兆參數的混合專家模型,每個 token 約有 950 億個參數處於啟用狀態,而它是阿里巴巴表示將以開放權重形式發布的第一款 Max 級 Qwen——宣布將於 2026 年 8 月 10 日當週發布,但沒有授權條款,也沒有確切日期,這個細節值得注意,因為宣布並不等於發布。它具備 100 萬 token 的上下文視窗,輸出上限為 131,072 個 token,並可接受文字、圖像與影片作為輸入。最後這一點在這次特定的比較中尤須強調:在本系列與 Boreal 對比的四款前沿文字模型中,Qwen3.8 Max 是僅有的兩款能接收一段完成的影片片段並就其提問的模型之一。

這項定價極具侵略性,重塑了這個市場區隔。每百萬輸入代幣 2.00 美元、每百萬輸出代幣 6.00 美元,快取讀取為 0.25 美元,價格比前一代低約 20%,同時將最大輸出長度加倍。在我們的排行榜上,這落在 2.00 與 6.00 美元、1M 代幣的上下文、p50 首個代幣時間為 10.00 秒——這是我們監測工具所回報的上限,所以請把它讀作「慢」而非精確數值——以及過去七天 1.83 億代幣的流量。

還有下面的那一行

這就是沒能登上發布貼文標題的那個部分。

Artificial Analysis 的獨立評估記錄到 Qwen3.7-Max 與 Qwen3.8 Max 之間的兩項退步。其長上下文檢索指標下降了兩分。其全知指標下降了十分,而評估方測得的幻覺率從 23% 上升至 40%。同時,該模型在 intelligence index 上每項任務的成本從 $0.53 上升至 $1.14——其每項任務大約需要 64 回合,而前代只需 14 回合。

把這些放在一起讀,一幅連貫的圖像就浮現了。Qwen3.8 Max 這個模型,在那些只有單一正確答案的基準測試所能衡量的事情上變得更強——程式碼、代理式任務完成、結構化問題解決——卻在最難評分的那件事上變得更差:知道自己不知道。一個思考得更久、卻也更容易產生幻覺的模型,並不矛盾。更長的推理軌跡會製造更多機會,讓它認定一個自信的錯誤答案;而一個獎勵任務完成的基準測試,除非任務本身帶有某個可被違反的隱藏不變量,否則不會對此施以懲罰。

對買家而言,實際後果狹窄而具體。如果你對模型的使用是程式碼生成,或是在錯誤答案會大聲失敗的代理式工作流程中——測試失敗、建置中斷——那麼這些回歸大致上隱形,而增益就是全部重點。如果你的用途是檢索、摘要,或任何讓流暢但錯誤的答案未經檢查就到達人類手上的情境,那麼 23 到 40 的變動才是應該決定你評估的數字,而不是 CodeArena 的排名。

Boreal 自家最糟的一列,由供應商發布

讓這個配對之所以有用的對比在於,Creatify 做了一件大多數廠商不會做的事:它把最弱的成果和最強的成果放進同一則貼文裡。

Boreal 曾在其自身未經改動的基礎模型上進行盲測,提示、解析度、影格數與種子皆保持固定,涵蓋 40 個實際製作案例。Creatify 報告 Boreal 獲得 81% 的偏好度——25 比 6,9 次平手,符號檢定 p<0.001——接著進一步拆解該平均值。產品廣告:83%。創作者與 UGC 場景:85%。單人談話片段:60%。

最後那個數字就是那一列。真人對鏡頭說話是直效廣告中最常見的格式之一,而在這種格式中,該模型相對於自身基線的優勢最為薄弱——相較於一個根本不會出貨的模型,幾乎只比擲硬幣好一點。渲染速度報稱在 720p 等級下與即時速度為 1:1,而細節保留度在 p=0.004 下提升了 11.3%,因此整體情況確實是正面的。這份拆分只是告訴你這個模型是針對該類別中的哪一半調校的,而那不是有人在鏡頭前說話的那一半。

另請注意,這些列各自屬於哪一種證據。Qwen3.8 Max 的效能退步,是由一位獨立評測者使用自家測試框架發現的。Boreal 表現較弱的那一列,則是由廠商在自家設計並執行的測試中揭露的。後者作為事實陳述更可信,但作為比較則較不具資訊性,因為 Boreal 的檔案中完全沒有任何獨立數字。

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

規格對比

• 輸出 — Boreal:渲染影片,720p 級,文字轉影片與圖像轉影片。Qwen3.8 Max:僅文字,最高 131,072 個 token。

• 輸入 — Boreal:文字提示或靜態影像。Qwen3.8 Max:文字、圖像與影片。

• 價格 — Boreal:成品影片每秒 $0.01。Qwen3.8 Max:每 1M 輸入 $2.00/每 1M 輸出 $6.00,快取讀取為 $0.25。

• 上下文 — Boreal:尚未公布。Qwen3.8 Max:輸入 1M 個 token,輸出 131K 個 token。

延遲 — Boreal:以與即時 1:1 報價。Qwen3.8 Max:在我們的測試平台上,首個 token 的 p50 時間為 10.00 秒。

• 權重 — Boreal:專有,由 Creatify 擁有並提供服務。Qwen3.8 Max:推出時為專有;阿里巴巴已宣布將為首個 Max 級 Qwen 發布開放權重版本,但尚未確認授權條款或日期。

• 證據 — Boreal:由供應商自行執行的 40 項案例盲測,無獨立評估。Qwen3.8 Max:具備獨立基準測試的涵蓋範圍,包含兩項經實測的效能退步,同時並列供應商自報的 OSWorld-Verified 86.1 與 Terminal-Bench 2.1 86.6 成績。

對買方而言,迴歸值多少

排行榜上的退步通常被當作花絮。它們其實更接近一份基準測試所發布、與決策最相關的東西,因為它們是唯一能告訴你供應商犧牲了什麼的資料列。

有用的做法不是去讀哪一張模型卡,而是用你自己的流量實際跑這兩個模型——而實務上的障礙在於,這通常意味著兩份合約、兩套 SDK 和兩套帳務關係,這樣的摩擦足以讓大多數團隊乾脆跳過測試,轉而根據頭條分數來選購。

那種摩擦正是路由層要消除的部分。Qwen3.8 Max 已在我們的目錄中,與上一代並列,因此要在你自己的評估集上比較兩者,只需改一行模型字串,而不必跑一趟採購流程;而當比較結果顯示你想在管線的不同階段使用不同模型時,同一把金鑰就能觸及目錄中的其餘模型。它的價格是供應商定價、零加成,這在這裡有特別的意義:Qwen3.8 Max 推出時比它所取代的那一代便宜約 20%,而這類供應商重新定價,理應在發生時就反映在你的帳單上,而不是等到下一次續約。

Boreal 不在我們的目錄中。OrcaRouter 不提供影片生成模型,這裡的任何內容都不應被解讀為聲稱相反之事。我們提供的是它之上的那層——文案、變體、合規審查、對成效表現的分析——而本系列中的兩個模型,其中包括 Qwen3.8 Max,可以拿到完成的影片片段來進行審閱。

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

如何讀取任一卡片

Qwen3.8 Max 是更值得購入的選擇,前提是你的工作涉及程式碼、代理或結構化推理,而且其價格還低於自家前代;而那兩項各自獨立的效能退化,正是你該先在自己的檢索與摘要流量上測試它、再將正式環境導向它的原因。40% 的幻覺數字並不是避開這個模型的理由;而是要讓你明白,自己的哪些工作負載能夠容忍它。

Boreal 是兩者之中唯一能產出這項比較名義上所要比較的成品者,而且在短版廣告影片的公開價目上,它是最便宜且可信的選項。它的限制與特定格式有關,且由其自家供應商明言:單人說話短片有 60% 偏好度。在產品廣告之前先測試該格式,因為那裡的提升空間最小。

有兩件事會改變局面。如果阿里巴巴交付它為 Qwen3.8 Max 所宣布的開放權重,該模型的定價與持久性都會改變,而它推出時所適用的授權條款,重要性將更甚於日期。而對 Boreal 而言,第一份獨立評估——任何種類、由任何人所做——將取代目前承擔全部證據重量的 40 個案例供應商測試;這個模型所銷售的格式,品牌對其產品外觀異常敏感。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新