一張主視覺標題卡寫著「Fugu Ultra v2 vs Qwen3.8-Max」,副標題為「為什麼價格標籤上的數字是錯的」,三個膠囊形徽章分別寫著「輸出:$30.00 vs $6.00」、「超過 272K:費率加倍」和「獨立 Fugu 評分:無」,一行頁尾文字寫著「Sakana AI,2026 年 9 月 11 日 vs Alibaba,2026 年 8 月」,以及右下角的 OrcaRouter 標誌。
Guides & Insights

Fugu Ultra v2 對比 Qwen3.8-Max:為何價格標籤是錯誤的數字

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Fugu Ultra v2 每百萬個輸出 token 要價 30.00 美元。Qwen3.8-Max 則要 6.00 美元。這是五比一的差距,而如果你依這個比例在兩套代理式系統之間做選擇,你一定會選錯——因為這兩者的實際計費方式,都不像價目表所暗示的那樣。根據 Artificial Analysis 自家的量測,Qwen3.8-Max 為了完成 Intelligence Index 產生了 1.8 億個輸出 token,是中位數模型 8,900 萬的兩倍以上,每項任務成本 2.67 美元。就 token 而言它是個節儉的模型,就答案而言卻是個奢華的模型。Sakana AI 於 2026 年 9 月 11 日推出的 Fugu Ultra v2,形狀正好相反:它會針對每個請求衍生並協調一批未公開的其他實驗室模型,並以單一混合費率計費,Sakana 表示這個費率不會隨著加入更多代理而倍增。一個是單一 2.4 兆參數的模型,會長時間把思考過程說出來。另一個則是會雇用幫手的小型協調者。比較它們的 token 價格,幾乎無法告訴你哪一個跑起來更便宜。

兩種截然不同的昂貴方式

先從機制講起,因為它解釋了這項比較中所有其他的差異。

Qwen3.8-Max 是一款稀疏混合專家模型——總參數達 2.4 兆,每個詞元約啟用 950 億——它之所以能達到接近前沿的成果,靠的是運作得更久,而非規模更大。Artificial Analysis 測得它的輸出速度為每秒 37.8 個詞元,在速度方面於 200 個模型中排名第 154,並在 Intelligence Index 上共輸出 1.8 億個詞元(在冗長度方面於 200 個模型中排名第 70)。其每項 Intelligence Index 任務的成本為 2.67 美元,而它的快取折扣異常地深,達 88%,這才是真正左右帳單的槓桿:長時間的代理執行若不斷重讀相同脈絡,就很便宜;若不斷生成新文字,則不然。

Fugu Ultra v2 從另一端處理同一個問題。它是一個協調器——一個小型的經訓練協調者,據報導約有 70 億個參數,負責讀取請求,依據 Sakana 的 TRINITY 研究中 Thinker、Worker 與 Verifier 的角色組建代理團隊,然後綜整出答案。它的 token 帳單是其子代理所產出的內容加上協調者自身的綜整文字之總和。Sakana 在其定價常見問題中承諾,你會被收取一個與所涉最高階模型掛鉤的混合費率,而且增加代理不會使帳單倍增,這消除了典型多代理系統中因扇出而導致成本倍增的爆炸性增長。它沒有消除的是用量。以每百萬輸出 token 30.00 美元計算,真正重要的數字是有多少代理執行過,以及它們寫了多少,而那是你與 Sakana 都無法從定價頁面預測的數字。

這就是對價格差距的誠實描述:它是費率,不是總額。把高出五倍的費率套用在一個你無法預測其產出量的工作負載上,成本並不會是五倍——而是一個沒有上限、卻有可預期下限的倍數。

A two-column scoreboard titled 'Fugu Ultra v2 vs Qwen3.8-Max Scoreboard' contrasting six dimensions. Fugu Ultra v2: price $5.00/$30.00 per 1M, context 1M tokens, above 272K input doubles to $10, AA Index none published, speed not measured, weights closed with pool undisclosed. Qwen3.8-Max: price $2.00/$6.00 per 1M, context 1M tokens, above 272K no surcharge, AA Index 40 ranked #30 of 200, speed 37.8 tokens/sec, weights open checkpoint published. Footer reads 'Fugu Ultra v2 figures vendor-reported; no independent evaluation. Qwen3.8-Max figures per Artificial Analysis, recalibrated scale.' OrcaRouter logo bottom-right.

規格表,以及決定一切的那一列

• 價格 — Fugu Ultra v2 每 100 萬個 token 輸入 $5.00 / 輸出 $30.00,對比 Qwen3.8-Max 輸入 $2.00 / 輸出 $6.00

• 快取輸入 — Fugu Ultra v2 每 100 萬 $0.50,對比 Qwen3.8-Max 每 100 萬讀取 $0.25,以及由 Artificial Analysis 測得的 88% 快取折扣

• 長上下文附加費 — 超過 272K token 時,Fugu Ultra v2 的輸入價格加倍至 $10.00、輸出價格加倍至 $45.00;相較之下,Qwen3.8-Max 不收長提示附加費,在整個上下文視窗內維持均一價

• 上下文視窗 — Fugu Ultra v2 100 萬個 token 對比 Qwen3.8-Max 100 萬個 token

• 輸出上限 — Fugu Ultra v2 未公布單一數字,而 Qwen3.8-Max 約為 128K tokens

• 輸入模態 — Fugu Ultra v2 文字,背後有該集區自身的能力支撐,對比 Qwen3.8-Max 的文字、圖像、影片與 PDF

• 權重 — Fugu Ultra v2 為閉源,集區成員身分依設計不予揭露;相較之下,Qwen3.8-Max 以自訂授權公開發布 Max 級檢查點的開放權重

• 區域供應情況 — Fugu Ultra v2 未在歐盟/歐洲經濟區銷售,而 Qwen3.8-Max 可在無區域限制的情況下取得

• 獨立評估 —— Fugu Ultra v2 未發布任何獨立評估,且任何 Fugu 模型都沒有 Artificial Analysis 頁面;相對地,Qwen3.8-Max 在 Artificial Analysis 上有現行條目,並公布了速度、冗長度與每項任務成本數據。

把最後兩行放在一起看,對比就更加鮮明。Qwen3.8-Max 是一個你可以鎖定版本、查閱授權條款、下載檢查點,並對照第三方評分板來查核的模型。Fugu Ultra v2 則是一個你無法檢視、無法自行架設、無法在歐洲購買,也無法向 Sakana 以外任何人驗證的系統。272K 的加價更讓情況雪上加霜:一旦超過該門檻,Fugu Ultra v2 的輸入費率就翻倍,輸出費率也調漲一半,而 Qwen3.8-Max 的費率則文風不動。對於這兩套系統所鎖定的長時程文件與儲存庫工作而言,那個更便宜的標價,同時也是更平穩的那一個。

大家都在引用的 Qwen3.8-Max 數字已經過時了

如果你在過去兩週內曾在任何地方讀過關於這個模型的資訊,你大概看過 Artificial Analysis Intelligence Index 為 58、58.1 或 58.4。那些數字當時是真實的,但如今已不再是最新數據。Artificial Analysis 於 2026 年 9 月 7 日將其指數重新校準至 v4.3,全面壓縮了各項分數,而 Qwen3.8-Max 的即時頁面現在顯示為40,在 200 個模型中排名第 30 名——並帶有標示分數經重述的「已更新」徽章。較早的報導也載有依前一尺度衡量的工作量成本:每項任務 64 回合,而前一代 Qwen 為 14 回合;以及每個 Intelligence Index 任務約 $1.14。目前頁面顯示每項任務 $2.67、每秒 37.8 個輸出 token,以及該指數上 1.8 億個輸出 token。

接下來有兩點。首先,在重新校準後的量表上,Qwen3.8-Max 與前沿第二梯隊的其他模型落在同一區間,而不是與前沿本身同級;任何你讀到、以 58 分將它與 Claude Opus 5Kimi K3 並列的比較,都是在比較來自不同量表的快照。其次,對這場對決更有用的是,這項修正具有單向性:Qwen3.8-Max 有一個可能出錯、然後被修正的數字。Fugu Ultra v2 則沒有數字。本文中每一個 Fugu 數字都來自 Sakana 自家的評估;截至 9 月 11 日,Fugu Ultra v2 或任何其他 Fugu 模型都沒有 Artificial Analysis 頁面——該網址會回傳 404。當廠商公布一份記分板,而沒有獨立第三方實際跑過該模型時,記分板就是全部的紀錄。

它們實際重疊之處,以及不重疊之處

Sakana 回報 Fugu Ultra v2 在八項基準測試中的五項拿下最佳或並列最佳——GDP.pdf、Chartography、SWEFish、DeepSWE 和 Toolathon——並在八項中的七項名列前二。該新聞稿中的兩個具體數字是 Chartography 的 48.3,同一張表中 Claude Opus 5 為 27.3、Claude Fable 5 為 29.5,以及 DeepSWE 的 74.3。Ali​baba 自己公布的 Qwen3.8-Max 數據列包括 Terminal-Bench 2.1 的 86.6、OSWorld-Verified 的 86.1、GPQA Diamond 的 92.6,以及 SWE-bench Pro 的 67.7。

注意那兩份清單的共同點:什麼都沒有。沒有任何一項基準測試同時出現在兩張廠商表格中。沒有任何一列能讓你並排放上 Sakana 的數字和 Alibaba 的數字,然後讀出誰勝誰負;這意味著,對「哪個更擅長程式碼代理」這個問題,誠實的答案是:沒有已發表的證據能回答。實際存在的是:一個系統有八列由廠商自行挑選的資料,且沒有外部驗證;另一個系統則有廠商提供的列,外加一筆獨立項目,衡量的是成本與速度,而不是能力的正面對決。這是證據上的缺口,不是模型上的缺口,而這應該改變你購買的方式:你無法根據基準測試在這些之間做選擇,所以就根據你真正能驗證的特性來選。

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, with the opening paragraphs arguing that the frontier which matters is two-dimensional — capability against cost — and stating that Fugu Ultra v2 pushes peak performance higher without indispensable reliance on the frontier models it orchestrates.

開放權重對上未公開的資源池

這正是常見的「鎖定」論點出現反轉的地方,而這也是這對組合最有趣的一點。

Sakana 對 Fugu Ultra v2 的宣傳主軸是主權。一個可替換的開放與專門化模型池,意味著沒有任何單一供應商的定價決策、淘汰時程或政策轉向能拖垮你的產品;而這次發布也明確點出這一點,指出該模型池的組成在 v2 中已有改變。該公司也直言,Fugu Ultra v2 的成績是在代理池中沒有 Claude Fable 5、Claude Fable 5.1 或 GPT-6 Astra 的情況下達成的——既聲稱勝過目前可取得的三個最強模型,又確認它並未呼叫其中任何一個。無論這個池子裡有什麼,根據 Sakana 自己的盤算,它都不是市場上最頂尖的。

但這種避險是有代價的,而這代價並不在價目表上。你看不到那個資源池,你無法把某位成員納入或排除於 Ultra 方案之外,你無法自行架設其中任何一部分,而且你完全不能在 EU/EEA 運行它——以新加坡為基地、調度其他實驗室的權重,與自己擁有權重是截然不同的風險輪廓。Qwen3.8-Max 則恰恰把這一切倒轉過來。它是單一廠商的模型,因此暴露於單一廠商的決策之下,但阿里巴巴以自訂授權條款發布了 Max 級 Qwen3.8-2.4T-A95B 檢查點的開放權重,這意味著那條逃生出口是真實存在的,而非只是修辭:若定價或條款改變,該模型可以從你自己的基礎設施提供服務。對於一個真正恐懼的是廠商突然抽腿的團隊而言,一份可下載的檢查點,比一個針對你不得檢視的資源池所作的承諾,是更強的保證。

對於同時在兩邊跑 agent 的人來說,這裡有個次要但值得留意的點。Qwen3.8-Max 已在我們的目錄上,輸入 $2.00、輸出 $6.00,也就是 Alibaba 的定價,以 0% 加成原樣傳遞——供應商價格一有變動,當天就會反映在同一組金鑰上,而自動容錯移轉也能涵蓋遭限流或效能衰退的供應商路徑。Fugu Ultra v2 不在 OrcaRouter 上。你得透過 Sakana 自家的 OpenAI 相容 API 及幾個第三方平台才能取得,而從較早版本的 Fugu 升級只需改一行參數。路由器不能取代協調器,協調器也不能取代容錯移轉的能力;如果你兩者都想要,就等於同時在跑兩家供應商的系統,請為兩筆帳單做好預算。

你應該選哪一個

如果你需要一個可預測、可驗證、可抽身的模型,就選 Qwen3.8-Max。以牌價計,它的輸出速率是 Fugu Ultra v2 的三分之一;它沒有長上下文斷崖;它接受圖像、影片與 PDF,而 Fugu 池的多模態能力則取決於底層代理剛好支援什麼;它會發布可供你退回使用的檢查點;它在各地都買得到;而且它有一筆即時且獨立的條目,衡量真正影響你帳單的東西——每秒 37.8 個 token,以及一個你在投入前就能建模的每任務成本數字。它的弱點同樣具體,值得點名:它很慢,速度在 200 個中排名第 154;它在索引上極為冗長,達 1.8 億個 token;而 Artificial Analysis 另行測得它的幻覺率相較前一代從 23% 升至 40%,這對它主打的自動化多步驟工作而言,正是嚴重的隱憂。請把驗證器納入預算,並積極利用深度快取折扣。

如果你的工作是長時間跨度且可驗證的、你的預算屬於探索性而非正式生產用途,而且你身處 EU/EEA 之外,那就選 Fugu Ultra v2。採用協調器的結構性理由確實成立,而供應商自家的範例也一致指向這一點——在單張 H100 上進行十四小時、涵蓋 123 項實驗的自動化研究執行;一個純 Python 的魔術方塊求解器完成了全部 300 顆打亂的方塊,而兩個匿名化的前沿基準則直接崩潰。這些都是供應商挑選過的範例,基準也經過匿名化,它們能證明的比表面上看到的少,但這個模式本身是連貫的:在正確性可驗證、而難處在於持續力的任務上,生成一個驗證器勝過把單一模型逼得更用力。你買到的就是那份持續力,代價是 Qwen3.8-Max 五倍的費率,而且是在一個你無法稽核其品質、也無法鎖定其模型池的系統上。以限定範圍進行試點,衡量「每完成一項任務的輸出 token 數」而非「每 token」,並在第一次執行前就設好上限。

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the model title, the 'Featured' badge, the identifier qwen/qwen3.8-max, vision, tools, JSON and reasoning capability tags, a 1M-token context window, text and image and video input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, and an OpenAI-compatible base URL with Python and cURL code samples.

價格標籤上的數字之所以不對,是因為這兩款產品都把「答案的成本」從「token 的成本」移開了。Fugu Ultra v2 的做法是分散到它不願具名的多個模型上。Qwen3.8-Max 的做法則是用一億八千萬個 token 來思考。如果你已經知道自己每項任務的 token 用量,這道算術很簡單,你應該直接算。大多數團隊並不知道那個數字,對他們來說,決定就簡化成更單純的一件事:Qwen3.8-Max 是你可稽核、可定價、可捨棄的選擇,而 Fugu Ultra v2 則是押注協調勝過能力的選擇。兩者都站得住腳。只有其中一個附有收據。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新