一張生成的標題卡,標題為「Unbiased 的 Pareto 26.10 預覽」,副標題為「同一個模型字串背後,換上了 1M 上下文」,上方有三張卡片,分別寫著「發布日期:2026 年 10 月 1 日」、「上下文:1,048,576 個 token」以及「路由價格:每 1M 為 $0.80 / $3.20」,頁尾則寫著「由廠商自行執行、初步的基準測試;截至 2026 年 10 月 1 日,尚未公布任何獨立評分。」
Guides & Insights

Unbiased 的 Pareto 26.10 預覽:同一個模型字串背後的 1M 上下文替換

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

整合方式不變。改變的是其背後的模型。2026 年 10 月 1 日,Unbiased 將其模型字串——pareto——改為Pareto 26.10 Preview,這是一個新版本,具備四倍大的上下文視窗、在路由目錄上更低的價格,以及一份供應商自己承認仍屬初步、尚未以最終形式發布的基準測試表。如果你今天以名稱呼叫 Pareto,你呼叫的就是 26.10 Preview,而供應商的變更記錄以最直白的方式如此說明:「Pareto 26.10 Preview 現在是現行的 Pareto 版本……模型字串維持為 pareto。」

那一行,對任何在技術堆疊中使用 Pareto 的人來說,就是事情的全貌。這不是與第一個產品並行推出的第二個產品。它就是第一個產品,在原位被替換,名稱並未改變——這表示你取得的版本是由發佈時程決定,而不是由你請求中的任何內容決定。

10月1日究竟改變了什麼?

有四件事出現了變動,而它們並非全都指向同一個方向。

• 上下文視窗 — 九月 Pareto 版本為 262,144 個 token,現在是 1,048,576。Unbiased 自家的文件從未載明這個數字;此數字來自該模型的公開技術清單,其中它是每次請求的上限,並未提供更小的級別。
• 價格(依路由計)— Pareto 常被引用的價格一直是每百萬輸入 token 2.50 美元、每百萬輸出 token 7.50 美元,快取的輸入則為 0.25 美元。26.10 Preview 的清單則分別列出 0.80 美元、3.20 美元與 0.03 美元 — 大約是輸入費率的三分之一,以及輸出費率的略高於 40%。
• 基準測試分數 — 此版本首次公布,且依供應商自己的標示仍屬初步結果。
• 穩定選項 — 26.10 Preview 是預覽版。Unbiased 的型錄文字說它「可能未經通知即變更」,並引導任何需要可預測行為的人改用先前的版本。

其他一切均維持不變。最大輸出仍為 131,072 個 token。輸入仍為文字與圖像;輸出仍僅限文字。列表上仍沒有 Hugging Face 識別碼,因此權重仍處於封閉狀態。而且仍恰好只有一個推論服務供應商——Unbiased 本身——列表內沒有第二個主機。

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

價格才是值得讀兩遍的那部分

在 Unbiased 自家的平台上,費率表並未變動。模型卡與定價頁面仍然寫著每百萬輸入 $2.50、快取 $0.25、輸出 $7.50——與九月發布時相同的三個數字——而由於模型字串仍為 pareto,使用該供應商 API 的客戶在 26.10 Preview 上支付的就是這些費率。較低的數字出現在路由目錄列表中,而兩者之間的差距,正是會決定是否遷移的那種關鍵因素。

有兩種解讀可能,而供應商尚未說明哪一種屬實。要不是 26.10 Preview 確實透過該管道以較低價格提供,作為初期推廣;就是該上架資訊代表了與直接平台不同的商業安排。Unbiased 並未公布促銷結束日期,而在推出當天設定的價格並不構成承諾。

這是故事中,路由器會改變其樣貌的那一個部分。OrcaRouter 會以 0% 加成直接傳遞供應商的定價,因此供應商一降價,我們這邊就會在它上線的同一天生效,而不是等到合約週期才反映——而自動容錯移轉意味著,某個下週行為可能不同的預覽版,可以不必變更程式碼就被替換掉。我們不提供 Unbiased 的 Pareto 26.10 Preview,所以誠實的說法是:如果你想要這個特定模型,請透過 Unbiased 自家的 API 來呼叫它。重點只在於,對於預覽版而言,價格和版本都是變數,而兩者都不該被寫死在程式碼裡。

基準表,連同它原本附帶的標籤

Unbiased 為 26.10 Preview 發布了四項分數,每一項都搭配每項任務的實測成本,而且每一項都附有廠商自己撰寫的但書。請將它們解讀為由廠商執行且未經重現的結果,因為它們就是如此:

• DeepSWE v1.1(代理式程式編寫)— 69.9%,每項任務 $0.24
• Terminal-Bench 4.0(代理式終端機操作)— 50.8%,每項任務 $0.48
• Humanity's Last Exam,純文字(專家推理)— 49.9%,每項任務 $0.008
• GPQA-Diamond(科學推理)— 92.4%,每項任務 $0.004

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

廠商對 26.10 Preview 的定調是「在所有四項基準測試上都達到或設定了帕雷托前沿」。該廠商隨著這項說法一併發布的表格更為具體,而這份表格能公開發布,功勞要歸於 Unbiased:在 Terminal-Bench 4.0 上,GPT 6 Astra 列為 58,Fable 5.1 為 56,兩者都高於 Pareto 的 50.8,而廠商自家的「其他模型得分較高之處」段落也直接這麼說。在 DeepSWE v1.1 上,該版本落在一群模型之中——GLM-5.3 與 Kimi K3 各列為 69.0,對比 Pareto 的 69.9——這在實務上算是平手,且落在單次執行所帶有的任何誤差範圍內。

這些比較數字帶有第二個警告,而它比第一個更重要:它們是從 9 月 21 日的一份比較中轉錄而來,而且用廠商的話來說,「未經獨立驗證」,並且它們是在針對個別模型的另一項評估中產生的——因此不應把它們與 Pareto 的每項任務成本數據配對,彷彿兩者都出自同一個測試台。廠商在評估細節中就是這麼說的。略過那一行的讀者會過度解讀這張圖表。

這一切都不是:獨立驗證。Artificial Analysis 是大多數團隊在信任價目表上的名字之前會查閱的排行榜,但它完全沒有 Pareto 的頁面。上述每一個數字,都是由販售該模型的公司自己產出的。唯一能稍微緩和這點的是,評估框架是公開的——廠商發布了一套可重現的對照測試套件,任何人都能指向某個端點執行——這把「相信我們的分数」變成「重跑我們的分数」。這是一項真實的提議,但與經過驗證的數字不是同一回事。目前還沒有人公布重跑的結果。

「preview」在合約中是什麼意思?

這個詞在這裡所承擔的份量,比發布說明還多。Unbiased 自家的文件將目前的存取方式描述為依其條款的評估存取,並指出商業或正式環境使用需要另行簽署書面協議。新帳號在核發 API 金鑰前會由人工審核。這套 API 與 OpenAI 及 Anthropic 相容——base URL、金鑰、模型字串,無需改寫——但文件記載的介面僅有 chat completions 與 messages,且有一些已知缺口是廠商公開列出的:GET /v1/models 尚未實作,且未知的模型識別碼不會遭到拒絕,因此呼叫端必須明確送出 pareto,而不能自行探索有哪些可用。

把 preview 標籤和 private-beta 合約放在一起看,營運建議自己就寫出來了。這是一個該放在路由層後面、拿來對照自身工作負載評估的模型,而不是放上營收流量前線後就拋諸腦後的那種。要做到這點的機制並不光鮮:設定一次備援鏈,如此一來,一週中間在你腳下悄悄變動的發佈版本,就會變成一次設定變更,而不是一起事故。Unbiased 九月時花力氣在自己這邊修的正是這一類問題——九月十六日的一筆更新日誌記載,大約 13% 的長時間非串流請求撞上了 120 秒逾時,而閘道上限被調高到 300 秒。這是一家廠商對自身粗糙邊角坦白以告。這也提醒我們,preview 的營運側寫還正在寫。

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

做出承諾前該注意什麼

三件具體的事就能釐清那些懸而未決的問題,而且每一件都可查核。

第一項是獨立分數。除非第三方在公開的測試框架上運行 26.10 Preview,否則 GPQA-Diamond 上的 92.4 與 Terminal-Bench 上的 50.8 都只是廠商對自家成果的宣稱——足以決定是否該測試,但不足以決定是否該遷移。

第二點是預覽對價格造成的影響。如果經路由導向的商品頁維持在 $0.80 與 $3.20,而供應商自家平台上的價格是 $2.50 與 $7.50,那麼這個差異就是一項通路決策,值得你在依據任一個數字建立成本模型之前先弄清楚。

第三個是「可能不另行通知即變更」在實務上到頭來代表什麼。一個在一個月內修訂兩次的預覽版,和一個在季度末被凍結並重新命名的預覽版,是截然不同的東西,而變更日誌正是最先顯現這一點的地方。

這些都不構成不該一試的理由。一個 1M token 的多模態模型,每項任務只要 $0.24 就能回報接近前沿的分數,值得你花一個下午用自家提示詞認真實測,而這項評估的成本比爭論它還低。它反對的,是假設你這週拿來評測的模型,就是你下週會拿到的同一個模型——而對於一個供應商自己稱為預覽版的發布來說,這是唯一必須正確的假設。

預覽版正是自動容錯移轉為之而生的情況:自動容錯移轉會把一個在週間於你使用時變更的模型,變成一次設定變更,而不是服務中斷。