
Unbiased 的 Pareto 26.10 預覽:同一個模型字串背後的 1M 上下文替換
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 221 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
整合方式不變。改變的是其背後的模型。2026 年 10 月 1 日,Unbiased 將其模型字串——pareto——改為Pareto 26.10 Preview,這是一個新版本,具備四倍大的上下文視窗、在路由目錄上更低的價格,以及一份供應商自己承認仍屬初步、尚未以最終形式發布的基準測試表。如果你今天以名稱呼叫 Pareto,你呼叫的就是 26.10 Preview,而供應商的變更記錄以最直白的方式如此說明:「Pareto 26.10 Preview 現在是現行的 Pareto 版本……模型字串維持為 pareto。」
那一行,對任何在技術堆疊中使用 Pareto 的人來說,就是事情的全貌。這不是與第一個產品並行推出的第二個產品。它就是第一個產品,在原位被替換,名稱並未改變——這表示你取得的版本是由發佈時程決定,而不是由你請求中的任何內容決定。
10月1日究竟改變了什麼?
有四件事出現了變動,而它們並非全都指向同一個方向。
• 上下文視窗 — 九月 Pareto 版本為 262,144 個 token,現在是 1,048,576。Unbiased 自家的文件從未載明這個數字;此數字來自該模型的公開技術清單,其中它是每次請求的上限,並未提供更小的級別。
• 價格(依路由計)— Pareto 常被引用的價格一直是每百萬輸入 token 2.50 美元、每百萬輸出 token 7.50 美元,快取的輸入則為 0.25 美元。26.10 Preview 的清單則分別列出 0.80 美元、3.20 美元與 0.03 美元 — 大約是輸入費率的三分之一,以及輸出費率的略高於 40%。
• 基準測試分數 — 此版本首次公布,且依供應商自己的標示仍屬初步結果。
• 穩定選項 — 26.10 Preview 是預覽版。Unbiased 的型錄文字說它「可能未經通知即變更」,並引導任何需要可預測行為的人改用先前的版本。
其他一切均維持不變。最大輸出仍為 131,072 個 token。輸入仍為文字與圖像;輸出仍僅限文字。列表上仍沒有 Hugging Face 識別碼,因此權重仍處於封閉狀態。而且仍恰好只有一個推論服務供應商——Unbiased 本身——列表內沒有第二個主機。

價格才是值得讀兩遍的那部分
在 Unbiased 自家的平台上,費率表並未變動。模型卡與定價頁面仍然寫著每百萬輸入 $2.50、快取 $0.25、輸出 $7.50——與九月發布時相同的三個數字——而由於模型字串仍為 pareto,使用該供應商 API 的客戶在 26.10 Preview 上支付的就是這些費率。較低的數字出現在路由目錄列表中,而兩者之間的差距,正是會決定是否遷移的那種關鍵因素。
有兩種解讀可能,而供應商尚未說明哪一種屬實。要不是 26.10 Preview 確實透過該管道以較低價格提供,作為初期推廣;就是該上架資訊代表了與直接平台不同的商業安排。Unbiased 並未公布促銷結束日期,而在推出當天設定的價格並不構成承諾。
這是故事中,路由器會改變其樣貌的那一個部分。OrcaRouter 會以 0% 加成直接傳遞供應商的定價,因此供應商一降價,我們這邊就會在它上線的同一天生效,而不是等到合約週期才反映——而自動容錯移轉意味著,某個下週行為可能不同的預覽版,可以不必變更程式碼就被替換掉。我們不提供 Unbiased 的 Pareto 26.10 Preview,所以誠實的說法是:如果你想要這個特定模型,請透過 Unbiased 自家的 API 來呼叫它。重點只在於,對於預覽版而言,價格和版本都是變數,而兩者都不該被寫死在程式碼裡。
基準表,連同它原本附帶的標籤
Unbiased 為 26.10 Preview 發布了四項分數,每一項都搭配每項任務的實測成本,而且每一項都附有廠商自己撰寫的但書。請將它們解讀為由廠商執行且未經重現的結果,因為它們就是如此:
• DeepSWE v1.1(代理式程式編寫)— 69.9%,每項任務 $0.24
• Terminal-Bench 4.0(代理式終端機操作)— 50.8%,每項任務 $0.48
• Humanity's Last Exam,純文字(專家推理)— 49.9%,每項任務 $0.008
• GPQA-Diamond(科學推理)— 92.4%,每項任務 $0.004

廠商對 26.10 Preview 的定調是「在所有四項基準測試上都達到或設定了帕雷托前沿」。該廠商隨著這項說法一併發布的表格更為具體,而這份表格能公開發布,功勞要歸於 Unbiased:在 Terminal-Bench 4.0 上,GPT 6 Astra 列為 58,Fable 5.1 為 56,兩者都高於 Pareto 的 50.8,而廠商自家的「其他模型得分較高之處」段落也直接這麼說。在 DeepSWE v1.1 上,該版本落在一群模型之中——GLM-5.3 與 Kimi K3 各列為 69.0,對比 Pareto 的 69.9——這在實務上算是平手,且落在單次執行所帶有的任何誤差範圍內。
這些比較數字帶有第二個警告,而它比第一個更重要:它們是從 9 月 21 日的一份比較中轉錄而來,而且用廠商的話來說,「未經獨立驗證」,並且它們是在針對個別模型的另一項評估中產生的——因此不應把它們與 Pareto 的每項任務成本數據配對,彷彿兩者都出自同一個測試台。廠商在評估細節中就是這麼說的。略過那一行的讀者會過度解讀這張圖表。
這一切都不是:獨立驗證。Artificial Analysis 是大多數團隊在信任價目表上的名字之前會查閱的排行榜,但它完全沒有 Pareto 的頁面。上述每一個數字,都是由販售該模型的公司自己產出的。唯一能稍微緩和這點的是,評估框架是公開的——廠商發布了一套可重現的對照測試套件,任何人都能指向某個端點執行——這把「相信我們的分数」變成「重跑我們的分数」。這是一項真實的提議,但與經過驗證的數字不是同一回事。目前還沒有人公布重跑的結果。
「preview」在合約中是什麼意思?
這個詞在這裡所承擔的份量,比發布說明還多。Unbiased 自家的文件將目前的存取方式描述為依其條款的評估存取,並指出商業或正式環境使用需要另行簽署書面協議。新帳號在核發 API 金鑰前會由人工審核。這套 API 與 OpenAI 及 Anthropic 相容——base URL、金鑰、模型字串,無需改寫——但文件記載的介面僅有 chat completions 與 messages,且有一些已知缺口是廠商公開列出的:GET /v1/models 尚未實作,且未知的模型識別碼不會遭到拒絕,因此呼叫端必須明確送出 pareto,而不能自行探索有哪些可用。
把 preview 標籤和 private-beta 合約放在一起看,營運建議自己就寫出來了。這是一個該放在路由層後面、拿來對照自身工作負載評估的模型,而不是放上營收流量前線後就拋諸腦後的那種。要做到這點的機制並不光鮮:設定一次備援鏈,如此一來,一週中間在你腳下悄悄變動的發佈版本,就會變成一次設定變更,而不是一起事故。Unbiased 九月時花力氣在自己這邊修的正是這一類問題——九月十六日的一筆更新日誌記載,大約 13% 的長時間非串流請求撞上了 120 秒逾時,而閘道上限被調高到 300 秒。這是一家廠商對自身粗糙邊角坦白以告。這也提醒我們,preview 的營運側寫還正在寫。

做出承諾前該注意什麼
三件具體的事就能釐清那些懸而未決的問題,而且每一件都可查核。
第一項是獨立分數。除非第三方在公開的測試框架上運行 26.10 Preview,否則 GPQA-Diamond 上的 92.4 與 Terminal-Bench 上的 50.8 都只是廠商對自家成果的宣稱——足以決定是否該測試,但不足以決定是否該遷移。
第二點是預覽對價格造成的影響。如果經路由導向的商品頁維持在 $0.80 與 $3.20,而供應商自家平台上的價格是 $2.50 與 $7.50,那麼這個差異就是一項通路決策,值得你在依據任一個數字建立成本模型之前先弄清楚。
第三個是「可能不另行通知即變更」在實務上到頭來代表什麼。一個在一個月內修訂兩次的預覽版,和一個在季度末被凍結並重新命名的預覽版,是截然不同的東西,而變更日誌正是最先顯現這一點的地方。
這些都不構成不該一試的理由。一個 1M token 的多模態模型,每項任務只要 $0.24 就能回報接近前沿的分數,值得你花一個下午用自家提示詞認真實測,而這項評估的成本比爭論它還低。它反對的,是假設你這週拿來評測的模型,就是你下週會拿到的同一個模型——而對於一個供應商自己稱為預覽版的發布來說,這是唯一必須正確的假設。
預覽版正是自動容錯移轉為之而生的情況:自動容錯移轉會把一個在週間於你使用時變更的模型,變成一次設定變更,而不是服務中斷。
