一張生成的標題卡,標題為「Pareto 26.10 Preview vs Pareto」,副標題為「相同的模型字串,兩個不同的版本」,上方有三張卡片,分別寫著「上下文:1M vs 262K」、「價格:$0.80 / $3.20 vs $2.50 / $7.50」以及「穩定性:預覽版 vs 穩定版」,頁腳則寫著「這兩個版本皆由 Unbiased 以模型字串 pareto 提供服務;數據依公開列表為準。」
Guides & Insights

Pareto 26.10 Preview 與 Pareto:相同的模型字串,兩個不同的模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Unbiased 發佈了 Pareto 26.10 Preview 於 2026 年 10 月 1 日,並將先前的版本 Pareto,並列在旁。這兩者不是同一系列中可用旗標選擇的變體。它們是同一個品牌旗下的兩個發行版本,而供應商自己的模型字串——pareto——現在會解析到較新、明確標示為不穩定的那一個。所以比較問題並不是真正的「哪個比較好」。而是:你的請求實際上會觸及哪一個,以及當它在你底下改變時,答案會發生什麼事?

唯一同時提到這兩者的地方,是該模型的公開技術規格列表。Unbiased 自家的模型卡、定價頁面和常見問答,描述的是一款堆疊而成的產品,從未提及拆分。這種不對稱——一方有詳細的公開差異,另一方則一片沉默——是進行正面對決時最誠實的起點,因為它告訴你下列每一個數字的來源。

六個維度,雙方

區隔這些版本的一切,就在這六行裡。左側是 Pareto 26.10 Preview;右側是 9 月 17 日的 Pareto 版本,也就是預覽版型錄文字所稱的穩定選擇。

• 上下文視窗 — 1,048,576 個 token 對 262,144 個 token。帳面上是四倍的空間,而兩者都沒有提供更小的級別。
• 最大輸出 — 131,072 個 token 對 131,072 個 token。維持不變。更大的視窗並未伴隨更大的回答長度。
• 輸入價格(依路由)— 每百萬 $0.80 對每百萬 $2.50。在那份價目上,預覽版大約只需三分之一的價格。
• 輸出價格(依路由)— 每百萬 $3.20 對每百萬 $7.50。不到一半。
• 快取輸入(依路由)— 每百萬 $0.03 對每百萬 $0.25。最長的代理軌跡在此獲益最多。
• 已公布的基準測試表 — 四項分數,明確標示為「初步」且「最終公布前可能變動」,對比完全沒有公布基準測試表。

那些列中有兩列才是真正左右實際工作的關鍵。上下文視窗是供應商不會在自己網站上公布的頭條數字——它出現在商品頁面上,而不是模型卡上——而快取輸入價格則是會改變代理帳單、而非其上限的那一項。其餘的一切,不是行銷上的差異,就是——就輸出分數而言——一種承認:以「初步」標籤公布預覽版的數字,比另一種做法更誠實,而且這也是一種警告。

A generated two-column scoreboard titled "Pareto 26.10 Preview vs Pareto - the scoreboard". The left column, "Pareto 26.10 Preview", reads "Context: 1,048,576 tokens", "Max output: 131,072 tokens", "Input price: $0.80 / 1M", "Output price: $3.20 / 1M", "Cached input: $0.03 / 1M" and "Scores: four, preliminary". The right column, "Pareto", reads "Context: 262,144 tokens", "Max output: 131,072 tokens", "Input price: $2.50 / 1M", "Output price: $7.50 / 1M", "Cached input: $0.25 / 1M" and "Scores: none published". A footer reads "Both columns per the public listing; the vendor's own site lists $2.50 / $7.50 for both releases."

你看到的價格取決於你從哪裡看

把兩張費率卡並排放在一起,它們卻對不上,而這正是這項比較中沒有人解釋的部分。

Unbiased 自家的平台,在 26.10 Preview 成為目前版本的當天,仍列出每百萬輸入 $2.50、快取 $0.25 與輸出 $7.50。那些是九月的數字,未經更動,在定價頁與模型卡上都一樣。較低的一組——$0.80、$0.03、$3.20——出現在同一個 preview 的路由目錄清單上。因此,當顧客呼叫 pareto 時,若直接透過供應商的 API,就要為新模型支付舊價目表,而路由清單卻宣傳大約只要三分之一。兩者都仍上線。供應商未公布任何促銷結束日期,也沒有任何聲明可調和這兩者。

那是通道問題,而在預覽版上,它同時也是時機問題:無論你依據哪個數字來建立成本模型,另一個數字都只差一則發布說明就會變成正確的。一台以 0% 加價直接轉嫁供應商定價的路由器,正好消除了這個摩擦——供應商價格變動當天就生效,而不是等到下一次合約檢視——而這正是這裡值得向OrcaRouter借鏡的一項結構性做法。我們目前並未收錄任何一個 Unbiased 版本,所以「我該去哪裡呼叫它」的直接答案是 Unbiased 自家的 API,至於是哪一組價格,就看你透過哪個上架項目購買而剛好帶有哪一組。之所以要把話說明白,是因為兩者相差三倍,而預覽版不是讓你發現自己訂錯了價格的地方。

預覽能帶給你什麼,以及會讓你付出什麼代價

預覽版自身的目錄說明便已訂下條件:它「可能不經通知即變更」,而任何需要可預測行為的人,都會被引導回九月的發行版。那不是制式樣板文字——而是產品定義。將這點與長時間代理工作階段的實際樣貌相比,取捨就變得具體了。

讓對話持續進行的代理會累積上下文,而長對話正是提示快取回本的地方。在未變更的外觀背後更換模型,是失去快取的典型方式。快取會以產生這些 token 的模型為鍵,因此若在軌跡中途悄悄替換版本,可能使你原本快取的內容失效,並重新計費你以為已經付過的運算。Unbiased 自家的文件則從相反方向論證這一點——它將其混合服務定位為快取穩定,而切換式路由器則不然——所以這是該供應商十分了解、且只是為了推出預覽版而甘願承擔的風險。值得把它說清楚,因為這種失敗在儀表板上是看不見的:你的 token 照樣計費、你的答案照樣回傳,只是那個數字比上週大了一些。

預覽版的優點是真的,而缺點也與之相應。上下文長度是四倍,在路由清單上快取輸入的費率是穩定版的八分之一,而且竟然還有一份基準測試表——九月版從未公佈過分數。如果你的工作負載屬於長上下文且對成本敏感,預覽版就是你要的;而要在不押上整個技術堆疊的情況下採用它,方法就是刻意將其固定:一個用於預覽版的具名端點、一個用於穩定版的具名端點,以及一個兩者之間的備援,設定一次。路由 DSL 正是為這類問題型態而存在——把兩者編排成各自獨立的支線,將一部分真實流量分別導向兩者,再讓請求記錄告訴你各自實際花費了多少。預覽版應該是你能用一行設定就撤銷的決定,而不是得從帳單上才發現的端點屬性。

A generated three-card graphic titled "Where the version reaches you", with cards reading "Vendor API: model string pareto leads to 26.10 Preview", "Vendor pricing card: $2.50 / $7.50, unchanged" and "Listing: $0.80 / $3.20, may change without notice", and a footer reading "Read Oct 1, 2026; which release pareto points at is set by the release calendar."

一個穩定度不足以令人信任的效能概況

上述每一個數字都來自公開的產品頁面,而該頁面本身的效能面板在發布當天於多次讀取之間就有所變動。對 26.10 Preview 頁面的一次讀取顯示,中位延遲為 5.28 秒、每秒 35 個 token;同一天發布的並列比較檢視則顯示,preview 為 3.54 秒與每秒 21 個 token,而 September release 為 1.05 秒與每秒 45 個 token。這些差異並不小。由單一供應商服務的全新模型,其量測基礎薄弱,而橫跨數小時的滾動視窗也會變動。

誠實的立場是:這兩個版本都沒有穩定到足以據以規劃的輸送量或延遲數字;而對預覽版來說,那是產品本身固有的特性,而不是快照問題。九月版至少已經歷經數週的流量——其列表顯示多日可用性維持在九成多的高檔,背後還有完整的供應商歷史紀錄。預覽版則只有幾個小時。如果你在兩者之間做選擇的理由是速度,而不是價格或情境,那麼目前根本還沒有可供選擇的證據;負責任的做法是直接用你自己的提示詞來實測,而不是從任一頁面讀取一個數字。

A screenshot of the OrcaRouter models catalogue headed "Models" and subtitled "208 models · 16 providers · one API key, one bill", with input-modality, context-length, input-price, status, series and supported-parameter filter rows, tabs for Models, Leaderboard, Offers and Playground, a "How to call any model" panel showing a POST to an OpenAI-compatible endpoint, and model cards including OpenAI: GPT-6.1 Sol.

該打給哪一個,以及如何不再在意

呼叫預覽版,如果你的工作屬於長上下文、對成本敏感且可評估——代理工作階段、批次處理,任何四倍視窗與三分之一輸入價格足以抵付週中變更風險的情況。把它當成一場試用,底下附上一行設定,並保留你自己的數字,因為供應商的數字會變動。

如果你的工作負載屬於正式生產環境、對延遲敏感,或受到合規審查涵蓋,而該審查不希望模型被描述為可能未經通知就變更,請呼叫 stable Pareto。你放棄 1M 視窗、較便宜的快取,以及已公布的評分;換來的是有實績的端點,以及一個下週仍代表相同意義的名稱。對許多團隊來說,這就是全部需求。

把這件事當成永久分岔,就是錯誤所在。Unbiased 當初把這道拆分設計成暫時性的——預覽版存在的意義,就是先接受評估、再被吸收——而真正要緊的決定,不是你選了兩者之中的哪一個,而是切換於兩者之間究竟是五分鐘的改動,還是一整季的專案。在單一端點、單一模型字串的情況下,目前兩者皆非:它是一個你必須及時接住的公告。反之,把這項選擇配置成一項路由決策,你所呼叫的版本就會變成一個旋鈕——而這正是預覽版問世以來唯一真正受到回報的姿態。