一張生成的主視覺卡片,標題為「GPT-6 對上 GPT-6 世代」,上方標題為「更高智慧,更低成本」,顯示四個堆疊層級:GPT-6 Astra(指數 52.7,每項任務 $3.00)、GPT-6.1 Sol(指數 51.8,每項任務 $0.72)、GPT-6 Sol(指數 47.6,每項任務 $1.05)及 GPT-6 Luna(指數 38.1,每項任務 $0.07),頁尾寫著「數據:Artificial Analysis v4.3.2。」,以及右下角的 OrcaRouter 標誌。
Engineering & Research

GPT-6.1 Sol 對上 GPT-6 世代:獨一無二的一代

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

該廠商於 2026 年 9 月 29 日在自家模型產品線中新增了第四個名稱,並稱之為一個世代,而這個陣容的算術才是其中最有意思的地方:GPT-6.1 Sol就是整個世代。GPT-6 Luna與GPT-6 Sol,兩者均於 2026 年 9 月 22 日發布,皆維持不變;GPT-6 Astra,自 2026 年 9 月 4 日起推出,維持不變;6.1 版更新恰好只影響了一個層級。同時,GPT-6.1 Sol 每百萬個 token 輸入為 $2.00、輸出為 $10.00,在 Artificial Analysis Intelligence Index 上得分 51.83,每項任務成本為 $0.724——與 GPT-6 Astra 相差在 0.84 分以內,而後者以 $10.00/$50.00 的價格計算,每項任務成本為 $3.2575。標籤上同屬一個世代,底下卻是四種截然不同的經濟邏輯。

這讓「我該使用 GPT-6 這一代嗎」成了錯誤的問題。這個產品陣容在每項任務成本上橫跨 48 倍,在實測智慧上橫跨 14.6 分,而答案完全取決於你指的是哪一個層級。以下是這道階梯,經過實測。

實測的四個梯級

A chart titled 'The GPT-6 ladder - measured', subtitle 'Artificial Analysis Intelligence Index, and the measured cost of one task', with four horizontal bars whose lengths are proportional to the Intelligence Index: GPT-6 Luna Index 38.1 / $0.068 per task, GPT-6 Sol Index 47.6 / $1.05 per task, GPT-6.1 Sol Index 51.8 / $0.72 per task, GPT-6 Astra Index 52.7 / $3.26 per task; footer 'Bar length is proportional to the Intelligence Index (0-60 scale). All figures: Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

• GPT-6 Luna — 指數 38.12,每 1M $0.10 / $0.50,快取 $0.01,每項任務 $0.0678,50,012 個輸出 token,首個 token 耗時 100.1 秒
• GPT-6 Sol — 指數 47.63,$2.00 / $10.00,快取 $0.20,每項任務 $1.045,31,000 個輸出 token,124.3 秒
• GPT-6.1 Sol — 指數 51.83,$2.00 / $10.00,快取 $0.10,每項任務 $0.724,38,128 個輸出 token,332.0 秒
• GPT-6 Astra — 指數 52.67,$10.00 / $50.00,快取 $1.00,每項任務 $3.2575,27,206 個輸出 token,400.4 秒

它們每一個都擁有相同的 1,050,000 個 token 上下文視窗,以及相同的 128,000 個 token 最大輸出,而且每一個都接受文字、圖像與檔案輸入。這些層級並不是以能力旗標來區分。它們的區別在於你願意為多少思考量付費,而這道階梯的兩端,每個任務相差 48 倍。

6.1 改版實際上改變了什麼

三件事,而其中只有一件是分數。

分數出現變化:從 47.63 到 51.83,一週內增加了 4.2 分。快取輸入費率減半,從每百萬 $0.20 降至 $0.10,這就是為什麼儘管定價完全相同,測得的每項任務成本仍從 $1.045 降至 $0.724——同一張價目表,不同的帳單。而輸出 token 數從 31,000 增加到 38,128,同時每項任務的實際執行時間從 321 秒變成 640 秒,這是這次更新唯一退步的地方,也是在任何規格表上最不明顯的一點。

與 Astra 對比時,這項比較最令人意外。GPT-6.1 Sol 在指數分數上落後旗艦 0.84 點,且每項任務便宜 4.5 倍。Astra 剩下的優勢不在於它的指數分數;而在於只有它被納入衡量的一組評測,以及 OpenAI 稱其獨有的一項能力——找出新型安全漏洞。這也是為什麼該模型在供應商自家的 Preparedness Framework 下被評為「critical」,且其最強大的設定僅限於經過審核的合作夥伴使用。

針對 GPT-6 Astra 的 OrcaRouter 方案是同一階梯中的旗艦端:$10.00 / $50.00、首個 token 的 p50 為 1.64 秒、七天內達 4,070 萬個 token,以及每個層級共用的相同 1,050,000-token 上下文視窗。

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the $10.00 input and $50.00 output per-million prices, a 1.64 s p50 time to first token, 40.7M tokens over seven days, a 1,050,000-token context window and 128K max output with text/image/file input, above the OpenAI-compatible code sample.

相較於 6.0 Sol,這次更新幾乎是純粹的改進——更高的指數,更少的費用——但需注意的是,6.1 模型是不同模型,而非檢查點,且它會更冗長地重新輸出其推理過程。相較於 Luna,這根本無法相提並論:以 10.7 倍的成本換取 13.7 點指數,對於艱鉅的工作來說是筆好交易,但對於大量工作來說則糟透了。

我們自家路由資料顯示市場早已決定的事

這份比較有一點是規格表所沒有的,那就是實際使用情況的視角。在我們自家路由層上,截至 2026 年 10 月 7 日的七天內,GPT-6.1 Sol 承載了 2.842 億個 token,而它所取代的 GPT-6 Sol 則承載了 95 萬個——兩個問世時間僅相差一週的模型,差距達 300 倍,這正是層級替換從內部看起來的模樣。GPT-6 Luna 這個廉價層級承載了 6.416 億個,比兩個 Sol 模型加起來還多。GPT-6 Astra 則承載了 4,070 萬個。

把這段讀成三種各自獨立的行為。高流量的工作以最大的量流向便宜的那一層。重要的工作則在最新的 Sol 推出後一週內整併到它身上,捨棄了它原本取代的模型。而旗艦仍屬小眾:能力最強的一階,卻最少被使用,只有那些問題唯有它才能解決的團隊才會採用。這個產品陣容不是讓人攀爬的階梯,而是一組供人挑選的工具,而且人們是按層級、而非按世代來挑選。

這就是為什麼層級屬於請求,而不是架構

一個世代分成四個層級的實際問題在於,正確答案會隨每項任務和每週而變——正如上方的流量數字所示,市場在七天內就重新做出了決定。把單一模型名稱硬編碼進應用程式,正是讓一組陣容變成一項承諾的原因。

這四者全都可以透過單一 OrcaRouter 端點取得:一套 API 就能使用 200 多個模型,並以 0% 加價直接沿用供應商的定價。最後這點在這裡尤其關鍵,因為這四個層級中有三個共用同一個定價或某個已經變動過一次的快取費率——GPT-6.1 Sol 的快取費率在上市一週內就腰斬,而正是這種原價直通的計量方式,讓它自動反映在你的帳單上。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample.

路由層有兩項功能,值得為這個特定陣容特別點名。路由 DSL 讓層級成為請求的參數,而不是部署的一部分——擷取階段用便宜層級,推理階段用 6.1 Sol,只有需要 Astra 獨有能耐的呼叫才用 Astra。而模型融合則讓一組模型共同回答同一個問題,這正是使用你無法負擔將所有請求都路由過去的旗艦模型的誠實做法:它成為小組裡的其中一個聲音,而不是整筆帳單。

該如何應對只有一個人的世代

不要買世代。買一級,並在梯級移動時再次買入。

對於高流量且對延遲敏感的工作,GPT-6 Luna 每項任務 $0.0678、首個 token 100 秒,是已經承載最多流量的層級,而且價格比階梯上其他任何選項都低了一個數量級。對於一般推理與程式編寫,GPT-6.1 Sol 如今已成為過去 6.0 模型所擔任的預設選擇——相同定價、更好的指標、快取成本減半,而 640 秒的任務時間是你在假定升級免費之前,唯一需要拿自己的工作量來測試的事情。對於需要前沿量測,或只有旗艦模型才能執行的安全工作等任務,GPT-6 Astra 仍是唯一能勝任這些工作的階層,成本是下一階的 4.5 倍。

值得關注的是,6.1 改版是否會延伸到其他層級。如果 Luna 或 Astra 也獲得同樣的待遇,這道階梯的形狀就會改變,本文中每項任務的計算也會隨之改變。在那之前,「GPT-6.1」指的是一個模型,而把它當成一個系列,正是團隊最終會為擷取任務支付旗艦級費率的原因。