一張為 GPT-6.1 Sol 生成的主視覺卡片,標題為「獨立分數出爐了」,徽章分別寫著「發布日期:2026年9月29日」、「智慧指數:最高努力下為 52」和「每項指數任務成本:$0.72」,頁腳寫著「獨立數據來自 Artificial Analysis,指數 v4.3.2,擷取於 2026年9月30日」,右下角則是 OrcaRouter 標誌。
Guides & Insights

GPT-6.1 Sol 首個獨立評分出爐:以不到四分之一的任務成本,落後 Astra 0.84 分

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

每一篇關於 GPT-6.1 Sol 的報導——包括本部落格——只要是在 Ope​nAI 於 2026 年 9 月 29 日 DevDay 發布後幾天內刊出的,都帶著同樣的但書:能力數字是廠商的,且沒有第三方為該模型評分。這個但書如今已經過時。Artificial Analysis 的 Intelligence Index 上有 GPT-6.1 Sol 這一列,以最高推理努力執行,而這是這個模型短暫生命中的第一個不是由 Ope​nAI 產出的數字。它顯示 51.8,對比 GPT-6 Astra 的 52.7,以及 GPT-6 Sol 的 47.5——與 $10/$50 旗艦機型差距不到一分,並比 GPT-6.1 Sol 所取代的模型高出 4.3 分。讓這一列有意思的數字是它旁邊那個:該排行榜為每個分數背後的評估執行定價,而 GPT-6.1 Sol 的指數評測執行每項任務花費 $0.72,Astra 的則花費 $3.26。為了 0.84 分花四倍半的錢,這一行就道盡了整個比較;而現在這是一條實測出來的線,而不是廠商對這條線的詮釋。

資料列本身,以及它執行所在的平台

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis 將其 Intelligence Index 發佈為十項評估的綜合指標,而 2026 年 9 月 30 日運行的是 v4.3.2 版——AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 與 AA-LCR v1.1。本文中的三個 OpenAI 模型都位於同一個版本上,因此下方的比較在某種意義上是同類相比,而廠商自家的發布表格從來不是如此。該排行榜也記錄了它所掌握之模型的發布日期——2026-09-29,即 DevDay 當天——並以最大努力配置對其進行評估,這正是該頁面在其自身標題中所指名的設定。

• Intelligence Index — GPT-6.1 Sol(max)為 51.8,GPT-6 Astra(max)為 52.7,GPT-6 Sol(max)為 47.5。
• 每項指數任務成本 — GPT-6.1 Sol 為 $0.72,Astra 為 $3.26,GPT-6 Sol 為 $1.05。這是排行榜本身針對跑完一次完整指數評估所耗成本的數字,而非價目表。
• 該次執行所花費的輸出 token — GPT-6.1 Sol 為 6,720 萬,Astra 為 6,000 萬,GPT-6 Sol 為 7,680 萬。AA 自家的評論稱 6,700 萬相對於排行榜中位數 8,200 萬來說「相當精簡」,這是它對自己所取代之模型的第二場、也是較不張揚的一場勝利。
• 輸出速度 — GPT-6.1 Sol 為每秒 66.8 個 token,Astra 為 57.0,GPT-6 Sol 為 76.2。
• 排行榜所列價格 — GPT-6.1 Sol 每百萬 token 為輸入 $2.00、輸出 $10.00,快取輸入為 $0.10,快取寫入為 $2.50。這四個數字與供應商定價頁面完全一致,而這正是這一列最平淡卻最實用之處:一份獨立列出我們早已引用過之費率的清單。

在這些數字被拿去當彈藥之前,先做一點框架說明。AA 的指數是十項評估,而 OpenAI 在自家發布公告中率先端出的評估——DeepSWE v1.1、OSWorld 2.0、Terminal-Bench Science 0.1——並不在其中。AA 執行自家的 AutomationBench 變體,這和該廠商引用的 AutomationBench 版本不是同一套測試框架。因此,這份獨立紀錄既未證實也未駁斥發布貼文中的四項頭條主張;它衡量的是一組大不相同的任務,值得把它讀作對該模型整體樣貌的第二意見,而不是對那些特定語句的定論。

Astra 仍以不到一分的差距勝出,但價格是四倍半。

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

兩個模型都提供了投入程度階梯,而排行榜如今已公布兩者每一層級的分數與執行成本。把這些階梯並排對照後,它們透露了一件單一頭條式比較無法說明的事:GPT-6.1 Sol 的最佳配置,並不是在與 Astra 的最佳配置較量,而是在與 Astra 的第二佳配置較量。

• GPT-6.1 Sol,最高 — 51.8,每項索引任務 $0.72。 GPT-6 Astra,最高 — 52.7,$3.26。
• GPT-6.1 Sol,極高 — 51.0,$0.39。 GPT-6 Astra,極高 — 52.4,$2.31。
• GPT-6.1 Sol,高 — 50.2,$0.32。 GPT-6 Astra,高 — 50.9,$1.73。
• GPT-6.1 Sol,中 — 47.8,$0.21。 GPT-6 Astra,中 — 49.6,$1.54。
• GPT-6.1 Sol,低 — 42.1,$0.13。 GPT-6 Astra,低 — 45.8,$0.82。

Astra 在每一個層級都領先,這是這場對決最誠實的總結,卻也是其中最不有趣的部分。有趣的部分在於換算比率。如果你想要能勝過 GPT-6.1 Sol 最佳表現的最便宜 Astra 配置,那就是 xhigh 的 Astra:52.4 對上 51.8,價格為 $2.31 對上 $0.72。那等於每次評估執行多花 $1.59,換來 0.56 個指數點——大約是 3.2 倍的成本,換取不到百分之一的分數。反過來,把 GPT-6.1 Sol 降到 xhigh,你會放棄 0.8 分,而帳單降至 $0.39,這比 Astra 的 xhigh 便宜 5.9 倍,也是 Astra 最大努力執行成本的九分之一。

對同一階梯還有第二種解讀,主張不應以最大投入購買 Astra。Astra 的四個較低層級都比它的 max 便宜,而它的 xhigh 比 max 低 0.29 分——換得執行成本降低 29%,代價只是分數少了略高於 0.5%。任何關於這對組合的採購討論,若從「Astra 設為 max」開始,最後得出「Astra 成本貴 4.5 倍」,就是把 Astra 自己更便宜的層級排除在比較之外。

六項評測歸 Astra,兩項歸 GPT-6.1 Sol,兩項平手。

綜合分數掩蓋了分歧。在最大努力設定下逐項評測計分,GPT-6.1 Sol 並非全面略遜一籌的 Astra——它在兩件事上更強,在六件事上更弱。

• GDPval-AA — GPT-6.1 Sol 的 Elo 為 1575.1,Astra 則為 1541.9,在專業工作任務上領先 33 點。這是較便宜的模型最大的單一獨立勝利。
• AA-LCR v1.1,長上下文推理 — 0.830 對 0.807。GPT-6.1 Sol 領先。
• AA-Briefcase v1.1 — Elo 1564.2 對 1568.9。Astra 領先 4.7。
• AutomationBench-AA — 0.649 對 0.685。Astra 領先 3.6 點。
• Terminal-Bench 4.0 — 0.561 對 0.591。Astra 領先 3.0 點。
• SciCode — 0.542 對 0.565。Astra 領先 2.3 點。
• Humanity's Last Exam — 0.529 對 0.547。Astra 領先 1.8 點。
• AA-Omniscience — 41.5 對 43.4。Astra 領先 1.9 點。
• GDP.pdf 與 CritPt — 分別以 0.310 和 0.317 完全打成平手,兩個模型皆然。

那些列中有兩列的價值高於它們在清單中的位置。GDPval-AA 的差距是唯一一個較便宜模型的優勢大到足以在更換測試框架後仍然存在的地方,而且它正好落在廠商定位說法所聲稱的工作負載上——專業、文件密集型的工作。而那兩項完全平手是出現在差距最小的評估上,這提醒我們,0.84 分的綜合差距是由個別從 33 分的勝利到 3.6 分的落敗不等的列所組成的。

相較於它所取代的型號,提升確實存在,但並不均勻。

對任何已經在生產流程中運行 GPT-6 Sol 的人來說,真正重要的比較,是 6.1 Sol 與自家前代相較的結果;而在這點上,獨立紀錄比廠商的貼文敘述得更明確。十項評估中有八項進步,兩項退步。

• SciCode — GPT-6.1 Sol 得分 0.542,而 GPT-6 Sol 為 0.576。較新的模型在科學程式碼方面落後 3.5 個百分點。
• AA-LCR v1.1 — 6.1 Sol 為 0.830,GPT-6 Sol 則為 0.837。在長上下文評估上差距微乎其微,但方向卻是錯的。
• AA-Omniscience — 41.5 對上 27.1。這是這一列中變動最大的一項:知識評估躍升 14.4 個百分點,而該測驗集的準確率也從 0.545 上升到 0.621。
• 同一測驗集的幻覺率 — GPT-6.1 Sol 為 0.543,低於 GPT-6 Sol 的 0.601,但仍高於 GPT-6 Astra 的 0.513。AA-Omniscience 將其分數拆成「答對」與「自信地答錯」兩部分,而這個拆分正是 6.1 這次更新展現價值之處:它是明顯比 Sol 更不虛假的模型,但仍是三者中最不誠實的。
• Terminal-Bench 4.0 — 0.561 對上 0.439,提升 12.2 個百分點。 AA-Briefcase — 1482.8 至 1564.2 Elo。GDP.pdf — 0.248 至 0.310。

解讀是:這比較是一次知識與工具的更新,而不是推理能力的更新。變動最大的評估,是那些獎勵知道事情、而非憑空發明事情的評估;下降的那項評估則是狹隘的技術性評估。任何為了節省快取而改用 6.1 Sol 的人,都把知識提升當成額外收穫,而且不該假設這會延伸到他們執行的每一個測試框架。

董事會把它排在哪裡,以及什麼位居其上

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

在排行榜預設的 Intelligence Index 排序中,GPT-6 Astra 在最高強度下排名第 7,GPT-6.1 Sol 在最高強度下排名第 10,而 GPT-6 Sol 在最高強度下則排名第 20。GPT-6.1 Sol 上方的九列是兩個 Astra 組態、三個 Claude Opus 5.5 組態、一個 Claude Sonnet 5.5 組態,以及兩個 Claude Fable 5.1 組態——因此,GPT-6.1 Sol 最接近的模型是其自身家族的旗艦,而它在該排序中實際取代的模型,則是它的前代,低了十三個名次。

拿掉努力設定後,排序會以一種對成本規劃很重要的方式壓縮:GPT-6.1 Sol 在 xhigh 排名第 13,在 high 排第 15,在 medium 排第 19,在 low 排第 35;而 Astra 則在 high 排第 14,在 medium 排第 16,在 low 排第 26。換句話說,在排行榜上,xhigh 的 GPT-6.1 Sol 勝過 high 的 Astra,而 medium 的 GPT-6.1 Sol 也勝過 low 的 Astra。努力程度在這裡是比模型選擇更大的槓桿,至少在這兩者之間是如此。

說真的,這數字該怎麼辦

這一列所測試的供應商聲稱是,GPT-6.1 Sol 以大約五分之一的價格幾乎媲美旗艦產品。這句話的獨立版本是:它與旗艦產品的差距在 0.84 個指數點之內,而其得分背後的評估運行成本僅為旗艦產品的 22%。這與該聲稱足夠接近,因此沒有人應該覺得被誤導,而且就買家關心的每一個方向而言,這都是一個比「未經驗證」更強而有力的陳述。

這一列沒有做到的,是替你的工作負載定價。一次索引跑分是特定任務的組合,而真正決定實際帳單的數字,是對照你自己 token 使用概況的那份價目表——這也是為什麼快取那一列仍然是該建模的一列:GPT-6.1 Sol 的 0.10 美元快取輸入對上 Astra 的 1.00 美元,是十倍的差距,沒有任何索引分數碰得到。在我們這邊,同樣的原價轉嫁也適用:OrcaRouter 以 OpenAI 自家的定價提供 GPT-6 Astra、GPT-6 Sol 與 GPT-6 Luna,不額外加價,所以當廠商費率變動的那一天,我們這邊的費率也會隨之變動,而不是要等另一份合約。GPT-6.1 Sol 不在我們的路由中——公開目錄會回傳「model not found」的對象是 openai/gpt-6.1-sol,今天如此,而我們也沒有誠實的方式去描述一個我們無法提供的模型。現在一把 API 金鑰真正買到的,是基準測試實際上在爭論的那一對組合——最艱難的工作交給 Astra,大量吞吐交給 Sol——供應商定價原樣轉嫁、不加價,而當其中一家供應商出錯時,會在供應商之間自動容錯移轉。

有兩件事可以讓這一點更為明確。對同一個模型採用第二套獨立測試框架,就能讓我們知道 GDPval-AA 的領先優勢是模型本身的特性,還是那項評估的特性,而這是這一列中最有用卻仍缺失的單一資料點。此外,對 272,000-token 長上下文層級進行獨立量測,會比再補上一個綜合分數更有意義,因為這正是這個系列的定價不再便宜的地方。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新