
GPT-6.1 Sol 對上 Gemini 4 Argon:僅差半分,而且只有其中一款有在販售
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
你能在 GPT-6.1 Sol與 Gemini 4 Argon 之間比較的一切都可量化,但沒有一項可付諸行動,因為這兩款模型中只有一款買得到。Gemini 4 Argon 於 2026 年 9 月 30 日在一篇 DeepMind 文章中宣布,署名為 Koray Kavukcuoglu,定價為所稱的導入價每百萬輸入 token 2.00 美元與每百萬輸出 token 10.00 美元,並透過 Fairwind Program 率先向一群具名的資安防禦人員推出。它沒有模型識別碼、沒有 API 端點、沒有已公佈、可供你計費的每 token 費率,也沒有任何你能以客戶身分存取的頁面。GPT-6.1 Sol 於 2026 年 9 月 29 日推出,價格為 2.00 美元與 10.00 美元,且現在已可使用。在 Artificial Analysis Intelligence Index 上,兩者相差 0.8 分——Argon 52.6,Sol 51.8——這使它們成為本批次中最接近的一對,而且單就該指數而言,是不分軒輊。在決定實際部署的衡量標準上,這兩個模型中有一個根本算不上候選者。
那種不對稱不是什麼技術細節,也不是什麼獨家新聞。它是應該主導這項比較該如何解讀的事實:Argon 的數字描述的是一個正在對單一組群進行受控推行的模型,而 GPT-6.1 Sol 的數字描述的則是價目表上的產品。比較兩者仍然值得一做——Argon 是該供應商目前主打的產品,而它的量測結果確實說明了 Gemini 產品線頂端所處的位置——但每一項結論都必須附帶「如果它買得到」這句話,而且沒有任何一項結論可以附帶「你該不該轉換」這句話。
該指數只允許進行一次比較,而結果幾乎不分軒輊。

兩個模型都出現在 Artificial Analysis 上,且兩者都附有一項分數,以及對產出該分數所耗成本的說明。
• 智慧指數,v4.3.2 — Gemini 4 Argon 52.6 對 GPT-6.1 Sol 51.8,差距 0.8 分
• 每項索引任務的成本——Gemini 4 Argon $1.99 對比 GPT-6.1 Sol $0.72,為了那 0.8 分,差距達 2.8 倍
• 執行完整套件的成本 — Gemini 4 Argon $2,407 對比 GPT-6.1 Sol $1,082
• 在該測試套件上發出的輸出 token —— Gemini 4 Argon 110M 對上 GPT-6.1 Sol 67M,1.6× 的冗長度差異
• 標示的首發價格 — 兩者皆為每百萬個 token 輸入 $2.00、輸出 $10.00,而 Argon 的快取輸入可享 95% 折扣
• 上下文視窗 — GPT-6.1 Sol 1,050,000 tokens;Argon 尚未公開
第四行說明了第二行。在幾乎相同的牌價下,每項任務成本卻相差 2.8 倍,原因在於以相近的輸出價格寫入 1.6 倍的 token,再加上其背後推理量所耗費的成本。從其模型卡來看,Argon 並不是昂貴的模型。它在評測中是個話多的模型,而帳是結算在輸出上的。
這些配置不同,而差異的方向對較便宜的模型有利。Artificial Analysis 的圖表以高努力設定呈現 Gemini 4 Argon,並以最高設定呈現 GPT-6.1 Sol——因此 Sol 是在其最昂貴的設定下測量,而 Argon 則是在低於其上限的某個設定下測量。所以,0.8 分的差距是對 Sol 而言較寬容的比較版本:給 Argon 最高設定,差距可能會擴大;給 Sol 較低設定,其成本則會進一步下降。這兩種做法都不會改變可用性這條線,而那是唯一能終結部署決策的線。
竟然能看出0.8點的差距
在十項評估的綜合分數上,不到一分的差距算不上排名。那只是兩個模型落在同一區間。
這個指數未為 Argon 公布的部分,正是能讓這個級距變得可解讀的組成細節——它贏下哪些評估、哪裡較弱、在構成綜合分數的各項子分數上表現如何。GPT-6.1 Sol 的頁面載有那些列;Argon 的頁面則只有一個頭條分數和一項成本。僅根據頭條分數建立的比較,只能說兩者旗鼓相當,除此之外別無其他;它應該就這麼說,而不是從 0.8 分的差距硬生生製造出一個贏家。
有一個值得補充的外部數據點,而它指向的是相反的方向。在發布之後流傳的一份第三方程式編寫評測中,Argon 名列第三,排在 GPT-6 Astra 與 Claude Opus 5.5 之後——對一個處於受控推出階段的模型而言,這是相當亮眼的成績,也與綜合分數 52.6 相互吻合。但這同樣只是來自單一評測的單一觀察,且發表於發布後的頭幾天,因此它只是佐證,而非長期實績。給它標記一下,然後繼續往下走。
這兩張價格卡實際上是做什麼用的
Argon 標示的費率比索引列更需謹慎看待,因為其中包含兩個數字。
introductory 價格是每百萬 input $2.00、output $10.00,而快取 input 可享 95% 折扣;若放在同一張卡上比較,這會讓 Argon 與 GPT-6.1 Sol 的價格看似同級對等。但供應商自家的註腳指出,在一個它並未定義的 introductory 期間過後,價格會變成每百萬 input token $4.00、每百萬 output token $20.00。後者這組數字並非假設——而是該模型預期最終會落定的公告價格——而且它恰好落在當前前沿模型定價清單的水準上,而不是低於它。只引用 introductory 那組價格的比較,等於是在引用一個尚未正式全面上市的模型的促銷價;同一行裡就疊了兩層暫時性。
GPT-6.1 Sol 的價目卡是另一種截然不同的東西。$2.00 和 $10.00 是現行費率,不是促銷價;超過 272,000 個提示詞 token 後,長上下文級距跳到 $4.00 / $15.00,這是已公開的資訊,且適用於明確定義的界線;$0.10 的快取輸入今日已上線且可計費。其中沒有任何內容需要針對供應商拒絕定義的期間加註腳。
這就是供貨狀態那一行背後的實質。不是說 Argon 是較差的型號——指數顯示兩者旗鼓相當——而是說這兩張卡之中,一張是承諾,另一張是意圖。
推出本身即是比較

Fairwind 計畫是 Argon 那則公告中,技術比較往往會略過的部分,而它正是這裡最關鍵的一環。
廠商正率先把這款模型交到一群具名的網路防禦人員手中,領先其他所有人,而且沒有公布全面開放的日期、沒有開發者候補名單,也沒有任何可供客戶鎖定的已公布識別碼。這是發布前沿模型的正当方式,對這類能力而言也並不罕見。這同時也意味著,目前所有關於 Argon 在真實流量下成本、延遲、輸送量與可靠性的說法都尚未經過實測:因為根本沒有可測量的生產流量。廠商自家的基準測試結果確實存在,Artificial Analysis 的綜合評比也存在,但這兩者加起來,就是一家實驗室的評估與一家評測機構的測試套件。這就是全部的紀錄。
GPT-6.1 Sol 的紀錄只有八天,而且其薄弱之處截然不同:只有一組獨立配置、沒有實務工作者的語料庫,還有一款已出貨的產品,其失效模式至今尚未在任何地方被記錄下來。這兩個模型的證據都不充分。然而,其中一個有一張發票。
所以這個比較是為了什麼
三種用途,而且沒有一種是購買決策。
首先,校準。如果你正在追蹤 Argon 相對於 GPT-6.1 Sol 的定位,那麼在每項任務成本差距為 2.8× 的情況下,52.6 對 51.8 就是目前的答案;這也顯示 Gemini 4 系列在能力上具競爭力,但仍在敲定其商業條款。留意入門優惠價是否會被 $4.00 / $20.00 這組價格取代;在能力不變的情況下,這會把價格持平變成價格溢價。
第二,一個保留立場。一個已發布、已被衡量、卻無法路由的模型,正是最鮮明的案例,說明為何要在你的應用程式與你的模型選擇之間保留一層抽象。本文中的兩個模型,從我們這一側來看,都能以相同方式觸及:GPT-6.1 Sol 已在 OrcaRouter 上,價格為它自身的 $2.00 / $10.00,快取輸入為 $0.10,且未加收任何費用,因此今天就能以供應商定價針對它建構工作負載。若有一天 Argon 取得了識別碼與價目表,評估它應該只是改個設定,而不是重寫——而在那之前,該投入在 Argon 上的正確工程心力,就是能讓這件事維持成立的那個份量。
第三,一份可證偽的觀察清單。以下任何一項,都會讓這篇從「目前我們所知」的文章,變成可實際據以選購的比較:開發者文件中出現模型識別碼、其模型卡索引中出現一筆條目、一篇附有公布每 token 費率的正式推出(GA)公告,或 Artificial Analysis 發布另一種不同 effort 等級的組態設定。在這些事情有任何一項成真之前,任何聲稱 Argon 在正式環境中比 GPT-6.1 Sol 更便宜、更快或更好的文章,描述的都是一個除了某一小群組之外,沒有人實際運行過的模型。

誠實的結語只有一句話,而且它關乎問題的形狀,而非分數。Gemini 4 Argon 與 GPT-6.1 Sol 在兩者唯一共同出現的獨立排行榜上足夠接近,以致該指數無法在它們之間做出選擇;真正做出區隔的是:一個已經可用,另一個只是承諾,而你不會把正式環境流量導向一個承諾。追蹤 Argon,如果價格與模態符合你的工作就採用 Sol,並讓抽象層保持得足夠薄,這樣當 Argon 成真的那天,它只會是一行設定,而不是一個專案。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
