
GPT-6 Astra Ultrafast 對比 Xiaomi MiMo v2.6 Pro Ultraspeed:同樣的手法,兩種不同的交易
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
兩個實驗室在同一個兩週內採取了相同的舉措,而有趣之處在於,他們是在對顧客究竟買的是什麼抱持相反假設的情況下這麼做的。GPT-6 Astra Ultrafast 是該廠商的旗艦產品,透過 Ultrafast 服務層級販售——該模型於 2026 年 9 月 3 日發布,該層級自 2026 年 9 月 29 日起廣泛提供,並在 NVIDIA 10 月 1 日的文章中獲指名為運行於 Blackwell GPU 上。Xiaomi MiMo v2.6 Pro Ultraspeed 是小米的版本,於 2026 年 9 月 22 日發布:與 MiMo-V2.6-Pro 相同的 1.02 兆參數檢查點,以更快的速度提供服務,約為標準費率的十倍。
其中一個是呼叫前沿模型最快的方式。另一個則是現存最便宜的快速層級。它們並非一般意義上的競爭對手——你得寫出非常奇怪的應用程式,才會在每百萬個 token 要價 300 美元的閉源旗艦模型,與每百萬個 token 要價 8.70 美元的開放權重模型之間做選擇。這組配對之所以值得用一頁來討論,在於兩者都是速度層級,而不是模型,因此把它們拿來比較,恰好能釐清速度層級所提出的唯一問題:你到底為了什麼支付這個倍數?
兩個層級賣的都是同樣的非事物
這兩個名稱都不是檢查點。這正是上市報導往往會模糊帶過的部分,所以值得以機械化的方式來處理。
• 名稱所指為何——GPT-6 Astra Ultrafast 就是設定了請求欄位 service_tier: "ultrafast" 的 GPT-6 Astra;請求中的模型 ID 仍然是 gpt-6-astra。Xiaomi MiMo v2.6 Pro Ultraspeed 是 MiMo-V2.6-Pro 檢查點,透過更快的路徑提供服務,並以獨立項目計價。
• 有哪些變更 — 批次處理、推測解碼、硬體配置、併發限制、連線處理。涵蓋權重與你的 HTTP 請求之間的一切,而權重內部則完全不動。
• 不變的是什麼——答案。相同的檢查點在相同設定下,應以不同速率產生相同的內容。若同一模型的兩條通道在相同輸入上出現分歧,那是該回報的缺陷,而不是你所購買的能力。
• 為何這一點對這項比較如此重要——因為兩個等級都沒有宣稱自家標準方案在基準測試上有所提升,所以整個購買決策就只剩下每 token 價格與所節省秒數之間的權衡。這意味著這兩筆交易取決於算術,而非評估。
不過,這個框架裡有一個不對稱,而它並不在於分級本身。小米的 UltraSpeed 建立在一個以開放授權釋出的模型之上——根據小米自家的模型卡,MiMo-V2.6 的權重採用 MIT 授權,而且該系列發布時也一併釋出了其 RL 訓練環境。OpenAI 的 Ultrafast 則建立在一個封閉的旗艦模型之上,只能透過 API 存取。為開放權重付出速度倍數的代價是可逆的決定;你永遠可以自己部署該檢查點。為封閉旗艦付出同樣代價則不然。

兩種價格倍數,以及它們能買到什麼
這裡正是這對組合不再對稱的地方,而且兩邊的數字都異常乾淨,因為每家供應商定價的是一個倍數,而不是一個絕對值。
• GPT-6 Astra Ultrafast — 每百萬輸入 token $60.00、快取輸入 $6.00、快取寫入 $75.00,輸出 $300.00,相較於標準級別的 $10.00 與 $50.00。在所有欄位上一致為 6.00x,當輸入 token 超過 272,000 時,價格調升至 $120.00 與 $450.00。標準級別已在我們的目錄中以 OpenAI 的定價上線,這是觸及旗艦模型最便宜的方式。
• Xiaomi MiMo v2.6 Pro Ultraspeed — 每百萬個詞元輸入 $4.35、輸出 $8.70,而標準 Pro 方案則是 $0.44 與 $0.87。這大約是9.9 倍的輸入差距,輸出差距則正好是 10 倍。
• 那些倍數所附帶的速度宣稱——OpenAI 與 NVIDIA 都將 Astra Ultrafast 的 token 生成速度上限訂為「最高比 Astra 標準模式快 8 倍」。小米自家的資料則宣稱輸出速度最高可達標準 Pro 服務的 20 倍;第三方產品目錄在同一天對同一型號的描述則說大約是 10 倍。目前尚未有任何能調和這兩個數字的量測結果發表。
• 倍數與速度的比率 — OpenAI 的 6 倍價格換來號稱 8 倍的上限,因此該層級的定價低於 其自身最佳情況。端看你相信誰的數字,Xiaomi 的 10 倍價格換來號稱 10 倍到 20 倍的上限,因此在廠商宣稱的上限下,這筆交易划算;若以較低數字來看,則完全打平。
那是兩者之間最與決策相關的單一差異,而且它比那些醒目價格所暗示的更狹窄。就廠商自家宣稱、每消除一單位延遲來看,Astra Ultrafast 是兩筆交易中較划算的一方。就每單位工作量(token)而言,Xiaomi UltraSpeed 對比 Ultrafast 的費率,輸入大約便宜十四倍、輸出大約便宜三十四倍,也比 Astra 的標準通道便宜二到六倍——但它是不同的模型,而且能力明顯較低,這正是你實際上所做的取捨。小米自家針對該系列發布的模型卡,公布的是架構與訓練相關事實,而非獨立的綜合評分;而用來衡量 OpenAI 旗艦模型的那個指數,也完全沒有公布它的任何讀數。

兩家廠商選擇披露的內容
速度分級與其說是效能測試,不如說是一種資訊揭露測試,因為你用來驗證該宣稱所需的東西——在指定並行數下的延遲分佈——完全掌握在供應商手中。
NVIDIA 10 月 1 日的貼文是 Astra 層級背後最具體的公開聲明,而它所提供的與其說是測量數據,不如說是功勞歸屬:Blackwell GPU、在 OpenAI API 中以及對符合資格的 ChatGPT Work 與 Codex 使用者開放,還有兩位 OpenAI 工程師描述這個迴圈。OpenAI 推論負責人 Philippe Tillet 表示,Astra 能「將那些知識轉化為高效能核心,讓 NVIDIA 硬體更具吸引力」;OpenAI 運算技術長 Uday Ruddarraju 則說:「我們用自家內部模型來最佳化 NVIDIA GPU 上的推論。」這兩句話都沒有附上該層級的輸送量數字。8 倍這個數字則獨立存在,除了「最高可達」之外沒有任何限定。
小米的披露則往相反方向走——它公布了訓練經濟學,包括強化學習環境與程式碼,而它的模型卡記載的是架構事實,而非服務事實。UltraSpeed 等級本身伴隨著 20 倍宣稱,卻沒有公布延遲曲線。這意味著,在速度等級之所以存在所要回答的那個問題上,兩家廠商同樣幫不上忙,而在這一點上打成平手,才是誠實的發現。
選擇,如果你真的非得選不可
這兩個層級重疊不多,所以與其說是在選出勝者,不如說是要認清你的購買屬於這兩者中的哪一種。
如果工作是代理式(agentic)的,而且模型選擇已經確定,就選 Astra Ultrafast。一個輸出 40,000 個 token 的工作會從 $2.00 變成 $12.00,而這個層級是唯一能以更快速度取得前沿模型品質的方法。OpenAI 自家的文件對這項運作前提說得很明白:它建議使用 WebSockets,「尤其是會快速連續發出大量工具呼叫的代理式應用程式」,並警告「沒有持久連線,網路額外負荷可能會削弱延遲改善的效益」。若你開啟這個層級,卻仍在底層使用逐請求的 HTTP,就等於付了 6 倍的錢,只換到一小部分的加速效果。在你把它接入之前,還有一點值得知道:這個層級只支援美國資料駐留與全球處理,沒有歐盟或其他非美國區域的處理端點,而且它推出時的初始速率限制很低,即使是原本有資格取得更高限制的帳號也一樣。
如果模型只是你能自行託管的管線中一項隨處可見的輸入,那就選 MiMo v2.6 Pro Ultraspeed。MIT 授權意味著標準 Pro 方案並非你唯一的退路——自行託管也是。以 $4.35 與 $8.70 的價格來說,它便宜到值得投機性地啟用更快的層級,而不必逐項任務去證明其正當性,而且其 1M token 的上下文與旗艦款相當。不過,要清楚自己買的是什麼:以大約十倍的費率,換取一個落後於前沿的模型——這對大量擷取而言是正確的取捨,但對任何答案品質會決定工作流程能否推進的用途來說,則是錯誤的選擇。
兩個快速層級都不在 OrcaRouter 上,而這點值得明白說出來,而不是含糊帶過。OrcaRouter 上確實有的是 openai/gpt-6-astra —— 標準層級的旗艦模型,每百萬詞元要價 $10.00 與 $50.00,長脈絡級距為 $20.00 與 $75.00,具備 1,050,000 詞元的脈絡與 128,000 詞元的最大輸出,透過 OpenAI 相容端點提供。這裡完全沒有託管任何小米模型,因此 MiMo-V2.6-Pro 及其 UltraSpeed 通道只能透過小米自家的 API 與幾個第三方平台觸及。這類兩百多款模型的端點在本比較中的實際用途,並不是取用快速層級。而是當你想知道昂貴通道是否真值得它的倍數價差時,你可以在下一個請求中,用同一組憑證與同一把金鑰,把同樣的提示詞送給較便宜的模型,然後找出答案。那是現行最便宜的實驗,也正是能回答這個問題的實驗 —— 因為沒有任何廠商發表過能讓你無須實測就能回答的延遲曲線。

誠實的解讀
過去三週內,兩家供應商都發布了延遲費率表,卻都沒有提供任何量測數據。這種對稱性正是重點所在,而它有個實際後果:今天你唯一能據以行動的數字就是價格,而那些數字格外具有資訊價值,因為雙方都把價格定在一個乾淨俐落的倍數上,而不是一個量身打造的數字。
OpenAI 的快速級別價格是其自家標準費率的六倍,並宣稱上限為 8。小米的價格則是自己標準費率的十倍,並宣稱上限介於 10 到 20 之間,取決於你相信誰的數字。若按兩家廠商自己的數字來計算,這兩者幾乎不相上下:OpenAI 的級別以每單位價格換得 1.33 單位速度的宣稱上限,小米的級別按同一算法則換得介於 1.0 到 2.0 之間——而兩者之所以都能站得住腳,是因為這兩個級別賣給不同的買家,而這些買家永遠不會認真考慮彼此的選項。價格也是如今這兩筆交易中唯一可供稽核的部分,因為費率表是已公布的事實,而延遲宣稱則不是。
