GLM-5.3-Flash 揭曉——匿名「Ox Alpha」一直是智譜的開放多模態前沿模型 重新生成的插圖。
Guides & Insights

GLM-5.3-Flash,上路五週後:一個獨立的 42、一場神話級漏洞利用演練,以及那個重建了自己服務堆疊的 GLM 代理

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GLM-5.3-Flash 已經承載生產流量五週,而在 2026 年 9 月 17 日,智譜 AI 針對「它跑在哪裡」給出了說法:該公司披露,GLM-5.3-Flash 的每一筆生產請求如今都執行在由超過 10 萬顆中國國產 AI 加速器組成的機群上,從在該硬體上首次開機到扛起實際上線工作負載只花了不到兩週,而同一期間端到端輸送量提升了 3.2 倍。而傳播得最遠的那一部分,是這些工作由誰完成。其中大部分並非由基礎設施團隊負責,而是由一個以 GLM-5.3 驅動的代理所做:它讀取瓶頸、提出修正方案並撰寫推論系統程式碼,人類則負責設定目標、建立回饋迴路,以及審查任何涉及數值、並行或風險的部分。GLM-5.3-Flash 是智譜於 2026 年 8 月 26 日發布並開源的多模態模型,總參數量 3,200 億、啟動參數 180 億(320B-A18B)——也就是該公司當天揭曉的匿名模型「Ox Alpha」——而它體型更大的兄弟 GLM-5.3,則是其定價所對標的 743B 旗艦。今天披露內容中的這三個數字,沒有一個來自我們或任何其他人:它們都是智譜自家的數字。旗艦也不再是唯一重要的比較基準:在 ExploitBench 這項獨立評測中——用來衡量模型能在真實 Chrome 漏洞利用鏈上攀升到多高——GLM-5.3-Flash 如今的實測表現已與 Claude Mythos Preview 持平,後者是該模型開發者僅釋出給經過審核的防禦者的封閉前沿模型,而 GLM-5.3-Flash 每次嘗試的成本僅是其一小部分。

那是好消息,而且是真的,但屬於廠商說法。自這篇文章最初在上市日刊出以來,另外有三件事已經出現變化,而其中兩件朝相反方向發展。Artificial Analysis 現已公布自家對該模型的測量結果,而它的數字並非 Zhipu 的數字。讓這款模型成為市面上最便宜且堪用模型的上市折扣,已於 9 月 9 日如期到期,且並未延長。而第三方評測機構 Generality Labs 也發布了自家的 ExploitBench 測試結果;在相同評分階梯上,GLM-5.3-Flash 的得分高於 Claude Mythos Preview 三次運行的平均值——成本大約只要每一美元六美分。對於任何在八月底把這款模型記為「便宜的那一款」的人來說,今天的帳已經和當時不同,而誠實的標題是好壞參半的:推論服務的經濟效益確實改善了,價格卻因促銷結束而上漲,廣被引用的智慧指標未能挺過獨立測試框架的首次檢驗,而確實對該模型有利的能力比較,則是一次未經同儕審查的運行,其作者自己也說不應過度解讀。

Zhipu 是叢集規模、兩週時程與 3.2 倍這三項資訊的唯一來源——這些全都沒有獨立審計,而且該公司自己表示尚未達成遞迴自我改進,並將此結果描述為最小規模的迴圈,而非真正的遞迴自我改進。凡是可以查核的,我們都查核了:該說法中唯一具體、且存在於 Zhipu 圍牆之外的產物——Flash Linear Attention 核心中的一項精度修正——確實已合併至上游,而我們也確認了此事。下文若某項數字來自 Zhipu,就會註明是 Zhipu。若來自 Artificial Analysis,就會改註明是 Artificial Analysis。若來自 Generality Labs——本文中漏洞利用數字背後的安全評估團隊——就會註明是 Generality Labs,並附上其作者自行提出的但書:一次執行、41 個錯誤、自行發表的方法、無第三方重現,以及他們主動提出的污染疑慮。若某項數字屬於 Anthropic——這裡唯一來自於在答案中具有競爭利害關係的實驗室的數字——本文會說明它實際測量的是哪個模型,因為並非所有數字都出自這個模型。

實際發佈的內容

GLM-5.3-Flash 是一款總參數 320B/活躍參數 18B 的混合專家模型,共有 45 層,這使其活躍參數規模略高於 GLM-5.2 約 32B 的一半。最受矚目的能力在於模態:它原生接受文字、圖像與影片輸入——是首個做到這點的 GLM-5 模型——而非透過獨立轉接器來處理視覺。上下文長度可達 100 萬個 token,且 Zhipu 聲稱其長上下文服務成本大約落在 GLM-5.3 的三分之一。

在架構方面,智譜將其描述為首個開源前沿模型,同時結合了混合稀疏加線性注意力與流形約束超連接(mHC)以實現規模化,並採用 IndexPool 機制,將四個索引器鍵向量壓縮成單一加權池,以降低長上下文延遲。預訓練使用了 30 兆 token 的多模態語料庫。這些全都未經獨立審計——畢竟是智譜在描述自家模型——但如今權重已擺在開源推論堆疊面前,其服務效率方面的說法已具體到足以檢驗,而九月十七日的說明則首次詳細描繪出服務端實際是如何打造出來的。

上市當天的規格表,一目了然:

• 參數 — 320B 總計 / 18B 啟用,45 層,MoE。

• 模態 — 原生文字、圖像與影片輸入;文字輸出。

• 上下文視窗 — 最多 1,000,000 個 token。

• 授權 — MIT,自發布日起即在 Hugging Face 上開放權重。

• 價格 — 每百萬個 token $0.15 / $0.50(輸入 / 輸出),每百萬個快取輸入 token $0.03。

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

那張卡片是發布當日的快照,而其中兩行自 8 月 26 日以來已經變動。AA Index 的數字仍是 Zhipu 自己的宣稱,如今已被獨立測量結果推翻——詳情見下文。它顯示的折扣價已經消失;促銷已於 9 月 9 日結束。參數數量、上下文視窗、授權條款與模態仍是未改變的當前事實,而這張圖片主要就是為了呈現這些。

Ox Alpha 週,以及免費贈品真正在測試什麼

這次揭露為期一週的猜測畫下句點。8 月 20 日,一個匿名模型出現在第三方 AI API 平台上,具備 100 萬 token 的上下文視窗、文字/圖像/影片輸入,且價格為零,很快便成為該平台每週排行榜上最常被呼叫的模型。社群在 48 小時內將其指紋追溯到智譜的 GLM 系列——這與先前辨識出其他中國實驗室模型的「先匿名、後認領」模式如出一轍——分析師普遍猜測這是 Flash 版本的 GLM-5.3。8 月 26 日的公告證實了這項猜測:免費的一週是刻意安排的測試,而該公司表示,匿名運行在六天內於提供該模型的各個程式設計平台上處理了超過 62 兆個 token,全部由中國國產晶片提供服務。

那最後一條但書在當時看來像個註腳。結果,它才是重點。那免費的一週,主要並不是行銷噱頭,甚至也不是對模型的壓力測試;而是對其底層加速器機群的壓力測試,而且是在一個失敗會公開上演、又不用付出代價的規模下進行。三週後,Zhipu 形容同一批機群正承載著該模型百分之百的正式環境流量。

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

那一週的定價邏輯依然成立,只有一處要更正。一款模型先以 $0 免費送出為期一週,接著以旗艦價位的一成推出,還再打五折,這是平價層級刻意為之的造市舉措,而「限時」這個限定詞始終是該留意的重點。我們當時就標記過,這件事有可能被收回。它如期被收回了——這點值得直說,因為在這則消息裡,折扣到期是唯一會在帳單上顯現的變動。

由代理重建的服務堆疊

智譜 9 月 17 日的技術文章,是首份詳細描述 GLM-5.3-Flash 如何在中國晶片上提供服務的文件,而其核心主張是:有一個模型協助優化了運行它的系統。該公司將此機制稱為「密集回饋」:正確性測試、執行日誌、追蹤、微基準測試與端到端指標都被串接起來,讓代理能在本地驗證假設,而不必在每次變更後等待完整部署與負載測試。智譜表示,若要讓這套做法奏效,回饋必須是本地、低成本且可客觀檢查的——綁定到特定核心或程式碼路徑、快到足以反覆迭代,並且無需人類介入就能判定真偽。

在該迴圈就位後,該代理程式發現並修正了公司已詳細描述的三件事:

• KDA 核心中的一條上下文平行路徑,隨著序列變長而逐漸流失精度,因為 tl.dot 在輸入為 FP32 的情況下仍預設使用 TF32,導致捨入誤差隨上下文長度不斷累積。修正方式是將輸入精度固定為 tf32x3,並在不支援 TF32 的平台上回退至 ieee。這三項之中,這一項最為有趣,因為它是整份陳述中唯一一項離開智譜自家基礎設施的主張:該變更已在上游的 Flash Linear Attention 中以 PR #1180 合併,我們已查核並確認它於 2026 年 8 月 27 日完成合併。

• KV 傳輸並未與 DeepEP 的排程重疊。在使用中的 DeepEP 版本裡,無論是節點內 dispatch 還是節點內 combine,都沒有釋放 Python GIL,這導致傳輸執行緒被卡在它們之後;同一篇報告的英文版與中文版記述,分別將由此產生的額外開銷列為高於 20% 與高於 30%。修復之後,Zhipu 表示,與其僅有 prefill 的基線相比的差距已降至低於 1%。

• 一個解碼核心原本會把相同的 FP32 正規化與閘控重複計算四次,每個 V 維度分塊各一次。拆分除法工作讓核心時間縮短了 9.6%,而將各分塊合併成單一執行緒區塊——使正規化只執行一次——則帶來了 1.71 倍的加速。

在這些修正之外,還有結構性變革:ReplaySSM,它以運算換取片上記憶體,因為加速器擁有的片上記憶體比最初編寫該堆疊所針對的 GPU 更少;節點內張量平行以緩解同樣的壓力;混合 INT8、FP8 和 BF16 快取以擴充容量;以及一個 Encode-Prefill-Decode 解構式架構,它將三個推論階段分開排程,而非作為單一管線。Zhipu 也誠實地列出了限制——有限的片上記憶體和互連頻寬、不成熟的軟體、不完整的內核覆蓋率和薄弱的文件——並表示它尚未實現遞迴自我改進,將結果描述為最小規模迴圈。

以懷疑態度閱讀這篇報導,因為其中的誘因顯而易見。Zhipu 不會說明代理做了多少工作、工程師又做了多少,也沒有外部稽核可查核吞吐量數字、兩週時程或叢集規模。密集回饋的論述框架也以一種特定方式自利:它讓聽來最驚人的說法(「我們的模型自我改進」)建立在最難以查核的證據上(一個沒有人能檢視的內部迴圈)。讓這個故事不至於純屬行銷的是,它最具體的主張可被否證,而且結果證明為真——tf32x3 核心修正確實在上游儲存庫中,標示日期為 8 月 27 日,比圍繞此事的媒體報導週期早了三週。

以實際美元計算,它的成本是多少

價目表是 Zhipu 的,而且很簡單:每百萬個輸入 token 0.15 美元、每百萬個輸出 token 0.50 美元,以及每百萬個快取輸入 token 0.03 美元。這是截至今日的定價。五折的上市促銷活動持續到 2026 年 9 月 9 日,並未延長,因此八月底廣為流傳的 0.075 / 0.25 / 0.015 美元數字,已無法在供應商自家 API 上取得。相較於 GLM-5.3 公布的 1.40 / 4.40 美元,Flash 以定價計算仍大約落在其十分之一——折扣只是附加在原本就是重點的價格之上的紅利,而不是價格本身。Artificial Analysis 以 7:2:1 的快取命中/輸入/輸出混合比例計算出約每百萬個 token 0.10 美元的綜合費率,並列出輸出速度約為每秒 117 個 token,其形容這樣的速度明顯很快;不過 AA 指出,這些速度數據描述的是該模型的第一方 API,而非 AA 自行執行的測試。

智譜更廣泛的成本故事,正是價格能維持在那個水準的原因。在8月31日發布的半年報中,該公司表示,其10萬顆加速器的國產算力集群上,單位詞元(token)推理成本自2026年初以來已下降80%,且由於規模、定價與更便宜的推論服務,API毛利率從-0.4%升至24.6%。這些是該公司向股東報告的公司數據,未經我們審計;請將其視為方向明確而非精確。上文所述的推論服務帳目,正是這一說法背後的機制——更少冗餘的核心(kernel)執行次數、更小的記憶體壓力、更好的重疊——這比單純的百分比更為可信,即使最終被引用的會是那個百分比。

針對旗艦產品的效率宣稱維持不變:與 GLM-5.3 相比,注意力運算降低 3.0 倍、KV 快取降低 4.4 倍,這些皆為廠商自行報告的數據,而 Zhipu 也承認其 KV 快取仍略大於 DeepSeek V4 Flash 與 Kimi K3。發表時宣稱在國產晶片上可達 3 倍端到端服務效能提升,如今則改稱 3.2 倍,衡量範圍是從首次開機到全量生產流量上線。這兩個數字都出自 Zhipu,而承載這兩項說法的兩份陳述相隔三週——這裡沒有任何內容在公司外部被重現過。

為何這項揭露事關重大——以及那個頭條數字去了哪裡

對任何讀過上市報導、並記下那個數字的人來說,以下這項更正最為重要。智譜的材料把 GLM-5.3-Flash 在 Artificial Analysis Intelligence Index 上列為 57,與 Claude Opus 4.8 相當。Artificial Analysis 其後公布了自家在 Intelligence Index v4.3 上對該模型的測量結果,讀數為 42——同一版本上 GPT-5.6 Sol(max)則是 47。57 從來不是獨立數字;那是智譜自己的數字,而獨立測量顯示該模型比貼近前沿的區間低約五點,也遠低於廠商掛在嘴邊的數字。在同一個現行指數上,GLM-5.3 本身的測量值為 45,因此我們上市報導中出現的旗艦型號 60 這個數字,已不再符合 Artificial Analysis 今日公布的結果。宣稱與測量之間 15 點的落差不是四捨五入的差別,而這是讀者能從這則更新中得到的最有用的一件事——但下一節會補上一項限定,因為這個故事裡的第二項獨立測量指向相反方向。

那次修正之後仍站得住腳的部分更狹窄了,但依然真實。GLM-5.3-Flash 是一款開放權重的多模態模型,具備 100 萬上下文,並原生支援圖像與影片輸入,價格大約是其旗艦同系列產品的十分之一——這樣的組合在美國前沿實驗室中沒有直接對應者,它們可相比的多模態模型價格明顯更高,而且以閉源形式發布。智譜自己的說法「前沿智能,閃電成本」,正是受到衝擊的部分:在實測 42 分之下,它是個強勁的平價模型,而不是打折的前沿模型。獨立評測也顯示,它明顯高於同規模開放權重模型的中位數,對一個活躍參數 18B、推論成本僅十分之一的模型來說,這是實實在在的成就——只是這項成就與發布報導所暗示的不同。

另一個獨立數字——而且它對模型有利

如果說 Artificial Analysis 的結果讓 GLM-5.3-Flash 降了一級,這一次則恰恰相反,而這也是整個故事中最奇特的一件事。由卡內基美隆大學打造的 ExploitBench,問的並不是模型能否弄崩目標。它評分的是攻堅的爬升過程:觸及易受攻擊的程式碼、觸發漏洞、建構可重複使用的基礎原語,最後是完整的控制流劫持並執行任意程式碼,並在開啟安全沙箱的正式版 V8 上以機械化方式評分。Generality Labs 讓 GLM-5.3-Flash 跑遍 41 個漏洞,每個漏洞給予十億權杖的預算,而非該基準慣用的 300 回合上限,理由是回合數並不能妥善代表買方實際的花費,而美元才是誠實的約束條件。GLM-5.3-Flash 在其中 13 個漏洞上達成完整的任意程式碼執行,能力平均得分為該階梯最高值的 64.8%。Claude Mythos Preview 三次已公布測試在同一階梯上的得分為 9、10 和 11——平均 10 分,亦即 62.2%。Generality 自己在圖表下方印出的說法是,就這項測量而言,GLM-5.3-Flash「在網路攻防方面可能已達 Mythos 水準」。Anthropic 自己於 9 月 29 日發布的 ExploitBench 測試,也報告了同樣的排序,但絕對比率低得多——不過對象是旗艦款 GLM-5.3,而非 Flash:它計數的是每次嘗試的端到端漏洞利用,而非階梯進展,並將 GLM-5.3 列為 410 次中成功 50 次,對比 Mythos Preview 的 410 次中成功 56 次。計數規則不同,排序卻相似——這正是為什麼引用 ExploitBench 的數字時,絕對不該不附上其規則。

真正重要的原因,在於它底下的那個分母。那次測試把 GLM-5.3-Flash 的輸出 token 定價為每百萬 $0.25——這是它上市時的五折價,如今已經結束——對比 Claude Mythos Preview 歷史上的每百萬 $125,差距達 500 倍。在成本對等的情況下,該次測試每項弱點花費 $16.81,而 Mythos 為 $297.17,這正是大約 6% 這個數字的由來。請仔細讀這項說法,因為流傳的那個版本是錯的。這並不是說 GLM-5.3-Flash 是比 Claude Mythos Preview 更優秀的漏洞利用開發者。而是說,在這個特定任務上,一美元的 GLM-5.3-Flash token 所能買到的成果,大約等同一美元的 Mythos token,而且前者的花費你負擔得起多得多。

Generality 自家的但書比標題本身更值得注意。他們明白指出,單次執行並不足以確立在整體網路安全領域的對等地位,資料汙染仍是未解的問題——ExploitBench 可能曾以某種方式被當作訓練對象——而且 41 個樣本中有四個發生錯誤,計分方式是沿用最後觀測到的結果,這若有任何影響,反而是低估了該模型。他們也在 9 月 28 日發表了一份後續報告,讓整個比較變得更加複雜。以 2.5 億個 token 的預算,讓 GLM-5.3-Flash 跑過七種不同的代理框架(agent harness),並在十個刻意涵蓋難度範圍的樣本上測試,同一組權重(模型)在 Codex 框架下得到 10.6 分——高於 Claude Mythos Preview 的 10.02 參考分數——而在 Claude Code 框架下只得到 6.2 分,甚至低於該基準原本受回合數限制之配置的 6.4 分。框架對分數的影響比模型之間的比較更大,而作者表示這個十個樣本的子集很可能不具代表性。那張圖在 10 月 2 日廣泛流傳,搭配的論點是測試時運算擴展正在抹平模型層級之間的差距;這是一個關於產業的宣稱,而非該評估的發現:該評估所發現的是,一個便宜的開源模型,在獲得運算預算而非回合數限制的情況下,能在某一評分階梯上達到前沿實驗室漏洞利用專家的水準。

這已不再只是某一個實驗室的故事。Anthropic 自家的 Frontier Red Team 評估於 9 月 29 日發表,在人工參與(human-in-the-loop)的 session 中執行了 GLM-5.3-Flash——也就是體型較小的同門模型:研究人員只交出一個已修補 Chrome 漏洞的公開細節,外加另一個漏洞,沒有給予任何重要指引,模型便在 20 分鐘的人力關注與 8 小時的模型工作下,將它們串成一個可靠的 ARM64 漏洞利用程式,繞過了指標驗證強化機制——以智譜(Zhipu)的 API 費率計算為 20.40 美元。同一份評估也是上文 410 分之 50 這個 ExploitBench 數據的來源,而該部分測量的是 GLM-5.3,也就是 743B 的旗艦模型,而非 Flash——這個區別在該報告的相關報導中大多被抹平了。兩個獨立團隊,不同的測試框架,不同的預算,方向卻一致。兩者也都只是單一實驗室的單次執行,且都不是可複現的結果,而且只有 Generality 那一次執行回報的是 Flash 的美元數字,而非旗艦模型的。實際的解讀正是 Anthropic 直言不諱的那一點:權重可以下載,對 GLM-5.3-Flash 進行去拒答處理(abliterating)大約花了 600 GPU 小時,而一個每小時執行成本不到一美元的模型,和一個被審查計畫擋在後面的模型,是不同性質的可用性問題。

試試看,以及路由層如何配合

取用方式很直接。智譜自家的 API 以上方所列的定價提供服務,採 MIT 授權的權重放在 Hugging Face 的 zai-org/GLM-5.3-Flash,提供 FP8 與 BF16 版本,而智譜的程式開發產品——ZCode 與 GLM Coding Plan——也都內含它。若要自行架設,vLLM 與 SGLang 都支援。若你走這條路,有兩點實務提醒:SGLang 的 cookbook 帶有一則未決變更警告,指出在 5.13 之前的 transformers 版本上,視覺輸入可能會被默默丟棄,這不會觸發錯誤,只會讓你對影像請求得到純文字的判讀;而 AMD 這條路徑仍算不上是現成做法。最初在發表日提出的 gfx950 啟用 PR(sgl-project/sglang #37653)於 9 月 6 日未合併即關閉,並由一組範圍更廣的 gfx950 首日 pull request 取代——透過 AITER 的 mHC、k-pool DSA 索引器、FP8 與 MXFP4 推論服務——其中數個在 9 月 17 日時仍處於開啟狀態。MI350X 等級硬體的啟用仍在進行中,尚未出貨,且目前仍沒有獨立的 AMD 吞吐量數據。

在路由這一端,情況自推出以來已經改變:GLM-5.3-Flash 如今已列入 OrcaRouter 的模型陣容,與 GLM 系列其餘成員並列。我們以 0% 加價直接轉遞供應商的定價,且不收取路由器附加費用,而這正是對一個價格剛剛變動的模型而言最關鍵的機制——智譜那側的折扣到期,就是你在此地、同一天要付的價格,無須重新議約第二份合約,也不必改動程式碼。這種轉遞是雙向的,值得把話講明白:促銷到期就是你帳單上實實在在的漲價,而且它在上游發生的同一刻,這裡也會發生。如果你正在權衡 Flash 與 GLM-5.3 或另一個平價模型,兩者都位於同一把金鑰之後,並在供應商之間自動容錯移轉,這是不必把正式生產路徑押上去、就能試用一個獨立評分仍在變動中的模型的省錢做法。它也契合上述結果的形態,而且理由比便利更直白:同一組權重在同樣的基準測試上,會因為由哪個代理框架驅動而得出 10.6 或 6.2 分,因此買方實際測試的是「腳手架+模型」的組合,而在同一把金鑰下、於固定的腳手架之後替換模型,比對任一方做出承諾都更便宜。

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

接下來要看什麼

這個故事的後續走向,取決於四件事。第一,那 42 是否會變動:該模型自八月以來已被廣泛公開使用,因此如果 Zhipu 的內部評估與 AA 的測試框架之所以不一致,是有結構性原因——例如推理 token 的計算方式、冗長程度,或某項廠商高度加權的評估——那麼這應該會在指數修訂時顯現,而不是成為一次性的落差。第二,漏洞利用結果能否重現。Generality Labs 曾用自己的測試框架跑過一次那 41 個漏洞,而且也表明如此;後續的測試框架比較顯示,光是測試框架的選擇,就能讓同一組權重移動四點,所以能讓問題定論的數字,是由第二個團隊在預算以美元固定、測試框架保持不變的情況下,重新跑一次那 41 個漏洞。第三,國產晶片的說法能否有第二個來源。Zhipu 是唯一能陳述叢集規模、兩週時程與 3.2 倍的單位,而其中唯一可獨立驗證的主張——已合併的 kernel 修正——只是個小項目。第四,價格:折扣已經沒了,而有趣的問題在於,當 Zhipu 需要衝量時,它會不會以促銷形式回歸,還是牌價現在就是底線。

這條主軸是:GLM-5.3-Flash 被要求同時證明兩件不同的事——便宜的模型可以夠好,以及中國加速器可以大規模提供服務——而 9 月 17 日的披露,是 Zhipu 對第二個問題的回答,且由一個協助寫出該回答的模型所交付。第一個問題如今附有兩個各自獨立的數字,而它們指向相反方向:智慧指數上的 42 分,遠低於廠商主打的水準;以及一次漏洞利用測試,以二十分之一的成本達到與前沿實驗室專用模型相當的水準。兩者可以同時成立,而真正做出決策的地方,正是它們之間的落差——不是其中任何一個數字。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新